#Speculative Decoding

2 件の記事

26
6月 2026
テクノロジー

DFlashで122B推論が1000tok/s超 品質劣化なし

推論のボトルネックは、計算よりも重みの読み込みにあります。 …

12
5月 2026
テクノロジー

LLM推論を3倍速くするSpeculative Decodingの仕組み

LLMの応答が遅い。その原因のほとんどは、モデルの賢さではな…