#vLLM

16 件の記事

02
7月 2026
オープンソース

CUDAから分散AIまでGPU工学リソースを整理したOSS

GPU工学の学習資料は、CUDAの公式ドキュメント、大学の講…

25
6月 2026
テクノロジー

GKEのRay Serve LLMがスループット5倍・遅延8分の1

LLMの本番推論では、開発しやすさとスループットの両立が長年…

25
6月 2026
オープンソース

OutlinesでLLMのJSON出力を生成段階から保証

LLMの返答は毎回フォーマットが揺れ、JSONパースでアプリ…

11
6月 2026
テクノロジー

LCLMが16倍圧縮で長文LLMの速度と精度を両立

長文を扱うLLMは、入力が長くなるほどKVキャッシュが膨らみ…

12
5月 2026
AIモデル

Kimi K2.6 コーディング最高峰OSSモデルの実力と使い方

オープンウェイトのコーディングAIが、ついに商用モデルと肩を…

12
5月 2026
テクノロジー

LLM推論を最大8倍速くする Speculative Decodingの仕組み

LLMの応答が1トークンずつしか出てこない——そのボトルネッ…

12
5月 2026
オープンソース

LLM推論を最大8.5倍高速化するDFlash — 品質劣化なし

LLMの推論速度を上げるために、モデルの差し替えや量子化を試…

08
5月 2026
AIモデル

Gemma 4 MTP ドラフターでローカルAIの推論を最大3倍高速化

ローカルでLLMを動かすとき、1トークンごとに処理が止まる遅…

05
5月 2026
テクノロジー

DFlash解説—LLM推論速度を3倍にするブロック拡散の仕組み

AIの推論速度は、サービスのコストと応答性を左右します。これ…

05
5月 2026
AIモデル

Qwen3.6-35B-A3B 3Bコストで73.4%を出すMoEコーディングモデル

ローカルで動くオープンソースモデルが、クラウドAPIの精度に…