#SGLang

5 件の記事

26
6月 2026
テクノロジー

DFlashで122B推論が1000tok/s超 品質劣化なし

推論のボトルネックは、計算よりも重みの読み込みにあります。 …

25
6月 2026
アプリ・サービス

Modalの管理型LLMエンドポイントが全ユーザーに公開

自社アプリにLLMを組み込むとき、推論基盤を自前で組むか、A…

12
5月 2026
オープンソース

LLM推論を最大8.5倍高速化するDFlash — 品質劣化なし

LLMの推論速度を上げるために、モデルの差し替えや量子化を試…

03
5月 2026
オープンソース

vllm-studio入門 4大推論エンジンを1画面で管理するOSS

ローカルLLMを本格運用し始めると、モデルの起動・停止、GP…

27
4月 2026
テクノロジー

LLM推論のGPU効率が2倍に 分散アーキテクチャの仕組みと実例

LLM推論のインフラコストを、GPUを追加せずに削減する手法…