26
6月 2026
テクノロジー
DFlashで122B推論が1000tok/s超 品質劣化なし
推論のボトルネックは、計算よりも重みの読み込みにあります。 …
25
6月 2026
アプリ・サービス
Modalの管理型LLMエンドポイントが全ユーザーに公開
自社アプリにLLMを組み込むとき、推論基盤を自前で組むか、A…
12
5月 2026
オープンソース
LLM推論を最大8.5倍高速化するDFlash — 品質劣化なし
LLMの推論速度を上げるために、モデルの差し替えや量子化を試…
03
5月 2026
オープンソース
vllm-studio入門 4大推論エンジンを1画面で管理するOSS
ローカルLLMを本格運用し始めると、モデルの起動・停止、GP…
27
4月 2026
テクノロジー
LLM推論のGPU効率が2倍に 分散アーキテクチャの仕組みと実例
LLM推論のインフラコストを、GPUを追加せずに削減する手法…