25
6月 2026
オープンソース
モデル不変で+14.5% Xiaomi HarnessXの全貌
AIエージェントの性能は、基盤モデルだけでなく「ハーネス」と…
15
6月 2026
テクノロジー
CPPOがprefix driftを抑えLLM推論強化学習を安定化
LLMの推論能力を高める強化学習では、PPOやGRPOによる…
12
6月 2026
テクノロジー
ECHOがエージェントRLに世界モデルを統合する理由
エージェントの強化学習(RL)では、モデル自身が出した行動ト…
06
5月 2026
オープンソース
LLM強化学習のRL環境を6フレームワークで実装比較したガイド公開
LLMをRLで鍛えようとすると、最初にぶつかる壁が「RL環境…
01
5月 2026
テクノロジー
Training-Free GRPO 再学習なしでLLMエージェントを強化する方法
LLMエージェントの性能を上げたい。でもファインチューニング…
24
4月 2026
オープンソース
NVIDIA NeMo RLがFP8で強化学習を最大48%高速化
NVIDIAがオープンソースの強化学習ライブラリ「NeMo …