#GRPO

6 件の記事

25
6月 2026
オープンソース

モデル不変で+14.5% Xiaomi HarnessXの全貌

AIエージェントの性能は、基盤モデルだけでなく「ハーネス」と…

15
6月 2026
テクノロジー

CPPOがprefix driftを抑えLLM推論強化学習を安定化

LLMの推論能力を高める強化学習では、PPOやGRPOによる…

12
6月 2026
テクノロジー

ECHOがエージェントRLに世界モデルを統合する理由

エージェントの強化学習(RL)では、モデル自身が出した行動ト…

06
5月 2026
オープンソース

LLM強化学習のRL環境を6フレームワークで実装比較したガイド公開

LLMをRLで鍛えようとすると、最初にぶつかる壁が「RL環境…

01
5月 2026
テクノロジー

Training-Free GRPO 再学習なしでLLMエージェントを強化する方法

LLMエージェントの性能を上げたい。でもファインチューニング…

24
4月 2026
オープンソース

NVIDIA NeMo RLがFP8で強化学習を最大48%高速化

NVIDIAがオープンソースの強化学習ライブラリ「NeMo …