#SWE-bench

7 件の記事

01
7月 2026
AIモデル

Claude Sonnet 5登場 Opus級性能を半額以下で

中位モデルが上位モデルに迫る。Anthropicが2026年…

29
6月 2026
オープンソース

ClawCodexがClaude CodeをPython再実装

Anthropic公式のClaude Codeは高性能ですが…

17
6月 2026
テクノロジー

LLM評価33指標|性能・安全・エージェント運用の見方

LLMを導入しても、何を基準に良し悪しを判断すればよいか迷う…

12
5月 2026
アプリ・サービス

モデルが同じでも結果が違う AIコーディングエージェント評価の新指標

AIコーディングツールを選ぶとき、モデルのスペックだけを比べ…

06
5月 2026
AIモデル

ProgramBench:全LLMが0%になった理由と課題の本質

全LLMがスコア0%——その事実が、コード生成AIの現在地を…

05
5月 2026
AIモデル

Qwen3.6-35B-A3B 3Bコストで73.4%を出すMoEコーディングモデル

ローカルで動くオープンソースモデルが、クラウドAPIの精度に…

24
4月 2026
AIモデル

Qwen3.6-27B コーディング性能で397Bを超えた理由

27Bのモデルが、その約15倍の規模を持つ397Bモデルを全…