OpenAIが「SWE-Bench Proの約30%が壊れている」と報告、AIのコーディング能力を測るベンチマークに大量の不備
OpenAIは2026年7月8日、AIのコーディング能力を測るベンチマーク「SWE-Bench Pro」を詳細に調査した結果、タスクのおよそ30%に評価として成立しない問題があると報告しました。<p><b><a href="https://gigazine.net/news/20260709-openai-coding-evaluations/">続きを読む...</a></b></p>
GIGAZINE
2026年07月09日 03:40