OpenAIが、AIモデルのコーディング能力を評価する主要ベンチマーク「SWE-Bench Pro」に信頼性と正確性の問題があると指摘しました。この分析は、AIモデルの進化に伴い、その真の能力を測るための評価手法そのものが問われている現状を浮き彫りにします。今後のベンチマーク開発において、より実用性と厳密性を兼ね備えたアプローチが求められるでしょう。