OpenAIがSWE-Bench Proの監査に、モデルベースの調査エージェントと5名の経験豊富なソフトウェアエンジニアによる独立レビューを併用したと発表しました。このハイブリッドアプローチは、大規模なタスク評価と専門家による判断の両立を可能にし、AIの性能評価における新たな基準を示唆しています。