← ポッドキャスト一覧に戻る
Podcast · Episode 446

VLMの「幻覚」問題に新評価軸:科学図理解で行動信頼性を検証

9月9日(水) · 5分
既存のVLM評価が知覚・推論精度に偏る中、不確実性下でのモデルの挙動信頼性が課題でした。今回、科学図理解に特化した新ベンチマーク「SciFigBench」と「A-R-Iフレームワーク」が導入され、モデルが情報不足を認め、誤解を招く文脈に抵抗し、慎重に推論する能力が評価されました。GPT-5.2は高精度ながら高い幻覚率を示し、Gemini 3.1 Proは不確実性認識に優れるなど、モデル間の行動差が浮き彫りになり、実用化には精度以外の側面が重要だと示唆されています。
前のエピソードLLMエージェントの自己進化が逆効果に?「スキル汚染」を防ぐ新手法VaG 次のエピソードDreamGuard:LLMエージェントの危険行動を未然に防ぐリスク認識型ガードレール