柴亮太の
AI最前線
最新
基礎
タイムライン
ポッドキャスト
About
☰
×
最新
基礎
タイムライン
ポッドキャスト
About
← ポッドキャスト一覧に戻る
Podcast · Episode 145
SABRE:VLMの弱点を炙り出す自動ベンチマークが登場
8月15日(土) · 6分
視覚言語モデル(VLM)の急速な進化に対し、その弱点を特定するためのベンチマーク開発が遅れていました。今回発表されたSABREは、VLMが「世界の事前知識」に頼りすぎず、視覚的証拠に忠実であるかを自動でテストするスケーラブルなパイプラインです。これにより、VLMの隠れた課題を効率的に特定し、モデル改善を加速させることが期待されます。
元記事を読む →
前のエピソード
中国AI「Kimi K3」がウォール街を動揺させた理由と、OpenAI未公開モデルのセキュリティ問題
次のエピソード
Diffusion LLMの安全性脆弱性を解明:既存モデルからの継承と新たなジェイルブレイク手法