Podcast · Episode 259
SPIEval登場:LLMモバイルアシスタントの個人情報分散活用能力を測る新ベンチマーク
8月22日(土) · 5分
大規模言語モデル(LLM)をモバイルアシスタントとして活用する際、複数のアプリに散らばる個人情報を統合し、ユーザー指示を完遂する能力が重要です。この度、その能力を評価する新しいベンチマーク「SPIEval」が発表されました。SPIEvalは250のタスクと4,335件の個人記録、21のツールをサポートし、既存のLLMはGPT-5.5 (xhigh)でも57.3%の精度に留まることが判明。失敗の79%が情報特定ミスに起因しており、今後の改善が急務であることが浮き彫りになりました。