0 / 4 節読了

生成AI監査の現状と課題

生成AIの振る舞いを評価する際、私たちは「どれくらいの頻度で方針に従うか」という割合を報告します。この報告される割合は、AIの性能を比較したり、機能の低下を追跡したり、導入の判断に使われます。しかし、この割合は評価対象のAIだけでなく、測定方法の選び方にも大きく左右されます。そのため、割合が変わったときに、AI自体が変わったのか、それとも測定方法が変わったのかが不明瞭になる問題がありました。

新しい測定の仕組み「ASSERT」

この課題を解決するため、新しい測定の仕組み「ASSERT」が提案されました。ASSERTは、生成AIの監査に特化した仕様駆動型の測定処理の流れです。評価される各割合を、その結果を生み出すために使われた測定方法の具体的な仕様書と紐付けます。これにより、評価の透明性が高まり、結果の解釈が容易になります。

測定方法が評価結果に与える影響

ASSERTは、行動評価の基準やテスト項目を作成するのを助け、その後、生成AIに対して監査を実行し、評価結果を返します。ある事例分析では、対話での詐欺行為に関する監査を行いました。そこでは、対話の設定、模擬利用者、評価者、そして違反の証拠となる基準といった測定方法の選択が、報告される割合に大きく影響することが分かりました。これらの測定方法の選び方によって、評価結果が大きく変わり、AIの順位さえ入れ替わる可能性があります。

私の見方と今後の展望

私の見方では、ASSERTのような仕組みは、生成AIの信頼性を確保する上で不可欠です。測定方法が明確になることで、なぜあるAIが別のAIよりも良い結果を出したのか、その原因を特定しやすくなります。これは、開発者がAIを改善する上での重要な手がかりとなるでしょう。今後は、様々な分野での生成AIの評価にこの仕組みが広く活用されることを期待しています。

柴亮太
柴亮太の視点

生成AIの評価は、何をどう測るかで結果が全く変わります。これは開発現場で痛感する事実です。ASSERTは、この測定の曖昧さを排除する第一歩。評価基準を明確にし、一次情報を取りに行く。これが最速でプロダクトを良くする道です。