Podcast · Episode 131
Visual RAGの精度を革新:拡散言語モデルは「多く」より「正しく」証拠を選ぶ
8月15日(土) · 4分
Visual RAGにおいて、取得した全ての情報を言語モデルに渡す従来の手法は、拡散言語モデル(DLM)では逆効果となることが判明しました。情報過多によるセマンティックな衝突が精度を低下させるためです。本研究では、この問題を解決するトレーニング不要の「Entropy-Based Candidate Filter (ECF)」を提案。ECFは選択的な証拠採用により、DLMの回答精度を大幅に向上させ、Visual RAGの新たな最適解を示します。