自然言語生成の評価における課題
近年の大規模言語モデル(LLM)の急速な発展により、自然言語生成(NLG)の技術は多岐にわたる実用的な場面で活用されています。しかし、生成された文章の質を客観的かつ信頼性高く評価することは、依然として重要な課題です。従来の自動評価基準は、文法的な正確さや単語の一致度といった表面的な側面を測るには有効でした。しかし、人間が文章を読む際に感じる「体験品質」(QoE)のような、より複雑で多角的な感覚は捉えきれませんでした。例えば、文章が流暢であるか、意図が明確に伝わるか、感情に訴えかけるか、といった要素は、自動評価では見落とされがちです。
ドイツ語向け評価データ集「TextQ-German」の構築
私たちはこの評価のギャップを埋めるため、ドイツ語の自然言語生成に特化した新しいデータ集「TextQ-German」を開発しました。これは、人間中心の評価に基づいています。データ集は、自動要約と機械翻訳という二つの主要な応用分野を対象としています。データ収集には、クラウドソーシングという手法を採用しました。これは、オンラインプラットフォームを通じて、多数のドイツ語話者から品質評価の協力を得るものです。参加者には、生成された文章に対する総合的な品質評価に加え、それぞれのタスクにおける具体的な知覚品質の側面、例えば「理解しやすさ」「自然さ」「正確性」などについても評価してもらいました。これにより、人間がどのような要素を重視して文章の品質を判断しているかを詳細に特定できました。
自動体験品質予測モデルの設計と性能
収集した人間の評価データを用いて、私たちは自動で体験品質を予測する仕組みを開発しました。この仕組みは、大きく分けて三つのアプローチで構成されています。一つは、トランスフォーマーという特定の設計に基づくものです。これは、大規模なテキストデータから学習し、複雑な言語パターンを捉える能力に優れています。もう一つは、言語的な特徴、例えば文の長さ、特定の単語の使用頻度、構文の複雑さなど、文章の構造や内容から抽出される情報に基づいたものです。そして三つ目は、これら二つの要素を組み合わせた複合型の手法です。実験の結果、複合型の手法が、純粋なトランスフォーマー設計や言語的特徴のみの仕組みよりも、ほぼ全ての実験設定で優れた性能を示しました。特に注目すべきは、言語的な特徴だけでも、細かく調整されたAIの仕組みに近い予測能力を発揮した点です。これは、複雑なAIを使わずとも、ある程度の品質予測が可能であることを示唆しています。
大規模言語モデルの出力と汎用性
私たちは、このデータ集をさらに拡張し、最新の大規模言語モデル(LLM)によって生成された文章の評価情報も加えました。これらの文章にも、総合的な体験品質の点数が付与されています。これにより、現代の最先端技術で生成された文章の品質も、人間の感覚に基づいて評価できるようになりました。最終的な検証は、学習に用いなかった「未知の」データセットで行われました。その結果、私たちの開発した予測仕組みが、これまで見たことのない文章に対しても高い汎用性(汎化能力)を持つことが確認されました。この研究成果は、自然言語生成の評価における貴重な公開情報源となるでしょう。また、自動で体験品質を予測するための基準も提供します。これにより、人間の感じる品質に、より一層寄り添った自然言語生成仕組みの開発が促進されると期待されます。
PR
文賢 →
生成AIの評価は、結局「人がどう感じるか」が全てです。自動評価基準はあくまで補助。この研究は、その本質に迫る良い試みです。私なら、まず自分のプロダクトのユーザー意見収集に、この考え方を応用します。最速で一次情報を掴みます。