リアルタイムMRIと発話研究の課題
リアルタイムMRI(rtMRI)技術の進化により、私たちは発話中の声道がどのように動いているかを直接観察できるようになりました。これは、従来の音声学では捉えきれなかった「見えない発話」のメカニズムを解明する上で画期的な進歩です。しかし、このrtMRIで得られる複雑な調音パターンを、言語学的な意味を持つ音素や音韻カテゴリに正確にマッピングすることは、依然として大きな課題でした。画像データから直接、発話の最小単位である音韻情報を抽出し、分類する技術が求められていたのです。
音声AIモデル「PhonoQ」の役割
この課題に対し、本研究では音声ベースのAIモデル「PhonoQ」が持つ構造化された音韻特徴に注目しました。PhonoQは、調音様式(例えば、破裂音か摩擦音か)、調音部位(唇、歯、口蓋など)、有声性(声帯振動の有無)、そして母音の特徴(高さ、前後性)といった音韻的な情報を認識するように教師あり学習されたモデルです。私たちは、PhonoQの内部にあるConformerモジュールからこれらの音韻特徴を抽出し、rtMRIで得られた調音輪郭データと同期させて組み合わせることで、調音パターンの分類精度向上を目指しました。
画期的な分類精度向上
PhonoQから抽出された音韻特徴を組み込んだモデルは、従来の音声認識で広く使われるWavLM-largeやHuBERT-largeといったベースラインモデルと比較して、顕著な性能向上を示しました。特に注目すべきは、未見の発話データや、モデルの学習には含まれていない未見の話者に対しても、調音様式、調音部位、有声性、母音の高さ、母音の前後性といった音韻ターゲットの分類において、マクロF1スコアが大幅に改善された点です。さらに、より詳細な39種類の音素分類においても、その精度が向上しました。これは、PhonoQの音韻特徴が、発話の多様性や話者間の個人差を超えて、普遍的な音韻情報を捉える能力を持つことを示唆しています。
音声情報と調音モデルの連携
本研究では、調音輪郭のみで推論を行う設定においても、同期された音声から得られた音韻情報を教師として用いることで、輪郭のみの学習よりも一貫して modest ながらも確実な性能向上が見られました。これは、音声データに含まれる音韻情報が、直接的な調音モデルに部分的に転送され、その学習を補強できる可能性を示しています。つまり、音と口の動きという異なるモダリティ間で、言語的な情報が相互に作用し、発話理解を深めることができるという新たな知見です。
発話の微細なパターン解明への貢献
最終的に行われた後方分析では、このモデルが発話における微細かつ解釈可能な表面感応パターンを捉えていることが明らかになりました。例えば、英語の/t/がフラッピング(軽く弾くような音)として実現される現象や、/t/と/r/の連続における調音部位の後退や破擦音化、さらには鼻音と続く子音の調音部位が同化する現象など、実際の言語で観察される複雑な音韻現象と一致するパターンが確認されました。これは、本研究が単なる分類精度の向上に留まらず、AIが人間の発話メカニズムの深層を解明する強力なツールとなり得ることを示しています。
声道調音の理解は、AI音声のリアリティを左右します。この研究は、AIが人間の発話メカニズムを深く学ぶための一次情報です。私は、この知見を最速で音声合成モデルに組み込み、より自然なAI音声をぐるぐる回す基盤にすべきだと考えます。