0 / 4 節読了

Ex-Omni-2Dとは何か

従来のマルチモーダル対話モデルは、テキスト入力の理解と音声応答の生成に特化していました。しかし、その応答には視覚的な要素が欠けており、まるで「声だけの存在」でした。私はこの点が、AIとの対話がまだ完全に人間らしいとは言えない理由だと感じています。

今回発表された「Ex-Omni-2D」は、この課題を根本から解決するものです。このフレームワークは、単にテキストと音声を生成するだけでなく、参照画像と参照音声に基づいて、アバターの動きを含む動画までを連携させて生成します。これにより、AIが視覚的な「存在感」を持って対話に参加できるようになるのです。

視覚的な存在感を持つ対話の実現

Ex-Omni-2Dの核となるのは、「Visual Thought Plan (VTP)」という構造化された計画です。これは、マルチモーダルなクエリ、参照画像、参照音声が与えられた際に、AIがシーンの状況、表現すべき感情、そしてアバターの動きを予測し、記述するものです。このVTPに基づいて、応答テキストと独自のマルチコードブック音声ユニットが生成されます。

生成された音声ユニットは、共有の音響-時間インターフェースを形成し、音声としてデコードされると同時に、動画フレームとオンラインで同期されます。この仕組みによって、テキスト、音声、そしてアバターの動画がシームレスに連携し、まるで人間が話しているかのような自然な視覚表現を伴う対話が実現します。

効率的な学習とリアルタイム生成の秘密

この画期的な技術は、大規模なクエリ-テキスト-音声-動画の教師データを必要としません。私の調査では、Ex-Omni-2Dは異種のスピーチ、対話、アバター動画データから学習することが可能だと判明しています。これにより、データ収集の障壁が大幅に下がります。

さらに、効率的なリアルタイム生成のために、フルシーケンスのVideo Generatorを「Teacher」とし、それを数ステップのブロック因果的な「Streaming Student」モデルに蒸留する手法を採用しています。この「Streaming Student」は、Prefix Streamingメカニズムによって連続するチャンク間でクリーンな潜在表現を保持し、生成品質の劣化を抑制します。結果として、4ステップの推論で、エンドツーエンドのRTF(リアルタイムファクター)が1.293という高速性を達成しており、実用的な品質と効率性を両立させています。

私の見方:AI対話の未来

Ex-Omni-2Dの登場は、AIとのインタラクションのあり方を大きく変えるでしょう。これまで、AIとの対話はテキストチャットか音声アシスタントが中心でしたが、視覚的なアバターが感情豊かに話すことで、ユーザー体験は飛躍的に向上します。

私はこの技術が、バーチャルアシスタント、カスタマーサポート、教育コンテンツ、さらにはエンターテイメント分野において、新たな標準を確立すると見ています。AIが「ただのツール」ではなく、「視覚的な存在」として私たちの生活に溶け込む日も近いでしょう。これは、人間とAIのコミュニケーションを次のレベルへと引き上げる、重要な一歩だと断言します。

柴亮太
柴亮太の視点

動画生成は対話AIの最終形態です。これまではテキストと音声だけでしたが、視覚情報が加わることで、人間はより深く没入します。私はこの技術を最速でプロダクトに組み込み、顧客体験をぐるぐる回して最適化します。