AIモデル学習における構造情報の重要性
AIモデルの学習において、訓練データがどのように構造化されているか、その「表記方法」はこれまで見過ごされてきた重要な変数だと私は見ています。テキスト抽出の選択がモデルの振る舞いを変化させることは確立されていますが、その選択がコーパスにどのような表記をもたらすかは、これまで十分に測定されてきませんでした。私たちは「クリーンウィンドウ生存率」という指標を定義し、ストリームがどれだけ境界推論を必要とするかを決定論的に計測しました。これは、文書の配置がどのように記述されているか、その表記がモデルに与える影響を明らかにするための重要な一歩だと考えます。
訓練データとモデル挙動の分析結果
私の調査では、主に3つの側面から表記の影響を測定しました。まず、13の公開コーパスを調査した結果、C4コーパスにおける「クリーンウィンドウ生存率」が0.889であるのに対し、ビジョン変換されたPDFスライスでは0.153まで低下することが判明しました。これは、マークアップされていない長文テキストが希少な資源であり、機関データが消費者データよりも多く残っていることを示していると私は分析します。次に、0.6Bから8.2Bまでの5つのベースモデルと2つのパイプラインを対象に、構造的な告知(見出しなど)を削除すると、後続の散文の予測が著しく困難になることを確認しました。しかし、その告知の表記方法を変更しても、予測精度には影響がありませんでした。この結果は、モデルにとって重要なのは「告知の存在」であり、特定の「記号」ではないことを明確に示していると私は考えます。最後に、ベースモデルは、入力から削除された構造的告知を自律的に再生成する能力を持たないことも判明しました。
データセット設計と今後の展望
これらの測定結果に基づき、私たちは新しいフォーマット「ピュアフレーム」を提案します。これは、段落を元の順序で配置し、すべての告知を可逆的なサイドカーに削除し、告知の有無に基づいてマーク付きコピーと混合するものです。このアプローチは、モデルが「訓練する能力」に基づいてフォーマットオペレーターを選択すべきであり、「保持する忠実度」に基づいて選ぶべきではないという私の見方に基づいています。データカードには、エクストラクターの識別子と「クリーンウィンドウ生存率」を記録することが必須だと考えます。これにより、AIモデルの訓練データにおける構造情報の重要性が再認識され、より効果的なデータセット設計へと繋がるでしょう。
マークアップの記号は重要ではありません。構造的告知の「有無」こそが、モデルの予測能力を左右します。データ設計は、複雑な表記よりも本質的な構造を重視すべきです。この一次情報を最速で自身のデータセットに反映させます。