研究の背景:LLMと人間の概念
先行研究では、大規模言語モデル(LLM)の表現が人間のカテゴリ境界を広く回復する一方で、詳細な典型性構造を反映できないことが指摘されていました。これは、密なモデル表現におけるコサイン類似度を用いた分析に基づくものです。LLMが人間の言語を理解し生成する能力を持つ一方で、その内部表現が人間の概念構造とどの程度一致しているのかは、重要な問いです。
新たなアプローチ:SAEの活用
私はこの先行研究のアプローチを再検討し、より解釈性の高い類似度尺度として、スパースオートエンコーダ(SAE)の活性化潜在セットのオーバーラップに着目しました。SAEは、モデルの内部表現から、より解釈可能な「特徴」を抽出するために用いられる技術です。まず、このセットレベルの尺度が意味を持つことを確認するため、SAE潜在セットが制御されたトイモデルにおいてユニオンライクな合成構造を回復できること、そして自然言語において意味的に一貫した近傍を誘発できることを検証しました。
SAEの有効性と限界
人間が持つ概念との関連性をSAE活性化セットの類似度で分析した結果、SAEの活性化セットは、密な埋め込みや残差ストリーム状態と比較して、人間のカテゴリ境界やカテゴリ内典型性をより忠実に回復しないことが判明しました。むしろ、SAEはモデル内部の類似性構造を追跡していると私は見ています。これは、SAEがモデルの内部ロジックを反映している一方で、それが必ずしも人間の認知構造と一致しない可能性を示唆しています。
人間の概念との乖離が示すもの
この乖離をさらに深く探るため、私は制御された意味的変更の下で活性化潜在セットを研究しました。その結果、人間の概念的変化の判断とSAE活性化セットの変化との間に大きな不一致があることが明らかになりました。例えば、人間が「少しだけ変化した」と感じる概念でも、SAEの活性化セットは大きく変化したり、その逆の現象が見られたりしました。これは、SAEが捉える特徴が、人間が直感的に感じる概念の変化とは異なるメカニズムで動いていることを示しています。
「Bag-of-Features」セマンティクスへの疑問
これらの分析結果は、理想化された設定以外では、SAEの特徴が単純な「bag-of-features」セマンティクス、つまり個々の特徴が独立して意味を構成するという考え方で構成されないことの証拠であると私は解釈しています。SAEは強力なツールですが、その内部で特徴がどのように相互作用し、より複雑な概念を形成しているのかについては、まだ多くの謎が残されています。この研究は、LLMの内部表現と人間の認知のギャップを埋めるための重要な一歩であると感じます。
SAEが人間の概念を捉えきれないのは当然です。モデルはモデルの論理で動いています。重要なのは、この乖離をどう理解し、どう設計に活かすか。一次情報を取り、ぐるぐる回して最適解を見つけるしかありません。