← ポッドキャスト一覧に戻る
Podcast · Episode 244

LLMの概念表現とSAEの限界:人間の知覚との乖離を解明

8月20日(木) · 5分
大規模言語モデル(LLM)が人間のカテゴリ境界を捉える一方で、詳細な概念構造を反映しないという先行研究を、スパースオートエンコーダ(SAE)の活性化セットの観点から再検証した論文を紹介します。SAEはモデル内部の類似性を追跡するものの、人間の概念的変化とは大きな乖離があることが判明。SAE特徴が単純な「bag-of-features」として機能しない可能性を示唆しています。
前のエピソードAIモデルの訓練後適応技術を体系化:6次元分類とAIガバナンスへの示唆 次のエピソードAI予測の確率的自己無矛盾性を検証する新手法:AI安全性の基盤構築へ