Podcast · Episode 244
LLMの概念表現とSAEの限界:人間の知覚との乖離を解明
8月20日(木) · 5分
大規模言語モデル(LLM)が人間のカテゴリ境界を捉える一方で、詳細な概念構造を反映しないという先行研究を、スパースオートエンコーダ(SAE)の活性化セットの観点から再検証した論文を紹介します。SAEはモデル内部の類似性を追跡するものの、人間の概念的変化とは大きな乖離があることが判明。SAE特徴が単純な「bag-of-features」として機能しない可能性を示唆しています。