Podcast · Episode 193
Post-Norm Transformerの「ランク崩壊」メカニズムを解明
8月17日(月) · 5分
ディープラーニングモデル、特にTransformerのPost-Normアーキテクチャで発生する「ランク崩壊」の根本原因が解明されました。本研究は、トークン類似度の増加と勾配消失のメカニズムを2段階で分析。因果的アテンションが初期段階で類似度を高め、高類似度状態での勾配収縮が学習を妨げることを示唆しています。これにより、Post-Normの不安定性が理論的に裏付けられ、より安定したPre-Normへの移行理由が明確になります。