← ポッドキャスト一覧に戻る
Podcast · Episode 193

Post-Norm Transformerの「ランク崩壊」メカニズムを解明

8月17日(月) · 5分
ディープラーニングモデル、特にTransformerのPost-Normアーキテクチャで発生する「ランク崩壊」の根本原因が解明されました。本研究は、トークン類似度の増加と勾配消失のメカニズムを2段階で分析。因果的アテンションが初期段階で類似度を高め、高類似度状態での勾配収縮が学習を妨げることを示唆しています。これにより、Post-Normの不安定性が理論的に裏付けられ、より安定したPre-Normへの移行理由が明確になります。
前のエピソードWDL-OPD:不安定なAI学習を安定化させる新手法、混合制約型共同学習で性能向上 次のエピソード不変学習の目的関数からモデルの学習内容を予測:Landau理論の新展開