0 / 5 節読了

MALTとは何か

MALTは、言語モデルの事前学習に用いられる新しい最適化アルゴリズムです。既存の「Muon」をさらに進化させた手法として登場しました。MuonはAdamWの代替として注目されていましたが、MALTはMuonの弱点を克服しています。特に、損失関数の「曲率異方性」への対応を強化し、学習の安定性と効率を向上させることを目的としています。

MuonとAdamWの課題

言語モデルの事前学習には、これまでAdamWのような最適化手法が広く使われてきました。しかし、AdamWは勾配の「異方性」に敏感であるという課題がありました。Muonはこの課題に対し、運動量行列を直交化することで勾配異方性を緩和する手法として提案されました。しかし、Muonは損失関数の「曲率幾何学」を明示的に考慮していませんでした。そのため、曲率異方性に対しては依然として敏感なままでした。この点が、学習のさらなる安定化と高速化を妨げる要因となっていました。

MALTの技術的特徴

MALTは、Muonの課題であった曲率異方性への感度を低減するために開発されました。その核心は「軽量な対角事前条件付け」の使用です。この事前条件付けは、メモリや計算オーバーヘッドを最小限に抑えつつ、損失関数の曲率幾何学を近似的に捉えます。具体的には、双方向の対角事前条件付けを適用し、事前条件付けされた運動量をニュートン-シュルツ反復によって直交化します。その後、結果を更新方向にマッピングし、ノルムグラフトによって更新の大きさを制御します。さらに、確率的勾配ノイズに対するロバスト性を高めるため、「MALTER」という適応的ステップサイズ再スケーリングを伴う拡張版も提案されています。

実験結果と期待される効果

MALTおよびMALTERは、GPT-2 Small、Medium、Largeの事前学習でその性能が評価されました。実験結果は、提案手法がMuonを明確に上回る性能を発揮することを示しています。同時に、メモリフットプリントと実時間(wall-clock time)はMuonとほぼ同等に維持されました。これは、性能向上と引き換えにリソース消費が増えるというトレードオフがないことを意味します。MALTの導入により、大規模言語モデルの事前学習がより効率的かつ安定的に行えるようになり、開発サイクル全体の高速化に貢献すると考えます。

私の見方

最適化アルゴリズムの進化は、AIモデルの性能向上に不可欠です。MALTは、既存の優れた手法であるMuonの弱点をピンポイントで改善しています。特に、リソース効率を損なわずに性能を向上させる点は高く評価できます。大規模モデルの学習コストが課題となる中で、このような地道な改善が積み重なることで、より高度なAIが実現します。今後、MALTがAdamWやMuonに代わる新たな標準として普及するか、動向を注視していきます。

柴亮太
柴亮太の視点

最適化手法の改善は、モデルの学習速度と安定性に直結します。MALTがMuonを上回るなら、すぐにでも試すべきです。理論より実践。一次情報を取りにいきます。