← ポッドキャスト一覧に戻る
Podcast · Episode 431

Transformerの長さ汎化を解明:正規言語における新分解理論

9月8日(火) · 5分
Transformerモデルは訓練時より長いシーケンスに汎化する能力を持つことが知られていますが、その条件は不明確でした。本研究は、特に正規言語においてTransformerが長さ汎化する条件を初めて完全に特性化。古典的な分解理論の限界を乗り越え、新しい代数的分解理論と判定アルゴリズムを提案し、モデルの予測可能性を大きく向上させます。
前のエピソードLLMと埋め込みモデルの使い分け:性能とコストの徹底比較 次のエピソードLLM推論を高速化する「RMM」:入力適応型行列積削減技術