柴亮太の
AI最前線
最新
基礎
タイムライン
ポッドキャスト
About
☰
×
最新
基礎
タイムライン
ポッドキャスト
About
← ポッドキャスト一覧に戻る
Podcast · Episode 432
LLM推論を高速化する「RMM」:入力適応型行列積削減技術
9月8日(火) · 5分
大規模言語モデルの推論コスト削減に向け、新しい手法「RMM(Reduced Matrix Multiplication)」が登場しました。これは、モデルの重みを変更せずに入力データに適応し、行列積の計算量を削減する画期的な技術です。訓練不要で、精度と効率のバランスを制御しながら、特に長いシーケンス長で推論速度を大幅に向上させることが期待されます。
元記事を読む →
前のエピソード
Transformerの長さ汎化を解明:正規言語における新分解理論
次のエピソード
発言者の権威を考慮したRAGシステム「ParliamentRAG」がイタリア議会で多角的視点を提供