往下拉回到首頁
突破訓練中矩陣乘法瓶頸的新路徑:用四元數重新思考 Transformer

突破訓練中矩陣乘法瓶頸的新路徑:用四元數重新思考 Transformer

Paths to Overcome Limitations Matrix Multiplication Bottleneck in Training [D]

核心想法是:我們可能用錯了數學工具來表示 Transformer 中的資訊。四元數(3D 旋轉背後的代數)提供了完全不同的計算方式。如果把注意力機制(attention)中的實數投影換成四元數的哈密頓積(Hamilton product),你會得到相同的效果,但參數數量只需四分之一。更有趣的是幾何角度:LoRA 這類微調方法之所以有效,是因為微調更新會聚集在低維旋轉子空間中。這暗示我們可能一直在用過度複雜的方式做本質上是旋轉的操作。