下に引いて戻る
ResBM:新型Transformerアーキテクチャが活性化値を128倍圧縮、AI訓練の通信コストを劇的削減

ResBM:新型Transformerアーキテクチャが活性化値を128倍圧縮、AI訓練の通信コストを劇的削減

ResBM: New Transformer Architecture Cuts AI Training Data Transfer by 128×, Making Massive Models Cheaper to Train

Macrocosmos が ResBM(残差ボトルネックモデル)に関する論文を発表しました。これは AI 訓練における実際の課題を解決する巧妙な新型 Transformer 設計です。巨大なモデルを複数の GPU に分散させると、それらが常に相互通信する必要があり、膨大な帯域幅を浪費して速度が低下します。ResBM はパイプラインステージ間のデータを 128 倍圧縮する残差エンコーダ・デコーダボトルネックを使用します。つまり、情報を元のサイズの 1/128 に圧縮しながら、モデルの学習能力を維持するということです。驚くべきことに、実際に機能し、性能を損なわないのです。これにより、大規模 AI モデルの訓練がはるかに安価で高速になる可能性があり、無制限の計算リソースを持たない研究機関にとって極めて重要です。