아래로 당겨서 돌아가기
ResBM: 새로운 Transformer 아키텍처가 활성화값을 128배 압축, AI 훈련 대역폭 비용 대폭 절감

ResBM: 새로운 Transformer 아키텍처가 활성화값을 128배 압축, AI 훈련 대역폭 비용 대폭 절감

ResBM: New Transformer Architecture Cuts AI Training Data Transfer by 128×, Making Massive Models Cheaper to Train

Macrocosmos가 ResBM(잔차 병목 모델)에 관한 논문을 발표했습니다. 이는 AI 훈련의 실제 문제를 해결하는 영리한 새로운 Transformer 설계입니다. 거대한 모델을 여러 GPU에 분산시키면 끊임없이 서로 통신해야 하는데, 이는 막대한 대역폭을 낭비하고 속도를 저하시킵니다. ResBM은 파이프라인 단계 간의 데이터를 128배 압축하는 잔차 인코더-디코더 병목을 사용합니다. 즉, 정보를 원래 크기의 1/128로 압축하면서도 모델의 학습 능력을 유지한다는 뜻입니다. 놀랍게도 실제로 작동하며 성능 손실이 없습니다. 이는 무제한의 컴퓨팅 예산이 없는 연구소에게 대규모 AI 모델 훈련을 훨씬 저렴하고 빠르게 만들 수 있어 매우 중요합니다.