往下拉回到首頁
用單張 RTX 5080 從零開始訓練 2.35 億參數的大型語言模型

用單張 RTX 5080 從零開始訓練 2.35 億參數的大型語言模型

Building a 235M Parameter LLM from Scratch on a Single RTX 5080

有位開發者用 PyTorch 在單張消費級 GPU 上完全從零開始訓練了一個小型 Transformer 語言模型——沒有預訓練權重,沒有任何捷徑。成果是 Plasma 1.0,一個擁有 2.35 億參數、18 層、隱藏層大小為 1024 的模型,採用 LLaMA 風格的架構,包括分組查詢注意力(GQA)、SwiGLU 前饋網路、RoPE 位置編碼和 RMSNorm。每一個參數都是直接從原始文本中學習得來的,證明了你不需要龐大的運算叢集也能訓練出可用的語言模型。