往下拉回到首頁
Transformer 模型優化卡關:FP16 + ONNX 之後還能怎麼做?(剪枝和圖優化效果不大)

Transformer 模型優化卡關:FP16 + ONNX 之後還能怎麼做?(剪枝和圖優化效果不大)

Transformer Model Optimization: Beyond FP16 + ONNX—Why Pruning & Graph Optimization Aren't Delivering

有個開發者在優化 Transformer 模型的推論速度和大小時遇到瓶頸。他已經用 FP16 把模型縮小到一半、用 ONNX Runtime 優化過、試過非結構化和結構化剪枝(pruning)以及圖優化(graph optimization),但這些都沒帶來明顯進展,模型還是卡在 ~162 MB。他想知道當標準優化招式都用完了,還有什麼辦法能繼續縮小和加速。