往下拉回到首頁
RTX 5090 上 cuBLAS 的 60% 矩陣乘法效能漏洞

RTX 5090 上 cuBLAS 的 60% 矩陣乘法效能漏洞

60% MatMul Performance Bug in cuBLAS on RTX 5090

你的 RTX 顯卡可能在浪費 60% 的運算能力!cuBLAS 在處理批次 FP32 矩陣乘法時,會呼叫一個超沒效率的核心,從 256×256 到 8192×8192×8 的工作負載都中招。這個問題應該影響所有 RTX 非專業版顯卡。用最新的 CUDA 13.2.51、cuBLAS 13.3.0 和驅動程式 595.58.03 測試過,舊版本的表現更糟。有人寫了一個簡單但高效的自訂核心來比較,結果在某些情況下快了 2 倍以上。

關鍵字

performance bugMatMulbatched operationsFP32GPU optimizationkernel efficiencycompute utilization