往下拉回到首頁
RTX 5090 上 cuBLAS 的 60% MatMul 效能漏洞

RTX 5090 上 cuBLAS 的 60% MatMul 效能漏洞

60% MatMul Performance Bug in cuBLAS on RTX 5090

cuBLAS 在所有批次 FP32 工作負載上都會分派一個低效率的核心,從 256×256 到 8192×8192×8 都受影響,只能使用 RTX GPU 上約 40% 的可用運算能力。使用最新的 CUDA 13.2.51、cuBLAS 13.3.0 和驅動程式 595.58.03 進行測試,舊版本的表現更差。作者撰寫了一個簡單但高效的核心,並在各種工作負載上與 cuBLAS 進行比較,展示了顯著的效能差距。

關鍵字

performance bugMatMulbatched operationsFP32GPU optimizationkernel efficiencycompute utilization