下に引いて戻る
RTX 5090 の cuBLAS における 60% の行列乗算性能バグ

RTX 5090 の cuBLAS における 60% の行列乗算性能バグ

60% MatMul Performance Bug in cuBLAS on RTX 5090

あなたの RTX GPU の計算能力の 60% が無駄になっているかもしれません。cuBLAS がバッチ FP32 ワークロードに対して非効率なカーネルをディスパッチしており、256×256 から 8192×8192×8 までのあらゆる行列演算で GPU の約 40% の性能しか使用していません。RTX 5090 で最新の CUDA 13.2.51、cuBLAS 13.3.0、ドライバ 595.58.03 でテストされており、すべての RTX 非 Pro GPU に影響する可能性があります。カスタムカーネルの実装により、複数のワークロードで劇的な改善が見られ、場合によっては cuBLAS より 2 倍以上高速です。

キーワード

performance bugMatMulbatched operationsFP32GPU optimizationkernel efficiencycompute utilization