下に引いて戻る
RTX 5090 における cuBLAS の 60% MatMul パフォーマンスバグ

RTX 5090 における cuBLAS の 60% MatMul パフォーマンスバグ

60% MatMul Performance Bug in cuBLAS on RTX 5090

cuBLAS がバッチ処理された FP32 ワークロード(256×256 から 8192×8192×8 まで)に対して非効率なカーネルをディスパッチしており、RTX GPU の利用可能な計算能力の約 40% しか使用していません。最新の CUDA 13.2.51、cuBLAS 13.3.0、ドライバ 595.58.03 でテストされており、以前のバージョンはさらに悪い性能を示しています。著者はシンプルながら効率的なカーネルを作成し、様々なワークロードで cuBLAS と比較し、顕著なパフォーマンスギャップを実証しています。

キーワード

performance bugMatMulbatched operationsFP32GPU optimizationkernel efficiencycompute utilization