아래로 당겨서 돌아가기
RTX 5090의 cuBLAS 60% MatMul 성능 버그

RTX 5090의 cuBLAS 60% MatMul 성능 버그

60% MatMul Performance Bug in cuBLAS on RTX 5090

cuBLAS가 모든 배치 FP32 워크로드(256×256부터 8192×8192×8까지)에 대해 비효율적인 커널을 디스패치하고 있으며, RTX GPU의 사용 가능한 컴퓨팅 능력의 약 40%만 활용하고 있습니다. 최신 CUDA 13.2.51, cuBLAS 13.3.0, 드라이버 595.58.03으로 테스트되었으며, 이전 버전들은 더욱 나쁜 성능을 보입니다. 저자는 간단하면서도 효율적인 커널을 작성하여 다양한 워크로드에서 cuBLAS와 비교하고 현저한 성능 격차를 입증했습니다.

키워드

performance bugMatMulbatched operationsFP32GPU optimizationkernel efficiencycompute utilization