아래로 당겨서 돌아가기
RTX 5090의 cuBLAS 60% 행렬 곱셈 성능 버그

RTX 5090의 cuBLAS 60% 행렬 곱셈 성능 버그

60% MatMul Performance Bug in cuBLAS on RTX 5090

당신의 RTX GPU가 계산 능력의 60%를 낭비하고 있을 수 있습니다. cuBLAS가 배치 FP32 워크로드에 대해 비효율적인 커널을 디스패치하여 GPU의 약 40%만 사용하고 있습니다. 256×256부터 8192×8192×8까지 모든 행렬 연산이 영향을 받으며, 모든 RTX 비전문가용 GPU에 영향을 미칠 가능성이 있습니다. 최신 CUDA 13.2.51, cuBLAS 13.3.0, 드라이버 595.58.03으로 테스트되었으며 이전 버전은 더 나쁜 성능을 보입니다. 커스텀 커널 구현으로 다양한 워크로드에서 극적인 개선을 확인할 수 있으며, 경우에 따라 cuBLAS보다 2배 이상 빠릅니다.

키워드

performance bugMatMulbatched operationsFP32GPU optimizationkernel efficiencycompute utilization