
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

개발자가 메모리가 제한된 GPU 환경에서 DFlash 추측 디코딩(speculative decoding) 기술 구현에 성공했습니다. 단 8GB의 VRAM을 가진 RTX 2080 SUPER를 사용하여 35B 파라미터의 Qwen3.5-35B-A3B 모델(Q5_K_M으로 양자화, 약 24.44GB)을 실행하고, 더 작은 Q4_K_M 드래프트 모델로 추론 속도를 높였습니다. CUDA 백엔드를 사용하며 llama.cpp 저장소의 DFlash PR을 기반으로 테스트되었으며, 소비자급 하드웨어에서도 적절한 양자화와 모델 선택을 통해 고급 추론 최적화 기술이 가능함을 보여줍니다.