
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

32GB VRAM이면 최대 20GB 정도의 모델만 실행할 수 있다고 생각했어요. Qwen3.5 27B Q4나 Q6 같은 거 말이에요. 모든 게 VRAM에 들어가야 하고, 아니면 2 t/s 정도로 떨어질 거라고 생각했죠. 근데 완전 틀렸어요. llama.cpp에서 Qwen3.6 Q8을 256k 컨텍스트로 테스트해봤는데, `--fit` 옵션을 켜니까 모델 가중치만 해도 제 VRAM보다 크고, Oculink로 연결된 RTX 5090인데도 57 t/s가 나왔어요! 진짜 마법 같아요. 저처럼 '모든 게 VRAM에 들어가야 한다'고 생각하고 있던 분들이라면 꼭 이 기능을 시도해보세요.