
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

TurboQuant 포크에서 Qwen3.6-35B-A3B를 실행하고 추측 디코딩을 시도했다면, 사실 아무것도 하지 않고 있었던 거예요. 서버가 에러 메시지도 없이 일반 디코딩으로 조용히 돌아가고 있었던 거죠. 추측 디코딩의 기본 개념은 이렇습니다: 작은 모델(Qwen3.5-0.8B 같은)과 큰 모델을 함께 실행합니다. 작은 모델이 다음 토큰들을 빠르게 예측하고, 큰 모델이 그 예측들을 한 번에 검증합니다. 큰 모델이 동의하는 부분은 유지하고, 거부하는 부분은 다시 생성합니다. 즉, 큰 모델이 충분히 빠르면 무료로 상당한 속도 향상을 얻을 수 있다는 뜻입니다.