
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

llama.cpp에서 추측 디코딩(여러 토큰을 한 번에 예측해서 속도를 올리는 기술)을 테스트하는 사람이 있는데, 결과가 완전 다르게 나왔대요. 같은 설정인데 Gemma 4 31b는 2배 빨라지고(100% 향상), Qwen 3.6은 40%만 빨라지는데, Devstrall small은 665%나 빨라진다고? 의문: 이 모델들의 뭐가 다르길래 추측 디코딩 효과가 이렇게 차이 나는 거야? 나중에 반복 페널티랑 스펙 타입을 조정하니까 Qwen도 빨라졌다고 해요. 같은 최적화 기법인데 모델마다 효과가 천차만별인 이유를 파고드는 얘기네요.