
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

이번 달 Cursor와 Zai 구독 한도를 다 써버려서 로컬 대규모 언어 모델(LLM)을 직접 구축하기로 결정했습니다. RTX 5090에서 Qwen3.5 27B를 실행한 결과 예상보다 훨씬 좋은 성능을 얻었고, 상당히 우수한 초당 추론 횟수(tps)를 달성했습니다. 컨텍스트 윈도우는 218k로 설정할 수 있으며, 2개의 동시 세션도 실행 가능하지만 세션당 속도는 예상대로 감소합니다. vLLM 0.19에서는 256k의 전체 컨텍스트 윈도우로 작동시킬 수 없었지만, 0.17에서는 작동합니다. 다만 속도가 저하되는데, 0.17에는 새 버전의 최적화 기능이 많이 포함되어 있지 않기 때문입니다.