
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

노트북 RTX 4060(8GB VRAM)에서 Qwen3.6-35B-A3B를 성공적으로 실행했으니 설정 방법을 공유하려고 합니다. 다만 이건 일반적인 채팅용이 아니라 더 큰 AI 파이프라인 안에서 코딩 서브에이전트로 사용하고 있어서, 일부 설정은 그 특정 용도에 맞춰져 있습니다. 가장 골치 아팠던 부분은 무제한 사고 모드(thinking)가 충돌하지 않으면서도 조용히 max_tokens 예산 전체를 소비하고 있었다는 것입니다. 사고 기능을 비활성화하면 해결되지만, 실제로는 토큰별 제한을 사용하는 더 똑똑한 방법도 있습니다. 제한된 하드웨어에서 특정 작업용 강력한 모델을 돌리려면 이 글이 몇 시간의 디버깅 시간을 절약해줄 겁니다.