아래로 당겨서 돌아가기
Qwen3 TTS는 심각하게 과소평가되고 있다 — 로컬에서 실시간으로 실행해보니 내가 써본 오픈소스 음성합성 모델 중 가장 표현력 있는 모델이었다

Qwen3 TTS는 심각하게 과소평가되고 있다 — 로컬에서 실시간으로 실행해보니 내가 써본 오픈소스 음성합성 모델 중 가장 표현력 있는 모델이었다

Qwen3 TTS is seriously underrated - I got it running locally in real-time and it's one of the most expressive open TTS models I've tried

안녕하세요 여러분, 약 1년 전에 Persona Engine이라는 재미있는 사이드 프로젝트를 공개했습니다. 음성인식(ASR) → 대형언어모델(LLM) → 음성합성(TTS) 파이프라인 전체를 로컬에서 실행하면서 동시에 입술 싱크가 맞는 실시간 가상 아바타(VTuber 같은 느낌)를 만드는 거였어요. 성공했고 정말 만족했는데, 당시에는 Sesame을 참고로 사용했기 때문에 음성합성 부분이 좀 아쉬웠거든요. 그 후로 한동안 쉬었다가, 1~2주 전에 이 프로젝트를 다시 시작해보려고 생각했고,