下に引いて戻る
Qwen3 TTS は過小評価されている——ローカルでリアルタイム実行してみたら、試した中で最も表現力豊かなオープンソース音声合成モデルだった

Qwen3 TTS は過小評価されている——ローカルでリアルタイム実行してみたら、試した中で最も表現力豊かなオープンソース音声合成モデルだった

Qwen3 TTS is seriously underrated - I got it running locally in real-time and it's one of the most expressive open TTS models I've tried

やあみんな、約1年前に Persona Engine という楽しいサイドプロジェクトをリリースしました。音声認識(ASR)→ 大規模言語モデル(LLM)→ テキスト音声変換(TTS)のパイプライン全体をローカルで実行しながら、リアルタイムでリップシンクする仮想アバター(VTuber みたいな感じ)を作るというものです。実現できて本当に満足していたんですが、当時は Sesame を参考にしていたので、音声合成の部分はちょっと物足りなかったんですよね。その後、しばらく休止していたんですが、1、2週間前にこのプロジェクトをリフレッシュしようと思って、それで