下に引いて戻る
ストリーミング音声合成の「テキスト正規化」がなぜか議論されていない理由

ストリーミング音声合成の「テキスト正規化」がなぜか議論されていない理由

I can't believe text normalization is so underdiscussed in streaming text-to-speech [D]

驚くほど誰も話題にしていないんですけど、ストリーミング型のテキスト音声変換(TTS)モデルって、自然な読み方や高い音声品質、表現力の豊かさは結構いいんです。でも価格、日付、URL、プロモーションコード、電話番号みたいな基本的な情報を読ませると、ボロボロになるんですよ。実際に商用のリアルタイムストリーミングTTSモデルを、日付やURL、頭字語の発音精度で比較したベンチマークを見つけたんですが、1000以上のテストケースで検証した結果、これらのモデルが意外と基本的なところで失敗してることが明らかになってます。