往下拉回到首頁
串流語音合成的文字正規化問題被嚴重忽視——為什麼沒人在討論?

串流語音合成的文字正規化問題被嚴重忽視——為什麼沒人在討論?

I can't believe text normalization is so underdiscussed in streaming text-to-speech [D]

說真的有點扯,大家都在追求自然語調、高品質音色和表達力豐富的語音合成(TTS)模型,但很少人討論一個根本問題:這些模型在處理價格、日期、網址、優惠碼、電話號碼這些基本資訊時,表現差到不行。我最近找到一份基準測試報告,比較了各大商用即時串流語音合成模型在念日期、網址、縮寫詞等內容時的準確度——他們測試了超過1000個案例。結果有點嚇人,這些看起來很聰明的AI其實在最基礎的東西上常常出包。