아래로 당겨서 돌아가기
스트리밍 음성합성의 텍스트 정규화 문제가 왜 아무도 안 얘기할까?

스트리밍 음성합성의 텍스트 정규화 문제가 왜 아무도 안 얘기할까?

I can't believe text normalization is so underdiscussed in streaming text-to-speech [D]

놀랍게도 스트리밍 텍스트음성변환(TTS) 모델의 기본적인 문제에 대해 거의 논의가 없어요. 자연스러운 목소리, 고품질 음성, 표현력 있는 발음 같은 건 다들 찾지만, 가격, 날짜, URL, 프로모션 코드, 전화번호 같은 기본 정보를 읽을 때는 완전히 망가져요. 상용 실시간 스트리밍 TTS 모델들이 날짜, URL, 약자 발음을 어떻게 처리하는지 비교한 벤치마크를 봤는데, 1000개 이상의 테스트 사례를 검증한 결과가 정말 충격적입니다.