How a benchmark change produced a faster TTS model
Coval は、テキスト読み上げの遅延ベンチマークを変更し、先頭の無音部分を計測に含めるようにした。新しい手法では、Gradium のコードを一切変更していないにもかかわらず、報告される最初の音声までの時間(TTFA)が171.9ミリ秒から429.6ミリ秒に増加し、モデルが相当量の聞こえない音声を出力していたことが明らかになった。Gradium はその後、先頭の無音を除去するようモデルを最適化し、中央値で214ミリ秒という新たな TTFA を達成した。これは従来より約170ミリ秒速い。