
検証・ベンチマーク
ラボレポート
中国語TTSモデルは数字をどう読むか:音声クローン600サンプルのベンチマーク
Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Baseを、少数・識別子・通貨・数式・科学単位を含む中国語の音声クローン600サンプルで評価しました。
Kai-Teh Tzeng
12分
Topic
モデルや方式を同じ条件で測り、数字の意味と限界まで確かめます。

Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Baseを、少数・識別子・通貨・数式・科学単位を含む中国語の音声クローン600サンプルで評価しました。
Kai-Teh Tzeng

8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。
Akash Verma

話者が重複しないホールドアウト評価を主結果とし、クリーン条件と900話者条件を補助検証に位置づけた、5モデルの多言語オープンセット話者識別ベンチマークです。
Arun Kumar

日本語・中国語の6感情を対象に、5つの感情TTSモデルをSenseVoice、emotion2vecアンカー、CER、自然性、実行時間、試聴サンプルで評価したベンチマーク。
Kai-Teh Tzeng

NeMo MSDDとPyannote 3.1を6つの実運用シナリオで比較評価した技術レポートです。
Ashar Mirza