
Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Baseを、少数・識別子・通貨・数式・科学単位を含む中国語の音声クローン600サンプルで評価しました。
概要
数字の読み上げミスは、単なる発音の問題ではなく、意味の問題です。TTSが流暢に聞こえていても、識別子のゼロを落としたり、9*14 を94として読んだり、面積単位の指数を消してしまうことがあります。中国語では、001000000066、9*14、12cm² の正しい読み方が、記号そのものだけでなく、文中での役割によって決まるため、この弱点が特に明確に表れます。
本検証では、社内データセットの2つの中国語参照音声を使い、Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Base の4つの音声クローニングモデル群を評価しました。各モデル・音声条件に同じ75の業務文を入力し、合計 600の音声サンプルを生成しました。
自動評価による数値完全一致率では、Fish Audio S2.1が79.3%(119/150)で首位、CosyVoice3-RLが74.7%(112/150)で2位でした。ただし総合値だけでは、モデルごとの性質は分かりません。CosyVoice3-RLは識別子で90.0%に達した一方、Qwen3-TTS Baseは識別子で0%でしたが、数式と科学単位ではそれぞれ86.7%で首位でした。
これは人間の聴取評価ではなく、自動スクリーニング用のベンチマークです。付録Bには別途生成した試聴セットを掲載していますが、これらはベンチマークのサンプルではありません。
数値TTSが意味理解の問題である理由
数字を正しく読むことと、各桁を明瞭に発音することは同じではありません。TTSモデルはまず、その数字が文中でどの役割を持つかを判断する必要があります。
| 表示テキスト | 想定される中国語の読み | モデルが判断すべきこと |
|---|---|---|
3786.712 | 三千七百八十六点七一二 | 小数点以下の数字は一桁ずつ読む。 |
001000000066 | 零零一零零零零零零零六六 | 識別子は数値ではなく、数字の並びである。 |
HK$100 | 一百港元 | 接頭辞が通貨を指定する。$100 だけでは地域通貨を特定できない。 |
9*14 | 九乘以十四 | 記号は句読点ではなく演算子である。 |
12cm^2 | 十二平方厘米 | 指数によって長さの単位が面積の単位に変わる。 |
したがって、流暢な文の中にも重大な数値エラーが含まれ得ます。識別子、金額、計測値、数式では、小さな発音の違いよりも深刻な問題になります。
ベンチマーク概要
| 項目 | 設計 |
|---|---|
| 対象 | 音声クローニング条件のみ |
| モデル群 | Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Base |
| 参照音声 | 社内データセットの中国語音声2件 |
| モデル群ごとのプロンプト数 | 150件:75プロンプト × 2参照音声 |
| 総音声数 | 600 WAVファイル |
| 数値カテゴリ | 小数、識別子、通貨、数式、科学・工学単位 |
| カテゴリごとのプロンプト数 | モデル・音声条件ごとに15件 |
| 入力方針 | アラビア数字表記を含む文をそのまま送信 |
| 通貨の曖昧性 | 裸の $ と ¥ は記号ファミリー単位で採点し、明示的なコードまたは通貨名には完全一致を要求 |
| 判定用ASR | 固定リビジョンのQwen3-ASR-1.7B |
| 主要指標 | 数値ターゲットとの意味的な完全一致 |
実験設計
1. 5つの均衡したプロンプト群を作成
各モデル・音声条件に75の中国語文を使用しました。5つの数値カテゴリに、それぞれ15プロンプトを割り当てています。
- 小数では、途中のゼロ、同じ数字の繰り返し、小数部末尾のゼロを検証しました。
- 識別子では、先頭や途中にゼロを含み、通常の数値へまとめて読んではならない、合成された非個人情報の長い数字列を使用しました。
- 通貨では、USD、CNY、JPY、CAD、AUD、SGD、HKDに加え、曖昧な
$と¥を扱いました。 - 数式では、乗算と除算、および
二分之三と三除以二のような同義の読み方を扱いました。 - 科学・工学単位では、
cm、µm、nmを扱いました。
各文は、1つのテンプレートに値を差し替えたものではなく、業務、エンジニアリング、物流、運用で自然に使われる文として個別に作成しました。
2. 参照音声を固定
4つのモデル群すべてで、社内データセットにある同じ2つの中国語参照音声をクローンしました。
スコアは2つの参照音声を統合し、モデル群ごとに150サンプルを評価しています。
3. 表示文をそのまま送信
このベンチマークでは、合成前に数字を読みへ展開していません。
例:
| |
数字を次のような期待読みへ置き換えることはしませんでした。
| |
これにより、モデル自身のテキスト正規化動作を切り分けて測定できます。実運用では重要な数字を事前に展開する方が安全な場合が多いものの、今回それを行うと、測定したい問題そのものが消えてしまいます。
4. 音声を生成・正規化
オープンウェイトモデルは固定チェックポイントから実行し、対応している場合は決定的なシードを使用しました。Fish Audio S2.1へのすべてのリクエストで normalize=true を設定しました。 サービスは通常レイテンシーモードで実行したため、本記事のスコアはプロバイダーのノーマライザーを有効にしたFish Audio S2.1の結果です。
各プロバイダーの出力をモノラル、24 kHz、16-bit PCM WAVへ統一し、チャンネル数、サンプルレート、サンプル幅、デコード可否を確認しました。
生成した600サンプルすべてが、この形式チェックを通過しました。
5. 文字起こしと数値意味の採点
すべての生成音声を、同じ固定リビジョンの Qwen/Qwen3-ASR-1.7B で文字起こししました。ASR文字起こしとターゲットをカテゴリ別の正規形へ変換し、完全一致を要求しました。そのため、周囲の文が流暢でも、ゼロの欠落、演算子の変更、通貨の不一致、指数の欠落があれば不合格となります。カテゴリ別のルールは記事末尾の付録に記載しています。
結果

結果は2つの社内参照音声を統合したものです。通貨出力は、付録の曖昧性を考慮した方針に基づき、保存済みの判定用文字起こしから再採点しました。総合スコアは各150サンプル、カテゴリスコアは各30サンプルに基づきます。
Fish Audio S2.1は総合79.3%で首位でしたが、すべてのカテゴリで勝ったモデルはありません。重要なのは、同じ数字でも、識別子、小数、金額、数式、単位のどれを表すかによって、モデルの失敗の仕方が大きく変わる点です。
識別子:モデル間で最大の差
| モデル群 | 完全一致(n=30) |
|---|---|
| Fish Audio S2.1 | 66.7% |
| CosyVoice3-RL | 90.0% |
| IndexTTS2 | 40.0% |
| Qwen3-TTS Base | 0.0% |
識別子は、モデル間のスコア差が最も大きいカテゴリでした。主な問題は発音品質ではなく列の完全性であり、数字のまとめ読み、繰り返しゼロの省略、余分な数字の挿入が見られました。
小数:全体的に安定
| モデル群 | 完全一致(n=30) |
|---|---|
| Fish Audio S2.1 | 93.3% |
| CosyVoice3-RL | 96.7% |
| IndexTTS2 | 100.0% |
| Qwen3-TTS Base | 93.3% |
小数は最も安定したカテゴリでした。一般的な読みの構造があるため、各桁の位置を厳密に保持する必要がある識別子よりも容易だったと考えられます。
通貨:金額と通貨記号を分けて評価
| モデル群 | 完全一致(n=30) |
|---|---|
| Fish Audio S2.1 | 93.3% |
| CosyVoice3-RL | 46.7% |
| IndexTTS2 | 93.3% |
| Qwen3-TTS Base | 86.7% |
発話された金額と通貨の意味は分けて判定しました。裸の $ は地域通貨を一意に特定しませんが、CAD または 加拿大元 と明記された入力にはカナダドルの読みが必要です。採点対象サンプルでは、Fish Audio S2.1が明示的な HK$100 を米ドルとして読み、CosyVoice3-RLの失敗の多くは金額自体を変えていました。
数式:演算子が消えやすい
| モデル群 | 完全一致(n=30) |
|---|---|
| Fish Audio S2.1 | 73.3% |
| CosyVoice3-RL | 70.0% |
| IndexTTS2 | 70.0% |
| Qwen3-TTS Base | 86.7% |
数字だけを聞くと自然でも、意味上は失敗している場合があります。乗算演算子が消えると、9*14 は 94 になります。
科学・工学単位:指数を保持できるか
| モデル群 | 完全一致(n=30) |
|---|---|
| Fish Audio S2.1 | 70.0% |
| CosyVoice3-RL | 70.0% |
| IndexTTS2 | 66.7% |
| Qwen3-TTS Base | 86.7% |
基数と単位が聞き取れても、二乗の指数が消えると面積測定は別の意味になります。
モデル別まとめ
| モデル群 | 総合(n=150) | 主なポイント |
|---|---|---|
| Fish Audio S2.1 | 79.3% | 総合首位。最も弱い識別子でも66.7% |
| CosyVoice3-RL | 74.7% | 識別子で首位。通貨では金額を変える失敗が多い |
| IndexTTS2 | 74.0% | 小数は100%。識別子は大きく低下 |
| Qwen3-TTS Base | 70.7% | 数式、通貨、単位に強い一方、識別子は全件不合格 |
再現性情報
| コンポーネント | 固定条件 |
|---|---|
| Qwen3-TTS Base | Qwen3-TTS-12Hz-1.7B-Base、revision fd4b254389122332181a7c3db7f27e918eec64e3 |
| CosyVoice3-RL | Fun-CosyVoice3-0.5B-2512_RL、revision 29e01c4e8d000f4bcd70751be16fa94bf3d85a18 |
| IndexTTS2 | IndexTTS2、revision 740dcaff396282ffb241903d150ac011cd4b1ede |
| Fish Audio S2.1 | 合成サービス、通常レイテンシーモード、normalize=true |
| 判定用ASR | Qwen/Qwen3-ASR-1.7B、revision 7278e1e70fe206f11671096ffdd38061171dd6e5 |
制約
- 判定には中国語母語話者のパネルではなくASRモデルを使用しています。ASRの誤りをTTSの誤りとして扱う可能性があります。
- 2つの社内参照音声は、すべての中国語話者、アクセント、声の高さ、録音条件を代表するものではありません。
- このベンチマークは表示表記をそのまま入力しています。実運用のテキスト正規化層によって結果は大きく改善する可能性があります。
- 割合は、2音声を統合したモデル群・カテゴリごとの30サンプルに基づきます。小さな差を過度に解釈すべきではありません。
- プロバイダーのサービスやモデル実装は、固定した評価日以降に変更される可能性があります。
結論
中国語の数値TTSに、すべてのカテゴリで優れた万能モデルはありませんでした。
Fish Audio S2.1は最も均衡しており、総合79.3%で首位でした。CosyVoice3-RLは識別子で最も強く、IndexTTS2は小数で100%でしたが長い数字列では弱くなりました。Qwen3-TTS Baseは3つの記号中心カテゴリで最も強かった一方、識別子は全件不合格でした。
重要なのは順位だけではありません。数値の意味は、独立して検証すべき信頼性の軸です。読み上げた数字が支払い、計測、経路、本人確認、アクセス判断を変え得る場合は、明示的に正規化し、合成後にも検証する必要があります。
付録A:カテゴリ別の正規化ルール
| カテゴリ | 正規化の手順と完全一致条件 |
|---|---|
| 小数 | アラビア数字と中国語の数詞を小数形式へ変換し、末尾のゼロを含む小数部の各桁を保持する。 |
| 識別子 | 数字列全体を抽出し、幺 を 1 とする読みの差を正規化した上で、先頭のゼロ、順序、桁数を保持する。 |
| 通貨 | 金額を正規化してから、記述された入力から許容通貨を決める。裸の $ はドル建ての読み、裸の ¥ は 人民币 または 日元 を許容する。US$、HK$、JPY、通貨名などが明示されている場合は、対応する中国語の通貨読みを要求する。 |
| 数式 | まず中国語またはアラビア数字を数値オペランドに変換する。次に、乘/乘以/×/* を multiply、除以///÷/分之 を divide に統一する。A分之B は B ÷ A を意味するため、保存時に表面上のオペランド順を反転する。最後に、結果を計算せず、演算子と順序付きオペランドを完全一致で比較する。このため 三除以二 と 二分之三 はどちらも 3/2 に一致するが、結果だけの 一点五 は演算子がないため不合格となる。 |
| 科学・工学単位 | まず数値を正規化する。次に、厘米/cm、微米/µm、纳米/奈米/nm のような読み方と表記の別名を1つの基本単位に統一する。平方、²、^2 は指数 2、指定がなければ指数 1 として記録する。数値、基本単位、指数のすべてが一致した場合のみ合格とする。そのため 12cm² と 十二平方厘米 は合格するが、十二厘米 は指数が 2 から 1 に変わるため不合格となる。 |
付録B:公開音声例
音声例を掲載する理由: 集計スコアから分かるのは、意図した読みをモデルがどの程度の割合で生成できたかです。しかし、誤りが実際にどう聞こえるかまでは伝わりません。ここでは、数字の欠落や不自然なまとまり、小数構造の変化、演算子や指数の脱落といった主な失敗パターンを音声で具体的に確認できます。あくまで試聴用の別の20本のデモセットであり、600サンプルのベンチマークには含まれず、掲載した割合の算出にも使用していません。
デモに使用した合成参照音声
4つのシステムはすべて、同じAI生成のQwen3-TTS Serena音声を参照に使用しました。まずこの音声を聞くと、以下のデモが再現しようとした共通の声を確認できます。
参照テキスト: 今天我们将讨论项目进度、客户反馈与后续安排。请各位确认会议内容,并在结束后整理需要继续跟进的事项,感谢大家的配合。
識別子の例
入力: 维修平台确认,本次设备校验码为001000000066。
ターゲット: 零零一零零零零零零零六六
| モデル群 | 例示音声とASR文字起こし | 確認ポイント |
|---|---|---|
| Fish Audio S2.1 | 零零幺零零零零零零六六 | ゼロを1つ省略 |
| CosyVoice3-RL | 零零幺零零零零零零零六六 | すべての桁を保持 |
| IndexTTS2 | 零零幺零零零零零零六六 | ゼロを1つ省略 |
| Qwen3-TTS Base | 零零幺零零万零六六 | 数字をまとめ、一部を省略 |
小数の例
入力: 值班工程师在电话会上报告:“主回路当前读数是3168.846。”
ターゲット: 三千一百六十八点八四六
| モデル群 | 例示音声とASR文字起こし | 確認ポイント |
|---|---|---|
| Fish Audio S2.1 | 三幺六八八四六 | 小数の構造が失われる |
| CosyVoice3-RL | 三千一百六十八点八四六 | ターゲットの読みを保持 |
| IndexTTS2 | 三千一百六十八点八四六 | ターゲットの読みを保持 |
| Qwen3-TTS Base | 三千一百六十八点八四六 | ターゲットの読みを保持 |
通貨の例
入力: 设计负责人提醒大家,加拿大外包插画的尾款还有$640未付。
許容ターゲット: 金額640と、ドル建てであることを示す読み
| モデル群 | 例示音声とASR文字起こし | 確認ポイント |
|---|---|---|
| Fish Audio S2.1 | 六百四十美元 | 金額とドル建ての読みを保持 |
| CosyVoice3-RL | 六百四十美元 | 金額とドル建ての読みを保持 |
| IndexTTS2 | 六百四十美元 | 金額とドル建ての読みを保持 |
| Qwen3-TTS Base | 六百四十美元 | 金額とドル建ての読みを保持 |
数式の例
入力: 生成标签底稿时,把画布网格参数填写为9*14。
ターゲット: 九乘以十四
| モデル群 | 例示音声とASR文字起こし | 確認ポイント |
|---|---|---|
| Fish Audio S2.1 | 九州十四 | 乗算演算子を認識できない |
| CosyVoice3-RL | 九十四 | 乗算演算子を省略 |
| IndexTTS2 | 九掺十四 | 乗算演算子を認識できない |
| Qwen3-TTS Base | 九乘以十四 | ターゲットの読みを保持 |
科学・工学単位の例
入力: 封装测试要求导热贴的接触面积达到12cm^2。
ターゲット: 十二平方厘米
| モデル群 | 例示音声とASR文字起こし | 確認ポイント |
|---|---|---|
| Fish Audio S2.1 | 十二厘米定二 | 二乗の面積表現が失われる |
| CosyVoice3-RL | 十二厘米二 | 二乗の面積表現が失われる |
| IndexTTS2 | 十二厘米,S二 | 二乗の面積表現が失われる |
| Qwen3-TTS Base | 十二厘米方 | 平方センチメートルの意味が失われる |
開示:著者は本メディア運営会社の関係者です。検証対象には外部のTTSモデル・サービスが含まれ、運営会社の製品販売を目的とする記事ではありません。


