メインコンテンツへスキップ
音声翻訳ラボ

ラボレポート · 検証・ベンチマーク

中国語TTSモデルは数字をどう読むか:音声クローン600サンプルのベンチマーク

Kai-Teh Tzeng VoicePing株式会社 12分で読めます
中国語TTSモデルは数字をどう読むか:音声クローン600サンプルのベンチマーク

Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Baseを、少数・識別子・通貨・数式・科学単位を含む中国語の音声クローン600サンプルで評価しました。

概要

数字の読み上げミスは、単なる発音の問題ではなく、意味の問題です。TTSが流暢に聞こえていても、識別子のゼロを落としたり、9*14 を94として読んだり、面積単位の指数を消してしまうことがあります。中国語では、0010000000669*1412cm² の正しい読み方が、記号そのものだけでなく、文中での役割によって決まるため、この弱点が特に明確に表れます。

本検証では、社内データセットの2つの中国語参照音声を使い、Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Base の4つの音声クローニングモデル群を評価しました。各モデル・音声条件に同じ75の業務文を入力し、合計 600の音声サンプルを生成しました。

自動評価による数値完全一致率では、Fish Audio S2.1が79.3%(119/150)で首位CosyVoice3-RLが74.7%(112/150)で2位でした。ただし総合値だけでは、モデルごとの性質は分かりません。CosyVoice3-RLは識別子で90.0%に達した一方、Qwen3-TTS Baseは識別子で0%でしたが、数式と科学単位ではそれぞれ86.7%で首位でした。

これは人間の聴取評価ではなく、自動スクリーニング用のベンチマークです。付録Bには別途生成した試聴セットを掲載していますが、これらはベンチマークのサンプルではありません。

数値TTSが意味理解の問題である理由

数字を正しく読むことと、各桁を明瞭に発音することは同じではありません。TTSモデルはまず、その数字が文中でどの役割を持つかを判断する必要があります。

表示テキスト想定される中国語の読みモデルが判断すべきこと
3786.712三千七百八十六点七一二小数点以下の数字は一桁ずつ読む。
001000000066零零一零零零零零零零六六識別子は数値ではなく、数字の並びである。
HK$100一百港元接頭辞が通貨を指定する。$100 だけでは地域通貨を特定できない。
9*14九乘以十四記号は句読点ではなく演算子である。
12cm^2十二平方厘米指数によって長さの単位が面積の単位に変わる。

したがって、流暢な文の中にも重大な数値エラーが含まれ得ます。識別子、金額、計測値、数式では、小さな発音の違いよりも深刻な問題になります。

ベンチマーク概要

項目設計
対象音声クローニング条件のみ
モデル群Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Base
参照音声社内データセットの中国語音声2件
モデル群ごとのプロンプト数150件:75プロンプト × 2参照音声
総音声数600 WAVファイル
数値カテゴリ小数、識別子、通貨、数式、科学・工学単位
カテゴリごとのプロンプト数モデル・音声条件ごとに15件
入力方針アラビア数字表記を含む文をそのまま送信
通貨の曖昧性裸の $¥ は記号ファミリー単位で採点し、明示的なコードまたは通貨名には完全一致を要求
判定用ASR固定リビジョンのQwen3-ASR-1.7B
主要指標数値ターゲットとの意味的な完全一致

実験設計

1. 5つの均衡したプロンプト群を作成

各モデル・音声条件に75の中国語文を使用しました。5つの数値カテゴリに、それぞれ15プロンプトを割り当てています。

  1. 小数では、途中のゼロ、同じ数字の繰り返し、小数部末尾のゼロを検証しました。
  2. 識別子では、先頭や途中にゼロを含み、通常の数値へまとめて読んではならない、合成された非個人情報の長い数字列を使用しました。
  3. 通貨では、USD、CNY、JPY、CAD、AUD、SGD、HKDに加え、曖昧な $¥ を扱いました。
  4. 数式では、乗算と除算、および 二分之三三除以二 のような同義の読み方を扱いました。
  5. 科学・工学単位では、cmµmnm を扱いました。

各文は、1つのテンプレートに値を差し替えたものではなく、業務、エンジニアリング、物流、運用で自然に使われる文として個別に作成しました。

2. 参照音声を固定

4つのモデル群すべてで、社内データセットにある同じ2つの中国語参照音声をクローンしました。

スコアは2つの参照音声を統合し、モデル群ごとに150サンプルを評価しています。

3. 表示文をそのまま送信

このベンチマークでは、合成前に数字を読みへ展開していません。

例:

1
维修平台确认,本次设备校验码为001000000066。

数字を次のような期待読みへ置き換えることはしませんでした。

1
维修平台确认,本次设备校验码为零零一零零零零零零零六六。

これにより、モデル自身のテキスト正規化動作を切り分けて測定できます。実運用では重要な数字を事前に展開する方が安全な場合が多いものの、今回それを行うと、測定したい問題そのものが消えてしまいます。

4. 音声を生成・正規化

オープンウェイトモデルは固定チェックポイントから実行し、対応している場合は決定的なシードを使用しました。Fish Audio S2.1へのすべてのリクエストで normalize=true を設定しました。 サービスは通常レイテンシーモードで実行したため、本記事のスコアはプロバイダーのノーマライザーを有効にしたFish Audio S2.1の結果です。

各プロバイダーの出力をモノラル、24 kHz、16-bit PCM WAVへ統一し、チャンネル数、サンプルレート、サンプル幅、デコード可否を確認しました。

生成した600サンプルすべてが、この形式チェックを通過しました。

5. 文字起こしと数値意味の採点

すべての生成音声を、同じ固定リビジョンの Qwen/Qwen3-ASR-1.7B で文字起こししました。ASR文字起こしとターゲットをカテゴリ別の正規形へ変換し、完全一致を要求しました。そのため、周囲の文が流暢でも、ゼロの欠落、演算子の変更、通貨の不一致、指数の欠落があれば不合格となります。カテゴリ別のルールは記事末尾の付録に記載しています。

結果

4つの中国語TTSモデル群について、総合、小数、識別子、通貨、数式、科学単位の完全一致率を比較したヒートマップ

結果は2つの社内参照音声を統合したものです。通貨出力は、付録の曖昧性を考慮した方針に基づき、保存済みの判定用文字起こしから再採点しました。総合スコアは各150サンプル、カテゴリスコアは各30サンプルに基づきます。

Fish Audio S2.1は総合79.3%で首位でしたが、すべてのカテゴリで勝ったモデルはありません。重要なのは、同じ数字でも、識別子、小数、金額、数式、単位のどれを表すかによって、モデルの失敗の仕方が大きく変わる点です。

識別子:モデル間で最大の差

モデル群完全一致(n=30)
Fish Audio S2.166.7%
CosyVoice3-RL90.0%
IndexTTS240.0%
Qwen3-TTS Base0.0%

識別子は、モデル間のスコア差が最も大きいカテゴリでした。主な問題は発音品質ではなく列の完全性であり、数字のまとめ読み、繰り返しゼロの省略、余分な数字の挿入が見られました。

小数:全体的に安定

モデル群完全一致(n=30)
Fish Audio S2.193.3%
CosyVoice3-RL96.7%
IndexTTS2100.0%
Qwen3-TTS Base93.3%

小数は最も安定したカテゴリでした。一般的な読みの構造があるため、各桁の位置を厳密に保持する必要がある識別子よりも容易だったと考えられます。

通貨:金額と通貨記号を分けて評価

モデル群完全一致(n=30)
Fish Audio S2.193.3%
CosyVoice3-RL46.7%
IndexTTS293.3%
Qwen3-TTS Base86.7%

発話された金額と通貨の意味は分けて判定しました。裸の $ は地域通貨を一意に特定しませんが、CAD または 加拿大元 と明記された入力にはカナダドルの読みが必要です。採点対象サンプルでは、Fish Audio S2.1が明示的な HK$100 を米ドルとして読み、CosyVoice3-RLの失敗の多くは金額自体を変えていました。

数式:演算子が消えやすい

モデル群完全一致(n=30)
Fish Audio S2.173.3%
CosyVoice3-RL70.0%
IndexTTS270.0%
Qwen3-TTS Base86.7%

数字だけを聞くと自然でも、意味上は失敗している場合があります。乗算演算子が消えると、9*1494 になります。

科学・工学単位:指数を保持できるか

モデル群完全一致(n=30)
Fish Audio S2.170.0%
CosyVoice3-RL70.0%
IndexTTS266.7%
Qwen3-TTS Base86.7%

基数と単位が聞き取れても、二乗の指数が消えると面積測定は別の意味になります。

モデル別まとめ

モデル群総合(n=150)主なポイント
Fish Audio S2.179.3%総合首位。最も弱い識別子でも66.7%
CosyVoice3-RL74.7%識別子で首位。通貨では金額を変える失敗が多い
IndexTTS274.0%小数は100%。識別子は大きく低下
Qwen3-TTS Base70.7%数式、通貨、単位に強い一方、識別子は全件不合格

再現性情報

コンポーネント固定条件
Qwen3-TTS BaseQwen3-TTS-12Hz-1.7B-Base、revision fd4b254389122332181a7c3db7f27e918eec64e3
CosyVoice3-RLFun-CosyVoice3-0.5B-2512_RL、revision 29e01c4e8d000f4bcd70751be16fa94bf3d85a18
IndexTTS2IndexTTS2、revision 740dcaff396282ffb241903d150ac011cd4b1ede
Fish Audio S2.1合成サービス、通常レイテンシーモード、normalize=true
判定用ASRQwen/Qwen3-ASR-1.7B、revision 7278e1e70fe206f11671096ffdd38061171dd6e5

制約

  • 判定には中国語母語話者のパネルではなくASRモデルを使用しています。ASRの誤りをTTSの誤りとして扱う可能性があります。
  • 2つの社内参照音声は、すべての中国語話者、アクセント、声の高さ、録音条件を代表するものではありません。
  • このベンチマークは表示表記をそのまま入力しています。実運用のテキスト正規化層によって結果は大きく改善する可能性があります。
  • 割合は、2音声を統合したモデル群・カテゴリごとの30サンプルに基づきます。小さな差を過度に解釈すべきではありません。
  • プロバイダーのサービスやモデル実装は、固定した評価日以降に変更される可能性があります。

結論

中国語の数値TTSに、すべてのカテゴリで優れた万能モデルはありませんでした。

Fish Audio S2.1は最も均衡しており、総合79.3%で首位でした。CosyVoice3-RLは識別子で最も強く、IndexTTS2は小数で100%でしたが長い数字列では弱くなりました。Qwen3-TTS Baseは3つの記号中心カテゴリで最も強かった一方、識別子は全件不合格でした。

重要なのは順位だけではありません。数値の意味は、独立して検証すべき信頼性の軸です。読み上げた数字が支払い、計測、経路、本人確認、アクセス判断を変え得る場合は、明示的に正規化し、合成後にも検証する必要があります。

付録A:カテゴリ別の正規化ルール

カテゴリ正規化の手順と完全一致条件
小数アラビア数字と中国語の数詞を小数形式へ変換し、末尾のゼロを含む小数部の各桁を保持する。
識別子数字列全体を抽出し、1 とする読みの差を正規化した上で、先頭のゼロ、順序、桁数を保持する。
通貨金額を正規化してから、記述された入力から許容通貨を決める。裸の $ はドル建ての読み、裸の ¥人民币 または 日元 を許容する。US$HK$JPY、通貨名などが明示されている場合は、対応する中国語の通貨読みを要求する。
数式まず中国語またはアラビア数字を数値オペランドに変換する。次に、/乘以/×/*multiply除以///÷/分之divide に統一する。A分之BB ÷ A を意味するため、保存時に表面上のオペランド順を反転する。最後に、結果を計算せず、演算子と順序付きオペランドを完全一致で比較する。このため 三除以二二分之三 はどちらも 3/2 に一致するが、結果だけの 一点五 は演算子がないため不合格となる。
科学・工学単位まず数値を正規化する。次に、厘米/cm微米/µm纳米/奈米/nm のような読み方と表記の別名を1つの基本単位に統一する。平方²^2 は指数 2、指定がなければ指数 1 として記録する。数値、基本単位、指数のすべてが一致した場合のみ合格とする。そのため 12cm²十二平方厘米 は合格するが、十二厘米 は指数が 2 から 1 に変わるため不合格となる。

付録B:公開音声例

音声例を掲載する理由: 集計スコアから分かるのは、意図した読みをモデルがどの程度の割合で生成できたかです。しかし、誤りが実際にどう聞こえるかまでは伝わりません。ここでは、数字の欠落や不自然なまとまり、小数構造の変化、演算子や指数の脱落といった主な失敗パターンを音声で具体的に確認できます。あくまで試聴用の別の20本のデモセットであり、600サンプルのベンチマークには含まれず、掲載した割合の算出にも使用していません。

デモに使用した合成参照音声

4つのシステムはすべて、同じAI生成のQwen3-TTS Serena音声を参照に使用しました。まずこの音声を聞くと、以下のデモが再現しようとした共通の声を確認できます。

参照テキスト: 今天我们将讨论项目进度、客户反馈与后续安排。请各位确认会议内容,并在结束后整理需要继续跟进的事项,感谢大家的配合。

識別子の例

入力: 维修平台确认,本次设备校验码为001000000066。

ターゲット: 零零一零零零零零零零六六

モデル群例示音声とASR文字起こし確認ポイント
Fish Audio S2.1
零零幺零零零零零零六六
ゼロを1つ省略
CosyVoice3-RL
零零幺零零零零零零零六六
すべての桁を保持
IndexTTS2
零零幺零零零零零零六六
ゼロを1つ省略
Qwen3-TTS Base
零零幺零零万零六六
数字をまとめ、一部を省略

小数の例

入力: 值班工程师在电话会上报告:“主回路当前读数是3168.846。”

ターゲット: 三千一百六十八点八四六

モデル群例示音声とASR文字起こし確認ポイント
Fish Audio S2.1
三幺六八八四六
小数の構造が失われる
CosyVoice3-RL
三千一百六十八点八四六
ターゲットの読みを保持
IndexTTS2
三千一百六十八点八四六
ターゲットの読みを保持
Qwen3-TTS Base
三千一百六十八点八四六
ターゲットの読みを保持

通貨の例

入力: 设计负责人提醒大家,加拿大外包插画的尾款还有$640未付。

許容ターゲット: 金額640と、ドル建てであることを示す読み

モデル群例示音声とASR文字起こし確認ポイント
Fish Audio S2.1
六百四十美元
金額とドル建ての読みを保持
CosyVoice3-RL
六百四十美元
金額とドル建ての読みを保持
IndexTTS2
六百四十美元
金額とドル建ての読みを保持
Qwen3-TTS Base
六百四十美元
金額とドル建ての読みを保持

数式の例

入力: 生成标签底稿时,把画布网格参数填写为9*14。

ターゲット: 九乘以十四

モデル群例示音声とASR文字起こし確認ポイント
Fish Audio S2.1
九州十四
乗算演算子を認識できない
CosyVoice3-RL
九十四
乗算演算子を省略
IndexTTS2
九掺十四
乗算演算子を認識できない
Qwen3-TTS Base
九乘以十四
ターゲットの読みを保持

科学・工学単位の例

入力: 封装测试要求导热贴的接触面积达到12cm^2。

ターゲット: 十二平方厘米

モデル群例示音声とASR文字起こし確認ポイント
Fish Audio S2.1
十二厘米定二
二乗の面積表現が失われる
CosyVoice3-RL
十二厘米二
二乗の面積表現が失われる
IndexTTS2
十二厘米,S二
二乗の面積表現が失われる
Qwen3-TTS Base
十二厘米方
平方センチメートルの意味が失われる

開示:著者は本メディア運営会社の関係者です。検証対象には外部のTTSモデル・サービスが含まれ、運営会社の製品販売を目的とする記事ではありません。