
Text to Speech
Emotional TTS
感情TTSベンチマーク:日本語・中国語における Qwen3-TTS、CosyVoice、IndexTTS-2、Fish Audio、VoxCPM
日本語・中国語の6感情を対象に、5つの感情TTSモデルをSenseVoice、emotion2vecアンカー、CER、自然性、実行時間、試聴サンプルで評価したベンチマーク。
Kai-Teh Tzeng-VoicePing
3 min
VoicePingのベンチマーク、評価手法、モデル評価、プロダクト研究をご紹介します。
27件の記事

日本語・中国語の6感情を対象に、5つの感情TTSモデルをSenseVoice、emotion2vecアンカー、CER、自然性、実行時間、試聴サンプルで評価したベンチマーク。

完全オフラインで動作するオープンソースのクロスプラットフォームモバイル音声翻訳アプリ。オンデバイスASR(SenseVoice)、ニューラル機械翻訳、TTSをiOS/Androidで実現

英日双方向音声翻訳モデルのベンチマーク比較。Qwen3-ASR(1.7Bパラメータ、最高品質)とDistilled Whisper(756M、4倍高速)をOpenAI Whisper large-v3およびMeta SeamlessM4T v2と比較評価。

Kokoro、Piper、Matcha、Kitten、VITSを含むAndroid/iOS向け18のオンデバイスTTSモデルの総合ベンチマーク

Android、iOS、macOS、Windowsにおける16のオンデバイス音声認識モデルと9つの推論エンジンの総合ベンチマーク

VoicePingがカスタマイズしたWhisper V2モデルを活用し、単一WebSocketストリーム内で自動・低遅延の言語切替を実現するバイリンガルモードをどのように設計したか。