
Speech Recognition
On-Device AI
オフライン音声文字起こしベンチマーク:Android/iOS/macOS/Windowsで16モデルを比較
Android、iOS、macOS、Windowsにおける16のオンデバイス音声認識モデルと9つの推論エンジンの総合ベンチマーク
Akinori Nakajima - VoicePing
5 min
VoicePingのベンチマーク、評価手法、モデル評価、プロダクト研究をご紹介します。
30件の記事

Android、iOS、macOS、Windowsにおける16のオンデバイス音声認識モデルと9つの推論エンジンの総合ベンチマーク

Figure、Apptronik、Agility Roboticsなどヒューマノイドロボット企業10社を比較。技術、導入を裏付ける情報、資金調達、世界と日本の市場予測を、実績と計画の違いに注意して整理します。

Google Cloud Vision、Azure、Mistral、OCR.Spaceを同じ画像20枚で比較。240件の記録から文字誤り率、成功件数、待ち時間を読み解き、現在の料金と導入時の注意点を整理します。

Unlimited-OCRを画像7件とPDF3件で検証した結果を解説。帳票・数式で残った構造と誤読、手書き・新聞の欠落、複数ページの重複を実際の出力で確認します。

Fish Audio S2.1、CosyVoice3-RL、IndexTTS2、Qwen3-TTS Baseを、少数・識別子・通貨・数式・科学単位を含む中国語の音声クローン600サンプルで評価しました。

話者が重複しないホールドアウト評価を主結果とし、クリーン条件と900話者条件を補助検証に位置づけた、5モデルの多言語オープンセット話者識別ベンチマークです。