
OCR
Document AI
多言語OCRベンチマーク:精度はHunyuanとQwen、スループットはPaddleがリード
8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。
VoicePing - Akash Verma
3 min
VoicePingのベンチマーク、評価手法、モデル評価、プロダクト研究をご紹介します。
30件の記事

8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。

VoicePing Diarization v0.1 は、多言語の話者分離モデルです。42ファイルのベンチマークで NeMo、pyannoteAI precision-2、AssemblyAI、Deepgram と比較しました。

100件の英日翻訳データをGPT-5.5で評価し、DeepL、Sakana Translate、VoicePing MT v0.1、GPT-5 mini、Google翻訳、Qwen、Azure、Llamaを品質と観測レイテンシで比較しました。

英語・日本語・韓国語・中国語・ベトナム語に対応した多言語音声認識モデル「VoicePing ASR Model V0.1」をご紹介します。

日本語・中国語の6感情を対象に、5つの感情TTSモデルをSenseVoice、emotion2vecアンカー、CER、自然性、実行時間、試聴サンプルで評価したベンチマーク。

英日双方向音声翻訳モデルのベンチマーク比較。Qwen3-ASR(1.7Bパラメータ、最高品質)とDistilled Whisper(756M、4倍高速)をOpenAI Whisper large-v3およびMeta SeamlessM4T v2と比較評価。