
検証・ベンチマーク
ラボレポート
多言語OCRベンチマーク:精度はHunyuanとQwen、スループットはPaddleがリード
8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。
Akash Verma
16分
Topic
音声認識、機械翻訳、TTS、話者処理の研究を実務の言葉で読み解きます。

8つのオープンOCRシステムを、5言語・6種類の文書からなる900ページで厳密なGPU限定条件のもと評価。CER、レイテンシ、スループット、VRAM、エネルギー、切り捨て、構造化出力を比較します。
Akash Verma

AISHELL-3データセットとBert-VITS2フレームワークを活用した中国語音声合成システムの開発に関する研究レポートです。
Boxuan Lyu

Llama 3.1を用いた英中双方向翻訳におけるRAFT手法の検証
Kai-Teh Tzeng

Llama 3.1を用いた中英翻訳のファインチューニングとハルシネーション軽減戦略に関する研究
Shuang LIANG
英語の発話における音節ストレスレベルを識別するSelf-Attentionモデルの研究
Wang Weiying / 中島明紀

TF-IDFによる検索を活用してGPT-4翻訳のIn-Context Learningの性能を向上させる手法に関する研究レポートです。
Chen Yufeng

Whisperのファインチューニング、話者ダイアライゼーション、複数ASRモデルの比較評価に関する包括的な研究レポートです。
Linchuan Du

複数の評価指標と5つのベンチマーク翻訳モデルを用いた機械翻訳品質の総合的な評価・改善手法に関する研究
Chen Yufeng

OpenAI WhisperとAzure Speech Studioを活用し、ベトナム語・日本語の音声認識精度を向上させるファインチューニング手法の研究成果をまとめています。
Vikas Reddy