メインコンテンツへスキップ
OCR API Google Cloud Vision Azure Mistral OCR.Space

商用OCR API4社比較|画像20枚の精度・速度・失敗率

VoicePing - Akash Verma
商用OCR API4社の文字誤り率と成功件数。Google30.8%・60/60件、Azure40.2%・60/60件、Mistral38.4%・60/60件、OCR.Space24.7%・53/60件。
2026年7月公開の検証。文字誤り率は成功した応答だけの平均で、小さいほど参照文に近い結果です。
この記事の内容

画像から文字を読み取るOCRのAPIを4社で比べたところ、Google Cloud Visionは60件すべてを完了し、応答時間の中央値は421ミリ秒でした。 OCR.Space Engine 3は成功した応答の文字誤り率が最も低い一方、60件中7件が失敗し、成功時の中央値も7.6秒でした。精度だけを見て選ぶと、この違いを見落とします。

本稿は、当社が2026年7月30日に公開した検証 と公開CSV に基づく比較です。同じ画像20枚を各社で3回ずつ処理した240件の記録を使っています。公式仕様・料金は2026年9月19日に確認しました。現在のモデルを新たに実行した結果ではありません。

結果の要点:誤り率・成功件数・速度を分けて見る

OCRの出力を参照文と比べ、文字の置換・欠落・追加を数えた指標が文字誤り率(CER)です。この検証ではUnicode、句読点、空白の表記をそろえた値を使います。小さいほど参照文に近い結果ですが、「100% − CER」がそのまま正しく読めた文字の割合になるわけではありません。追加が多いとCERが100%を超える場合もあります。

画像20枚×3回の結果(2026年7月公開)
サービス成功件数平均CER応答時間の中央値
1. Google Cloud Vision60 / 60件30.8%421ミリ秒
2. Azure AI Vision Read60 / 60件40.2%542ミリ秒
3. Mistral OCR60 / 60件38.4%1.3秒
4. OCR.Space Engine 353 / 60件24.7%7.6秒

CERと応答時間は成功した実行だけを集計しています。CERは各実行の値の平均で、全文字をまとめて重み付けした値ではありません。OCR.Spaceの7件の失敗はCER平均に含まれないため、成功件数と組み合わせて判断します。表の番号は紹介順であり、性能順位ではありません。

この結果からは、操作中に素早く文字を返す用途ではGoogleを最初の検証候補にできます。待ち時間を許容する一括処理ではOCR.Spaceも候補ですが、失敗した画像の再処理が必要です。AzureとMistralは、ともに60件を完了しました。言語ごとの傾向や、後のシステムで使いやすい出力形式まで見て絞り込みます。

同じ画像20枚を各社で3回ずつ処理

傾いた写真、細かいメニュー、古い文書、数式では、文字を読む力に加えて読み順や配置の解釈が影響します。きれいなスキャン文書の成績だけで、こうした画像への適性は判断できません。

対象は英語・日本語・韓国語・中国語の4言語です。各言語で、表、数式・技術資料、メニュー・看板、包装・ラベル、文書・帳票を1枚ずつ用意しました。4言語×5種類で20枚、各画像を3回、4社合計で240件です。同じ画像データを使っていますが、公開ファイルには固定モデルID、詳細なAPI経路、契約プラン、同時実行数が残っていません。

参照文にも限界があります。日本語5枚は画像から独立に書き起こし直した一方、残る15枚は複数のOCR出力を補助にして目視確認したものです。特定の出力を基にした参照文は、その提供元に有利になる可能性があります。この点は検証の限界 で説明します。

集計JSON 、実行ごとのCSV 、入力画像の出典とライセンス を公開しています。CSVから成功件数、平均CER、応答時間の中央値を再集計できます。ただし、全文のOCR出力と参照文はこの3ファイルに含まれないため、文字単位の採点をすべて再現できる資料ではありません。

OCR API4社の特徴と注意点

1. Google Cloud Vision:応答速度と完了率を重視する場合

Google Cloud Visionの公式OCR説明。画像内の文字とその位置を抽出する機能を紹介している。
Google Cloud VisionのOCR仕様。画像内の文字と、密な文書向けの検出機能を使い分けます。 Google Cloud Vision公式

Googleは60件中60件を完了し、中央値421ミリ秒でした。成功時の平均CERは30.8%で、4言語を合わせた本検証では、速さと完了率の両方を満たしています。画像を送信して結果を画面へ返す仕組みの候補になります。

公式のOCR説明 では、写真や看板の文字を扱うTEXT_DETECTIONと、文字が密集した文書を扱うDOCUMENT_TEXT_DETECTIONを区別しています。文字と位置情報を返すため、画像上のどの場所から読み取ったかを後から示せます。

ただし、成功時のCERはOCR.Spaceより高く、今回の韓国語ではAzureにも及びませんでした。速く返ったことだけで、金額や日付の確認を省けるわけではありません。フォームの項目抽出などを含むGoogle Document AIは別製品なので、機能と料金を混ぜずに検討します。

2. Azure AI Vision Read:韓国語と位置情報を確認したい場合

Microsoftの公式説明、OCR for images version 4.0。画像向けのReadと文書向けのDocument Intelligenceを区別している。
現在の画像向けReadの公式資料。ベンチマークで使ったAPIの詳細な版は、公開データから特定できません。 Azure Read公式

Azureは60件中60件を完了し、中央値542ミリ秒でした。韓国語のメニュー1枚では3回とも参照文と一致し、CERは0%です。一方、全言語を合わせたCERは40.2%で、4社の中で最も高くなりました。日本語・中国語の複雑な配置を扱う場合は、読み順を含む確認が必要です。

韓国語全体ではAzureが20.7%(15件成功)、OCR.Spaceが20.4%(15件中14件成功)でした。Azureが韓国語のCERで単独首位だったという意味ではありません。 Azureは全件を完了した点と、特定のメニューで誤りがなかった点を分けて評価します。

現在の公式資料 は、写真などの画像向けReadと、PDF・Office文書向けのDocument Intelligence Readを区別しています。またMicrosoftは、Image Analysisの/imageanalysis経路(v3.2・v4.0)を2028年9月25日に終了すると案内しています 。これはAzureのOCR全体が同日に終了するという告知ではありません。新規導入ではAPI経路と移行先を確認してから実装します。

3. Mistral OCR:文書の構造を後工程で使う場合

Mistral OCR 4.1の公式モデルページ。文字抽出、位置情報、構造化出力と料金を掲載している。
現在のOCR 4.1の製品情報。7月の測定で使われた固定モデルIDは公開データに記載されていません。 Mistral OCR公式

Mistralは60件をすべて完了し、中央値は1.3秒、平均CERは38.4%でした。日本語5枚では24.7%と4社で最も低い結果です。公開集計では、各画像の3回の正規化済み出力もすべて一致していました。ただし、同じ誤りを繰り返しても出力は一致するため、再現性と正確さは別に評価します。

公式の文書処理機能 は、Markdown、表、画像などを文書の構造に沿って返します。読み取った内容を社内検索や文書管理へ渡したい場合に、後処理を組み立てやすい形式です。現在のOCR 4.1 には段落の位置情報や構造を示すラベルもあります。

今回の応答はGoogleやAzureより遅く、韓国語の平均CERは59.5%でした。文書の形式が整って返ることと、すべての文字が正しいことを同一視しないようにします。現在のOCR 4.1の仕様を、7月の測定モデルの仕様として断定することもできません。

4. OCR.Space Engine 3:待ち時間と再処理を許容できる場合

OCR.SpaceのEngine 3公式説明。表のMarkdown出力、手書き、処理速度、検索可能PDFの制限を掲載している。
Engine 3はEngine 1・2と速度や利用枠が異なります。検索可能PDFの出力にも制限があります。 OCR.Space Engine 3公式

OCR.Spaceの成功時CERは24.7%で、4社中最も低い結果でした。一方、成功は53件、失敗は7件で、成功時の中央値は7.6秒です。20枚のうち、3回とも成功した画像は15枚でした。大量の文書を後から処理する用途では候補になりますが、操作中に必ず結果を返したい用途では再試行や代替サービスを用意する必要があります。

Engine 3の公式仕様 は、表のMarkdown出力や手書きへの対応を示す一方、大きな画像・PDFでは処理が遅くなり、利用枠も別になると説明しています。Engine 3では検索可能PDFを出力できません。文字の位置情報も、Engine 1・2と同じ精度として扱わないよう案内されています。

原記事では、7件のHTTP 504エラーを間隔を空けて再試行し、3件が回復、4件が再び失敗したと報告しています。この再試行分は比較表の60件に加えていません。契約プランが公開データにないため、この失敗率を有料プラン全般の実績や稼働保証の評価へ広げることもできません。

現在の料金と無料枠を比較

以下は2026年9月19日に確認した公式情報です。US$は米ドルで、円換算や税額を加えた請求総額ではありません。請求通貨、税、契約割引は契約条件で変わります。ページ単位、機能の実行回数、月間枠が混在するため、同じ件数でも請求額が一致するとは限りません。

料金・無料枠(2026年9月19日確認)
サービス・プラン課金単位・価格無料枠・条件
1. Google Cloud Vision
Text / Document Text Detection
従量課金。月1,001〜500万単位はUS$1.50 / 1,000単位、500万単位超はUS$0.60 / 1,000単位。毎月最初の1,000単位は無料。画像×機能、文書はページ単位。公式料金
2. Azure AI Vision Read
S1 Read / Group 2
Japan Eastの従量課金。月100万取引まではUS$1.50 / 1,000取引、100万取引超はUS$0.60 / 1,000取引。別枠のFree(F0)は月5,000取引、毎分20取引。S1の無料枠として合算しない。公式料金
3. Mistral OCR
現在のOCR 4.1
通常OCRはUS$4 / 1,000ページ。注釈付き処理はUS$5 / 1,000ページ。ページ数に応じた従量課金。掲載料金には継続無料のページ数を確認できない。公式モデル・料金
4. OCR.Space Engine 3
Free / PRO / PRO PDF
FreeはUS$0。PROはUS$30 / 月、PRO PDFはUS$60 / 月(月払い)。Engine 3専用枠:Free月2,500回、PRO / PRO PDF月30,000回。月払いは随時解約可。入力上限はプラン別。公式料金・上限

Azureの金額はJapan Eastの公開小売価格です。料金表 でReadが属するImage Analysis Group 2を確認し、Microsoftの公開価格API の同地域・同区分と照合しました。文書の1ページを1取引として数え、複数機能を呼び出す場合は機能ごとに課金されます。

Googleも画像に実行する機能ごとに数え、複数ページ文書はページごとに扱います。Mistralの注釈付き処理は通常のOCRと別単価です。OCR.Spaceの月額は月払いの価格で、年払いの割引価格ではありません。Engine 1・2向けのFree月25,000回・PRO月300,000回という表示を、Engine 3の枠と取り違えないでください。

APIの料金に加えて、失敗時の再試行、別APIへの切り替え、応答形式の変換、人による確認にも費用がかかります。読み取り結果を待てる時間と、誤りを見つける工程を決めたうえで見積もります。

言語と画像が変わると結果も変わる

次の表は各言語5枚、各3回の集計です。括弧内は成功件数で、分母は各15件。CERは成功した応答の平均です。

言語別の平均CERと成功件数
サービス英語日本語韓国語中国語
1. Google Cloud Vision29.2%(15/15)26.4%(15/15)33.7%(15/15)33.8%(15/15)
2. Azure AI Vision Read37.9%(15/15)48.2%(15/15)20.7%(15/15)54.1%(15/15)
3. Mistral OCR32.8%(15/15)24.7%(15/15)59.5%(15/15)36.5%(15/15)
4. OCR.Space Engine 326.1%(15/15)26.9%(13/15)20.4%(14/15)25.6%(11/15)

たとえば韓国語ではOCR.SpaceとAzureのCERが近いものの、集計に含まれる件数が異なります。この小さな差だけでは、韓国語全般の優劣は判断できません。以下の図は原記事の入力画像と測定値です。図中のCERは文字誤り率、returnedは成功回数、LATENCYは成功時の平均応答時間を表します。冒頭の中央値とは異なります。

英語の時刻表:誤り率の差と待ち時間

全社が3回とも成功した時刻表では、OCR.SpaceのCERは5.2%、Googleは44.6%でした。ただし平均時間はOCR.Spaceが13.1秒、Googleが686ミリ秒です。同じ文字を少なく誤ることと、素早く返すことを同時には満たしていません。

英語の鉄道時刻表と4社の結果。CERはGoogle44.6%、Azure33.6%、Mistral62.6%、OCR.Space5.2%。全社3回成功。
原記事の比較図。入力の時刻表画像を切り抜き・縮小しています。掲載元はパブリックドメインと表示しています。 入力画像:Hogyn Lleol

韓国語のメニュー:Azureは3回とも参照文と一致

Azureはこの1枚でCER 0%でした。Googleは35.2%、Mistralは77.8%、OCR.Spaceは44.1%です。全体平均では見えなかった相性が現れています。韓国語のメニュー全般で誤りがなくなるという結果ではありません。

韓国語のメニュー写真と4社の結果。AzureのCERは0%、他社には文字誤りが残った。
入力写真を切り抜き・縮小した原記事の比較図。写真とその加工部分はCC BY-SA 2.0で提供されています。 写真:Uri Tours · CC BY-SA 2.0

日本語の数式:1回の成功だけでは運用を決められない

OCR.SpaceのCERは4.4%でしたが、成功したのは3回中1回です。Googleは3回とも成功し、CERは17.6%、平均時間は403ミリ秒でした。低い誤り率だけを抜き出すと、残る2回を処理できなかった事実が隠れてしまいます。

日本語の代数学教科書と4社の結果。OCR.Spaceは3回中1回成功、Google・Azure・Mistralは3回成功。
関本幸太郎『代数学教科書-高等女学校』の入力部分を切り抜き・縮小した原記事の比較図。掲載元はパブリックドメインと表示しています。 入力資料:Wikimedia Commons

中国語の帳票:MistralのCERが最も低かった例

中国語の郵便物の控えでは、Mistralは3回とも成功してCER 8.0%、Googleは12.0%、Azureは38.7%でした。OCR.Spaceは3回中2回が成功し、CERは16.0%です。この1枚の結果から、中国語のすべての帳票や手書きへの優位性は推定できません。

中国語の郵便物の控えと4社の結果。MistralのCER8.0%がこの画像で最も低い。
入力写真を切り抜き・縮小した原記事の比較図。写真とその加工部分はCC BY-SA 3.0で提供されています。 写真:Dingli35 · CC BY-SA 3.0

導入前に自社の画像で確かめること

待てる時間と、間違えると困る項目を先に決める

利用者が画面上で待つ処理なら、平均や中央値だけでなく遅い応答と失敗時の待ち時間を測ります。夜間の一括処理なら、再試行で増える料金や処理時間が判断材料です。文書検索に使う場合は、文章、表、読み順を後工程で扱える形式へ変換できるかを確認します。

数字、日付、氏名、分類欄などは、全文のCERが低くても1文字の誤りで意味が変わります。実際の画像を使い、これらの項目が正しかった件数も集計すると、業務で必要な確認量を見積もれます。クラウドへ送れる文書の範囲や保存・削除の条件も、契約前に確認する項目です。

20枚の測定から一般的な順位は決められない

3回の反復は同じ画像での揺れを見るためのもので、異なる画像60枚を試した結果ではありません。画像20枚の構成、文字の密度、撮影条件が変われば結果も変わります。固定モデルIDやプランなどが公開記録に含まれないため、現在のサービスを同じ条件で再現した比較とも言えません。

参照文への偏りを調べるため、公開JSONには各社の出力を参照文作成に使った画像を除いた集計もあります。ただし、除外数はGoogle4枚、Azure3枚、Mistral3枚、OCR.Space5枚と異なります。同じ画像集合で再比較した成績ではないため、これを新しい順位表としては使えません。

他の公開ベンチマークと比べるときも、入力画像、参照文、正規化、集計方法、モデルの版をそろえる必要があります。本稿のCERを、別の文書解析テストの表・数式・配置の点数と直接比較しないでください。

結論:候補を絞り、失敗する条件まで評価する

今回の結果では、速度と完了率を重視するならGoogle、韓国語の具体的な画像と位置情報を確認するならAzure、文書構造を後で使うならMistral、待ち時間と再処理を許容するならOCR.Spaceが検討候補です。これは20枚の記録からの判断で、恒久的な性能順位ではありません。最終的には、自社の文書で誤り・失敗・待ち時間を同時に測って選びます。

クラウドAPIと自社GPUでの実行を比べる場合は、多言語OCRのGPUベンチマーク とUnlimited-OCRの実文書検証 も参考になります。録音・動画を文字にする用途はOCRとは異なります。VoicePingの音声・動画文字起こし は、音声の内容を記録したい場合に確認してください。

よくある質問

文字誤り率が最も低いAPIを選べばよいですか?
成功件数と待ち時間も確認します。この検証のOCR.Spaceは成功した応答の文字誤り率が24.7%で最も低い一方、60件中7件がHTTP 504になりました。操作中に結果を返す用途では、失敗時の再試行や代替処理まで含めた評価が必要です。
日本語に最も強いサービスはどれですか?
今回の日本語画像5枚ではMistralの平均文字誤り率が24.7%で最も低い結果でした。ただし、画像の種類は5種類各1枚です。日本語全般の性能順位ではないため、自社で扱う帳票・縦書き・撮影条件で確認してください。
料金表のモデルを今回再テストした結果ですか?
いいえ。測定値は2026年7月30日公開の記録に基づき、料金と公式仕様は2026年9月19日に確認しています。公開データには固定モデルIDや契約プランなどが含まれていないため、現在のモデルや有料プランの性能と同一とは扱っていません。
この記事をシェア

録音・動画も文字に

文字起こしと翻訳を一緒に。

動画
0:00 0:00