【AIの裏側】なぜGeminiはPDFの読み取りに失敗し、動画だと精度が上がるのか?(※ただし動画も万能ではない)

「PDFを読み込ませたら文字やアイコンを盛大に読み間違えたのに、同じものを動画で撮って見せたら、かなり正確に読み取った」

そんな体験をしたことはありませんか?

この前、YouTubeで動画で名刺をスキャンする映像を見て試してみました。
結果的にだいぶよかった。
また試したら4枚の名刺で2枚NGだった。
うぅ~ん・・・

ってことでもう少し深掘りしてみました。

前回の投稿はこちら:

Two businesspeople are smiling and engaged in conversation while holding cups. The background features promotional text in Japanese related to a name card management tool, emphasizing high-speed recognition solutions with 'GEMINI'.
展示会で集めた名刺の整理

「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

さて、この前、たった4枚の名刺で2枚がきちんと読み取れなかった問題があったが、比較的認識率がScanSnapでスキャンしてPDFやJPGにした画像よりも間違いが少ないことに気づいた。
今回は、本当にただダメだっただけだが、なぜ動画のほうが認識率が高いのか調べてみましたので報告いたします。


「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

実はこれ、最新AI(LLM・マルチモーダルAI)の裏側にある「画像の処理方式(アーキテクチャ)」に明確な理由があります。
そして同時に、「動画なら100%完璧かというと、実はそうでもない」という現実もあります。

1. なぜPDF(静止画)の読み取りは失敗しやすいのか?

AIにPDFや画像をアップロードすると、AIはそれを人間の目のように見ているわけではありません。

内部システムは、送信された画像を「固定の決まったサイズ(例: 512×512ピクセルなど)」に一括縮小・リサイズして処理します。

  • 名刺の小さな文字
  • 診断カルテの微小なアイコンやマーク

これらが一枚の大きなPDFに含まれていると、縮小された時点で画像全体が潰れ、文字やマークが「ドットのモヤモヤ」になってしまいます。その結果、AIは必死にそれっぽく推測しようとしてハルシネーション(知ったかぶりの嘘)を起こしてしまうのです。

2. 動画のほうが「圧倒的に精度が高くなる」仕組み

一方、動画はどうでしょうか?

動画は1秒間に30〜60コマの静止画が連続する「パラパラ漫画」です。

  • 時間軸による情報補完:1コマ目で光が反射して文字が消えていても、別のコマでクリアに見えればAIが補正できます。
  • アングルの変化:カメラが近づくことで、特定部分の解像度が一気に高まる瞬間が生まれます。
  • 動作の文脈(コンテキスト):「手で指さす」「カメラを寄せる」といった動きがあることで、AIが「今どこに注目すべきか」を特定しやすくなります。

3. 【注意】動画でも起こる「読み取り漏れ」と「欠落ミス」

静止画に比べて格段に精度の上がる動画処理ですが、「完璧」ではありません。
実際に試してみると、いくつものミスや欠落が発見されます。

なぜ動画でもミスが起きるのか? 主な原因は以下の3つです。

  1. フレームの「间引き」によるスキップ AIは動画の全フレームを解析しているわけではなく、
    数フレームに1回(間引き処理)抽出して処理しています。
    一瞬しか映っていない重要文字やマークは、この「間引き」の隙間に落ちて丸ごと欠落することがあります。
  2. 手ブレや動体ボケ カメラを動かすスピードが速すぎると、抽出されたフレームがボケてしまい、
    結果としてPDFと同じように誤認識が発生します。
  3. 情報の過多による認識の不整合 情報量が多すぎるがゆえに、
    AIがどのフレームの情報(文字)を優先すべきか迷い、
    要素の一部を読み飛ばしてしまうことがあります。

まとめ:AIに正しく読ませるための実践テクニック

AIの「苦手な構造」と「ミスの傾向」を知っておくと、普段の業務効率が劇的に変わります。

  • PDFや書類を読ませる時 全体をドカンと読み込ませるのではなく、読ませたい部分だけを「拡大スクショ」して渡す(圧縮による文字潰れを防ぐ)。
  • 動画で撮影して読ませる時 ただ撮影するのではなく、「見せたい部分で1〜2秒ピタッと止める」(AIがフレームを間引いても確実に捉えられるようにする)。

「AIなら一発で完璧に読んでくれる」と過信せず、
AIの癖を理解してこちらが少し渡し方を工夫してあげるのが、
ストレスなく使いこなす一番の近道です。

現場での検証に基づく「完璧ではなく欠落も起きる」という視点を入れることで、
一気に説得力のある記事になるかと思います。ぜひ調整してご活用ください。

おわかりいただけたでしょうか?
動画は30FPSや60FPSでスキャンしているのです。
しかもピントも合わせながら。
一方、精子がだと画像を撮影した「今」しかないわけです。

ぜひトライしてみてください。

ちなみに動画が大きすぎるとGEMINIでは読み取れなくなる可能性もあるので、
大量の場合、部分的にファイルを作って読み込ませてください。

次回、ぜひお試しください!