【AIの裏側】なぜGeminiはPDFの読み取りに失敗し、動画だと精度が上がるのか?(※ただし動画も万能ではない)

「PDFを読み込ませたら文字やアイコンを盛大に読み間違えたのに、同じものを動画で撮って見せたら、かなり正確に読み取った」

そんな体験をしたことはありませんか?

この前、YouTubeで動画で名刺をスキャンする映像を見て試してみました。
結果的にだいぶよかった。
また試したら4枚の名刺で2枚NGだった。
うぅ~ん・・・

ってことでもう少し深掘りしてみました。

前回の投稿はこちら:

Two businesspeople are smiling and engaged in conversation while holding cups. The background features promotional text in Japanese related to a name card management tool, emphasizing high-speed recognition solutions with 'GEMINI'.
展示会で集めた名刺の整理

「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

さて、この前、たった4枚の名刺で2枚がきちんと読み取れなかった問題があったが、比較的認識率がScanSnapでスキャンしてPDFやJPGにした画像よりも間違いが少ないことに気づいた。
今回は、本当にただダメだっただけだが、なぜ動画のほうが認識率が高いのか調べてみましたので報告いたします。


「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

実はこれ、最新AI(LLM・マルチモーダルAI)の裏側にある「画像の処理方式(アーキテクチャ)」に明確な理由があります。
そして同時に、「動画なら100%完璧かというと、実はそうでもない」という現実もあります。

“【AIの裏側】なぜGeminiはPDFの読み取りに失敗し、動画だと精度が上がるのか?(※ただし動画も万能ではない)” の続きを読む →

展示会で集めた名刺の整理

入力するのが億劫ですよね
とくに枚数が増えると

皆さん、どうされていますか?
企業ならSANSANとか個人ならEIGHTとかWantedly PeopleやMy Bridgeを活用しますよね。
あと、他にローカルでいくつか。
その他にNFC系のアプリとかいくつかありますが、正直、これってメチャクチャ不便。
だって、そのアプリでしか活用できないから。

私は友人がMEETを活用していたから試したが、
スマホでしか対応していないから、正直なところデータは一切入れていない。
いちいちスマホで自分の情報を入れないといけないってのは極めて不便。
そもそも音声もチャットも嫌いなタイプなので。

最近はAIを活用して文字起こしをしたりすることもできます。

私が過去に試した方法は:

  1. GEMを通じて名刺ファイルをプリントしたものをGeminiに読み込ませて文字起こしさせてSpreadsheetに入れる
  2. Scansnapでスキャンした名刺(PDF)をGeminiに読み込ませる
  3. Claudeにも頼んで処理してもらいました

実は、これは非常に厄介なことが判明


何が起きているか (Claudeからの回答)

GEMはチャット形式で動いているため、会話履歴がどんどん蓄積されていきます。

名刺1枚のスキャンデータ(PDF画像)は、テキストに比べてトークン消費が非常に大きい。
10枚を超えたあたりで、コンテキストウィンドウの後半部分が圧迫され始めます。

“展示会で集めた名刺の整理” の続きを読む →