【AIの裏側】なぜGeminiはPDFの読み取りに失敗し、動画だと精度が上がるのか?(※ただし動画も万能ではない)

「PDFを読み込ませたら文字やアイコンを盛大に読み間違えたのに、同じものを動画で撮って見せたら、かなり正確に読み取った」

そんな体験をしたことはありませんか?

この前、YouTubeで動画で名刺をスキャンする映像を見て試してみました。
結果的にだいぶよかった。
また試したら4枚の名刺で2枚NGだった。
うぅ~ん・・・

ってことでもう少し深掘りしてみました。

前回の投稿はこちら:

Two businesspeople are smiling and engaged in conversation while holding cups. The background features promotional text in Japanese related to a name card management tool, emphasizing high-speed recognition solutions with 'GEMINI'.
展示会で集めた名刺の整理

「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

さて、この前、たった4枚の名刺で2枚がきちんと読み取れなかった問題があったが、比較的認識率がScanSnapでスキャンしてPDFやJPGにした画像よりも間違いが少ないことに気づいた。
今回は、本当にただダメだっただけだが、なぜ動画のほうが認識率が高いのか調べてみましたので報告いたします。


「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

実はこれ、最新AI(LLM・マルチモーダルAI)の裏側にある「画像の処理方式(アーキテクチャ)」に明確な理由があります。
そして同時に、「動画なら100%完璧かというと、実はそうでもない」という現実もあります。

“【AIの裏側】なぜGeminiはPDFの読み取りに失敗し、動画だと精度が上がるのか?(※ただし動画も万能ではない)” の続きを読む →