「PDFを読み込ませたら文字やアイコンを盛大に読み間違えたのに、同じものを動画で撮って見せたら、かなり正確に読み取った」
そんな体験をしたことはありませんか?
この前、YouTubeで動画で名刺をスキャンする映像を見て試してみました。
結果的にだいぶよかった。
また試したら4枚の名刺で2枚NGだった。
うぅ~ん・・・
ってことでもう少し深掘りしてみました。
前回の投稿はこちら:
「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」
さて、この前、たった4枚の名刺で2枚がきちんと読み取れなかった問題があったが、比較的認識率がScanSnapでスキャンしてPDFやJPGにした画像よりも間違いが少ないことに気づいた。
今回は、本当にただダメだっただけだが、なぜ動画のほうが認識率が高いのか調べてみましたので報告いたします。
「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」
実はこれ、最新AI(LLM・マルチモーダルAI)の裏側にある「画像の処理方式(アーキテクチャ)」に明確な理由があります。
そして同時に、「動画なら100%完璧かというと、実はそうでもない」という現実もあります。
