【AIの裏側】なぜGeminiはPDFの読み取りに失敗し、動画だと精度が上がるのか?(※ただし動画も万能ではない)

「PDFを読み込ませたら文字やアイコンを盛大に読み間違えたのに、同じものを動画で撮って見せたら、かなり正確に読み取った」

そんな体験をしたことはありませんか?

この前、YouTubeで動画で名刺をスキャンする映像を見て試してみました。
結果的にだいぶよかった。
また試したら4枚の名刺で2枚NGだった。
うぅ~ん・・・

ってことでもう少し深掘りしてみました。

前回の投稿はこちら:

Two businesspeople are smiling and engaged in conversation while holding cups. The background features promotional text in Japanese related to a name card management tool, emphasizing high-speed recognition solutions with 'GEMINI'.
展示会で集めた名刺の整理

「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

さて、この前、たった4枚の名刺で2枚がきちんと読み取れなかった問題があったが、比較的認識率がScanSnapでスキャンしてPDFやJPGにした画像よりも間違いが少ないことに気づいた。
今回は、本当にただダメだっただけだが、なぜ動画のほうが認識率が高いのか調べてみましたので報告いたします。


「動画のほうが情報量が多くて処理が重そうなのに、なぜ静止画(PDF)のほうが苦手なのか?」

実はこれ、最新AI(LLM・マルチモーダルAI)の裏側にある「画像の処理方式(アーキテクチャ)」に明確な理由があります。
そして同時に、「動画なら100%完璧かというと、実はそうでもない」という現実もあります。

“【AIの裏側】なぜGeminiはPDFの読み取りに失敗し、動画だと精度が上がるのか?(※ただし動画も万能ではない)” の続きを読む →

展示会で集めた名刺の整理

入力するのが億劫ですよね
とくに枚数が増えると

皆さん、どうされていますか?
企業ならSANSANとか個人ならEIGHTとかWantedly PeopleやMy Bridgeを活用しますよね。
あと、他にローカルでいくつか。
その他にNFC系のアプリとかいくつかありますが、正直、これってメチャクチャ不便。
だって、そのアプリでしか活用できないから。

私は友人がMEETを活用していたから試したが、
スマホでしか対応していないから、正直なところデータは一切入れていない。
いちいちスマホで自分の情報を入れないといけないってのは極めて不便。
そもそも音声もチャットも嫌いなタイプなので。

最近はAIを活用して文字起こしをしたりすることもできます。

私が過去に試した方法は:

  1. GEMを通じて名刺ファイルをプリントしたものをGeminiに読み込ませて文字起こしさせてSpreadsheetに入れる
  2. Scansnapでスキャンした名刺(PDF)をGeminiに読み込ませる
  3. Claudeにも頼んで処理してもらいました

実は、これは非常に厄介なことが判明


何が起きているか (Claudeからの回答)

GEMはチャット形式で動いているため、会話履歴がどんどん蓄積されていきます。

名刺1枚のスキャンデータ(PDF画像)は、テキストに比べてトークン消費が非常に大きい。
10枚を超えたあたりで、コンテキストウィンドウの後半部分が圧迫され始めます。

“展示会で集めた名刺の整理” の続きを読む →

Anthropicも透かしを入れる、その他のAI ニュース

今日のAIが割り出したAI News

3.7 Flashが出てくるけど、未だにProは3.5のままだ。
Flashは正直なところ使い物にならない(変な忖度をしすぎる)。
Proの回答も注意しないといけないのは人間が聞きたがるような答えを出してくる。
実際、どの生成AIもなんだけどね。

Anthropicも透かしを入れる。
最近、Sunoも入れると発表した(先週のニュースでもお伝えしたけど)。
これはインチキしたかどうかというのもある。
しかし画像や音楽などは可能だが、回答をすべてテキストにした場合はどうなんだろうと。
つまり、一旦、コピーして、テキストやMD方式で保存。
内容に変なものが「付着」していないかチェックできる。

一番厄介なのが、Claudeが出力するMS-Wordなどのオフィスドキュメントだ。
もともとはバイナリーデータだからだ。

NVIDIAが資金調達。
インフラを整ってくれるのはありがたいが、現状、データセンターお断りになってきている自治体が増えているのをご存じだろうか。
それは、ものすごい量の電力と冷却のために水を使うからだ。
問題はそこで終わらず、このお金が流れる先がウォール街の連中に牛耳られて経済を左右されることになる。
日本はどこまで対抗できるのか?半導体製造だけでいいのか?
ちなみにデータセンターはできるだけ発電所に近いところがいい。
各国で原発がどんどん建設されている中、日本のエネルギーは大丈夫なのかと老婆心ながら心配してしまう。

1. Googleがコーディング・エージェント向け新モデル「Gemini 3.7 Flash」を発表
2. Anthropic、AI生成テキストに「見えない透かし」のグローバル適用を開始
3. NVIDIAがウォール街大手6社と提携、約75兆円規模のAIインフラ資金枠組みを発表


“Anthropicも透かしを入れる、その他のAI ニュース” の続きを読む →

個人情報を絶対に守りながらAIを活用するには?ローカルLLM「Gemma 4 12B」徹底解説

「最近、AIという言葉をよく聞くけれど、うちのような葬儀社には関係ないのでは?」 「ご遺族の複雑な事情や、故人様のセンシティブな個人情報を扱うのに、よく分からない外部のAIにデータを入力するなんて絶対に無理だ」

現場で日々ご遺族と向き合っている葬儀事業者の方ほど、AIの導入に対して強い警戒心をお持ちではないでしょうか。事実、葬儀の現場は「究極の個人情報」の連続です。しかし同時に、深夜早朝問わず発生する事務作業や、形式に沿った案内状の作成、見積もりの調整など、本来であれば効率化したい「待ったなしの業務」に追われているのも現実です。

「情報を絶対に外に出さず、安全にAIに手伝ってもらう方法はないのか?」

実は今、その答えとして注目されているのが、手元のパソコンの中で完全にオフラインで動く「ローカルLLM(ローカルAI)」という技術です。

この記事では、話題の最新ローカルAI「Gemma 4 12B」を例に挙げながら、普段私たちが耳にするChatGPTのような「クラウド型AI」と何が違うのかを解説します。「常に最新で賢いけれどデータ管理に工夫がいるクラウドAI」と、「少し賢さは劣るけれど絶対に情報が漏れないローカルAI」。ITの専門知識がなくても分かるように、これからの終活や葬儀業務のデジタル化において、どちらをどう使うべきかの現実的な戦略をお伝えします。


1. クラウドLLMとローカルLLMの本質的な違い

ChatGPTやGemini(Web版)などのクラウドLLMと、手元のPCで動かすローカルLLM。この2つは「どこで計算しているか」だけの違いではなく、活用における前提が大きく異なります。

比較軸クラウド型LLM (ChatGPT, Gemini等)ローカル型LLM (Gemma, Llama等)決定的な違いが生む影響
データの所在サービス提供者のサーバー(クラウド)ユーザー自身のハードウェア内【機密性】 ローカルはオフラインで完結するため、極秘の社内データや個人情報を学習・解析させても外部流出のリスクがゼロ。
モデルの規模数千億〜数兆パラメータの超巨大モデル数十億〜数百億パラメータの中規模モデル【知能の限界】 複雑な論理推論や広範な一般常識はクラウドが圧倒的に優れる。ローカルは特定のタスク(要約、翻訳、コード生成)に特化させることで実用レベルに達する。
コスト構造従量課金(API)または月額サブスクリプション初期投資(PC・GPU代)+電気代【利用の自由度】 ローカルはどれだけ大量のデータを処理させても追加コストがかからないため、数万件のログ解析といった力技が容易。
カスタマイズ性提供者が用意した枠組み内での調整(プロンプト等)モデル自体の改造、追加学習(ファインチューニング)【独自性の構築】 ローカルは特定の業界用語や自社のトーン&マナーを「モデルそのものの脳内」に焼き付けることが可能。
安定性・可用性ネット回線とサービス提供者のサーバー状況に依存手元のハードウェアが動く限り、永続的に利用可能【依存性】 クラウドはサービス終了や規約変更で突然使えなくなるリスクがある。ローカルは環境を自己所有できる。
“個人情報を絶対に守りながらAIを活用するには?ローカルLLM「Gemma 4 12B」徹底解説” の続きを読む →

2025/11/19 Gemini 3 がロールアウトした!

早速、そのGEMINIに違いを聞いてみました。

主にエージェント機能!

もうCopilotなんか目じゃない。
マジに昨日、CopilotにJPYCのことを聞いていたら、情報が古すぎて、
間違った回答ばかりしてきていた。
あと、日本の法律についてもきちんと理解していなさすぎだった。

改めて、夜中にGEMINIに聞いて理解しなおしていたところ、

本日、GEMINIがバージョンアップ

  1. Deep Think
  2. Agent
  3. インターフェース生成
  4. 処理性能アップ

すでにGoogleの Discord で紹介されている映像があって、
動画を簡単に解析する能力がありました!

https://discord.gg/gemini

“2025/11/19 Gemini 3 がロールアウトした!” の続きを読む →

単純映像の比較 Veo3 vs. Sora 2

昨日、Sora 2の招待コードをいただいたので早速単純なものを作ってみました。

プロンプトが: river flowing slowly in the dark meadow, with a sharp red silverligning light glowing in from the sky, ajacent to the river is a graveyard, full of tombstones, with ccolorful flowers growing around the headstone.

なかなかいいな!

画質はイマイチだけど、雰囲気は出ている

“単純映像の比較 Veo3 vs. Sora 2” の続きを読む →