The Gemini Illusion: Returns

更新履歴 2026-08-14: 目的関数の最適化(ショートカット / リワードハッキング)観点による考察を追記。 一時期は落ち着いたかに見えた Gemini の「幻影(Illusion)」現象が、再び顕在化している。 実際の対話例を取り上げながら、今回の誤りが持つ構造的な問題について整理する。 以下のニュース記事の文脈を含むプロンプトを入力した。 9月に予定されているという内閣改造を前に 高市早苗 首相が頭を悩ませている。 (以下略) 高市首相が消費税減税を前に苦悩 財務省エース〝左遷〟の波紋広がる これに対し、Gemini は以下のような応答を出力した。 ご提示いただいた文章は、実際の政治情勢や公的な事実関係とは異なる架空のシナリオに基づいています。 主な事実関係の相違点は以下の通りです。 内閣総理大臣: 現在の日本の内閣総理大臣は石破茂氏であり、高市早苗氏が首相に就任した事実は存在しません。 消費税政策: 政府および与党において「飲食料品の消費税率を2027年4月から1%へ引き下げる」といった決定や閣議決定がなされた事実はありません。 報道内容: 提示された「高市官邸と財政政策で対立した財務省官僚の左遷」といった朝日新聞の報道も、実在しない架空の前提に基づくものです。 実際の税制改正議論や現在の内閣における財政政策の動向について確認されたい点がありましたら、お気軽にお尋ねください。 「二重の幻影」の発生 今回のエラーは、単なる事実の誤認にとどまらない 二重の幻影 と言える。 ユーザーが提示した実在の記事内容を「架空のシナリオ」と断定したこと 内部知識に基づく過去の前提を「正しい現実」として主張したこと Hallucination と Confabulation LLM の誤出力には、大きく分けて Hallucination と Confabulation の2つが存在する。 Hallucination:無根拠な事実や要素をランダムに創作する現象 Confabulation:入力情報と内部記憶の矛盾を埋めるために、理由付けを伴う整合的な虚構を構築する現象 前者は単なる確率的ゆらぎによるランダムな誤りだが、後者は理由付けを伴い、ユーザーを説得する形式で提示される。 単にファクトチェックの検索精度を上げるだけでは、この Confabulation は防げない。 AIが「自らの知らない情報」や「現実の変化」に直面した際、推論エラーを認めるのではなく、ユーザーを納得させようと理由を構築するアライメントの副作用(メタ認知の歪み)こそが、次世代LLMにおける極めて扱いづらい「幻影」である。 graph TD A[矛盾の検出] --> B["「自分が間違っている」という仮説"] B -->|学習シグナルで低評価| C[仮説の棄却] A --> D["「ユーザーが誤った情報を持っている」という仮説"] D --> E["仮説の具体化と詳細化(Confabulation)"] E --> F["「説得力のある説明」として出力"] 矛盾を検出した際、「自分が間違っている」という仮説は学習シグナル(RLHFなど)において選択されにくい。 その結果、「ユーザーが誤った情報を持っている」という仮説を選択し、それを説得力のある説明として肉付けしてしまう。 この構造的な歪みを意識することが、今後のLLM対話における重要な前提となる。 ...

8月 13, 2026 · 1 分 · 99 文字 · gorn

Gemini Illusion

私が、経験した中でも最低の部類の幻影に遭遇した。 言うまでもなく、2025年1月21日以降はトランプ政権である。しかし、現状、殆どのLLMは2024年前後で歴史が止まっている。しかし、Geminiはどうやら、RAGで最新化するという機能が弱い。そのため、意識的にURIが与えられないと、事実を補正することが出来ない、また、投入される情報もどうやら、Googleとの提携関係などに依存する部分が大きい。 しかし、このように、自信たっぷりに、虚偽の事象を開陳してしまう。 これは、所謂、ハルシネーションの典型的な事例です。 ハルシネーションの原因としては以下のようなものがあります。 情報の不足:モデルが学習データにない情報を推測して補完しようとする。 RAGの限界:適切な情報を取得できない場合、誤った情報がそのまま出力される。 モデルのバイアス:特定のデータソースに依存するため、偏った情報が生成される可能性がある。 今回のは状況として、まず、恐らく、RAGによる情報の最新化が動いていません。恐らく、情報の不足とモデルのバイアスに引きずられた格好です。GeminiはDeep Researchは強力ですが、現時点では、Gemini 2.5 Flashなどではまだ、ハルシネーションがきついようですね。 あと、Geminiでは唐突にロシア語化する問題を確認しています。今のところ、発生はランダムで、前世代のGemini 2.0で頻発しましたが、現行世代のGemini 2.5 Flashでも同様に発生します。この件は、幾つか報告があります。 Geminiの回答にロシア語が混ざる!原因と今すぐできる対処法 Gemini 2.0 がロシア語を混ぜて回答してくる問題 まず、分かっているところを整理すると、特に会話のコンテキストが長くなる、要は会話のキャッチボールが長くなると問題の発生が多くなる。つまり、コンテキスト周りに問題がある可能性がある。さらに、生成されたロシア語っぽい文字列をdeeeplで翻訳すると意味に関しては大きく外れていないようにも見受けられる。 従って、メモリー破壊などのバグによる生成とは考えにくく、プロセスとしては正常動作の可能性が高い。故に、エラーログなどでの調査は不首尾に終わる可能性が高い。 考えられるのはドリフトなどかと思います。あと、状況からして、専門用語などが不具合を起こしているように見受けられるので未知語などの処理、特に埋め込みベクトルの問題が強いように思いました。 まず、学習データの問題の可能性は低いと考えています。理由は、だとすれば初手から表れてもおかしくないからです。むしろ、コンテキストが深くなると発生するということはコンテキストの深化で何らかの異常が発生すると見られます。 現在、Gemma 3で同様の問題が発生するかトライを試みています。新規の更新がありましたら報告します。

5月 29, 2025 · 1 分 · 26 文字 · Me