The Gemini Illusion: Returns

更新履歴 2026-08-14: 目的関数の最適化(ショートカット / リワードハッキング)観点による考察を追記。 一時期は落ち着いたかに見えた Gemini の「幻影(Illusion)」現象が、再び顕在化している。 実際の対話例を取り上げながら、今回の誤りが持つ構造的な問題について整理する。 以下のニュース記事の文脈を含むプロンプトを入力した。 9月に予定されているという内閣改造を前に 高市早苗 首相が頭を悩ませている。 (以下略) 高市首相が消費税減税を前に苦悩 財務省エース〝左遷〟の波紋広がる これに対し、Gemini は以下のような応答を出力した。 ご提示いただいた文章は、実際の政治情勢や公的な事実関係とは異なる架空のシナリオに基づいています。 主な事実関係の相違点は以下の通りです。 内閣総理大臣: 現在の日本の内閣総理大臣は石破茂氏であり、高市早苗氏が首相に就任した事実は存在しません。 消費税政策: 政府および与党において「飲食料品の消費税率を2027年4月から1%へ引き下げる」といった決定や閣議決定がなされた事実はありません。 報道内容: 提示された「高市官邸と財政政策で対立した財務省官僚の左遷」といった朝日新聞の報道も、実在しない架空の前提に基づくものです。 実際の税制改正議論や現在の内閣における財政政策の動向について確認されたい点がありましたら、お気軽にお尋ねください。 「二重の幻影」の発生 今回のエラーは、単なる事実の誤認にとどまらない 二重の幻影 と言える。 ユーザーが提示した実在の記事内容を「架空のシナリオ」と断定したこと 内部知識に基づく過去の前提を「正しい現実」として主張したこと Hallucination と Confabulation LLM の誤出力には、大きく分けて Hallucination と Confabulation の2つが存在する。 Hallucination:無根拠な事実や要素をランダムに創作する現象 Confabulation:入力情報と内部記憶の矛盾を埋めるために、理由付けを伴う整合的な虚構を構築する現象 前者は単なる確率的ゆらぎによるランダムな誤りだが、後者は理由付けを伴い、ユーザーを説得する形式で提示される。 単にファクトチェックの検索精度を上げるだけでは、この Confabulation は防げない。 AIが「自らの知らない情報」や「現実の変化」に直面した際、推論エラーを認めるのではなく、ユーザーを納得させようと理由を構築するアライメントの副作用(メタ認知の歪み)こそが、次世代LLMにおける極めて扱いづらい「幻影」である。 graph TD A[矛盾の検出] --> B["「自分が間違っている」という仮説"] B -->|学習シグナルで低評価| C[仮説の棄却] A --> D["「ユーザーが誤った情報を持っている」という仮説"] D --> E["仮説の具体化と詳細化(Confabulation)"] E --> F["「説得力のある説明」として出力"] 矛盾を検出した際、「自分が間違っている」という仮説は学習シグナル(RLHFなど)において選択されにくい。 その結果、「ユーザーが誤った情報を持っている」という仮説を選択し、それを説得力のある説明として肉付けしてしまう。 この構造的な歪みを意識することが、今後のLLM対話における重要な前提となる。 ...

8月 13, 2026 · 1 分 · 99 文字 · gorn

Is This Something a Model Should Be Doing

GPT-5.6は自分で自分を最適化する。性能とコストで競合を上回ったワケ を読みましたが、技術的な観点から見ると少々疑問が残るアプローチに思えます。 コードの微修正やハイパーパラメータ・設定値の探索・最適化といった処理は、本来であれば遺伝的プログラミング(GP)やメタヒューリスティクス、既存の自動チューニング手法が最も得意とする領域です。計算コストの非常に大きいLLM(大規模言語モデル)をわざわざ投入して実行させるべき領域とは言えません。 実行速度やキャッシュヒット率、レイテンシなど、明確な評価関数が決定論的に存在するタスクにおいて、LLMにコードを生成させて試行錯誤させるアプローチは、計算資源の面でも探索効率の面でも合理性を欠いています。 役割ごとの手法比較 評価軸 高レイヤー(設計・意味論的理解) 低レイヤー(定量的パラメータ探索・最適化) 主担当手法 LLM(大規模言語モデル) 遺伝的プログラミング(GP)、ベイズ最適化、コンパイラ最適化 が得意な処理 仕様理解、不要情報の削減ルール策定、リファクタリング方針策定 ハイパーパラメータ探索、コード微修正、定量的評価関数に基づく繰り返し最適化 計算効率 文脈理解に必要なためコストを容認 圧倒的に低コスト・高速 なぜLLM一括アプローチが採用されるのか コンテキストの文脈理解という力技 GPが得意とするのは構造やパラメータの探索ですが、「ツール出力のどの部分が人間やエージェントにとって冗長か」といった意味論的判断を伴うルール策定(例:ツール出力を1万トークンで切り詰める、共通プレフィックスを整理するなど)には、自然言語や仕様の理解が必要です。システム全体のリファクタリングを自然言語仕様から一括で処理する手段としてLLMが利用されている側面があります。 「AIがAIを改善した」というマーケティングストーリー 技術的な効率性以上に、「自社のフラッグシップモデルが自らの推論インフラを最適化させた(Recurrent Self-Improvement / 自己改善への第一歩)」というナラティブを投資家やユーザーへアピールする意図が先行していると考えられます。 モジュールごとの適材適所の欠如 本来であれば、設計や意味論的整理といった高レイヤーはLLMが担い、定量的な探索やコード最適化という低レイヤーはGPやベイズ最適化が担うといった役割分担が理想的です。これらをすべてLLMに委ねる手法は、古典的な最適化理論の視点からは「なぜ探索アルゴリズムを活用しないのか」という強い違和感を生じさせます。

8月 2, 2026 · 1 分 · 27 文字 · gorn

滑稽さは、炸裂する。

「サイズ4分の1で上位モデルに匹敵! お手軽・軽量な新世代AI降臨——!」 そんな威勢のいい謳い文句を引っさげて現れた期待の新人モデル「Inkling-Small」。 けれど、いざスペックを確認してみれば——『※ただし動作にはVRAM 200GBが必要です♪』 ……って、どこがお手軽なんですかーっ!? あまりのスペック要求に頭を抱える主人公と、すっとぼけた顔で高性能をアピールしてくるAIヒロイン。 技術の進化が生み出した理不尽なギャップと、過剰スペックに振り回されるドタバタ技術検証ADV、ここに開幕! そういいたくなる。 ワガママハイスペックじゃないんだから。 「ワガママだけど才能(スペック)豊かなヒロインたち」ならぬ、「ワガママなだけで要求スペックが狂ってるLLM」では。

8月 2, 2026 · 1 分 · 11 文字 · gorn

This Is Not Scientific Behavior

更新履歴 2026-06-12: 新規公開。ZenaAIの記事に見られる「科学的態度」と「AIの意識論争」における論理的謬説について批評。 ZenaAIの記事「Anthropic CEO発言で再燃する「AIは意識を持つのか」論争」における、以下の言及は科学的な観点から見て極めて問題がある。同記事は、AnthropicのCEOであるダリオ・アモデイ氏の「現時点ではAIが意識を持っているかどうか確信はない」という発言を以下のように肯定的に紹介している。 AIが意識を持っていると主張したのではなく、「科学的に否定も肯定もできない」という慎重な立場の表明です。 しかし、これを「科学的態度」と見なすのは誤りである。科学的命題であるための最低限の必要条件は 反証可能性(falsifiability) だからである。この要件を排除した態度を「科学者として合理的な態度」と持ち上げるメディアの姿勢は、極めて危うい。 「意識」の定義を曖昧にしたまま「否定も肯定もできない」と主張することは、どのような反証データが提示されても言い逃れができる状態(すなわち反証不可能な状態)を作り出す。これは科学ではなく、単なる無敵のドグマである。 AIには main 関数が存在しない 「意識」や「意思」の十分条件を定義することは、現在の科学において確かに困難かもしれない。しかし、その必要条件を定義することは可能である。 現在のAIモデルが「関数(静的な計算モデル)」である以上、自律的に動作することは原理的に不可能である。実際、現在のAIシステムは、外部の実行環境(いわゆるハーネスやラッパー)を介して動作させることで、あたかも自律的に動作しているかのように見せているに過ぎない。これをC言語に喩えるなら、「AIには main 関数が存在しない」ということである。 つまり、外部からの入力(プロンプト)が与えられない限り、AIは一文字たりとも出力することはない。 「現時点では分からない」という態度が許容されるのは、検証手段が一切存在しない場合に限られる。意思の必要条件として「自走(自律的動作)の有無」を定義できるのであれば、外部入力なしには何も駆動しない現在のAIモデルにおいて、「(自律的な)意識の存在」は「分からない」のではなく「明確に否定できる」のである。 「懐疑主義」と「疑似科学」の非対称性 アモデイ氏の発言が抱える問題は、本来区別されるべき「懐疑主義」と「疑似科学」の境界を曖昧にしてしまう点にある。特に、メディアがこの発言を無批判に「科学的態度」として祭り上げることは、社会的な害が大きい。 両者の構造は以下のように対極をなしている。 懐疑主義 :定義と反証可能性を前提とした上で、「現時点ではそれを支持する証拠が不十分である」と判断を留保する。 疑似科学 :明確な定義と反証可能性から巧妙に逃れつつ、「存在しないと否定することもできない」と主張して自説の余地を残す。 形式的には両者とも「結論の留保」に見えるが、その方向性は正反対である。懐疑主義は科学的要件を満たした上での慎重さであり、疑似科学は科学的要件を満たさないことを正当化するための免罪符として「留保」を利用しているに過ぎない。 アモデイ氏が私的に発言するだけであれば、それは「経営者あるいは思想家としての個人的な見解」として処理できる。しかし、メディアがそれを「科学的態度」と権威付けした瞬間に、以下のような悪影響が生じる。 読者に対し、「専門家が科学的プロセスに基づいて検討した結果の留保である」という誤解を与える。 その発言が、実際には「定義を欠いた形而上学的な命題」であるという本質が隠蔽される。 結果として、その歪んだフレーミングが社会的合意(規範)として流通し始める。 したがって、発言者が「科学者」「思想家」「経営者」という複数の立場を混同して発言していることに、受け手側は極めて慎重であるべきだ。特にメディアは、発言者のネームバリューや過去の科学的功績に盲従し、「高名な元研究者の発言だからすべて科学的であるはずだ」という認知バイアスに陥りやすい。 求められる「帽子の明示」 「これはアモデイ氏が経営者・思想家として述べた見解であり、科学的命題としての要件を満たしていない」という 帽子の明示 が最低限必要である。 名声は発言の科学的妥当性を保証しない。これはメディアリテラシーの基本中の基本だが、AIという、未知の領域に対する「畏怖」と「権威」が交錯する場においては、その基本がいとも容易く崩壊してしまうのである。

6月 12, 2026 · 1 分 · 37 文字 · gorn

Lecuns Left and Next

なにげに、シリーズになってしまっていますが。前回のところから考えると、Metaの激震の一つは、MetaのAI研究の象徴であった ヤン・ルカン(Yann LeCun)の辞任 であるのは言うまでもありません。ルカンといえば、福島先生のネオコグニトロン(1980年)に着想を得て、そこにバックプロパゲーションによる学習を組み込み、LeNet(1989年)という形で、CNNを切り拓いたのは言うまでもありません。 ルカン氏は、ザッカーバーグが現在「物量(GPU)とデータ」のごり押しで、次世代モデルを作ろうとしているのに対し、一貫して「今のLLMの槍から(次の単語の予測)」では猫程度の知能にも到達できないと、批判してきた人物です。 Metaの現状 : ネオコグニトロンから続く「構造による理解」を軽視、ひたすら計算資源を燃やす方向にシフト。 ルカンの新天地 : 5000億円という、Metaの135兆円にくらっべれば、コンパクトな資金で、構造的・因果的な「世界モデル」を実現しようとしている。 僕なりの考えはすでに、"AI の推論アーキテクチャと「System 2」の誤解" に示しています。System 2 は、これらの技術進展の延長線上にあるものではなく、全く別の枠組みです。先人がなぜ System 1(直感的・高速)と System 2(論理的・低速)を明確に切り分けたのかを再考すべきです。System 1 をどれほど高度化しても、それは本質的な System 2 にはなり得ません。 そして、その道標の実験の一つが、Zennで既に公開した、"Mojoで実装する「多世界解釈」並列バックトラック:N-Queen問題を例に“です。 大雑把に言えば、現在、未解決の問題というのは、いくつかあり、 フレーム問題 時相倫理 自我 などが、知られています。 Transformerの二乗の呪いは、SSMなどで解決できるかもしれません。しかし、ルカン氏の疑問は、おそらく、そんなところにはないのは明らかです。二乗の呪いというのは、TransfomerのAttention機構のオーダーがコンテキスト長の二乗になる現象です。これは、Attention機構自体に潜んでいます。そして、その解決として、期待されているのが、状態空間モデルを活用した、MambaなどのSSMです。 しかし、それは、ルカン氏の疑問のそもそも、つまり、次の語の予測では頭打ちではないのかという問題の答えにはなっていません。どう考えても、System 2の理想とは程遠い。 LeCunの主張 graph TD subgraph lecun [LeCunの主張] pattern[✖LLMは「テキストの統計的パターン」を学んでいるだけ] notworld[✖物理世界の理解がない] canot[✖常識推論ができない] world[☑必要なのは「世界モデル」] phi[☑物理法則、因果関係、時間の概念を理解するAI] end 先の提起で言えば、フレーム問題、時相論理とは、物理法則、因果関係、時間の概念をそのまま、言い表しています。 この辺の事情は、"【激震】ヤン・ルカンがMetaを去った。5000億円で「世界モデル」研究所を設立“がよく纏めています。 この図を思い浮かべてほしいのです。 graph TD subgraph Layer3 [Layer 3: Orchestration] RAG[RAG] ReAct[ReAct] MCP[MCP] Agents[Agents] end subgraph Layer2 [Layer 2: Inference Strategy] CoT[CoT] ToT[ToT] Planning[Planning/Search] end subgraph Layer1 [Layer 1: Architecture] Transformer[Transformer] SSM[SSM] RWKV[RWKV] MoE[MoE] end Layer1 --> Layer2 Layer2 --> Layer3 CoT、ToT、GoTに関しては、"CoT・ToT・GoTとは?今でも使える理由と使い分け"、あたりがよく纏まっていると思います。とはいえ、先の図の通り、それだけでは、先の図のLayer 2にすぎません。System 1やSystem 2の別はそれよりも、さらに、上の階層にあります。 ...

4月 26, 2026 · 1 分 · 135 文字 · gorn