top of page

個人が賢くなるほど、社会は同じ間違いをするのか──認知インフラの集中と誤差の相関

5 日前
読了時間: 26分

シリーズ: 論文渉猟


◆今回の論文:Steven D. Shaw & Gideon Nave, "Thinking—Fast, Slow, and Artificial: How AI is Reshaping Human Reasoning and the Rise of Cognitive Surrender" (SSRN Working Paper, 2026年)

  • 概要:人間の直感と熟慮に加え、脳の外側で動く人工的な認知を第三の体系として位置づける三体系理論を提示し、認知反射テストの改変版を用いた事前登録3実験(参加者1,372人、試行9,593)でAIの正確性を無作為に操作して、AIの出力を最小限の精査で採用する傾向を測った論文。



生成AIについて「AIに頼れば人間は考えなくなる」という懸念をよく耳にする。この問いの立て方は、しかし粗い。


人間はもともと、自分の認知能力だけで考えてきたわけではない。文字は記憶を外部化し、印刷は知識の流通を変え、電卓は計算を、検索は情報探索を、地図アプリは経路判断を外部の技術へ移した。そのたびに、人間が自力で行う認知作業の一部は使われなくなった。それでも、社会全体として利用可能な認知能力はしばしば拡張してきた。したがって、生成AIによって人間の考え方が変わるというだけでは、それが問題だとは言えない。


問うべきなのは、生成AIが入ることで、人間と技術を合わせた認知システム全体がどのような構造へ変わるのか、である。


この問いに実験で答えようとした研究がある。ウォートンのスティーブン・ショーとギデオン・ネイブは、1,372人を対象とする三つの事前登録実験で、AIが正しい答えを出す場合ともっともらしい誤答を出す場合を無作為に振り分けた。結果は、AIに頼ると人が愚かになる、というものではなかった。AIが正しいときの成績は基準を大きく上回り、AIが誤ったときの成績は基準を下回った。人間の判断結果が、AIの正誤とより強く結びついたのである。


本稿は、この読み替えを出発点にする。そして、個人の判断がAIの誤差へ接続されるというミクロな現象から、多数の判断が同じ認知基盤へ依存するというマクロな構造へ、どこまで橋を架けられるのかを検討する。筆者の見立てでは、最も警戒すべきは人間の頭から何かが失われることではない。高性能なAIを使うことが個々人にとっても組織にとっても合理的であるほど、社会の判断が少数の共通した基盤へ集中し、その誤りを独立に発見して訂正する経路が細くなりうる、という構造の方である。



介入できる位置の数


認知作業を身体の外へ出すこと自体は新しくない。予定を紙に書き、計算を電卓に任せ、経路探索を地図アプリへ渡す。認知科学ではこれを認知的委託(cognitive offloading)と呼んできた。この枠組みで重要なのは、外部の道具が担うのは工程の一部にすぎず、全体の統制は人間の側に残る、という点である。


生成AIが従来の道具と異なるのは、性能の高さよりも、介入できる位置の数にある。問題の設定、関連情報の選別、仮説の生成、比較軸の設定、推論、反論、文章化。かつては検索エンジン、専門家、教師、編集者、同僚といった別々の主体や技術に分散していた機能が、ひとつの継続的な対話相手を通じて横断的に提供される。この機能の統合が、道具論としての新しさの中身にあたる。


ショーとネイブは、この事態を二重過程理論の拡張として定式化する。直感的で自動的な処理をシステム1、意識的で分析的な処理をシステム2と呼ぶ従来の枠組みに対し、脳の外側で動く人工的な認知をシステム3 (System 3) として置く。彼らによれば、システム3は内的な過程を補うこともできれば、置き換えることもできる。


この命名にどこまで理論的な意味があるかは、留保が要る。システム1とシステム2は人間内部の処理様式の区別であり、システム3は外部の主体についての区別である。分類軸が揃っていない。別の研究者たちは、人間が考え始める前の情報環境を形成する層をシステム0と呼んでおり、番号の付け方としてはこちらも同じ問題を抱える。重要なのは番号ではなく、生成AIが人間の思考の前にも最中にも入りうるという事実の方だろう。


ただし、この定式化には実務上の効用がある。AIの影響を「どれだけ使うか」という利用率で測ろうとすると、肝心のところが落ちる。同じ利用率でも、答えをひとつ受け取るのと、問題の立て方から一緒に作るのとでは、起きていることが違う。使うか使わないかではなく、認知過程のどこへ挿入したかを見よ、という要請が、この枠組みからは出てくる。



正誤を割り当てるという設計


実験の設計を見ておく必要がある。ここに、この研究がほかの多くのAI利用研究と違うところがあるからだ。


AI利用の効果を観察研究で測ろうとすると、厄介な問題に突き当たる。AIを使う人と使わない人を比べても、その差がAIによるものなのか、AIを使うことを選ぶ人の性質によるものなのかが分からない。自信のない人ほどAIに頼るのだとすれば、因果は逆向きにも読める。


ショーとネイブは、参加者にAIの相談窓口を用意したうえで、そのAIの正確性を研究者の側で無作為に割り当てた。隠した指示を仕込み、ある試行では正しい答えを、別の試行では自信ありげな誤答を出すようにした。参加者はどちらが割り当てられたか知らないまま相談する。これによって、AIの正誤という一点だけを動かしたときに人間の回答がどう変わるかが、因果として読める。


課題には認知反射テストの改変版を使った。直感的にすっと浮かぶもっともらしい誤答と、一段の熟慮を経て到達する正答が、明確に分かれるように作られた問題である。直感と熟慮の切り分けを観察する道具として長く使われてきたが、この研究での役割はそれだけではない。正解が一意に定まるからこそ、外部から供給された答えの正誤を研究者が完全に統制できる。


もっとも、この設計はそのまま限界にもなる。現実に人がAIへ持ち込む問題の多くは、正解が一意に定まらない。曖昧な状況の判断、複数の基準の衡量、創造的な課題、規範的な問い。著者ら自身がこの点を限界として挙げている。実験室の一発勝負と、職場や医療や金融に埋め込まれた反復的な利用とでは、条件がかなり違う。



上下しているのは人間の側ではない


結果である。参加者は用意された相談窓口を、過半数の試行で実際に利用した。そしてAIなしの状態を基準にすると、AIが正しいときは正答率がおよそ25ポイント上がり、AIが誤っているときはおよそ15ポイント下がった。効果量はコーエンのhで0.81にのぼる。


最初の実験では、AIが誤っていた場合でも、参加者はおよそ五回に四回その助言に従った。


この結果を「AI依存は危険である」という警告として読むと、実験が示したものの半分を落とすことになる。正確なAIが利用できる条件では、参加者の成績は基準線を大きく上回っている。同じ人たちが、条件次第で賢くもなり、鈍くもなる。上下しているのは人間の能力ではない。


ここで観察されたのは、能力の低下ではなく、出力の決定要因の移動である。人間の判断結果が、自分自身の認知能力よりも、AIの正誤へ連動するようになった。この読み替えが、以後の議論の足場になる。


著者らはこの挙動を認知的明け渡し(cognitive surrender)と呼ぶ。AIの出力を最小限の精査で採用し、直感と熟慮の両方を上書きしてしまうこと。ネイブは認知的委託との違いをこう説明している。電卓を使うことは特定の計算作業を外部化するが、推論の統制は人間に残っている。認知的明け渡しはそれとは異なり、AIが専門的な作業をこなしているのではなく決定を下していて、しかも人間が、その移転が起きたことに気づかないままその決定を自分のものとして採用する瞬間を指す。


ただし、この命名には実証上の飛躍が含まれている。実験が直接観察できるのは、誤った回答が採用されたという行動である。本当に考えなかったのか、少し考えたうえで相手の方が正しいと判断したのか、信頼できる情報源として合理的に重みづけたのか。この三つは、採用という一点の観察からは区別しきれない。行動としての追随は無作為化によって強く立証されているが、精査の欠如という内的な状態の方は、間接的に推測されている。



状況を変えても消えないもの


この研究の粘り強さは、条件を変えた二つの追試にある。


ひとつは時間制約である。一問あたりの時間を絞れば熟慮の余裕が奪われ、人は直感へ寄るはずだ、という予測が立つ。実際、人間だけで解く条件では時間制約によって成績がはっきり落ちた。興味深いのは、正確なAIが使えるときには、その時間不足による損失がAIによって吸収されたことである。人間の認知資源の有限性という制約が、部分的に解除される。これは生成AIの明白な便益にあたる。


もうひとつは誘因とフィードバックである。正解ごとに報酬を出し、一問ごとにその場で正誤を知らせる。もし追随が単に面倒だから考えないことの帰結なら、この介入で解消されるはずだった。実際、誤ったAIを覆す割合は改善している。人間はAIを見破れないわけではない。注意を払う理由と学習の機会を与えれば、それなりに見破る。


にもかかわらず、正確なAIと誤ったAIの差そのものは消えなかった。基準線の成績は動いたのに、パターンは残った。正確なAIは時間制約の損失を吸収し、誘因の効果を増幅した。誤ったAIは、状況要因によらず一貫して正答率を下げた。


ここから読み取るべきは、努力の不足では説明しきれない何かがあるということである。外部から供給された完成度の高い答えは、それを評価しようとする過程そのものに影響する。比較の基準が、自分の推論ではなく、目の前の回答になってしまう。注意と誘因は追随を減らしはするが、独立した判断を復元するわけではない。



誤ったあとに残る確信


もうひとつ、この論文には不穏な観察がある。AIを利用すると確信度が上がる。しかもその上昇は、誤答のあとでも起きている。


順序を確認しておきたい。確信度は回答のあとに測られており、正誤のフィードバックがない条件では、参加者は自分が誤ったことを知らないまま自信を報告している。つまり、誤ったと知りながら自信を持ったのではない。誤ったことに気づかないまま、参照した分だけ確かになったと感じている。


この区別は重要である。怠慢の帰結として読むと、真面目な人は大丈夫だという誤った安心が出てくる。むしろこの現象は、検証の主観的な完了条件が変わることの帰結に近い。何をもって確かめたとするか。その基準そのものが、外部の出力によって書き換えられている。


独力で難しい問題に取り組んでいるとき、人は自分の理解の不確かさをある程度モニターできる。どこかで引っかかっている、という感覚が残る。これは判断の質を自分で調整するための重要な信号である。大規模言語モデルの出力は、内容の確度とは独立に、流暢で完成度が高い。理由が整い、語調が揺れない。この形式的な完成度が、内容についての不確実性を覆う。


なお、著者らは個人差も測っている。AIへの信頼が高く、認知欲求(need for cognition)と流動性知能が低い参加者ほど、システム3への明け渡しが大きかった。ただしこれは正確性の無作為化とは異なり観察的な分析であり、能力が低いから依存するという因果を主張するものではない。最も安定して読み取れるのは、AIを信頼する傾向と、誤ったAIへの脆弱性との関係くらいである。



委ねることの合理性


ここで議論の向きを一度戻しておきたい。委ねること自体を悪とするのは、おそらく間違っている。


仮に、ある作業で人間の正答率が七割、AIが九割五分だとする。このとき毎回AIを疑って一から検算するのは、単純に損である。というより、AIを使う便益の相当部分が失われる。飛行機の自動操縦を操縦士が毎秒手計算で検算することも、電卓の答えを暗算で確かめることも、通常は要求されない。


したがって課題は、認知的明け渡しをゼロにすることではない。明け渡す度合いが、相手の信頼性に対して適切に較正されているかどうかである。九割五分の相手には大きく委ねてよい。七割で、しかもどれが外れか見分けにくい相手には、全面的な委任は危険になる。正答率が同じでも、外れの見分けやすさによって適切な委任の度合いは変わる。


そしてショーとネイブの実験が示したのは、この較正が必ずしもうまくいかない場面があるということだった。問題は「AIを使うな」ではない。高性能なAIへ依存することが合理的であるからこそ、どのような新しい脆弱性が生じるのか、という方向へ問いを組み替える必要がある。



最終確認者という配置


この研究には、設計思想に関わるもうひとつの含意がある。


AIの後ろに人間を置けば安全装置になる、という考え方は広く共有されている。だが、冗長性の設計において重要なのは構成要素の数ではなく、故障が独立に起きるかどうかである。同じ電源に接続された二台の装置は、二重化されているように見えて、電源が落ちれば同時に止まる。


人間とAIを直列に並べる構成にも、同じ問いが向けられる。人間がAIの出力を見たあとで判断するなら、その人の推論はすでに提示された答えを起点にしている。心理学で古くから知られる係留の効果を持ち出すまでもなく、比較対象が与えられた状態での評価は、白紙からの推論とは別の作業である。誤ったAIを覆す割合が、誘因を与えても完全には回復しなかったという観察は、この懸念を裏づける方向にある。


もっとも、ここから「人間はAIを監督できない」と一般化するのは行きすぎである。実験の課題は正解の定まる推論問題であり、参加者はその領域の専門家ではない。長い訓練を受けた専門職が自分の領域でAIの出力を吟味する状況には、別の実証が要る。


言えるのは、限定された、しかし十分に厄介な命題である。人間が最終判断者として配置されていることと、AIから独立した判断経路が存在することは、同じではない。



平均ではなく、相関を見る


ここから先は、この論文が測っていない領域に入る。区別を明示しておきたい。


ショーとネイブの実験は、一人の人間が、一つの課題で、一つのAIの答えをどう扱うかを見ている。ある瞬間を切り取った像である。社会全体で何が起きるかは、個々人への効果を人数分足し合わせて得られるものではない。


仮に、AIを使った百万人全員の平均的な判断精度が上がったとしよう。それだけを見れば、社会の認知能力も向上したように見える。しかし、もうひとつ見るべき変数がある。その百万人の誤りが、互いにどの程度独立しているかである。


AIを使わない世界では、異なる人間が異なる理由で間違える。ある人は経験則に寄りすぎ、別の人はデータを過大評価し、第三の人は別の情報源を参照している。一人ひとりの判断能力には限界があっても、誤りが完全には一致しない。訂正が成立するのは、誰かが違う外し方をしているからである。


ところが、多数の人々が同じ、あるいはよく似たAI基盤を利用するようになると事情が変わる。同じモデルが同じ種類の情報を参照し、同じ学習データに由来する偏りを持ち、同じような安全調整や検索機構を使っているなら、利用者同士の誤りも相関しうる。


すると、次のような状態が生じる。個々人の平均正答率は上がる。しかし、間違うときには皆が同じ方向へ間違う。この二つは矛盾しない。システムは平常時には以前より高性能であり、特定の共通要因に対しては以前より脆い。


工学の信頼性設計では、これを共通原因故障(common-mode failure)と呼ぶ。複数の系が同じ原因で同時に機能を失う事態であり、冗長化そのものを無効にする典型的な失敗として扱われてきた。予備が本体と同じ弱点を共有していれば、二重化は見かけだけになる。


金融における共通のリスク評価モデルへの依存も、構造としては近い。個々の銀行にとって合理的なモデル選択が、多くの銀行で共有されることで、市場環境の変化に対して一斉に同じ行動を取る条件を作る。ただし借りるべきなのは構造だけであり、金融危機と同じだと言い切るのは雑である。共通しているのは、個別の合理的な最適化が、相関した依存関係を通じて全体の脆弱性を増すという形だけである。



誤りは、すでに揃っている


この段階の議論は、しばしば思弁として退けられてきた。社会全体でAIが多様なら、誤りは分散するはずだ、という反論が立つからである。開発元も、学習データも、アーキテクチャも、安全調整の方針も違うのだから、と。


この反論には、近年ようやく実測が向けられた。コーネル大学のエリオット・キムらは、二つの主要な評価用リーダーボードと履歴書選考の課題を用いて、350を超えるモデルの誤りを突き合わせている。結果は、多様性への期待を支持しなかった。あるリーダーボードのデータセットでは、二つのモデルが両方とも誤っているとき、その60%で同じ誤りに一致していた。


相関を駆動する要因として、共通のアーキテクチャと同じ提供事業者が特定されている。ここまでは直感に合う。だが著者らが強調するのはその先である。より大きく、より正確なモデルほど、アーキテクチャも提供事業者も異なるのに、誤りの相関が高い。


この発見は、独立性についての通常の想定を反転させる。性能を上げる方向の選択が、独立性を下げる方向の選択と一致してしまう。個々の利用者にとって合理的な「いちばん良いものを選ぶ」という判断が、集合としては相関を高める方向へ働く。製品名が違えば独立だろうという見立ては、ここで根拠を失う。独立性は主体の数ではなく、外し方の方向で測られなければならない。


著者らは、この相関が下流の課題へ及ぼす影響を、モデルによる評価と採用選考の二つで示している。後者は、アルゴリズム的単一栽培 (algorithmic monoculture) について理論的に予測されてきた事態、すなわち特定の応募者が複数の選考から一様に排除される構造と整合する。誤りの相関は抽象的な性質ではない。誰が機会を失うかという形で現れる。



組織という媒介層


もうひとつ、個人から社会へ渡るために必要な段がある。なぜ多数が同じものを使うことになるのか、という問いである。


個人が自由に選んだ結果としてたまたま集中する、というだけでは説明が弱い。実際には、その間に組織がある。


企業や行政機関が生成AIを導入するとき、一人ひとりが好きなツールを使い続けることは、まずない。品質管理、情報の取り扱い、費用、監査、セキュリティ、教育。どの観点からも、使用するモデルと業務手順を標準化する方に理由がある。この資料作成にはこれを使う。一次審査はこのモデルで行う。この判断にはAIの評価を添付する。そうした業務標準ができていく。


そして、それは無能な判断ではない。個人にとって高性能なAIを選ぶことが合理的なのと同じように、組織にとっても、最も性能が高く、扱いやすく、管理しやすいものへ業務を集約することには合理性がある。複数の組織が同じ判断をすれば、社会のかなりの部分が少数の基盤モデルやその派生システムを共有することになる。


ここで初めて、個人のAI利用、組織内の標準化、認知インフラの集中、誤差の相関、という経路が成立する。この段を省くと、「AIが普及すると社会が同じ間違いをする」という飛躍になる。逆に言えば、集中は誰かの不合理から生まれるのではない。個人にとっての合理性と、組織にとっての合理性が、同じ方向を向いている。これが、この問題をとりわけ扱いにくくしている。



依存度と集中度は別の変数


以上を踏まえると、AI社会の認知リスクを考えるうえで、区別しなければならない二つの変数が見えてくる。AIへの依存度と、AIインフラの集中度である。


社会の大部分がAIを利用していても、互いに独立性の高い複数のモデル、情報源、評価手続きが存在するなら、共通の障害への耐性は比較的高いかもしれない。逆に、AI利用がそれほど全面的でなくても、社会的に重要な判断を担う組織が少数の共通モデルへ集中していれば、そのモデルの誤りは大きく波及する。


問題は「AIをどれだけ使うか」だけではない。どのAIへ、どの判断が、どの程度集中するかである。


そしてもう一つ、利用者の数だけでは測れない変数がある。社会的な位置である。同じ百万人でも、その中に診療指針を書く人、教科書を編む人、審査基準を定める人が含まれているかどうかで、波及の規模は変わる。医療ガイドラインの作成者、大手報道機関、監督官庁、大企業の戦略部門が同じ基盤へ依存する場合の影響は、個人利用者が同じ数だけ増える場合とは比較にならない。社会的リスクは、利用率と、ネットワーク上の位置と、モデル間の相関の組み合わせで決まる。



均質化は設計の帰結でもある


ここまでの議論は、集合レベルの現象について実証を要求する。この点については、すでに一定の知見が出はじめている。


短編小説の執筆を用いた実験では、生成AIから着想を得た書き手の作品は、より創造的で、よく書けていて、読んで楽しいと評価された。効果はもともと創造性の低い書き手ほど大きい。同時に、AIの支援を受けた物語同士は互いに似通い、集合としての目新しさは減っていた。個人の向上と集合の収縮が、同じ操作から同時に出てくる。


人間と生成AIの共同創作を扱った19の研究、61の効果量を統合したメタ分析も、統計的に有意な均質化の効果を報告している。ただしその効果量は小さい。著者らはこれを、創造性そのものの減少ではなく、創造的多様性の再編成として位置づけている。孤立した場面では微細であり、似たAIへの広範な関与を通じて意味を持つ程度の大きさである、と。


ここで結論を急ぎたくなるが、もう一段ある。十の異なる役割を与えたAIから多様な筋書きを生成させ、それを参照して書かせた実験では、作品の多様性が保たれた。この結果が示唆するのは、均質化が生成AIの不可避な性質ではなく、同じモデルを同じ方法で大量に使うという運用設計から生じている部分がある、ということである。


これは重要な留保である。集中が組織の決定の積み重ねとして生じるなら、それは設計の対象でもある。ただし、平常時には誰も困っていない。誰がその設計の手間を払うのか、という問いは残る。



守るべきは、有益な独立性


多様性という言葉を無条件の価値として使うと、議論が緩む。


二足す二の答え、手術前の手洗い、航空機の緊急時手順について、意見が分かれている必要はない。誤情報や根拠のない偏見が収束するなら、それは望ましい収束である。したがって、最大化すべきなのはばらつきではない。


より正確に言えば、必要なのは三種類の独立性である。異なる根拠と推論経路を持てること。誤りが同じ方向へ揃わないこと。複数の仮説を並行して探索できること。


この三つが要求される度合いは、領域によって大きく違う。翻訳、文法の修正、定型的な要約のように、誤りが容易に発見でき失敗の損害も小さい作業であれば、高度に集中した認知基盤へ依存しても実害は小さい。一方、政策、科学研究、医療、金融、法務、戦略のように、正解がすぐには分からず、誤りの損害が大きく、後になって初めて失敗が判明する領域では、独立した検証経路の価値は高い。とりわけ科学とイノベーションでは、現在の多数派から外れた仮説が後になって重要になることがある。


そして、この独立性は少なくとも三つの層に分けて考える必要がある。個人が自分の内部でAIと異なる推論を保持できるか。組織内で異なる人間、異なるAI、異なる手続きが相互にチェックするか。社会全体で複数のモデル、企業、研究機関、情報源、制度が並存するか。


この三層は連動しない。個人がAIへ全面的に依存していても、社会全体で実質的に独立な複数の基盤が競合していれば、耐性は残るかもしれない。逆に、各人が多少批判的に考えていても、全員が同じ情報基盤を使っていれば、共通の脆弱性は残る。AIリテラシーの向上だけで解決する問題ではない、というのはこの意味においてである。



社会の賢さには複数の次元がある


こうして見ると、「AIは社会を賢くするのか」という問いは、一つの尺度では答えられない。少なくとも四つを分ける必要がある。


第一は平常時の性能である。日常的な課題をどれだけ速く、正確に処理できるか。生成AIはここを大きく改善する可能性が高い。


第二は探索能力である。既存の答えがない状況で、どれだけ異なる仮説や解決策を生み出せるか。


第三は誤差訂正能力である。もっともらしい誤りが一度広まったあとで、それを発見して修正できるか。


第四は耐障害性である。主要な認知基盤の一部が誤った場合でも、別の経路が残り、全体として判断能力を維持できるか。


この四つは同じ方向へ動くとは限らない。平常時の性能が大きく上がる一方で、探索経路や訂正経路が細ることは、理論的には十分あり得る。逆に、これまで専門知へアクセスできなかった人々が高度な分析を行えるようになることで、社会の探索能力そのものが増す経路もある。


したがって、AI導入の評価を「人間の能力が上がるか下がるか」という一次元の議論に還元してはいけない。見るべきなのは、社会の認知能力の構成そのものがどう変わるかである。



反復と、まだ検証されていないもの


さらに時間軸を伸ばすと、もう一つの論点が現れる。AIによる判断支援を長期間使うことで、人間自身の認知能力や習慣も変化する可能性である。


短期の相互作用については、すでに実験的な兆候がある。モシェ・グリックマンとタリ・シャロットは1,401人を対象とした実験で、人間とAIの相互作用が知覚的・感情的・社会的な判断の偏りを増幅し、その増幅が人間同士の相互作用における増幅より大きいことを示した。さらに、参加者はAIの影響の大きさに気づいていない。この「気づいていない」という点は、先に見た確信度の観察と同じ形をしている。影響を受けた本人が、受けたことを報告できない。


長期については、ここから先は仮説である。使わなくなった技能が衰えること自体は、それだけでは問題ではない。重要なのは、AIが代替する能力と、AIの誤りを発見するために必要な能力が重なる場合である。診断AIを評価するには診断能力が要る。法的推論AIを評価するには法的推論能力が要る。ところがAIが十分に優秀なら、人間がその能力を日常的に使う必要は減る。


AIを使う方が合理的である。自力で判断する機会が減る。熟練形成の経路が変わる。AIを独立に評価できる人間が減る。さらにAIへの依存が合理的になる。こうした循環は論理としては筋が通るが、現時点で実証は限られている。確立した知見としてではなく、今後検証すべき仮説として扱うべき段階にある。


現在の研究が個人・短期・実験室に偏っているのは、研究者の視野が狭いからではない。個人のAI利用は実験室で操作できるが、社会全体の認知構造が十年かけてどう変わるかを実験することはできない。しかも生成AIそのものが急速に変化し、同時に制度、教育、雇用、報道、法律も変わる。AIだけの因果効果を切り出すことは難しい。この限界は慎重になる理由であると同時に、問題を小さく見積もる理由ではない。



役に立つからこそ、難しい


生成AIがほとんど役に立たない技術なら、ここまで考える必要はない。性能が悪ければ、人も組織も使わなくなるだけである。


難しいのは、生成AIがかなり役に立つことである。個人にとって、使う方が合理的になる。組織にとっても、優れたモデルへ標準化する方が合理的になる。その結果として、社会全体が共通する認知インフラへの依存を深める。誰も間違った判断をしていない。全員が正しく振る舞った結果として、構造が変わる。だからこそ、誰を説得すればよいのかも見えにくい。


そして、この構造は平常時には可視化されない。集中しているあいだ、システムはむしろ以前より良く回っている。うまくいっている間は、証拠が出ない。証拠が出るときには、もう出ている。


筆者の見立てでは、生成AIの認知的リスクを評価する枠組みは、ここで組み替えられなければならない。問うべきなのは、人間が考えなくなるかどうかではない。高性能な認知支援を広く共有する社会が、その便利さと引き換えに、どの程度まで共通の失敗の形まで共有するようになるのか、である。


科学には再現と異なる研究集団があり、司法には複数の審級があり、企業には監査と職務分離があり、市場には異なる情報と異なる判断を持つ主体がいる。いずれも完全ではないが、全体を一つの判断経路に依存させない仕組みである。AI時代にも同じ観点が要る。ただしそれは、人間を最後に置いておくことでも、複数のAIを並べることでもない。情報源、推論経路、モデル、評価方法が実質的に独立しているかどうかが問題になる。


AI時代の賢さは、一人の人間が以前より良い答えを出せるようになったかだけでは測れない。社会全体が間違えたときに、その間違いを別の経路から発見し、訂正できるか。そこまで含めて初めて、社会の認知能力が本当に向上したのかを問える。



 

ポイント整理


  • 能力の低下ではなく、決定要因の移動

    • AIが正しいときの成績は基準を大きく上回り、誤ったときは基準を下回った。上下しているのは人間の能力ではなく、判断結果を決める要因の所在である。

    • したがって「AIに頼ると考えなくなる」という問題設定は、実験が示したものの半分を落としている。

  • 状況要因では消えない追随

    • 時間制約も、報酬と即時フィードバックも、基準線の成績は動かしたが、正確なAIと誤ったAIの差そのものは残した。

    • 誘因と注意は追随を減らすが、独立した判断を復元するわけではない。怠慢の問題として扱うと対策を誤る。

  • 最終確認者の配置と独立性の区別

    • AIの出力を見たあとで判断する人間の推論は、すでに提示された答えを起点にしている。並んでいるように見えて、一つの経路であることがある。

    • 人間が最終判断者として配置されていることは、AIから独立した判断経路の存在を保証しない。

  • 平均ではなく誤差の相関

    • 個々人の平均正答率が上がることと、誤りが互いに独立であることは別の指標である。平均が上がりながら、間違うときに全員が同じ方向へ間違う状態が成立しうる。

    • 350を超えるモデルを比較した研究では、両方が誤るとき60%で同じ誤りに一致し、しかも大きく正確なモデルほど提供事業者が違っても相関が高かった。

  • 個人と社会をつなぐ組織

    • 集中は個人の自由選択の総和ではなく、品質管理、監査、費用、教育を理由とした組織の標準化を経て生じる。

    • 個人にとっての合理性と組織にとっての合理性が同じ方向を向いているため、誰の不合理も想定せずに集中が進む。

  • 依存度と集中度を分ける

    • 社会の大部分がAIを使っていても、実質的に独立な複数の基盤が残るなら耐性は保たれうる。逆に利用が限定的でも、重要な判断を担う主体が集中していれば波及は大きい。

    • 利用者数だけでなく、社会的な位置、すなわち誰が同じ基盤に依存しているかが影響の規模を決める。

  • 均質化は運用の帰結でもある

    • 個人の創作の質が上がる一方で集合の多様性が下がることは実験で示され、19研究・61効果量のメタ分析も小さいが有意な均質化を報告している。

    • 一方、多様な役割を設計してAIを使わせた実験では多様性が保たれた。均質化の相当部分は、同じモデルを同じ方法で使う運用設計から来ている。

  • 社会の認知能力は四つに分かれる

    • 平常時の性能、探索、誤差訂正、耐障害性。この四つは同じ方向へ動くとは限らない。

    • 一次元の「賢くなったか」という問いは、四つのうち一つについての知らせを全体の結論と取り違えさせる。



キーワード解説


【三体系理論 (Tri-System Theory)】

直感的処理をシステム1、分析的処理をシステム2とする二重過程理論を拡張し、脳の外側で動く人工的な認知をシステム3として加える枠組み。システム1とシステム2が人間内部の処理様式の区別であるのに対し、システム3は外部の主体についての区別であり、分類軸が揃っていないという批判の余地が残る。


【認知的委託 (cognitive offloading)】

記憶や計算などの認知作業を、紙、電卓、地図アプリといった外部の資源へ移すこと。工程の一部を外へ出しても全体の統制は人間の側に残る点で、統制そのものが移る認知的明け渡しとは区別される。


【認知反射テスト (Cognitive Reflection Test)】

直感的に浮かぶもっともらしい誤答と、一段の熟慮を経て到達する正答が明確に分かれるように設計された問題群。正解が一意に定まるため、外部から供給された答えの正誤を実験者が統制できる利点がある一方、現実の曖昧な判断課題を代表しないという限界も持つ。


【共通原因故障 (common-mode failure)】

複数の系が同一の原因によって同時に機能を失う事態。予備系が本体と同じ弱点を共有していると冗長化が見かけだけになるため、信頼性設計では構成要素の数ではなく故障の独立性が問われる。


【アルゴリズム的単一栽培 (algorithmic monoculture)】

多数の意思決定主体が同一または高度に類似したアルゴリズムへ依存することで、判断の誤りや排除の対象が系統的に重なる状態。採用選考のように複数の主体が独立に判断していると想定される場面で、実際には同じ応募者が一様に落とされるという形で現れる。


【較正 (calibration)】

自らの確信の度合いを、実際の正確さと対応させること。AI利用の文脈では、委任の度合いをAIの信頼性へ合わせることを指し、問題は委任するか否かではなく、委任が信頼性に較正されているかどうかになる。



本稿を素材として対話形式で再構成した記事も、近日中にnoteに掲載予定です。
ご関心を持っていただけましたら、note上でご感想などお聞かせいただけると幸いです。
bottom of page