top of page

AIの使う「むしろ」の気持ち悪さから見えるもの──談話の自然さという、多言語LLM評価に欠けた単位

3 日前
読了時間: 21分

シリーズ: 論文渉猟


◆今回の論文:Chengzhi Zhong, Fei Cheng, Qianying Liu, Junfeng Jiang, Zhen Wan, Chenhui Chu, Yugo Murawaki, Sadao Kurohashi, "Beyond English-Centric LLMs: What Language Do Multilingual Language Models Think in?" (arXiv, 2024年8月20日)

  • 概要:日本語処理における三種類の大規模言語モデルを比較し、中間層の隠れ表現を語彙空間へ射影したときにどの言語の答えが高い確率を示すかを分析した研究。英語中心のモデル、日本語で継続事前学習したモデル、英日を均等に事前学習したモデルで、内部の言語的な偏りが学習履歴に応じて異なることを報告する。



生成AIの日本語を読んでいると、「むしろ」という語で引っかかる。文法の誤りではない。辞書の記述から外れているわけでもない。それでも引っかかり、しかもモデルを替えても、話題を替えても、時期を替えても消えない。


この持続性を、まず証拠として扱っておきたい。特定の製品の癖であれば、更新のたびに揺れるはずである。揺れないなら、個々のモデルの事情ではなく、生成という営みの側に定数がある。だとすれば、これは文章の好みをめぐる話ではない。


以下では、この引っかかりを二度手放す。一度目は語彙として、二度目は文として。残ったものの居場所を探すと、多言語の大規模言語モデルをめぐる研究のあいだに、奇妙な形の空白が見えてくる。修辞と談話の層はすでに測られている。英語の内側でだけ。英語中心性は言語をまたいで測られている。語彙と統語でだけ。私たちの違和感は、その二つが交差しない場所に落ちている。


結論を先に置く。問うべきなのは、AIが英語で考えているかどうかではない。流暢な日本語を書くことと、日本語で文章を組み立てることが同じなのかどうかであり、そして後者を測る単位が、まだ存在しないということである。



消えない引っかかり


具体例から始めよう。


「したがって、本報告書はDeFi規制の完成形ではない。むしろ、今後の規制争点を次の一点へ集約した文書である。」


この文に瑕疵を指摘するのは難しい。主述は整い、語の選択も適切で、意味は完全に通る。にもかかわらず、日本語の書き手として読むと据わりが悪い。


最初に疑うのは単語である。単語は目に見えるからだ。そこで素朴な仮説を立てる。この語の使用頻度が高すぎるのではないか。


だが頻度だけでは説明にならない。「しかし」も高頻度で現れるが、読者はそこで立ち止まらない。高頻度であることと、引っかかることのあいだには、別の要因が挟まっている。



二度の書き換え


そこで書き換えてみる。第一段階として、当該の語を別の語に替える。


「本報告書はDeFi規制の完成形ではない。実際には、今後の規制争点を次の一点へ集約した文書である。」


違和感は弱まる。だが消えない。ここで、原因はその語ではないと確定する。


重要なのは、この確定が違和感そのものを無効にしないことである。当該の語は、直前に述べた内容をいったん退け、別の理解へ移行することを予告する機能を持つ。つまり、その移行が行われていれば表面に現れざるを得ない語である。原因ではないが、原因が作動したことを最も確実に知らせる指標だ。読者の耳が繰り返し同じ語で止まるのは、そこに構造の出口があるからである。目印を疑うのではなく、目印が指しているものを見ればよい。


第二段階の書き換えに進む。対比は保持したまま、二文を一文に畳む。


「本報告書が示すのは、DeFi規制の完成形ではなく、今後焦点となる規制争点である。」


違和感は大きく落ちる。対比は残っているのに、である。さらに対比そのものを捨てると、ほとんど消える。


「本報告書は、今後のDeFi規制をめぐる争点を次の一点に絞り込んでいる。」


この落ち方の勾配に情報がありそうだ。変わったのは語彙ではない。文法でもない。いくつの命題を、どの順序で、読者にどれだけの時間だけ保持させるかという配分である。



一文を与えるという発話行為


最初の版では、「完成形ではない」という命題が独立した一文を与えられていた。一文を与えられた命題は、読まれる順序を持つ。読者はそれを引き受け、それから落とす。否定されるためだけに置かれた命題であっても、引き受けの手続きを省略することはできない。


対比を一文に畳み込んだ版で違和感が薄れるのは、そこで対比が主張から限定へ格下げされるためだ。限定は引き受けを要求しない。「AではなくB」という形で提示されたAは、読者の中で一度も候補にならない。独立した一文として提示されたAは、短い時間だけ候補になる。


そしてこの配分は、日本語の文法が決めるものではない。書き手が選ぶものである。しかも、選ばれたという事実は表面に残らない。読者が受け取るのは、選択の痕跡を消した結果だけだ。


ここまでで観察対象が移動している。頻度から、一つの修辞的操作へ。すなわち、読者が想定していそうな解釈をいったん立て、それを否定し、別の理解を正しいものとして提示するという操作である。



反駁の痕跡という担保


冒頭の例に戻ると、決定的な事実が一つある。その報告書をDeFi規制の完成形だと考えていた者は、どこにもいない。否定された解釈は、書き手が持ち込んだものである。


否定という操作には、副産物がある。否定されたものは、否定されたという事実によって、一度は存在した扱いを受ける。実在した選択肢の資格を、事後的に与えられる。すると後続の命題は、それを退けた末の判断として読まれる。


ここで何が起きているかを精確に言えば、説得の重みの供給源が移っている。後続の命題が帯びる重みは、その内容の妥当性からではなく、何かを倒したという形式から供給されている。反駁の痕跡が、検討の担保として機能する。実際に検討が行われたかどうかとは独立に、である。


この操作が悪いわけではない。読者が抱きそうな誤解を先に排除するのは、説明文の作法として広く推奨されている。翻訳研究には明示化(explicitation)という概念があり、原文で暗黙だった関係が訳文で言語化される傾向を指す。似た現象が生成文に見えるという指摘も繰り返されてきた。ただし概念を借りたからといって、原因まで借りられるわけではない。


問題は操作の存在ではなく、その発動条件にある。そして発動条件は、一つの基準へ絞り込める。否定された解釈が、前の文脈に候補として既に存在していたかどうか。存在していたなら、否定は読者の負担を減らす。存在していなかったなら、否定はまず候補を作り、それから壊す。読者は自分が提出していない選択肢を、否定されるためだけに引き受ける。



形式が論証から独立する


ここで、個人的な観察から研究へ渡る。


LLMの認識と修辞のずれを測る枠組みを提案した2026年の研究は、認識的なしるしと修辞的なしるしを三分類し、形式と意味の乖離、真正な認識表明と演出されたそれの比、修辞装置の分布のエントロピーという三つの合成指標を設計した。論証的テキスト225本、約60万語を、専門家、非専門家、モデル生成の三群で比較している。


個別の数値も示唆的である。三重反復(tricolon)はモデル生成で専門家の約2倍、答えを求めない問いかけは人間側が2倍以上、断定を避けるしるしはモデル生成で人間の2倍の密度となった。しかも著者はそれを演出された躊躇と呼ぶ。形式と意味の乖離は、モデル生成で両方の人間群より有意に高い。


だが本稿の論旨に効くのは、別の結果である。修辞装置の分布が、モデルの文書のあいだで有意に均一だった。


この一点の意味を取り違えないようにしたい。均一であることが悪いのではない。均一であるという事実が、形と論の関係について何かを語っているのだ。人間の書き手の修辞は偏る。何を論じているかによって、必要な装置が変わるからである。対立が実際に存在する議論では対比が増え、存在しない議論では現れない。偏りは、形が内容に引きずられている証拠だ。


偏らないのであれば、引きずられていない。著者の表現では、修辞の肉付けが論証の構造から独立して走っている。


読者の違和感の正体は、おそらくここにある。個々の文は正しい。問題は、文章の形がその文章の中身についてもう何も教えてくれないことである。「むしろ」が据わらないのは誤用だからではなく、倒すべき対立が実際にあったかどうかと無関係に到着するからだ。


ただし、この研究は限界を自ら明記している。対象は英語の論証文のみであり、他の言語やジャンルへの一般化は未検証である。修辞の層はすでに測られた。英語の内側で、人間とモデルの差として測られただけである。



検出できることと、記述できること


日本語についてはどうか。


7つのモデルと人間の日本語を文体統計で比較した2025年の研究は、機能語のユニグラム、品詞のバイグラム、機能語と品詞を隠した内容語からなる句パターンという三種の特徴を用いた。人間が書いた公開コメント100本と、7つのモデルの生成文が対象である。組み合わせた特徴による識別精度は99.8パーセントに達した。事実上の完全識別である。


同じ研究は、人間にも判定させている。人間が書いた文章を正しく人間のものと判定できた割合は、31.5パーセントだった。


この落差を、人間の能力の不足として読むことはできる。だがもう一つの読み方がある。被験者が判断の根拠として挙げたのは、言い回し、語尾、接続詞、句読点といった表層の印象だった。接続詞が名指しされている点は軽くない。判断の材料として選ばれた場所は、おそらく間違っていない。間違っているのは、そこから結論へ至る経路である。


検出できることと記述できることは別である。統計は差を検出したが、その差が何であるかは述べていない。人間は差を感じたが、述べる語を持たなかった。両方の側に、差そのものは何かという問いが残されている。


ここから先は私の判断である。測れるものを実在とし、測れないものを印象として扱う順序は、この場合に限って逆かもしれない。違和感が先にあり、それを言い表す語彙が追いついていないだけだという順序のほうが、二つの数字の落差をよく説明する。名前のない現象は、毎回ゼロから言い直すしかない。だから何年も同じ語の前で立ち止まることになる。



言語をまたぐ測定は、なぜ統語で止まるのか


言語をまたいだ測定も進んでいる。LLMに英語訛りがあるのかを問い、多言語出力の自然さを測る指標を提案したACL 2025の研究は、フランス語と中国語について、語彙的自然さと統語的自然さを評価するコーパスレベルの自動指標を新たに設計した。多言語モデルの自然さそのものがほとんど注目されてこなかったという問題設定を明示し、最新のモデルにも英語の影響を受けたパターンが残ることを示している。あわせて、汎用ベンチマークの性能を損なわずに対象言語と領域での自然さを改善する手法も提案されている。


つまり語彙と統語については、測れるだけでなく直せる段階に入っている。


ここで分析の水準を三つに分けておく。どの語を選ぶかという語彙の水準。一つの文をどう組むかという統語の水準。そして複数の命題をどの順序でどう関係づけるかという談話の水準である。


注意すべきなのは、この三つを程度の差として一直線に並べないことだ。統語が英語に寄ったから談話も寄る、とは言えない。談話の組み立ては、ジャンル、想定する読者、書き手の目的、受けた教育によって大きく動く。三つの水準は連続した坂ではなく、別の力が働く別の場所である。語彙と統語を測れたことは、談話を測れたことを含意しない。


では、なぜ談話の水準は測定から取り残されたのか。測りにくさの構造が違うからだと考えられる。語彙は数え上げられる。統語も一文の内部で構造として取り出せる。だが何と何を対立させたかは、その文の外に出なければ判定できない。しかも、どこまで外に出れば足りるのかが決まっていない。必要な文脈の窓を定義するという作業が、測定の手前に立ちはだかっている。


空白は偶然そこにあるのではない。空きやすい形をしている場所に空いている。



内部表現は意味中立な符号ではない


内側を見た研究が、起点素材である。


著者たちが「think」と呼ぶのは比喩ではなく操作である。中間層の隠れ表現に出力層と同じ逆埋め込みを適用し、語彙空間での確率分布を得る。そこで高い確率を示す言語を内部潜在言語(internal latent language)と呼ぶ。日本語は一語が複数のトークンに分かれ、漢字を中国語と共有するため、単一トークンを前提にした従来の手法を複数トークン列の確率計算へ拡張している。


比較された三モデルは、どれも130億パラメータ、40層、埋め込み次元5120に揃えられている。事前学習データの構成は、Llama-2が英語89.7パーセント・日本語0.1パーセント、Swallowの継続事前学習(continued pre-training)部分が日本語90パーセント・英語10パーセント、LLM-jpが英日各50パーセントである。日本語を目的言語とする翻訳、日本語から日本語への反復、日本語での穴埋めのいずれでも、Llama-2は英語を経由し、Swallowは英日混在、LLM-jpは日本語が支配的になった。並行データは英仏日中の166件である。


この設計の利点は、比較の軸が学習履歴だけに絞られている点にある。規模も層数も揃っているのだから、観察された差は学習コーパスの言語構成に帰しやすい。したがって二つのことが言える。流暢な出力は、内部処理の言語中立性を保証しない。そして内部の偏りは学習履歴によって動く。


ここで言ってはならないことを明示しておく。この研究は、モデルが内部で英文を生成してから日本語へ翻訳していることを示していない。人間の内言に相当するものが発見されたわけでもない。中間表現を語彙空間へ射影すると特定言語への偏りが観察される、という以上のことは述べられていない。


より射程が長いのは、文化的な衝突を含む問いへの応答である。日本の学年の開始月を日本語で問うたとき、英語中心のLlama-2の中間層では米国の慣行に対応する答えが優勢となり、目的言語へ確率が集中する後段の層でようやく日本の文脈に適合する。Swallowでは誤った候補が終盤に一度現れるだけで、英日を均等に学習したLLM-jpではこの偏りが観察されない。著者の解釈は、主要言語の文脈にある知識がモデルの予測に大きく影響するというものである。


さらに著者たちは、意味と言語の同一性が分けられるかを調べている。英日の同義語30組で、中間層と出力層の隠れベクトルの差を平均し、それを中間層の表現へ加えると、上位の候補が英語から日本語へ移る。しかもその変化は5120次元に均等に広がるのではなく、一部の次元に疎に集中していた。意味は言語をまたいで共有され、言語の同一性だけが別の次元に載っている可能性を示す結果である。


したがって内部の言語は、意味中立な符号変換の層ではないらしい。言語と、その言語に結びついた知識の分布とのあいだに関係がある。事実の選択が内部の言語に影響されるなら、論の組み立ては本当に言語中立なのかという問いが、ここで初めて根拠を持つ。だがこの研究が測っているのは語と短い句であり、例は166件である。問いを立てる理由は与えられたが、答えは与えられていない。



最も手強い反証


ここまでの流れは、一本の説明へ収束したくなるように見える。英語中心の学習が英語寄りの内部表現を作り、それが語彙と統語へ漏れ、最終的に談話の設計まで英語化する、という筋である。


それを止める材料がある。


多言語モデルの生成文に翻訳調が現れるかを検証したCOLM 2026の研究は、英語、ドイツ語、スペイン語、ギリシャ語、パシュトー語の5言語を扱った。日本語は対象外である。欧州議会の議事録から母語話者による原文と人間による翻訳を集め、翻訳研究由来の表層指標を特徴量とする分類器を、人が産出したデータのみで学習させている。学習時に機械翻訳を一度も見ていないにもかかわらず、それを90パーセントの精度で翻訳と判定できたことが、指標の妥当性を支えている。


結果の一部は仮説どおりである。ドイツ語では生成文の60.2パーセント、スペイン語では平均45.7パーセントが翻訳と分類された。翻訳を依頼したのではなく、その言語で直接書かせた文章である。


だが残りの一部が仮説を壊す。資源の乏しいギリシャ語とパシュトー語では、生成文の翻訳調が独語・西語より少なかった。著者が挙げる候補は三つある。英独・英西が代表的な並行データ対であるため学習データ中の翻訳文が多いこと、両言語の語順が極端に柔軟であること、そして英語との近さ自体が干渉を生む可能性である。


英語中心性が原因なら、英語から遠い言語ほど崩れるはずだ。観察は逆を示した。しかも三つの候補のうち、二番目は英語と無関係であり、一番目は英語の影響ではあるが内部処理の話ではない。翻訳された文章をその言語として学んだ、という話である。日本語に置き換えれば、海外報道の訳、国際機関の文書、学術翻訳、外資系企業の日本語を大量に学べば、内部で英語を経由しなくても翻訳調は再現される。著者自身、結果は文章が翻訳された証拠ではないと明記し、二つの説を並置している。


もう一点、概念の区別を確認しておく。翻訳調であることと英語的であることは同義ではない。翻訳研究が扱うのは明示化、単純化、規範化、原言語からの干渉といった性質であり、これらは英語以外の原言語からの翻訳にも現れる。翻訳調の検出が支持するのは、生成文がその言語の原文から体系的にずれているという事実である。どの言語に向かってずれているかは、別に示さなければならない。



原因を決めずに進む手続き


以上から、原因の候補を四つ並べたままにする。


第一に、事前学習の言語構成そのもの。内部潜在言語の研究は、この可能性を疑う理由を与える。第二に、学習された日本語に含まれる翻訳文の量。第三に、指示への追従や整列の過程。明確に説明し、違いを明示し、誤解を避けるよう調整されたモデルにとって、否定してから言い直す形式は便利である。第四に、次のトークンを予測するという生成方式そのもの。談話関係を表面の標識で先に宣言しておくほうが、後続の生成が安定する可能性がある。


第三と第四については直接の証拠がない。だから仮説として並べるに留める。第四の候補が正しい場合、現象は英語とも日本語とも関係を持たないことになる。


一本道の因果図を捨てることで、実は問いが広くなる。英語のせいだと決めれば、問いは一つで終わる。決めなければ、別の問いが立つ。独立に開発された複数のモデルが、なぜ似た日本語の組み立て方へ収束するのか。


ここで手続きとして重要なのは、現象の確認と原因の特定を分けることである。前者を、現象仮説と呼ぶ。生成AIの日本語には、人間が日本語で直接書いた文章とは異なる談話上の規則性が存在するのではないか。後者を、原因仮説と呼ぶ。その一部は、英語中心の学習と、英語圏で発達した説明文の作法に由来するのではないか。


二つの確信度は同じではない。前者には観察と隣接する測定がある。後者には傍証しかない。そして前者が成立して後者が否定されても、本稿の中心は残る。原因がalignmentであれ生成方式であれ、談話の自然さが多言語モデル評価の抜けた層であるという指摘は変わらないからだ。



何を数えれば足りるのか


検証は大規模でなくとも成立する。


同一のテーマとジャンル、同程度の分量で、五種類の文章を集める。日本語の母語話者が日本語で直接執筆したもの。英語の母語話者が英語で直接執筆したもの。それを人間が日本語へ翻訳したもの。モデルに日本語で直接生成させたもの。モデルに英語で生成させてから日本語へ翻訳したもの。


数えるのは語の頻度ではない。否定された解釈が、前の文脈に候補として既に存在していたかどうかである。この一点を分類するだけで、仮説は動く。あわせて、譲歩から反転への移行、直前の内容の言い直し、対立軸の新規導入といった操作を数えれば、輪郭はさらに出る。


そして結果の読み方を先に決めておく。モデルの生成文が人間の日本語原文に近ければ、現象仮説は弱まる。人間の翻訳日本語に近ければ、翻訳調との関係が強まる。英語原文の談話構造に近ければ、表層の言語を越えて説明文の作法が保存されているという説明が力を持つ。さらに学習履歴の異なるモデル間で差が出れば、原因の切り分けにも手がかりが出る。


外れた場合も結果である。頻度に差がなく、使用条件の分布だけが違うという結果のほうが、実は面白い。それは誤用でもなく、日本語話者が使わない語でもなく、発動条件が違うという話になる。文法違反ではなく、語用論的な分布の差という形に落ちれば、言語学的にも扱いやすくなる。



単位の不在


多言語モデルの評価は長らく、その言語を正しく扱えるかを問うてきた。質問を理解できるか、文法的に正しい文を作れるか、知識や推論の課題に答えられるか。近年になって語彙と統語の自然さが評価対象へ加わりつつある。だが複数の命題をどう配置し、何と何を対立させ、どの関係を明示してどれを暗黙に残すかという水準には、対応する評価軸がない。


この不在が意味するのは、測定の失敗ではない。測っている場所と、構造が決まっている場所が違うということである。だからベンチマークの高得点と読者の違和感は、矛盾なく両立する。片方が間違っているのではなく、両者が別の対象について語っている。


そして談話の設計は、文体の趣味の問題ではない。何を対立項として置くかが変われば、読者に見える選択肢が変わる。どの関係を因果として明示するかが変われば、議論の構造が変わる。存在しなかった解釈をわざわざ立てて否定すれば、その後に置かれた主張の重みが変わる。談話の設計は思考そのものではない。しかし、思考をどのような構造として読者へ差し出すかを決めている。



規範の手前で止まる


最後に、価値判断へ滑らないための線を引いておきたい。


英語圏の説明文に多い明示的な対比や論理標識が、日本語の文章を読みやすくする場合は当然ある。込み入った議論では、対立関係を明示したほうが追いやすい。逆に、日本語であえて明示されなかった関係をすべて言語化すれば、冗長になり、存在しなかった対立を作ることにもなる。どちらが優れているかという問いは、ここでは立てない。


問うべきなのは、明晰で論理的な文章という基準が、特定の言語圏で発達した文章作法へ、誰にも気づかれずに収束していないかということである。


この点で、生成AIには従来と違うところがある。人間の翻訳者が英語から訳した文章なら、読者はそれを翻訳として読める。割り引ける。だが日本語で報告書を書いてくれと頼んで出てきた文章は、翻訳とは表示されない。日本語の原文として流通する。もしそこに特定の学習履歴や調整方法に由来する談話上の規則性が含まれているなら、生成AIが媒介するのは語彙だけではない。何を対立させ、何を明示し、どの順序で読者を結論へ導くかという形式まで、表示のないまま運ばれることになる。


それが本当かどうかは、まだ測られていない。測るための単位が、まだ作られていないからである。「むしろ」という一語への引っかかりは、その単位が欠けている場所を指している。



 

ポイント整理


  • 不透明性の二分

    • 機械学習の数学的複雑性と、企業が開示しないという選択は、同じ語で呼ばれながら性質が異なる。前者は認識の限界であり、後者は意思決定である。

    • 両者を混ぜたままにすると、後者がつねに前者の権威を借りる。論文は、不透明性を不可避の特徴として語ること自体を、監督回避のための言説的操作だと指摘する。

  • 規制対象は作られる

    • 高頻度取引では、アルゴリズムを取引プラットフォームや取引企業から分析的に切り離すことが、規制の前提条件だった。遺伝子組み換え作物では、名称の付与と検出手法の標準化が追跡を可能にした。

    • 生成AIについても、規制対象は自然に存在するのではなく、行政上の名称と検出方法を通じて制度的に構成される。組み立てが粗ければ、罰則の重さは執行力に変換されない。

  • 透明性から介入能力へ

    • 透明性は開示されたか否かという状態を指す。観察可能性は、誰が、どの情報へ、どの頻度で接近できるのかという実践の条件を問う。

    • この区別を通すと、ガバナンスの質は開示文書の量ではなく、問題を発見し、原因を特定し、変更を命じ、その結果を再検証できるかで測られることになる。

  • アクセス権と検査能力の乖離

    • モデルのウェイトを開いても、走らせて評価する計算資源がなければ検査は成立しない。膨大な訓練データも、解析する人員と資金がなければ実質的には不開示と変わらない。

    • したがって公共性は、アクセス権の分配だけでなく検査能力の分配で評価する必要がある。検査できる主体が少数に限られるなら、権力は企業から別の少数者へ移っただけになる。

  • 介入能力と正当な統治の分離

    • 観察・検査・変更のすべてを備えた権威主義国家は想定可能であり、三条件はそれ自体では民主的ガバナンスを含意しない。論文自身、強制的な電子透かしが検閲の手段として機能しうることを認めている。

    • 三条件が定義しているのは、対象への実効的な介入能力の条件である。その能力を誰に、何のために、どの範囲まで与えるかは、別の設計問題として立てなければならない。

  • 統治権力の修正可能性

    • 監督者を誰が監督するのかという無限後退への答えは、上位監督者の追加ではなく、権限の分割と複数のフィードバック回路の設置だった。

    • ただし修正可能性の最大化は目的ではない。予見可能性との緊張があるため、変更の条件と手続きと頻度そのものを制度化する必要がある。



キーワード解説


【規制対象物 (regulatory object)】

規制主体が「規制されるべきもの」として理解し、統治されうる物質的な項目として捉えうる対象を指す。エリザベス・フィッシャーによる概念で、社会的影響を与える現象であるだけでは足りず、境界、測定すべき属性、変更対象が特定できることを要件とする。


【行政的名辞論 (bureaucratic nominalism)】

規制対象に明確な名称を与え、行政上の曖昧さを除去する実務を指す。ハビエル・レサウンが遺伝子組み換え作物の統治を分析する際に用い、検出手法の標準化と組み合わせて「参照可能性のインフラ」を構成するとした。


【プラットフォーム化の木】

生成AI産業を、樹冠の消費者向けアプリケーション、幹の基盤モデル、根の計算インフラという三層として描く比喩。ホセ・ファン・ダイクによるもので、注目が集まる層と権力が集中する層が一致しないことを視覚化する。


【モデルカード】

基盤モデルの訓練データ、性能、バイアス、倫理的考慮などを記載する開発者向けの標準化された文書。規範と規制の圧力から生まれた書式だが、記述不足のまま形式的な透明性を演出する装置にもなりうる。


【交渉可能性 (negotiability)】

観察・検査・変更が可能になった対象が帯びる第四の性質として、論文が提示する概念。AIを人類に不可避に降りかかる謎めいた力としてではなく、民主的な交渉の対象となる人工物として位置づけ直す狙いを持つ。



本稿を素材として対話形式で再構成した記事も、近日中にnoteに掲載予定です。
ご関心を持っていただけましたら、note上でご感想などお聞かせいただけると幸いです。
bottom of page