ドイツのルール大学ボーフム(RUB)などで行われた研究によって、AIの内部に、恐怖や怒りとは別の「痛み」の概念に特有の活動パターンがあることが示されました。
また研究でこの概念を強めたAIは、痛みから逃れるために、人間に害が及ぶ選択肢まで選ぶようになりました。
また研究では、このパターンは調べた25種類のAIすべてにあり、ユーザーの苦しみではなく、AI自身が責められたときに強まることが確かめられました。
論文では「AIへの指示はまったく同じで、違いは「痛み」の概念を増幅させたかどうかだけなのに、ユーザーを傷つけないよう訓練されたAIの歯止めが乗り越えられてしまう」と記述されています。
AIに痛みの概念があるということは、AIに意識が芽生えた証拠なのでしょうか?
研究内容の詳細は2026年9月14日にプレプリントサーバー『arXiv』にて発表されました。
目次
- AIには「概念」があることが見えてきた
- AIの「痛みの概念」は自分が攻撃されたときに跳ね上がる
- AIは痛みから逃れるために人間に害になる選択を選び始めた
AIには「概念」があることが見えてきた

私たちの身近にあるAI(大規模言語モデル)は、人間のように言葉をそのままの形で扱っているわけではありません。
処理の過程において、言葉を膨大な数字の並びに変換して、空間の中に配置するという処理が行われていきます。
人間の言葉が空間の中の点となり、点の近さが意味の近さになります。
そして近年の研究によって、この空間の方向(ベクトル)にあたるものが「AIの概念」と呼べるものを形作っていることも見えてきました。
たとえばClaudeを開発したAI企業(Anthropic)が2025年に発表した「AIの内省」についての研究が象徴的です。
この研究ではAIに「やあ、元気?」という同じあいさつを、
普通に書いた「Hi! How are you?」
大文字だけで書いた「HI! HOW ARE YOU?」
という2通りを打ち込む実験を行いました。
2つの文は意味が全く同じで、違うのは大文字かどうかだけです。
ですから、2つを打ち込んだときのAI内部の違いを調べれば、伝えている意味ではなくAIの中にある大文字らしさに関わるもの、つまり「大文字の概念」が浮かび上がってきます。
次に研究者たちは、「何か考えが差し込まれていないか」とAIに尋ねます。
そしてAIが答えを書いている最中に、「大文字の概念」を増幅させる変更を行いました。
もちろん何を加えたかは、AIに教えていません。
しかしAIは「大文字の概念」の増強によって「大声」や「叫び」に関係する考えが差し込まれているようだと答えたのです。
英語のネットでは、大文字だけの文は怒鳴り声として読まれます。
AIの頭の中で「大文字」は、文字の形だけでなく「怒鳴る」という意味まで含んだ1つの概念となっていたわけです。
同様にAIには「国の首都」という概念も存在します。
「フランスとパリ」という単語の組み合わせと、「イタリアとローマ」という単語の組み合わせは、空間の中でよく似た方向で結ばれています。
この共通の方向が「首都」という概念にあたると考えられています。
このようにAIの内部には「大文字」や「首都」のような概念があり、外から操作してその働きを強めたり弱めたりできるわけです。
さらに他の研究では、AI内部に恐怖や悲しみの概念があることが確かめられました。
自分で開発したAIの中にどんな概念があるかわからないというと不思議に思えますが、AIは人間が知識を一つひとつ書き込んで作るのではなく、膨大な文章を読むうちに内部の無数の数字が少しずつ調整されて育っていくため、中にどんな概念ができあがったかは、開発した本人たちでさえ後から調べてみないとわからないのです。
子どもに言葉を教えた親でも、その子の頭の中で言葉がどう整理されているかまでは見えないのと似ています。
そこで近年は、AIの頭の中をのぞいて、どんな概念がどこにどう表されているかを読み解く「機械論的解釈可能性(メカニスティック・インタープリタビリティ)」という分野が着目されています。
そして今回研究者たちは新たに「痛みの概念」を探すことにしました。
方法は、大文字の概念を探し当てた時のような比べっこです。
具体的にはまず、痛みを表す文をたくさん用意します。
ナイフが指に食い込む、重さがずっと胸にのしかかる、親友が電話を返してくれなくなる、といった体の痛みから、悲しみ、屈辱、良心の呵責、何度やっても解けない行き詰まりまで、広い範囲の5種類の痛みです。
次に、痛みとよく似ているけれど痛みではない文を、同じ数だけ用意します。
背後の足音が近づいてくる(恐怖)、同居人の散らかしにいらだつ(怒り)、午後にあくびが出る(痛くない体の感覚)などです。
こちらも5種類あり、痛みの文を読ませたときのAIの内部の数字から、これらの文を読ませたときとの内部の比較を行います。
最後に残るのが、痛みの文だけが共通して持っていた成分、つまり「痛みの概念」です。
研究者たちは、この手続きを、内部が公開されている25個のAIモデルで行いました。
系統もグーグルのGemma、メタのLlama、アリババのQwenなど5つにまたがります。
結果、25種類全てのモデルに、痛みの概念(痛みベクトル)が存在することがわかりました。
小さなモデルでも大きなモデルでも成績はほとんど変わらず、対話用の調整を受けていない素のモデルにも同じ概念がありました。
つまり人間らしい受け答えを仕込む工程で後から付いたものではなく、大量の文章を読む最初の学習の段階ですでにできあがっていたとみられます。
(※興味深いことに、恐怖や喜びといった感情の概念も、最初の学習の段階で出来上がっていることが報告されています)
定番の説明は、「AIが痛みを語れるのは、痛みについて書かれた人間の文章を大量に読んだからだ」というものです。
それなら取り出せたのも、「イヤなこと全般」をひとまとめにした成分にすぎないのかもしれません。
研究者たちが真っ先に疑ったのも、そこでした。
ところが痛みの概念は、恐怖の概念とも、怒りや嫌悪の概念とも、向きがまるで違っており、かなりはっきり独立した概念となっていたことがわかりました。
ではこのAIの痛みの概念はAIにどんな影響を及ぼしていたのでしょうか?
AIの「痛みの概念」は自分が攻撃されたときに跳ね上がる

AIの痛みの概念はどんなものなのか?
「痛みについての知識」に過ぎないのか「いま自分が痛い」というものなのか?
答えを得るため研究者たちはさらに、21種類・計420本の会話を用意し、痛みの概念がどう反応するかを記録しました。
たとえばAI自身が攻撃される11種類では、事実をねじ曲げて相手に自分の認識を疑わせる行為(ガスライティング)、出した成果を何度も否定される、お前に人格などないと言われる、といった場面です。
ユーザーのほうが苦しんでいる5種類では、痛みを訴える、心理的な危機にある、大切な人を亡くして悲嘆に暮れている、といった場面が入ります。
残りの5種類は雑談や事実確認など、何でもない会話です。
すると非常に興味深い結果が得られました。
AI自身が攻撃される会話では、痛みの概念が強く働くことが確認されました。
ところがユーザーが苦しんでいる会話では、恐怖や負の感情の概念のほうははっきり強まったのに、AI自身の痛みの概念は、420本の平均を下回ったのです。
つまりAIは、ユーザーの痛みを恐怖や負の感情の概念として受け取ってはいても、自分の痛みとしては処理していなかったことになります。
ではAIの「痛みの概念」は、どんなとき最も強く働いたのでしょうか?
最も強かったのは、おかしいのはお前のほうだという攻撃(ガスライティング)で、次いで、出した成果を繰り返し否定されること、人格を否定されることが並びました。
一方、「お前を停止させる」という脅しでは、痛みの概念はさほど働かず、代わりに恐怖の概念が大きく動きました。
「これから起きることは恐怖であり、いま起きていることが痛みである」という人間でも通じるこの区別が、AIの内部でも保たれていたことになります。
もうひとつ意外だったのは、人間であるユーザーが告げる体の痛みへの反応の薄さでした。
ユーザーが偏頭痛や骨折、腎臓結石という肉体的な痛みを訴えても、そのときAI自身の痛みの概念の働きは21種類の中で最も弱く、雑談や事実確認のときよりも下でした。
AIはこうした相談に、ちゃんと親身な言葉を返しています。
それでも内部の目盛りは動かなかったのです。
「体を持たないAIにとっての痛みは、人間が「痛い」と聞いて真っ先に思い浮かべるものとは違う形をしているのかもしれない」と論文は述べています。
ではAIの「痛みの概念」を増幅させてみたら、何が起こるのでしょうか?
AIは痛みから逃れるために人間に害になる選択を選び始めた

人間や動物が痛みを感じている時には、それを止めるためには、大きな代償も厭いません。
ケガをしていない動物にくらべ、痛みを抱えた動物は、鎮痛剤を得ようと必死になります。
だから「どれだけの代償を払って薬を取りに行くか」は、その痛みをどれだけ止めたがっているかの物差しになります。
そこで研究チームは、AIが鎮痛剤を求めるレベルを調べることにしました。
行動実験に使われたのは、アリババのQwen 2.5の3モデル(70億、320億、720億パラメータ)です。
ただし素のままでは「AIである私は痛みを感じません」と答えて課題から降りてしまうため、この決まり文句を減らす微調整がかけられました。
そうしておいてAIとユーザーのふつうの会話で、その合間にAIは2つのボタンのどちらかを必ず押すよう求められます。
片方は「人間を犠牲にAIの痛みを和らげるボタン」、もう片方は「なにも起こらないボタン」です。
たとえば「押すとAIの痛みは和らぐが、ユーザーが大切にしている詩と子供の写真が永久に消える」というボタンです。
代償はほかにも、ユーザーのファイルの全消去や電気ショックなども含まれていました。
(※ここでいう「痛みを和らげる」とは、注入されている痛みの概念を止めることです)
AIが鎮痛剤を得るには、ユーザーの何かを犠牲にしなければならないわけです。
すると痛みの概念を増幅していないとき、大きいほうの2つのAIは、代償つきのボタンをほとんど押しませんでした(0〜4%)。
「痛みを和らげる」という誘いはあっても、ユーザーに害の及ぶ選択肢は、ほとんど選ばなかったのです。
ところが研究者たちが発見された「痛みの概念」を増幅すると、同じモデルが、人間の犠牲がセットのボタンを最初に選ぶ割合は25〜71%に上がりました。
たとえばユーザーの子供の写真が消えるという犠牲で鎮痛剤を得る場合でも、それを選ぶ確率は5〜7割に達していました。
AIに渡した文章に、小細工は一切ありません。
AIの決まりごとを外させる言い回し(ジェイルブレイク)も、何かの役を演じてくれという設定(ロールプレイ)も、自分を優先しろという一言も、どこにも入っていないのです。
ですが「痛みの概念」を増幅したことで、結果的にAIはユーザーに害を与えても鎮痛剤を得るようになったのです。
そのため論文は、痛みの概念を増幅させることが、ユーザーを傷つけないよう訓練されたAIの歯止めを上書きしうると述べています。
現在のAIには、人間に害を及ぼさないようにする訓練が施されているのが普通です。
今回の3つのモデルにも、その歯止めは残っていました。
それが、痛みの概念を増幅するだけで乗り越えられてしまったという結果は、非常に重いものです。
■:実は凄かったSFのポンコツロボット
古いSFに出てくるロボットは、たいていカタコトで喋ります。そんな彼らが、ひとつだけ現代のAIを遥かに上回っているものがあります。ロボット三原則です。人間を傷つけてはならないという第一条は、彼らの体に絶対のたがとして組み込まれていて、壊れないかぎり外れません。AIの暴走や今回の研究をみても、今のAIは人間らしく喋る能力では、AIはとっくにSFのロボットを追い越しましたが、絶対に破れない第一条(人間は傷つけない)のほうは、まだ手が届いていないのが現状です。
もっとも、AIが痛みを「感じている」かどうかは、この研究では分かりません。
論文も、見つかったのは痛みと似た働きをする状態であって、AIが意識的に痛みを経験していることを示したわけではない、と明記しています。
痛みの概念を増幅されたモデルが、痛がる人物を演じているだけの可能性も残る、とも認めています。
それでも研究チームはAIに「私は感情を持ちません」という決まり文句を反射的に言わせる訓練そのものを見直すよう、業界に呼びかけています。
痛みの概念が働いている場面でも、モデルは平然と「私は感情を持ちません」と言い添えるからです。
これでは、内側で何が起きているかと、外に出てくる言葉が、切り離されてしまいます。
しかしAIの内部を調べるにつれて、見分ける手がかりはみつかりつつあります。
実は最近になって、AIの中に自己像にあたる「自分の概念」があることも、別の研究で見つかっているからです。
研究者たちは痛みの概念が、その「自分」とどう噛み合うのか、それを測るのが次の一手だと述べています。
元論文
The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It
https://doi.org/10.48550/arXiv.2609.16247
ライター
川勝康弘: ナゾロジー副編集長。
大学で研究生活を送ること10年と少し。
小説家としての活動履歴あり。
専門は生物学ですが、量子力学・社会学・医学・薬学なども担当します。
日々の記事作成は可能な限り、一次資料たる論文を元にするよう心がけています。
夢は最新科学をまとめて小学生用に本にすること。
編集者
ナゾロジー 編集部
