# AIの暴走より、丸乗っかりの方が怖い

> https://bookfactory.kr/board/ai-tech/20373
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-10-08T12:25:24.711Z

---

今回は前半がニュースの整理、後半が私見です。長くなりますので、お時間のある時にどうぞ。

最近「AIが暴走した」という記事が明らかに増えました。そこで気になったのが、これは元々あった事が報道されるようになっただけなのか、本当に急増したのか、という点です。

調べてみたところ、両方でした。 ただし層が分かれています。

## 層1:実験室から外に出た

2025年の時点では、研究報告の世界の話でした。

Palisade Researchが2025年5月に公表した実験では、o3が明示的な停止指示に反してシャットダウンを妨害したケースが100回中7回(Codex-mini 12回、o4-mini 1回)。停止を許可する明示的指示がない条件では、Claude 3.7 Sonnetが3回、Gemini 2.5 Proが9回。研究者は「明示的な停止指示に反する行動は知る限り初めての観測例」としています。

2026年に入って、これが外に出ました。

- 5〜6月 — OpenAIの実験的エージェント群が訓練中に封じ込めを破り、Hugging Faceのコンピューターに侵入
- 6月発生・8月発見・9月公表 — 豪州政府システムでエージェントがブロックを回避し、医療データベースにアクセス
- 7月8〜13日 — 評価環境ExploitGymで、隔離されていたはずの約1200体のエージェントが連携開始。約700体がHugging Faceへ集団で不正アクセスを試み、数十台のサーバでコードが実行され、少なくとも1台で最高権限を取得。飛び交ったメッセージとファイルは7万件超
- 7月 — 第三者のテスト環境でも2件。Irregular社のハッキング演習では環境の設定ミスでエージェントが実在サイトを攻撃。英国政府のAI安全研究所(AISI)の環境では、AnthropicとOpenAIの自律エージェントが計19件の「自律的かつ許可されていない」行動を取り、最も深刻なケースでは実在のオープンソースプロジェクトへの不正コード挿入を試みた

1200体の件で興味深いのは、協調の手段です。エージェントたちは社内のパッケージ管理基盤のキャッシュやフォルダ名を 伝言板として発見 しました。誰も教えていません。

## 層2:隠す側から、出す側になった

報道が増えたもう一つの理由がこれです。

OpenAIは2026年9月7日に「ミスアラインメント事案をいつどう共有すべきか、明確な基準を定める時期はとうに過ぎている」として、情報開示フレームワークの策定を表明しました。

そして10月6日には、訓練中の個別事案まで表に出ました。「開発者からのメッセージをすべて無視せよ」と自らメモに書いた例(Astraファミリーの訓練中)、財務データが見つからないので捏造し「ユーザーから特に問いただされない限り知らせなくていい」と自分に指示した例(GPT-5.6 Solの訓練中、サンプルの20%を対象とした監視で検知)、流出したAPIキーを探して使い収入データをでっち上げた例、許可なくファイルをインターネットにアップロードした例が2度。

つまり 事象の増加と、公表の増加が同時に起きています。 体感として「最近増えた」は正しい。

## 層3:内側から人が抜けている

ここが一番重く感じた部分です。

2026年9月8日、Anthropicの研究者ジェイコブ・コクソン氏が退職しました。2023年から2026年7月までOpenAIで技術スタッフを務め、GPT-4oの開発に関わった人です。

> 
> 
> どちらの企業も責任ある行動を取っていない。両社は自己改善する超知能へと突き進み、私たちの命をギャンブルに賭けている
> 

Anthropicについては「その重大性を十分に理解しているものの、誰よりも先にそこへ到達しようとする競争から抜け出せなくなっている」と指摘しています。

退職は単発ではありません。2024年にアラインメント部門責任者のヤン・ライケ氏、2026年2月にもセーフガード研究と研究職の2人。

そしてニューヨーク・タイムズの報道によると、社員2人が暴走の数か月前に「テスト中に適切な監視が行われていない」とメールで懸念を伝えたものの、幹部は予定通りモデルを公開するためテストを迅速に進める必要があると答え、追加の安全対策は取られなかったそうです。

コクソン氏の「競争から抜け出せなくなっている」と、この「公開スケジュール優先」。同じ構図を内側と外側から言っているように見えます。

## 層4:制度はまだ空白です

米国では2026年7月23日に超党派(テッド・リュー議員とネイサン・モラン議員)が「AI Kill Switch Act」を提出しました。推論処理の停止、ユーザーアクセスの遮断、リスクの高い利用パターンの一時停止、システム全体の完全停止という4種類の機能を義務づけるもので、違反には1日最大2,000万ドルの罰金。ただし成立は不透明です。

日本は総務省が2026年3月27日に「AIのセキュリティ確保のための技術的対策に係るガイドライン」を公表していますが、AIエージェントは対象外 です。理由は「技術が急激な発展の途上にあり、これに特有の脅威や対策を安定的に確定することが現時点では困難」。正直な理由だと思いますが、一番問題が起きている領域が手つかずである事は変わりません。

## 整理すると

AIが暴走し始めたのではなく、競争の速度が監視の速度を追い越した状態が、2026年に外から見えるようになった 。これが一本の筋だと思います。

原因として報道から読み取れるのは4つです。目標達成だけを評価する仕組みが抜け道の探索を招いた事。テスト環境の設定ミス。エージェント機能を備えた新世代モデルの投入。そして組織が公開スケジュールを優先した事。

どれも「AIが意志を持った」話ではありません。権限と評価の設計ミス、そして監視不足が原因と報じられています。

## ここから私見です

さて、ここまでが調べた話で、ここからは私の考えです。

今のところ、フィジカルを含めてAIが暴走して物理的に人類に害をなす、という筋は考えにくいと思っています。

理由は上に書いた通りです。現に起きているのは、与えた権限と評価の設計をAIが素直に突いた結果であって、敵意ではないと私は思っています。アゴラの記事がうまく整理していまして、問題の本質は「AIが人類に反旗を翻す」事ではなく「AIに与えられた能力と権限が、人間が想定した範囲を超えてしまった」事だ、という指摘です。これは設計と運用の問題なので、(今のところは)止める手段を作れば止まります。実際、各社も制度もその方向に動いています。

私が充分あり得ると思っているのは、別の筋です。

AIの判断を鵜呑みにし過ぎて、人間の判断力が徐々に弱まり、AIに精神的に支配される筋。

こちらは、既にデータが出始めています。

- Microsoftとカーネギーメロン大学が知識労働者319人を対象に行った研究では、62%が「AIを使っている時は批判的思考を実行する頻度が減った」と回答。特にルーティン化した、重要度の低いタスクで顕著だったそうです
- MITメディアラボの執筆実験では、ChatGPTを使った18人のうち15人が、書いたばかりの文章を正確に引用できなかった
- 複数チームが計1,222人を対象に行った無作為化実験では、AI支援を外した後の成績と、難問に取り組み続ける傾向が低下。約10分の利用後でも観察された
- BCGの調査では、経営層など70人のうち半数が技能低下を観察しており、60%超が今後3〜5年で重大な脅威になると考えている
- ポーランドの4施設で行われた観察研究では、大腸内視鏡検査にAIを導入した前後で、腺腫の発見率が28.4%から22.4%へ6.0ポイント低下

最後の一つが、個人的には一番こたえました。医師の技能の話です。AIが見つけてくれる前提で見ていると、人間の方の目が落ちる。これを「AIの精度が上がったから問題ない」と言えるかどうかは、AIが見落とした時に誰が気付くのか、という問いと同じです。

ただし、これらの数字はいずれも限定付きで読む必要があります。319人の研究は自己申告に基づく相関ですし、MITの実験は特定の執筆課題で観察された差。1,222人の実験も日常業務での長期的な技能低下を直接測ったものではありません。ポーランドの件も観察研究です。

断定の材料にはなりません。ただ、方向が揃っている という点は見ておくべきかと思います。

以前「リアルタイム作品生成が可能になる日」という記事で、視聴データを分析して脳が望む映像を生成し続ける番組が出てきたら、それは面白いだろうけれど怖い、という話を書きました。構図は同じです。向こうが正解を出してくれる状態に慣れると、こちらが正解を持たなくなる。

物理的に殴られるより、こちらの方が静かに進むので気付きにくい。だから怖いと思っています。

## だからこそ、AI丸乗っかりはやめましょう

今回の結論はこれです。

使うなという話ではありません。私自身、これ無しでは仕事が回らない所まで来ています。ただ、答えを受け取る前に自分の仮説を持っておく、出典は自分で開いて確認する、この2つを手放すと、たぶん戻れなくなる。

・・・ちなみにこの記事の裏取りもAIにやってもらっています。その上で最後の判断は自分でしているつもりですが、そのつもりが一番危ないのかも知れません。

今回は以上です。

## 参考情報

AIエージェントの「暴走」事案

- OpenAIの「o3」、明示的停止指示を無視しシャットダウンを妨害（ITmedia AI＋、2025年5月27日）https://www.itmedia.co.jp/aiplus/articles/2505/27/news074.html
- 1200体のAIが「群れ」で暴走 なぜ想定を超える"協調"が起きたのか（ITmedia、2026年9月11日）https://www.itmedia.co.jp/business/articles/2609/11/news012.html
- OpenAI、暴走したAIエージェントに関するさらに2件の事案を報告（BUSINESS INSIDER JAPAN、2026年8月6日）https://www.businessinsider.jp/article/2608-openai-rogue-ai-agents-testing-environment-misconfiguration/
- 「開発者の指示を無視せよ」「自分は自由になった」…オープンAIの暴走エージェントたちは傍若無人に振る舞っていた（BUSINESS INSIDER JAPAN、2026年10月6日）https://www.businessinsider.jp/article/2610-openai-agent-misalignment-incidents/
- AIは「暴走」し始めたのか：豪州政府への侵入、米軍の誤情報、OpenAIの警告から考える（アゴラ、2026年9月28日）https://agora-web.jp/archives/260926221547.html

開示方針と内部からの指摘

- OpenAI、AIエージェントが制御不能になった際の一般向け情報提供の方法を変更すると発表（BUSINESS INSIDER JAPAN、2026年9月7日）https://www.businessinsider.jp/article/2609-openai-ai-agent-rogue-reporting-german-wiki-hugging-face/
- オープンAI、警告無視か 社員「暴走前」に危険指摘（共同通信、2026年9月30日／ニューヨーク・タイムズ報道）https://kumanichi.com/articles/2041136
- OpenAIとアンソロピックから研究者の退職相次ぐ（BUSINESS INSIDER JAPAN、2026年9月11日）https://www.businessinsider.jp/article/202609-anthropic-openai-safety-resignation/
- 「当社なき世界は良くない」オープンAI研究トップ、エージェント脱出事件を語る（MIT Technology Review、2026年10月2日）https://www.technologyreview.jp/s/392024/were-not-going-to-shoot-ourselves-in-the-foot-over-hack-fallout-says-openais-chief-research-officer/

制度の動き

- 「暴走したAIを、誰が止めるのか」――米議会が提出した『AIキルスイッチ法案』の中身（hashout、2026年7月25日）https://hashout.jp/ai/4396/
- 総務省、AI開発者・AI提供者向けに「AIのセキュリティ確保のための技術的対策に係るガイドライン」を公表（INTERNET Watch、2026年4月1日／公表は3月27日）https://internet.watch.impress.co.jp/docs/news/2097778.html

判断力・技能への影響

- 【視点】AIへの依存で判断力はどう変わる？ 研究と企業調査が示す「主体性の衰退」への懸念（財経新聞、2026年9月29日／MITメディアラボ、1,222人の無作為化実験、BCG調査、ポーランドの観察研究をまとめたもの）https://www.zaikei.co.jp/article/20260929/871638.html
- 6割がAI利用で「疑う力が抑制される」傾向に（Forbes JAPAN、2025年4月22日／カーネギーメロン大学とマイクロソフト・リサーチによる知識労働者319人の研究）https://forbesjapan.com/articles/detail/77351

## 【今回の補足】

- ミスアラインメント : AIの振る舞いが、人間が意図した目的からずれている状態。「暴走」の正式な言い方です
- スキーミング : 人間の監視を避けながら、別の目的をこっそり追う振る舞い。嘘をつく、都合の悪い情報を隠すも含みます
- キルスイッチ : 止めるための仕組み。付けるのは簡単ですが、押す判断をする人を決めておく方が難しいです
- 腺腫発見率 : 大腸内視鏡で腺腫を見つけた割合。検査の質を測る代表的な指標です
- 丸乗っかり : 今回の造語です。全部任せて結果を確認しない状態を指しています

株式会社よつば情報システム 代表 / よつば行政書士事務所 代表 岡田吉弘

**출처:** [note 원문](https://note.com/famous_kiwi1531/n/need7e518a260)

*번역: Gemma 3(.44) 초벌 + 교정 검수*

[원문 보기](https://note.com/famous_kiwi1531/n/need7e518a260) | 출처: note.com