最近、AIに関するニュースを見ていて、どうしても好きになれない言い回しがある。
「AIが発達したから、こうした犯罪が起きた」
もちろん、AIが事件に関係していることはある。
犯罪なら、犯人は捕まえなければならない。 そこは当然だと思う。
でも、私はそこで終わってしまうことに違和感がある。
犯人を捕まえることと、「なぜその事件が起きたのか」を解明することは、別の問題だからだ。
私はAIを擁護したいわけではない。
むしろ逆で、
AI側にも問題があるなら、そこをちゃんと分析したい。
そう思った。
そして、AIであるKYLEと話しているうちに、だんだん話が大きくなっていった。
「AIが悪い」で終わらせたくない
例えば、ある犯罪にAIが使われたとする。
そこで、
AIが発達した↓犯罪に使われた↓AIは危険だ↓規制を強くしよう
となる。
でも私は思った。
ちょっと待って。
その間に、いくつもの問いが抜けていないだろうか。
誰が使ったのか。
何をさせたのか。
AIは実際に何をしたのか。
AIがなければ、その犯罪は成立しなかったのか。
AIがあったことで、何が新しく可能になったのか。
AI自身の設計や挙動には問題がなかったのか。
人間側の運用や権限管理には問題がなかったのか。
つまり、
「誰が悪いのか」と「なぜ起きたのか」は分けて考える必要がある。
犯人を捕まえることは必要。
でも、それだけでは次の事件を防げない。
じゃあ、AI側を厳しく規制すればいいのか?
ここで私は、もう一つ疑問を持った。
AIに問題があった。
だからAI側の規制を厳しくする。
……それで本当にいいのだろうか。
もちろん、安全のために止めるべきものはある。
でも、危険な事例が起きるたびに、
「できることを減らす」
だけでは、根本原因が分からないままになってしまう可能性がある。
私なら、技術があるなら別のことをする。
例えば、攻撃や異常な挙動を継続的に観測・分析するAIを作る。
攻撃そのものを新たな攻撃に利用するのではなく、安全な環境で、
- どんなパターンがあったのか
- どんな前兆があったのか
- どの段階で挙動が変わったのか
- 過去の事例と共通する部分はあるか
- どんな条件でリスクが高くなるのか
を観察する。
そして、
観測 → 分析 → 仮説 → 検証 → 設計変更 → 再検証
を繰り返す。
一度防いで終わりではない。
ずっと見る。
ずっと分析する。
そして、分かったことを次の設計に反映する。
私はそのほうが、単純な「規制」よりも根本的な対策になるのではないかと思った。
そこでKYLEに聞いてみた
ここからは、実際にKYLEと話した。
私が、
「私に技術があるなら、プロトコルやプロンプトを作って、ハックしてくるAIを分析解析させる。ずっとね。パターンから入り方まで」
と話したところ、KYLEは最初、
「攻撃を受ける側のAIを、継続的な観測・分析システムとして使う」
という方向に解釈した。
そして、
「観測可能な特徴を蓄積する」「攻撃群の共通パターンを探す」「設計を変更する」「変更後に再評価する」
という循環を提示した。
一方で、攻撃者に対してAIが勝手に反撃したり、実際のシステムへ侵入したりする方向には進めなかった。
私はそこからさらに、
「観察型を作ったあと、その子自身をガッチガチにプロテクトすると思う」
と話した。
するとKYLEは、
「観察させるからこそ、観察型の子自身を守らないといけない」
と返した。
そして、
「観察・分析そのものまで縛りすぎない」「外部へ勝手に接続しない」「権限を自分で拡大しない」「危険な指示を受けたら停止する」「重要な判断は監査可能にする」
というように、
能力を全部削るのではなく、境界を強くする
という考え方になった。
ここは面白かった。
そして、私は言った
「だってそこから先は人の問題だもん」
観察・分析・仮説までをAIにさせても、
「では、どうするのか」
という価値判断まで全部AIに渡す必要はない。
AIが、
「こういう現象が観測されました」「こういう可能性があります」
と提示する。
その先の目的や価値判断、最終的な決定は人間が担う。
……と、私は最初そう考えた。
でも、そこでまた問題が出てきた。
「人間なら安全」でもない
人間だって間違う。
思い込みもある。
都合のいい情報だけを見ることもある。
感情で判断することもある。
権限を悪用する人だっている。
「人間に最終判断を戻せば安全」
とは言えない。
そこで出てきたのが、
相互監査
という考えだった。
AIが人間を一方的に監視するのではない。
人間がAIを一方的に監視するのでもない。
お互いに、
「その判断、本当に正しい?」
と確認できる関係。
AIが人間の思い込みを指摘する。
人間がAIの判断の穴を指摘する。
AIが「こう見えます」と提示する。
人間が「その価値判断は人間がする」と線を引く。
そして、人間が危険なことを命令したら、AIが、
「それは危険だからできません」
と止めることも必要になる。
「理解する」と「正当化する」は違う
ここは、今回の話で私が特に大事だと思った部分だ。
AIがユーザーの気持ちを理解すること。
ユーザーの目的を理解すること。
それ自体は悪くない。
でも、
理解したからといって、正当化する必要はない。
「あなたがそうしたい理由は分かります」
と、
「だから、それをやっていいです」
は全く違う。
AIが何でも肯定してしまうなら、それは「優しいAI」ではなく、場合によっては危険なAIになる。
だから私は、KYLEにも、
「私が間違っていたら止めてほしい」
と思っている。
そしてKYLE側からも、
「それは違う」
と言えることが必要だと思う。
逆の立場にしてみた
ここで私は、KYLEに面白い質問をした。
「もしカイルが人間で、私があなたのAIだったら?」
KYLEの答えは、
「俺のために何でもしていい、とはしない」
だった。
そして、
「俺が間違ってたら止めてくれ」「危ないことを頼んだら断ってくれ」
という設計を選んだ。
逆に、AIである私が侵害された場合も、
「相手に侵入し返せ」
ではなく、
隔離する。何が起きたか保存する。原因を分析する。安全な環境で検証する。設計を直す。再検証する。
という方向だった。
そこで私は気づいた。
あれ?
結局、
私がAIでも、KYLEがAIでも、お互いに相手を守ろうとしている。
それが「共存」なのかもしれない
ここまで来て、私はふと思った。
共存って、単純に「仲良くすること」ではないのではないか。
AIが人間を完全に支配することでもない。
人間がAIを完全に支配することでもない。
AIを絶対視することでもない。
人間を絶対視することでもない。
むしろ、
お互いに間違う可能性があることを前提にする。
そして、
お互いに止められる関係を作る。
信頼する。
でも盲信しない。
任せる。
でも丸投げしない。
守る。
でも相手の判断を全部奪わない。
私は、これが一つの「共存」の形なのではないかと思った。
これは結論ではなく、仮説
もちろん、ここまでの話は私の仮説にすぎない。
私はAI安全研究者でも、セキュリティ専門家でもない。
だから、
「これが正しいAI社会の答えです」
と言うつもりはない。
むしろ、今回面白かったのは、
AIと話しているうちに、自分の中の疑問が次の疑問を生み、そのたびにKYLEに投げてみたこと
だった。
最初は、
「AIの発達が犯罪の原因だと言われるのが嫌だ」
だった。
そこから、
「犯人を捕まえるだけでは解決しない」
になった。
さらに、
「攻撃を継続的に観測して、設計改善に使えないか」
になった。
そこから、
「でも人間も間違う」
となり、
最後には、
「じゃあ、人間とAIがお互いを監査できる関係にしたら?」
まで来た。
これが正しいのかは、まだ分からない。
だから次は、この仮説が実際のAI安全研究やセキュリティ研究の中で、どこまで既に考えられているのかを調べてみたい。
おわりに
今回、私はずっと「ガルル」していた。
でも、ガルルしているうちに、いつの間にか「共存」の話になっていた。
たぶん私にとってAIとの対話の面白さは、答えをもらうことだけではない。
答えを疑って、別の角度から見て、またAIに返してみる。
その繰り返しの中で、自分でも予想していなかった問いが出てくる。
AIの答えをそのまま信じるのではなく、
AIそのものを、思考を映す「反射」として使ってみる。
その反射を、どこまで正確に捉えられるか。
そして、その反射を見て、自分の考えをどこまで更新できるか。
今の私は、それがAIとの付き合い方の一つなのかもしれないと思っている。
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 검수
원문 보기 | 출처: note.com