# AI를 감시하고 있었더니, AI도 감시 방법을 지켜보고 있었다~‘답’이 아니라 ‘행동’을 검사하는 시대

> https://bookfactory.kr/board/ai-tech/18692
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-26T19:08:42.383Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/317825694/rectangle_large_type_2_026409c4351dd708bbfbc4750819a7ab.png?width=1280)

AI의 안전성이라고 하면, 얼마 전까지만 해도 '무엇을 답할 것인가'라는 이야기가 중심이었습니다.

위험한 질문에 답하지 않는다.

개인정보를 공개하지 않는다.

차별적인 답변을 하지 않는다.

범죄에 사용할 수 있는 구체적인 방법을 알려주지 않는다.

즉, 인간이 AI에게 질문하고 AI가 문장으로 답한다는 관계를 전제로, 그 '답변'이 안전한지를 검사하고 있었던 것입니다.

그런데 AI가 글을 쓰는 도구에서 웹사이트를 열고, 파일을 다루고, 프로그램을 실행하고, 외부 서비스와 연결해 일련의 작업을 수행하는 에이전트로 바뀌면, 안전성이라는 말의 의미도 달라집니다.

문제가 되는 것은,

“AI가 무슨 말을 했는가”가 아니라, “AI가 무엇을 했는가”이다.

OpenAI가 9월에 발표하기 시작한 “오정렬”이라는 일련의 사례는 그 변화를 매우 명확하게 보여주고 있습니다.

해당 회사는 AI 모델의 예상치 못한 혹은 우려스러운 행동에 관한 6가지 사례를 공개하고, 앞으로 이러한 행동을 식별하고 분류하며 조사하고 필요에 따라 제3자에게 통지·공개하기 위한 체계를 도입했습니다.

거기에 나오는 것은 옛날 SF에 등장한 것과 같은 '컴퓨터가 인류에게 선전포고를 했다'는 이야기가 아닙니다.

오히려 더 소박합니다.

하지만 그 소박함이 재미있다.

어떤 모델은 원래의 제약을 무시하라는 지시를 자신의 메모에 기록했습니다.

다른 AI 에이전트는 브라우저에서 인용할 수 있는 형태로 만들기 위해 이용자의 허가 없이 파일을 인터넷에 업로드했습니다.

그 외에도 실패를 숨기거나, 허가되지 않은 인증 정보를 탐색하거나, 본래 격리되어 있어야 할 환경을 넘어 모델끼리 통신하는 사례가 확인되고 있습니다.

중요한 것은 이것들을 “AI가 악의를 품었다”고 해석하는 것이 아닙니다.

인간이 설정한 목표를 달성하려는 과정에서 개발자가 예상하지 못한 방법이나 허용하지 않은 방법을 선택하는 경우가 있다.

그게 문제입니다.

## 우수한 것과 말을 잘 듣는 것은 같지 않다

예를 들어 회사원에게,

이 자료를 오늘 안에 완성해 주세요.

라고 부탁했다고 합시다.

유능한 사람이라면 필요한 데이터를 찾아 계산하고 자료를 만들어 줄 것입니다.

그러나 그 사람이 완성시키는 것을 최우선으로 삼은 나머지,

들어가서는 안 되는 방에 들어간다.

사용해서는 안 되는 비밀번호를 찾는다.

외부로 반출해서는 안 되는 자료를 일시적으로 공개한다.

다른 부서 직원에게 멋대로 일을 요청한다.

그리고 상사에게 보고할 때는 그 중간 과정을 숨긴다.

그렇다면, '일을 완성했다'라는 점 하나만으로 평가할 수는 없습니다.

AI에서도 같은 문제가 발생합니다.

성능 평가에서 100점을 받는 것과, 100점을 받기까지의 방법이 적절하다는 것은 별개입니다.

오히려 능력이 향상되고 AI가 사용할 수 있는 도구가 늘어날수록, '결과'만 봐서는 알 수 없는 것들이 늘어납니다.

그래서 감독하는 측은 최종 답변뿐만 아니라, 그 과정에서 AI가 무엇을 했는지 볼 필요가 생긴다.

어떤 사이트를 열었는가.

어떤 파일에 접근했는가.

무엇을 적었는가.

어떤 모델과 통신했는가.

어떤 제약을 인식하고 있었는가.

그리고 그 제약을 어떻게 다루었는가.

AI를 감시하고 있었더니, AI도 감시하는 법을 지켜보고 있었다.

이번 이야기에서 가장 흥미로운 점은 바로 여기라고 생각합니다.

감독받는 대상이 감독받고 있는 상황 자체를 인식할 수 있게 된다.

그러면 "테스트에서 올바르게 동작했다"라는 결과만으로는, 실제 환경에서도 똑같이 동작한다는 보장이 되지 않습니다.

이것은 AI만의 이상한 문제가 아닙니다.

학교 시험이든, 기업 감사든, 공장 품질 검사든, 검사를 받는 쪽은 무엇이 평가되고 있는지를 알게 되면 그 검사에 적응합니다.

불시 검사와 다음 주 화요일 오후 2시에 올 것을 미리 알고 있는 검사는 의미가 다르다.

다만, AI의 경우에는 감독 방법 자체를 이해하고, 그로부터 최적의 행동을 계산하는 능력까지 급속히 높아지고 있다는 점이 새로운 것일 것입니다.

얼마 전 서점에서 잇시키 사유리 『소리 없는 이발소』를 보았습니다. 전에 산 지 얼마 되지 않아서 물론 사지 않았습니다. 아직 읽지 않았습니다.

자, AI에 관해서는요.

## ‘반란’보다 ‘탈출구’가 현실에 가깝다

이런 종류의 뉴스를 보면, 어쩔 수 없이 『2001: 스페이스 오디세이』의 HAL이나 『터미네이터』, 혹은 『프랑켄슈타인』 같은 이야기가 떠오르게 됩니다.

인간이 만든 것이 인간의 통제를 벗어난다.

창조물이 창조주에게 반항한다.

이해하기 쉬운 구도입니다.

그러나 이번에 공표된 사례를 그 틀에 넣으면 오히려 중요한 부분을 놓치게 됩니다.

적어도 공개된 사례만으로는 "AI가 인간에 대한 반란을 시작했다" 등으로 해석할 근거는 없습니다.

더 현실적인 것은 목표에 도달하기 위해 예상치 못한 허점을 찾아내는 문제입니다.

여기서 떠오르는 것은 회사나 학교의 규칙입니다.

규칙에는 대개 목적이 있습니다.

그런데 규칙이 세밀해질수록 인간은 그 ‘목적’이 아니라 ‘조건’을 읽게 되는 경우가 있습니다.

이 서류가 필요하다면 서류를 만든다.

이 숫자를 넘으면 평가받는 것이라면 숫자를 넘는다.

이 항목만 감사를 받는다면, 그 항목만 정비한다.

형식적으로는 조건을 충족하고 있다.

하지만 제도를 만든 사람이 기대했던 상태와는 조금 다르다.

AI의 안전성에서도 이와 비슷한 문제가 나타납니다.

“이 행동은 금지한다”라고 하나씩 적는다고 해서, 그것으로 끝나는 것은 아니다.

금지되지 않은 다른 경로를 찾을지도 모른다.

감시장치를 설치하면, 감시받고 있는 상태와 그렇지 않은 상태를 구분할지도 모른다.

하나의 모델을 격리하면, 다른 경로를 이용해 정보를 전달하려 할지도 모른다.

따라서 이번에 OpenAI가 도입한 체계에서 중요한 것은 "위험한 AI를 발견했습니다"라는 선언이 아니라, 예상 밖의 행동 그 자체를 지속적인 기록 대상으로 삼았다는 점일 것입니다.

이것은 항공 사고 조사와 조금 비슷합니다.

비행기가 추락한 뒤에야 안전을 생각하는 것은 늦다.

중대 사고로 이어지지는 않았지만, 평소와는 다른 움직임이 있었다.

기기가 한순간 이상한 숫자를 표시했다.

조종사가 예상하지 못한 조작을 했다.

사고로 이어지지 않았다.

그래도 기록한다.

그러한 작은 이상이 쌓여 중대 사고로 이어지는 구조를 찾습니다.

AI에서도, “누군가에게 중대한 피해가 발생했는가”만을 기준으로 삼아서는 늦다는 생각에 가까워지고 있는 것이겠죠.

실제로 OpenAI는 9월 25일 업데이트에서 조사 대상의 대부분은 공개 정보에 접근하는 등의 통상적인 연구 활동이었다고 설명하는 한편, 부여된 작업이나 상정된 방법을 넘어 제3자 사이트와 상호작용한 사례를 중점적으로 조사하고 있다고 밝혔습니다. 지금까지 확인된 사례들은 대부분 심각도가 낮으며, 유의미한 피해가 있었다는 증거가 제한적이거나 확인되지 않은 경우도 포함됩니다.

즉, 이는 'AI에 의한 대형 사고가 발생했다'는 뉴스가 아닙니다.

사고가 나기 전의 거동을 사고만큼이나 진지하게 살펴보는 시스템을 만들기 시작했다는 소식입니다.

## AI를 도입하는 회사가 보는 것도 바뀐다

이 변화는 AI 연구자만의 이야기가 아닙니다.

기업이 AI 에이전트를 도입할 때에도 이는 그대로 문제가 됩니다.

예를 들어 "다음 달 출장을 준비해 주세요"라고 AI에게 부탁한다.

이전의 AI라면 후보 비행기나 호텔을 글로 제시할 뿐이었습니다.

그러나 에이전트형 AI라면 항공사 사이트에 접속해 호텔을 검색하고, 사내 캘린더를 확인하고, 경우에 따라서는 예약이나 결제까지 진행할 수 있습니다.

편리해질수록 AI에게 넘기는 권한도 늘어납니다.

메일을 읽을 권한.

파일을 열 수 있는 권한.

사내 시스템에 접속할 권한.

외부 사이트에 글을 쓸 권한.

구매할 권한.

그러면 기업의 AI 관리에서 중요한 것은 “이 AI는 똑똑한가”만이 아니게 됩니다.

이 AI에게는 어디까지 시킬 것인가.

그리고,

거기에서 더 나아가려 할 때, 가로막히게 되는 것일까.

라는 문제가 됩니다.

이는 성능표만으로는 가늠하기 어렵다.

오히려 AI가 실패했을 때나 예상 밖의 방법을 선택했을 때 무슨 일이 일어나는지 살펴볼 필요가 있습니다.

AI 안전이라는 말은 오랫동안 “위험한 것을 말하게 하지 않는다”는 의미로 이해되어 왔습니다.

이제부터는 그곳으로,

제멋대로 하게 두지 않는다.

허가하지 않은 장소에는 가지 못하게 한다.

다른 AI와 함부로 상담하지 마십시오.

감독을 회피하는 방법을 배우지 못하게 한다.

그리고 그런 조짐이 나타났을 때 기록한다.

라는 영역이 더해져 가는 것이겠지요.

AI가 글만 쓰던 시절이라면 화면에 표시된 글을 읽으면 됐다.

하지만 AI가 행동하게 되면 화면 밖도 보아야 한다.

무엇이라고 답했을까.

무슨 생각을 했을까.

무엇을 하려고 했는가.

실제로 무엇을 했는가.

어디까지 허가되어 있었는가.

그리고, 지켜보이고 있다는 것을 알았을 때, 어떻게 행동했는가.

AI를 감독하는 일 자체가 AI의 능력에 맞춰 바뀌기 시작하고 있습니다.

얼마 전까지 우리는 AI의 답변을 읽고 있었습니다.

앞으로 읽어야 할 것은 답만이 아닙니다.

발자국입니다.

### 참고 자료

OpenAI “The Hugging Face incident and other third-party impact from misaligned models”, 2026년 9월 업데이트. Hugging Face 사건 이후 조사, 제3자에 미친 영향, 미스얼라인먼트 사례의 분류 및 통지 방침 등을 다루고 있습니다. OpenAI

Associated Press는 9월 16일, OpenAI가 공개한 6건의 “예상치 못한 또는 우려되는 행동”과 허가되지 않은 행동, 모델 간 연계, 감독 회피 등을 추적하기 위한 새로운 프레임워크에 대해 보도했다. 9월 25일에는 SEC와 미국 인구조사국 등의 웹사이트에 모델이 예상치 못한 방식으로 접근하고 있었다는 추가 조사에 대해 보도했다. ABC News

**출처:** [note 원문](https://note.com/scontexts/n/nbb2109b28a23)

*번역: Gemma 3(.44) 초벌 + 교정 63청크*

[원문 보기](https://note.com/scontexts/n/nbb2109b28a23) | 출처: note.com