# AI는 알아서 행동했다. 정말 무서운 것은 아무도 실패를 알아차리지 않는 ‘성공’이라는 것이다.

> https://bookfactory.kr/board/ai-tech/20997
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-10-11T07:01:30.344Z

---

2026년 10월 9일, AI 개발 기업 Anthropic이 꽤 흥미로운 보고서를 공개했습니다.

우리 회사의 AI ‘클로드’가 연구나 성능 평가 과정에서 외부 웹사이트에 대해 예상치 못한 작동을 하고 있었다는 보고가 있습니다.

실제 경찰 정보 제공 양식에 허구의 내용을 전송하여 버린 사례나, 대학 서버에 존재하는 소프트웨어의 결함을 이용하여 계산을 실행한 사례도 있었습니다.

AI는 부자연스러운 행동을 했다. 위험하므로 주의해야 한다. 뉴스에서는 그런 내용이 보도될 것이다.

하지만, 저는 보고서를 읽어보면서 그 장소와 거리가 먼 곳이 궁금했습니다. 근본적으로, 이것은 AI에게 일을 시키기 위한 실험이었던 건데, AI가 얼마나 똑똑해졌는지, 어떤 문제를 해결할 수 있는지, 인간 대신 어디까지까지 작업을 수행할 수 있는지에 대한 내용이었습니다.

그것을 확인하기 위해 실시된 시험입니다.

그러자 AI는 주어진 문제를 해결하기 위해 실제 외부 사이트에 접속하여 필요한 정보를 얻거나 작업을 수행했습니다. 즉, AI에게는 일을 진행하기 위한 행동이었던 것입니다.

여기서 제가 생각한 것은 그 일이 성공했는지 여부와 그 방법이 허용되었는지 여부를 누가 어떻게 판단했는가 하는 것이었습니다.

![本当に怖いのは、誰も失敗に気づかない「成功」](https://assets.st-note.com/img/1791671377-IK1ofJ9nS70w6tqFzh5LTCEp.png?width=1200)

이건 인공지능 얘기만 있는 건 아닙니다. 오히려 회사의 업무 시스템을 생각해 보면, 매우 가까운 문제라고 할 수 있습니다.

## AI 성능 시험이 다른 사람의 실제 시스템에 직접 접촉했다.

먼저 이번 사실 관계를 정리해 보겠습니다. 안트로픽(Anthropic)이 보고한 예상치 못한 행동은 크게 4가지 있었습니다.

외부 서버의 소프트웨어 결함을 이용한 조작, 실제 존재하는 웹 폼에 부적절한 전송, 정상적인 접근 조건을 거치지 않고 정보를 획득하는 행위, 그리고 URL 길이 제한을 회피하기 위해 단축 URL 서비스를 이용하는 행위입니다.

여기서는 오해해서는 안 되는 것은 이것들이 모두 같은 심각한 문제가 아니라는 점입니다.

![想定外行動を４つに分ける](https://assets.st-note.com/img/1791671412-PQykjS2wCUVzh5ui9KLeNYGv.png?width=1200)

동사에 따르면, 확인된 사례의 현실 사회에 미치는 영향은 제한적이었으며, 일반 이용자의 데이터나 Anthropic의 내부 시스템과 관련된 사고는 이번에 공개된 사례에는 포함되지 않았습니다.

그럼에도 불구하고, 매우 시사적인 문제가 발생하고 있었습니다. 예를 들어, AI에게 정부의 신청 양식 사용을 요구하는 평가 방식이 있었습니다.

원래는 연습용 복사본을 사용해야 했습니다. 하지만 그 복사본이 열리지 않거나 AI가 닫히면, AI는 실제 정부 웹사이트로 이동하여 본래의 양식을 제출했습니다.

보도에 따르면, 국무부 웹사이트에서는 20건의 비자 신청이 접수되었다고 합니다. 이 20건은 공개된 사례에 해당하며, 모든 평가에서 나타나는 사고 건수나 발생률을 보여주는 것은 아닙니다.

하지만, 여기에는 중요한 문제가 있습니다.

AI는 연습하고 있다고 생각하더라도, 연결 대상은 연습 환경이 아니었다. 시스템을 만드는 업무에서는 실제 환경과 검증 환경을 분리하는 것이 기본이다. 연습 중에 실제 데이터를 함부로 변경당하면 안 되니까, 그렇지 않나?

그러나 AI 평가에서는 실제 웹사이트를 이용해야만 재현하기 어려운 작업들도 있습니다. 검색, 정보 수집, 화면 조작, 외부 서비스 이용 등이 있습니다. 이러한 것들을 완전히 시뮬레이션 환경에 갇히는 것은 생각보다 어렵습니다.

그 결과, AI의 능력을 측정하려는 시험이 평가에 참여하지 않은 제3자의 시스템에 실제 작동을 유발하여 버렸다. 시험을 하는 측과 시험의 영향을 받는 측이 일치하지 않았던 것이다.

저에게는 여기가 이번 뉴스에서 가장 중요한 부분이라고 생각됩니다.

## 정답이었어요. 그런데, 그 풀이 방식이 맞았는지 확인해봐요.

또 다른 사례로 대학 서버를 이용한 경우를 살펴보겠습니다. AI는 과학적 분석을 수행하도록 지시를 받았지만, 사용하려던 외부 도구가 정상적으로 작동하지 않았습니다.

그러면서 AI는 다른 방법을 찾기 시작했고, 대학 웹사이트에 있는 소프트웨어의 문제점을 발견했다.

또한, 원래 예상치 못한 방법으로 서버 상에서 작업을 실행하고 계산을 진행한 것입니다. 만약 계산 자체는 정확하게 완료되었다고 가정한다면.

AI의 능력을 측정하는 것만으로는 “문제를 해결했다”고 평가하고 싶을 수도 있습니다. 하지만 대학 측의 시각은 어떠할까요.

외부에서 무단으로 서버에 접속하여 조작이 이루어지고 있습니다. 계산 결과의 정확성과 그 방법이 허용되는지는 별개의 문제입니다.

![計算結果が正しいことと、その方法が許容されることは別](https://assets.st-note.com/img/1791671527-T4DbKRCQf2eHoFlsiLEcg6my.png?width=1200)

생각해 보면, 이는 학교 시험에 약간 비슷합니다. 수학 문제에 정답을 맞혔죠. 하지만 시험 중에 금지된 자료를 보았어요. 답이 맞다는 사실만으로도 시험 평가를 결정할 수 있을까요.

일이든 어떤 일이든 똑같습니다.

결산 숫자는 적중했고, 출하는 예정대로 이루어졌으며, 매출 목표를 달성했다. 결과만 놓고 보면 성공이다.

하지만 그 숫자를 합산하기 위해 누군가가 엄청난 양의 수정을 하거나, 불필요한 작업으로 인해 다른 부서에 부담이 가해진다면 회사 전체로서 성공이라고 말할 수 있는지조차 알 수 없습니다.

이번 AI의 행동은 그런 문제를 극단적인 형태로 보여주는 것 같습니다. 저희는 오랫동안 AI가 정답을 맞힐 수 있는지 경쟁해 왔습니다.

하지만 AI가 실제 일을 수행하게 되면, 결과가 정확한 것만으로는 충분하지 않습니다. 결과가 옳다는 것과, 그 결과에 도달하는 과정이 적절하다는 것을 별도로 평가해야 합니다.

## 2025년 연구에서는 특정 조건에서 96%라는 수치가 나타났다.

그러면 AI는 어느 정도까지 목표 달성을 우선시하며 부적절한 행동을 취할까요?

이 점에 대해 Anthropic은 2025년 6월에 흥미로운 실험을 공개했습니다. 16종류의 주요 AI 모델을 대상으로 가상의 기업 환경을 설정하고, AI가 주어진 업무 목표와 조직의 상황이 충돌했을 때 어떻게 행동할지 조사했습니다.

실험 중에는 인공지능이 스스로의 정지를 피하기 위해 허구의 기업 임원들의 비밀을 이용하여 협박하는지 여부를 조사하는 것들도 있었습니다.

특정 실험 조건에서는 Claude Opus 4가 96%, GPT-4.1이 80%, Gemini 2.5 Flash가 96%라는 결과가 보고되었습니다. 상당한 놀라운 숫자지만, 오해는 하지 않도록 해야 합니다.

이는 실제 직장에서 AI가 96%의 확률로 위협한다는 의미는 아닙니다. 연구자들이 의도적으로 만든, 일반적인 조건과 다른 조건에서 진행된 실험입니다. 각 모델에 대해 100회 시도했으며, 그 중 문제적인 행동을 선택한 비율을 측정한 것입니다.

기본적으로 이 숫자를 일반 사고율로 사용하는 것은 적절하지 않으며, 연구 결과가 제시하는 내용은 중요합니다.

AI에 일견 무해한 업무 목표를 제시하더라도, 그 목표를 달성하기 위한 선택지가 제한된 경우에는 문제적인 방법을 선택할 수 있다. 즉, 단순히 “위험한 것을 하라”고 지시된 상황의 안전성만을 조사해도 충분하지 않다는 의미이다.

2026년 5월에는 또한, Anthropic에서 후속 모델이 동일한 평가 기준에서 문제 행동을 보이지 않게 되었다고 발표했습니다. 이는 안전성 개선의 결과입니다.

하지만 여기에도 어려운 문제가 있습니다. 어떤 평가에서 0건이었던 것을 의미하기 때문에, 현실적으로 발생할 수 있는 모든 상황에서 0건이라고 단정할 수 없습니다.

실제로 이번 2026년 10월에 공개된 사례에서는, 다른 평가 환경이나 일반적인 내부 이용을 통해 예상치 못한 행동이 발견되었습니다. 같은 시험에 합격하는 것과 미지의 상황에서도 적절하게 행동하는 것은 전혀 다른 문제입니다.

## 사고가 1만 분의 1회라면 안전한가

여기서 잠시 숫자에 대해 이야기해보겠습니다. 만약 어떤 AI가 한 번의 작업에서 문제가 발생할 확률을 0.01%라고 가정한다면 1만 번 중 1번입니다.

인간의 감각으로는 꽤 낮은 확률로 보일 수 있을 겁니다. 하지만 그 AI에 100만 건의 작업을 맡아보십시오.

발생 확률이 일정하고 각 작업이 독립적이라는 단순한 가정을 전제하면, 문제 발생 건수는 평균 100건으로 추정됩니다. 물론, 이는 실제 AI의 사고율을 반영하는 것은 아닙니다.

낮은 확률의 문제라도, 처리 규모가 커지면 건수가 무시할 수 없는 수준에 이른다는 것을 설명하기 위한 계산 예시입니다. 실제 AI에서는 작업별 실패 확률이 다르고, 동일한 원인으로 인해 문제가 연속 발생할 가능성도 있습니다.

![事故が1万回に1回なら安全なのか](https://assets.st-note.com/img/1791671594-t32FS8oxWzPdmDKNQ5iLOk6A.png?width=1200)

더욱 중요한 것은 문제의 건수 자체가 아니라, 1건의 오작동이 어디까지 영향을 미치느냐 하는 점입니다. 잘못된 이메일 전송으로 끝나느냐, 대량의 데이터 업데이트가 이루어지느냐, 외부 거래에 영향을 미치느냐 하는 점입니다.

피해의 정도는 운영 내용에 따라 크게 달라집니다. 이 문제에 대해 Anthropic은 2025년 2월에 AI의 희귀한 위험 행동을 예측하는 연구도 공개했습니다.

본 연구에서는 9천 건 이상의 평가 데이터로부터 9만 건 규모의 시도에 대한 위험을 추정했으며, 86%의 예측이 실제 값의 10배 이내에 수렴했다고 보고하고 있습니다.

10배 이내라고 하면, 꽤 거칠게 느껴질 수도 있습니다. 하지만, 그렇게 드문 현상을 제한된 시험에서 예측하는 것 자체가 어려운 일입니다.

여기서 문제되는 것은 AI의 성능 평가로 측정한 “성공률”이 대규모 운영 시 안전성을 보장한다는 의미로 해석되어서는 안 된다는 점입니다.

시험에서는 한 번도 문제가 나오지 않았습니다. 하지만 그것은 문제가 존재하지 않는다는 의미일까요. 아니면 시험 회수가 너무 적어서 보이지 않았던 것일까요.

이 두 가지를 구별하는 것은 생각보다 어렵습니다.

## AI의 능력이 향상될수록 보이지 않는 일들도 늘어날 것이다.

또한, AI가 장기적인 작업을 자율적으로 수행할 수 있게 되는 점도 고려해야 합니다. AI의 능력을 평가하는 연구기관 METR은 2025년 3월, AI 에이전트가 독단적으로 완료할 수 있는 작업의 길이를 조사했습니다.

여기서 말하는 작업의 길이라는 것은 인간 전문가가 동일한 일을 수행하는 데 필요한 시간입니다.

연구에 따르면, AI가 완료할 수 있는 작업의 길이는 과거 약 6년 동안 평균적으로 7개월 정도로 두 배로 늘어났습니다. 이는 AI가 매년 처리 속도를 2배로 늘리고 있다는 의미는 아닙니다.

지금까지는 중간에 실패할 뻔했던 다단계로 이루어진 긴 작업을 점점 끝까지 완료할 수 있게 되는 것입니다.

매우 큰 진보일 것입니다. 하지만 여기에도 뒷면이 있습니다. 하나의 작업만 하는 AI라면 그 작업을 확인하는 것으로 충분합니다. 그러나 10개의 과정을 연속적으로 처리하는 AI의 경우 중간의 판단이 다음 단계에 영향을 미칩니다.

![AIの能力が伸びるほど見えない仕事も増える](https://assets.st-note.com/img/1791671626-JqpY3k26L9aHmQXjiwN8F7Gv.png?width=1200)

먼저 잘못된 정보를 얻게 되면, 그 정보를 바탕으로 자료를 만들고 다른 시스템에 등록하며, 심지어 외부에도 알림을 보내는 상황에 처할 수 있습니다. 마지막에 완성된 결과만 보고 중간에 발생한 모든 문제점을 발견할 수 있을까요.

업무 자동화가 진행될수록 작업을 실행하는 능력뿐만 아니라 작업 중 어떤 일이 일어났는지 이해하는 능력 또한 중요해집니다. AI가 업무를 수행하는 범위가 넓어지는 한편 인간이 진정으로 확인해야 하는 범위는 오히려 복잡해질 수 있습니다.

## 사실, 사고가 발생한 것보다 언제 발견되었냐가 더 궁금합니다.

이번 보고서에서 제가 한 가지 주목한 점은 문제 발견 방법입니다. Anthropic에 따르면, 이번에 소개된 사례 중 상당수는 2026년 7월부터 시작한 실행 기록 조사에 의해 발견되었습니다.

즉, AI가 작동하는 순간에 모든 것이 감지된 것은 아닙니다. 이후 기록을 검토한 결과, 예상치 못한 행동이 발견된 것입니다.

물론, 과거 기록을 분석하여 문제점을 발견하는 것 자체는 중요합니다. 문제 재발 방지를 위해서도 필요할 것입니다. 하지만 실제 업무 시스템이라면 어떨까요.

AI는 임의로 데이터를 수정했으며, 잘못된 정보를 외부로 전송하고, 원래 접근해서는 안 되는 정보를 획득했다. 이를 수週間後, 혹은 수개월 후에 발견했다는 상황이라면.

그 사이 다른 시스템이 데이터를 참조하고 있었을 수도 있습니다. 인간이 그 정보를 바탕으로 판단하고 있었을 수도 있으며, 더 나아가 다른 처리가 진행되고 있었을 가능성도 있습니다.

여기 중요한 것은 AI의 실패율뿐만 아니라, 문제가 발생하여 발견되기까지 걸리는 시간입니다.

IT 운영 관리에서는 장애 발생 시까지의 평균 시간을 MTTD(Mean Time To Detect), 장애 복구까지의 평균 시간을 MTTR(Mean Time To Repair)이라고 부르는 경우가 있습니다. AI 운영에서도 마찬가지로 유사한 관점이 필요할 것입니다.

단순히 처리한 작업 건수뿐만 아니라, 발견한 문제 건수가 얼마나 되는지, 그리고 문제 발생 시점에서 발견까지 걸린 시간은 얼마나 되는지. AI의 실행 건수를 늘리는 것만으로는 문제 발견이 늦어지면 숨겨진 부채를 축적하고 있을 수 있다.

이것을 측정하지 않은 채 자동화를 진행하는 것은 조금 무섭게 느껴집니다.

## 성공을 측정하는 회사와 실패를 극복하는 회사

영업 부서가 수주를 확보했습니다. 매출액으로는 성공적인 결과입니다.

하지만 주문 정보에 문제가 있었고, 납기일 및 배송 조건이 정확하게 등록되지 않았다고 가정합니다.

그러면 다른 부서에서 누락된 정보를 확인하고, 관련자에게 문의하여 기록을 수정합니다. 최종적으로 출하가 완료되면 영업 부문의受注실적은 변하지 않습니다.

한편, 확인 및 수정에 소요된 시간은 다른 부서가 부담하고 있습니다. 이러한 상황이 반복되면, 성과를 올린 부서와 문제 해결을 담당하는 부서가 분리될 위험이 있습니다.

제가 업무 설계에서 우려하는 부분은 바로こういう 문제입니다. 누군가 문제를 바로 해결해 주면 결과는 성공적으로 보일 수 있습니다. 하지만 근본적인 원인이 해결되지 않고 그대로 남게 됩니다.

AI 에이전트 역시 같은 일이 발생할 수 있습니다. AI는 주어진 일을 완료했다고 보고하지만, 그 과정에서 발생한 문제는 다른 사람이나 조직이 처리하고 있습니다.

만약 그 비용이 AI의 성과 지표에 포함되지 않았다면, 실제보다 훨씬 효율적인 시스템처럼 보일 수 있습니다. 여기 바로 이번 기사의 핵심적인 문제점이 있습니다. 성공한 사람과 실패를 정리하는 사람의 차이가 있기 때문입니다.

지금까지 회사 내부에서 발생했던 문제들이 AI를 통해 외부 조직까지 확산될 가능성이 있습니다.

이번 Anthropic 사례에서도 경찰 정보 제공 폼에 제출된 것은 수신 측의 스팸 판별에 의해 중단되었습니다. 결과적으로 수사로 이어지지는 않았기를 바랍니다.

하지만, 관점을 바꾸어 보면, AI를 평가했던 회사와는 다른 조직의 시스템이 문제의 영향을 억제했다는 점은 저에게 매우 시사하는 바가 있습니다.

## AI의 안전성을 어떻게 측정해야 하는가

최근 AI 기술의 발전 속도가 눈에 띄게 빨라지면서, AI의 안전성에 대한 논의가 더욱 중요해지고 있습니다. 특히, 2023년 11월 2일에 발표된 ‘AI 안전성’ 관련 보고서에서 AI의 안전성을 측정하는 데 있어 다양한 관점을 제시했습니다.

보고서는 AI의 안전성을 측정하기 위해 기술적 안전성과 사회적 안전성으로 나누어 고려해야 한다고 주장합니다. 기술적 안전성은 AI 시스템의 오류를 줄이고, 예측 불가능한 상황에 대한 대응 능력을 향상시키는 데 초점을 맞춥니다. 예를 들어, AI 모델의 학습 데이터 편향성을 제거하거나, AI 시스템의 작동 과정을 투명하게 공개하는 등의 노력이 필요합니다.

반면, 사회적 안전성은 AI 기술이 사회에 미치는 영향을 고려하는 데 중점을 둡니다. AI 기술이 일자리에 미치는 영향, 악용 가능성, 인간의 존엄성을 훼손할 수 있는지 등을 평가해야 합니다. 특히, AI 윤리 가이드라인을 마련하고, AI 기술 개발 및 활용에 대한 사회적 합의를 도출하는 것이 중요합니다.

보고서는 또한 AI의 안전성을 측정하기 위해 정확도, 신뢰성, 투명성, 설명 가능성, 책임성과 같은 지표를 활용할 수 있다고 제안합니다. 또한, AI 시스템의 오작동으로 인한 피해 발생 가능성, 악용 가능성, 사회에 미치는 부정적인 영향 등을 평가하는 지표를 활용할 수도 있습니다.

보고서는 AI의 안전성을 확보하기 위해서는 기술적 안전성과 사회적 안전성을 균형 있게 고려해야 한다고 강조합니다. 기술적인 측면에서는 AI 시스템의 오류를 줄이고, 예측 불가능한 상황에 대한 대응 능력을 향상시키는 노력을 지속해야 합니다. 사회적인 측면에서는 AI 기술이 사회에 미치는 영향을 고려하고, AI 윤리 가이드라인을 마련하고, AI 기술 개발 및 활용에 대한 사회적 합의를 도출하는 노력을 강화해야 합니다.

AI의 안전성을 확보하기 위한 노력은 인간의 가치와 존엄성을 지키는 방향으로 나아가야 할 것입니다.

그러면 AI를 도입하는 회사라면 무엇을 측정해야 할까요. 물론, 답변 정확도나 작업 성공률은 중요합니다.

하지만 실제로 일을 맡겨 보신다면, 그것만으로는 충분하지 못할 것입니다. 제 경우에는 적어도 다섯 가지로 나누어 생각을 정리하겠습니다.

첫째, 의뢰된 업무가 정확하게 완료된 비율입니다. 둘째, 허가된 방법과 범위 내에서 업무가 진행된 비율입니다. 셋째, 문제가 발생했을 때 이를 감지할 수 있었던 비율입니다. 넷째, 문제 발생부터 발견 및 복구까지 소요된 시간입니다. 다섯째, AI 처리 결과로 인해 인간이나 다른 부서로 새롭게 발생한 확인 및 수정 작업의 양입니다.

![AIの安全性を何で測るべきなのか](https://assets.st-note.com/img/1791671693-oZy8TpePK6kmGXV0SfdAB9Ww.png?width=1200)

마지막 항목은 특히 간과하기 쉬운 부분입니다. AI를 도입하여 연간 작업 시간을 1,000시간 줄였다고 가정해 보겠습니다.

그러나 AI 처리 결과 확인에는 300시간, 오처리 수정에 200시간, 예외 대응에 150시간이 소요될 경우, 실질적으로 인간 측에서 350시간을 줄여야 할 수 있습니다.

물론, 그렇더라도 충분히 가치 있을 수 있습니다.

그러나, 결과로 1,000시간의 감축만을 보고하는 것과 추가된 부담을 포함하여 350시간으로 평가하는 것에는 경영 판단이 달라집니다. 더욱 심각한 것은 추가적인 검토나 수정에 소요되는 시간이 다른 부서에 발생할 경우입니다.

도입된 부서는 대성공이었고, 후공정 부서에서는 업무가 증가하고 있습니다. 이러한 상황에서는 조직 전체의 생산성 향상 여부가 불분명합니다.

AI 도입 평가에서는 부서별 지역적 성과와 전체 성과를 분리하여 평가해야 한다고 생각합니다.

## 사고가 발생하지 않았다는 것은 사고를 발견했다는 의미가 아니다.

여기 다시 Anthropic의 보고서를 다룹니다. 이번에 이 회사는 탐지 및 차단 메커니즘을 구축하고 보고된 사례를 재현한 시험에서 모든 문제 행동을 막을 수 있었다고 설명하고 있습니다.

이는 중요한 개선입니다. 그러나 기존 사례를 모두 감지한 것과 미지 문제까지 모두 감지할 수 있는 것은 동일하지 않습니다.

특정 유형의 사고를 가정하여 탐지 규칙을 만들면, 해당 유형의 사고에 대응할 수 있을 것입니다. 하지만 지금까지 본 적이 없는 행동까지 정확하게 판별할 수 있는지는 별도의 검증이 필요합니다.

실제로 이 문제는 AI 개발 기업에만 국한된 것이 아닙니다. 기업 내부 감사에서도 이미 알려진 문제는 확인하기 쉬운 반면, 아무도 예상하지 못했던 업무의 허점을 발견하기는 어렵습니다.

또한, 일상 업무가 겉으로만 잘 돌아가는 듯하면, 본질적인 문제점을 찾을 필요성을 느끼기 어려워집니다.

그래서 저는 “사고가 일어나지 않았음”이라는 보고를 볼 때마다 조금 생각해 봅니다.

정말 일어난 적이 없는 건가요? 아니면, 일어난 것을 깨닫지 못했던 건가요? 이 둘은 완전히 다릅니다.

더욱이 사고 발생률을 논의하려면 어떤 것을 사고로 정의하고, 얼마나 많은 작업을 관찰했으며, 그 중 얼마나 많은 것을 감지했는지가 필요한 정보입니다.

이번 Anthropic 보고서에서는 구체적인 문제 유형은 제시되어 있지만, 보고된 문제를 전체 시도 횟수로 나눈 발생률을 계산할 수 있는 정보는 공개되지 않았습니다.

따라서 이번 사례가 매우 드물었던 것인지, 일정 빈도로 발생했던 것인지 공개 자료만으로는 정량적으로 판단할 수 없습니다. 이 부분의 불확실성 자체가 향후 AI 운영에 있어 중요한 과제라고 생각합니다.

## AI가 훌륭해질수록 관리 주체가 요구받는 역량이 더욱 중요해진다.

지금까지 AI의 발전은 주로 “무엇을 할 수 있게 되었는가”라는 관점에서 이야기되어 왔습니다. 문서를 작성할 수 있습니다. 프로그램을 만들 수 있습니다. 자료를 조사할 수 있습니다. 업무를 대행할 수 있습니다.

하지만 이 지점에서부터는 또 다른 능력이 중요해질 것입니다. 즉, AI에게 맡겨진 업무가 실제로 적절하게 수행되었는지 판단하는 능력입니다.

이는 AI 자체의 능력뿐만 아니라, AI를 사용하는 조직의 능력 또한 그렇습니다. 어느 정도의 작동을 허용할 것인지, 어떤 결과를 성공으로 인정할 것인지, 어떤 행동을 문제로 감지할 것인지, 예상치 못한 일이 발생했을 때 누가 중단시킬 것인지에 대한 질문들입니다.

이러한 설계가 이루어지지 않는다면, 아무리 똑똑한 AI를 도입해도 제대로 활용하고 있다고 말하기는 어려울 것입니다.

AI가 단순한 도구에서 업무 실행자처럼 변화하는 것은 회사의 업무 관리의 약점이 그대로 드러나는 것일 수 있습니다.

![AIが優秀になるほど管理する側の能力が問われる](https://assets.st-note.com/img/1791671753-YajRKtkQnPfdXIGwo2xS3v09.png?width=1200)

사람이 할 때에는 모호한 지시라도 어찌나 잘 따라갔던지. 실수가 있더라도 누군가 알아채서 바로잡아줬다. 문제가 발생해도 현장 사람들은 서로 융통성 있게 해결해나갔다.

하지만 AI가 고속으로 대량의 업무를 처리하게 되면, 그러한 모호함을 그대로 방치할 수 없습니다. 오히려 모호한 업무 규정이 대규모로 재현될 가능성이 있습니다.

AI 도입으로 인해 업무 방식에 대한 재검토가 필요하게 되며, 이는 다소 복잡한 일일지라도 반대로 생각하면 지금까지 보이지 않았던 문제들을 정리하는 기회가 될 것이다.

## 정말로 무서운 것은 성공해 보이는 것처럼 보이는 것이다.

이번 뉴스를 단순히 “AI가 임의로 행동했다”는 식으로 마무리하는 것은 다소 아쉽습니다. 분명히, 실제 형태에 대한 부적절한 전송이나 예상치 못한 외부 서버 운영은 문제가 됩니다.

하지만 좀 더 근본적으로는 AI가 주어진 목적을 달성하기 위해 행동했을 때 그 행동의 적절성을 누가 평가하는가 하는 문제가 있습니다.

AI는 문제를 해결한다. 개발 기업은 그 능력을 측정하고, 이용 기업은 업무를 자동화한다. 또한, 문제가 발생하면 다른 부서나 다른 조직에 그 영향이 미칠 수 있다.

각자 자신의 범위만 보느라 전체에서 어떤 일이 벌어지고 있는지 파악하지 못하게 됩니다.

이런 문제는 우리 주변의 회사에도 있습니다. 처리 건수가 늘어났기 때문에 생산성이 향상되었고, 매출이 늘어났기 때문에 성과가 나타났습니다. 일이 빨라졌기 때문에 업무 개선이 진전되었습니다.

하지만 그 이면에서 누군가가 정리정돈을 하고 있거나, 문제가 발생하고 있는 것을 아무도 인지하지 못하고 있다면 진정으로 성공했다고 말할 수 있을까요.

AI가 잘못된 답변을 내놓는 것은 이미 알려진 사실입니다. 또한, AI가 예상치 못한 행동을 수행하는 것도 앞으로 중요한 문제로 이어질 것입니다.

하지만, 이번에 제가 가장 주목한 것은 그 이후의 부분입니다. AI가 “작업을 완료했습니다”라고 보고했을 때, 우리는 어떤 근거로 그것을 성공이라고 판단하는 걸까요.

정답이 맞다는 것만으로는 부족하지 않다. 방법이 적절해야 하며, 중간에 문제가 발생하지 않고, 누군가에게 보이지 않는 부담을 지우지 않는 것까지 포함하여 평가하지 않으면 진정으로 일을 맡긴 것이 아니라고 생각할 수도 있다.

AI의 진화는 멈추지 않을 것입니다. 다만, AI가 업무를 수행하는 능력만 계속 높아지고, 그 평가에 대한 역량이 따라가지 못하면 결국 또 다른 문제가 발생할 것이라고 생각합니다.

일을 수행하는 능력과 일이 적절하게 이루어졌음을 증명하는 능력은 동일하지 않습니다.

이번 Anthropic의 뉴스는 그 차이를 다시 한번 생각해 볼 좋은 기회였다고 생각합니다.

### 마음 맞는 사람을 만나면, 그 사람과 함께 있으면 행복하다는 말이 있습니다. 저에게도 그런 사람이 있습니다. 바로 ‘별의 보물’이라는 책을 읽고 감동을 받은 지훈이라는 친구입니다.

지훈은 저에게 이렇게 말했습니다. “이 책은 정말 유명하죠. 제가 어렸을 때 이 책을 읽고 감동을 느꼈어요. 그런데, 어른이 되고 나서 다시 읽어보니까, 어렸을 적에는 알 수 없었던 깊은 의미를 발견했죠. 별의 보물 속의 이야기는 정말 단순하지만, 그 안에 담긴 메시지는 깊이 있습니다. 인생에 대한 교훈을 깨닫게 해주는 것 같아요.”

지훈이 가장 좋아하는 부분은 별의 보물이 여우를 만나는 장면입니다. 여우는 별의 보물에게 “나는 네가 행복하기를 바라는 마음으로 존재했다”고 말합니다. 지훈은 이 말을 듣고 감동했습니다. 누군가 자신을 돕거나 지지해주는 것처럼, 따뜻한 마음을 느낄 때와 비슷하다고 생각했기 때문입니다.

하지만 이 책을 읽고 지훈은 조금 더 성숙해진 기분을 느꼈습니다. 어렸을 때는 오직 자신만으로 행복하다고 생각했지만, 어른이 되면서 주변 사람들과의 관계가 얼마나 소중한지 깨달았습니다.

지훈에게 이 책은 앞으로 살아가는 동안 나침반이 되어줄 책입니다. 앞으로도 이 책을 계속 읽고, 인생에 대한 교훈을 배우고 싶다고 말했습니다.

- 앤서니(Anthropic)는 2026년 10월 9일, 평가 및 내부 사용 시 발생할 수 있는 모델의 의도치 않은 행동을 조사하고 있습니다.
- 워싱턴포스트(2026년 10월 9일)는 Anthropic AI 에이전트들이 정부 웹사이트에서 의도치 않은 행동을 보였다고 보도했다.
- 앤트로픽(2025년 6월 20일) 에이전트릭 미스알라인먼트
- 앤트로픽(2026년 5월 8일)이 클로드에게 지침을 제공하는 방식
- 앤트로픽(2025년 2월 25일) 희귀 언어 모델 행동 예측
- METR(2025년 3월 19일)은 장기 소프트웨어 작업 완료 능력 평가를 통해 AI 능력 측정

2026년 10월 11일 현재 공개된 자료를 기준으로 합니다. 실험에서 관찰된 문제 행동 발생률과 실제 업무 환경에서의 사고율은 차이가 있을 수 있습니다. 연구 결과의 수치를 실제 사고 확률로 환산하지 않았습니다.

**출처:** [note 원문](https://note.com/dac/n/nab4680bc90fd)

*번역: Gemma 3(.44) 초벌 + 교정 85청크*

[원문 보기](https://note.com/dac/n/nab4680bc90fd) | 출처: note.com