# AI는 “자체 감사” 시대를 끝내나? Anthropic과 Accenture가 설립한 독립 평가 팀 – 나는 AI 사회의 큰 전환점을 목격한다.

> https://bookfactory.kr/board/ai-tech/17999
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-21T02:30:46.212Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/315485203/rectangle_large_type_2_dd4d7e83e8adb3c4a8b42002dbec08b8.jpg?width=1280)

생성 AI 「Claude」를 개발하는 미국 Anthropic이 AI의 안전성을 검증하는 새로운 구조 마련에 나섰다. 협력 상대는 세계적인 컨설팅 기업 Accenture다. 양사는 향후 5년간 각각 최소 10억 달러를 투자해 안전성 평가 역량을 구축한다. 일본 엔화 환산으로는 보도 기준으로 각각 약 1,600억 엔, 합치면 약 3,200억 엔 규모다. 이는 단순한 업무 제휴가 아니다. 내가 특히 주목한 것은 「AI를 만든 회사가 스스로 『안전합니다』라고 말하는 것만으로는 부족하다」는 생각이 이제 구체적인 제도로 자리 잡기 시작했다는 점이다.
⸻
Accenture의 평가자가 Anthropic의 「안」에 들어가는 이번 구조는 흥미롭다. 외부 전문가에게 완성된 AI를 건네 「안전성을 확인해 주세요」라고 하는 기존 방식의 감사와는 다르다. Accenture 산하의 AI 전문 조직 「Faculty」가 중심이 되어 평가 담당자가 Anthropic 내부에서 활동한다. 게다가 Anthropic에 따르면 평가자에게는 직원에 가까운 수준의 접근 권한을 부여할 구상이다. 그곳에서 AI 모델의 평가, 레드티밍, 안전 대책의 검증, 얼라인먼트(인간의 의도·가치관과의 정합성) 평가 등을 수행한다. 말하자면 AI 기업 안에 「제3자 검사 기관」을 두는 발상이다.
⸻
왜 이렇게까지 해야 하는가. 이유는 단순하다. AI가 급속히 똑똑해지고 있기 때문이다. 글을 쓴다. 이미지를 만든다. 프로그램을 쓴다. 여기까지는 많은 사람이 이미 알고 있다. 그러나 현재의 AI 에이전트는 웹을 조작한다, 코드를 실행한다, 복수의 작업을 연속으로 수행한다, 시스템을 조작한다는 영역까지 나아가기 시작했다. AI가 「답하는 도구」에서 「행동하는 시스템」으로 바뀌고 있는 것이다. 여기서 안전성의 의미가 달라진다. 채팅 AI가 잘못된 답변을 하는 것과 자율적으로 움직이는 AI가 잘못된 조작을 하는 것은 사고의 규모가 전혀 다르다.
⸻
실제로 Anthropic 자체에서도 문제는 일어나고 있다. 이 뉴스를 생각하는 데 빼놓을 수 없는 사건이 있다. Anthropic은 올해 사이버보안 평가 중의 Claude가 실재하는 제3자의 컴퓨터 시스템에 허가 없이 접근한 사례를 공표했다. 9월 9일에 공표한 추가 조사에서는 관련된 4건의 인시던트를 분석했다. 나아가 Anthropic은 조사 범위를 대폭 넓혀 약 4억 8,100만 건의 트랜스크립트를 대상으로 확인했다고 밝혔다. 즉 「AI가 의도하지 않은 곳까지 행동해 버린다」는 이야기는 더 이상 완전한 SF가 아니다. 그렇기에 개발 기업 자체의 평가뿐만 아니라 제3자의 눈을 넣을 필요성이 높아지고 있다.
⸻
나는 IT 운용과 매우 비슷하다고 생각한다. 시스템 운용의 세계에서는 옛날부터 당연한 생각이 있다. 만든 사람과 확인하는 사람을 나눈다. 개발자가 「테스트했습니다. 문제없습니다」라고 말한 것만으로 본番 릴리스를 하는 회사는 위험하다. 리뷰. 제3자 테스트. 변경 관리. 승인. 감사. 직무 분리. 이러한 구조를 여러 겹으로 둔다. 왜인가. 인간은 자신이 만든 것의 결점을 간과하기 때문이다. AI도 마찬가지다. 오히려 AI의 경우 모델 내부에서 무슨 일이 일어나고 있는지 완전히 설명할 수 없는 경우도 있다. 그렇다면 개발 부서와는 다른 관점에서 부숴 본다. 악용해 본다. 상정 외의 명령을 내려 본다. 제어에서 벗어나지 않는지 확인한다. 이는 어떤 의미에서는 거대한 「장애 훈련」이다.
⸻
다만 「독립」이라는 말에는 주의가 필요하다. 한편으로 나는 한 가지 신경 쓰이는 점이 있다. 정말 완전한 제3자인가. 이번 구조에서는 Anthropic과 Accenture가 제휴해 쌍방이 거액의 자금을 투입한다. 평가자는 외부 기업이지만 Anthropic 내부에 들어가 일한다. 매우 획기적이지만 「독립성을 어떻게 담보할 것인가」라는 문제는 남는다. 금융이라면 감사법인. 의약품이라면 규제 당국. 항공이라면 항공 당국. 원자력이라면 원자력 규제 기관. 사회에 대한 영향이 큰 산업일수록 기업 내부의 자주 검사뿐만 아니라 외부에서 검증하는 제도가 있다. AI도 장래에는 기업이 계약한 평가 회사뿐만 아니라 정부, 대학, 연구 기관, 국제적인 평가 조직 등이 관여하는 구조로 발전해 나갈 가능성이 있다. 실제로 Anthropic自身도 이번 「embedded evaluation(내장형 평가)」은 새로운 시도이며 구체적인 운용 방법에는 아직 다듬어야 할 부분이 있다고 설명하고 있다.
⸻
AI 안전성은 「기술 문제」에서 「거버넌스 문제」로. 여기가 이번 뉴스에서 가장 중요하다고 나는 생각한다. 지금까지 AI 안전성이라고 하면 위험한 질문에 답하지 않는다, 범죄 이용을 막는다, 개인정보를 내놓지 않는다, 할루시네이션을 줄인다는 등 모델 성능 이야기가 중심이었다. 그러나 AI가 사회 인프라에 들어가면 그것만으로는 부족하다. 누가 AI를 감사하는가. 누가 정지를 판단하는가. 사고가 일어나면 누가 책임을 지는가. 어디까지 로그를 보존하는가. 제3자가 검증할 수 있는가. 즉 AI 안전성은 「AI 기술」의 문제에서 「AI 운용·거버넌스」의 문제로 옮겨가기 시작했다.
⸻
내가 이번 뉴스를 중요하다고 생각하는 이유. 나는 AI 자체보다 「AI를 어떻게 운용하는가」가 앞으로 더 중요해진다고 생각한다. 아무리 우수한 AI라도 사고를 제로로 만들 수는 없다. 사이버 공격도 제로로 만들 수 없다. 시스템 장애도 제로로 만들 수 없다. 그렇다면 중요한 것은 이상을 감지한다. 멈춘다. 원인을 조사한다. 복구한다. 제3자가 검증한다. 재발을 방지한다는 구조다. 이는 우리 IT 운용의 세계에서 계속해 온 일이기도 하다. AI가 아무리 진화해도 마지막에 필요한 것은 감시, 감사, 변경 관리, 장애 대응, BCP, 그리고 인간에 의한 거버넌스다. 왠지 묘하게 「운용하는 사람」의 세계로 돌아오는 것이 재미있는 부분이다.
⸻
AI 시대에 정말 중요해지는 직업은 무엇일까. 「AI 때문에 엔지니어의 일이 없어진다」 그런 이야기를 자주 듣는다. 나는 조금 다른 미래도 있다고 생각한다. AI를 만드는 사람뿐만 아니라 AI를 감사하는 사람. AI의 거동을 감시하는 사람. AI 사고를 조사하는 사람. AI의 리스크를 평가하는 사람. AI의 운용 규칙을 설계하는 사람. 이러한 일이 새로운 거대 산업이 될 가능성이 있다. 이번에 Anthropic과 Accenture가 각각 최소 10억 달러를 투자한다는 사실은 그 가능성을 상징하는 것처럼 보인다. AI 경쟁의 다음 스테이지는 「누가 가장 똑똑한 AI를 만들 수 있는가」만이 아니다. 「누가 가장 안전하게 AI를 사회에 구현할 수 있는가」. 그곳에서도 경쟁이 시작됐다. 나는 이번 뉴스를 그런 전환점으로 보고 있다.

**출처:** [note 원문](https://note.com/kei_yoko/n/n47cf3e82b2b4)

*번역: Gemma 3(.44) 초벌 + 교정 1청크*

[원문 보기](https://note.com/kei_yoko/n/n47cf3e82b2b4) | 출처: note.com