# 3만 개의 AI 에이전트, 인간은 감시할 수 없다: Anthropic이 제시한 “Human in the Loop의 다음”

> https://bookfactory.kr/board/ai-tech/18615
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-26T06:21:46.835Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/315932060/rectangle_large_type_2_c3600c9f0b69c70804f824453356f735.png?width=1280)

AI에 최종 판단을 맡기지 않는다. 인간이 확인하고, 문제 발생 시 즉시 중단한다.

기업의 인공지능 거버넌스에서는 이러한 원칙들이 자주 언급됩니다.

그러나 AI 에이전트가 수만 건 단위로 움직이고, 1개월에 10억 건을 넘는 판단을 수행하게 되면서 인간의 확인이 정말로 가능한가요?

Anthropic는 2026년 9월 20일에 공개한 내부 데이터에서 이 문제를 상당히 구체적인 수치로 보여주었습니다.

동사무소에서는 주요 연구·개발 기반만으로도 약 3만 개의 AI 에이전트가 동시에 가동되고 있습니다.

여기 진행되고 있는 것은 단순한 ‘인간 중심’ 방식이 아닙니다.

기계가 감시하고 위험한 것을 차단하며, 이상 징후를 분석하여 인간이 진정으로 봐야 할 정보만 제공한다.

AI 에이전트 시대의 인간 통제는 이미 그 단계에 들어갔습니다.

## 클로이드는 AI 개발을 주도하고 있다고 보도되고 있습니다.

Anthropic는 이번에 공개한 것이 프론티어 AI 개발 속도를 외부에서 파악하기 위한 세 가지 측정 방법입니다.

R&D 자동화 지수입니다.

2026년 8월 기준으로, Claude는 Anthropic의 AI 연구 개발 업무의 26%에서 “AI 리드(AI Leads)” 단계에 있다고 평가됩니다.

이는 인간의 감독이 남아있는 가운데, 고수준의 지시를 받으면 업무의 대부분을 AI가 엔드 투 엔드 방식으로 완수하는 상황입니다.

AI 협업은 90% 이상을 달성합니다.

완전 자율의 영역은 아직 없다.

그러나 AI가 연구자를 보조하는 수준에서, 일정 수준의 업무에서는 AI 스스로가 업무를 주도하는 단계로 전환되고 있다는 사실이 수치로 나타났습니다.

이는 AI 연구소만의 이야기가 아닙니다.

영업, 회계, 조달, 법무, 개발, 고객 지원 업무 모두 동일 방향으로의 전환이 가능합니다.

AI는 “답변하는” 것뿐만 아니라

- 다수의 공정을 맡다
- 다른 인공지능에게 일을 넘기다
- 외부 시스템을 운영합니다.
- 조건을 확인하며 다음 행동을 결정한다.

결국 인간이 일일이 확인하는 방식은 한계에 부딪힐 것입니다.

## 약 3만 명의 에이전트들을 어떻게 감시하고 있는 것일까요?

더욱 중요한 것은 Anthropic의 에이전트 모니터링입니다.

본사와 동일한 주요 내부 연구 및 개발 플랫폼에서는 2026년 8월 현재 약 3만 명의 에이전트가 동시에 운영되고 있습니다.

Anthropic는 그 활동을 크게 두 가지 감시 시스템에 보고합니다.

하나로는 “온라인 감시”입니다.

에이전트가 행동을 취하기 전에 감시하고 위험한 행위를 차단하거나 다른 행동으로 유도합니다.

예를 들어, 모델의 가중치를 외부로 복사하는 행위는 실행되면 되돌리기 어려운 행동입니다.

Anthropic에 따르면 대상 에이전트의 액션은 100% 이 모니터링을 통과합니다.

8월에 분석한 10억 건 이상의 판단 중 약 0.002%로, 4만 7,700건 중 1건이 차단된 것으로 보고되었습니다.

또 하나는 “오프라인 모니터링”입니다.

이후에는 행동 후 기록을 확인합니다.

매주 약 10만 건의 트랜스크립트가 플래그되고, 여러 분류기들에 의해 필터링된 후, 최종적으로 우선 순위가 높은 약 50건이 인간의 검토를 위해 올라옵니다.

여기 중요한 것은,

인간이 모두 확인하고 있습니다.

그렇지 않다는 것입니다.

3만 명의 에이전트와 10억 건 이상의 판단을 인간이 하나하나 보게 되는 것은 불가능합니다.

기계가 막대한 양의 판단을 감시하고, 그 중에서도 인간이 주목해야 할 것들만 선별하고 있습니다.

## 인간 중심 설계만으로는 실현할 수 없다

AI 책임 설계는

AI에게 무엇을 맡기고, 인간은 어디에서 판단, 승인, 개입하며, 최종 책임은 누가 지는지에 대한 질문입니다.

결정을 내리겠습니다.

하지만 AI 에이전트의 수와 처리 속도가 증가한다면 “인간을 루프에 넣는다”라는 표현만으로는 설계가 이루어지지 않습니다.

AI에게 권한을 부여할 때, 최소한 다음 네 가지를 확인해야 한다고 생각합니다.

- 역행성: 실행 후 이전 상태로 복귀할 수 있는가
- 영향도: 오차 발생 시 손실이 얼마나 확대될 수 있는지
- 검출성: 뒤에서 이상을 발견할 수 있는가
- 인간에 의한 설명이나 승인이 어디까지 요구되는가

이번 Anthropic의 방식은 특히 “역가능성”과 “탐지성”을 고려하는 데 유용한 사례입니다.

모델의 가중치 외부 유출과 같이 한 번 실행되면 회수가 어렵고 영향 또한 크므로 실행 후의 감사에서는 이미 늦은 것입니다.

그러므로 실행 전에 멈추십시오.

한편으로, 시간이 지남에 따라 나타나는 이상 경향이나, 추후 검증 및 어느 정도 수정이 가능한 경우까지 모두 사전에 승인했다면 처리가 멈추게 됩니다.

그러므로, 사후 감시로 전환하겠습니다.

그러다 방대한 기록들을 기계로 먼저 선별하고, 그 중 일부만 사람에게 전달한다.

이는 “인간과 AI 중 하나를 선택하는” 이분법적 선택이 아닙니다.

위험의 성질에 따라 인간이 들어갈 위치 자체를 변화시키는 설계입니다.

## 경영자가 결정해야 할 것은 “확인 여부”가 아니라 “어디까지 중단하는가”이다.

예를 들어, AI 에이전트에게 조달 업무를 맡기는 사례를 고려해 보겠습니다.

과거의 가격 정보를 정리한다. 여러 공급처를 비교한다. 발주안을 만든다.

이 단계에서는 AI를 보조 또는 제안으로 활용할 수 있습니다.

그러면 기존 거래선에 대한 소액 발주까지도 AI가 자동으로 실행하는 방안을 고려해 볼 수 있을까요.

일정 금액 이하로, 취소 가능하며, 비정상 발주를 사후에 쉽게 감지할 수 있다면 자동화될 수 있는 범위는 더욱 확대됩니다.

한편으로

- 신규 거래처 등록
- 송금 계좌 변경
- 고액 발주
- 장기 계약 체결

그것은 본질적으로 다릅니다.

실수를 하거나 오르면 영향이 크고, 취소하기도 어렵습니다.

이 영역에서는 실행 전에 인간의 승인을 받거나, 최소한 AI 단독으로는 실행할 수 없는 기술적 제약 조치를 부과해야 합니다.

결국, “AI를 사용하느냐 사용하지 않느냐”를 결정하는 것이 아니라.

같은 업무 안에서도

자동 보조 제안 경고

분할해야 합니다.

## 모니터링에는 KPI가 필요합니다.

이번 Anthropic의 공개에서도 중요한 점은 감시 자체를 수치화하고 있다는 것입니다.

제시된 내용은 다음과 같습니다.

- 감시 영역
- 리뷰 작성까지 소요된 시간
- 블록 및 에스컬레이션 비율

이러한 지표입니다.

이는 기업의 AI 운영에도 그대로 적용할 수 있습니다.

로그를 기록했습니다.

그것만으로는 충분하지 않습니다.

묻어야 할 것은,

로그의 몇 퍼센트를 모니터링하고 있는가?

이상사 발생 이후, 몇 분, 몇 시간, 몇 일에 걸쳐 확인되는지.

어떤 조건에서 인간으로 올라갈 수 있는가.

중요한 행위는 실행 전에 저지될 수 있는가.

감시에서 누락된 것을 어떻게 감지할 것인가.

그 정도로 결정이 확정되면 처음으로 운영 설계를 진행합니다.

AI 책임 설계 연구회에서 정리하고 있는 8가지 항목 중에서는 이것이 “②업무 판단 및 인간 확인 범위”만을 의미하는 문제가 아닙니다.

⑥ 책임 배분 및 독립 검증자

또한,

⑧ 지속 운영 및 노후화 대응

이 게시글도 다른 게시글과 연결됩니다.

도입 시에는 안전했던 시스템이라도, 모델 능력이 향상되고 연결 대상이 늘어나며 에이전트에 부여하는 권한이 확대되면 모니터링 설계는 쓸모없게 됩니다.

도입 시점에 한 번 승인된 것으로 끝이 아닙니다.

AI의 능력과 권한이 변할 때마다 감시 방식을 바꿔야 합니다.

## AI가 발전할수록 인간은 모든 것을 보지 못하게 된다.

AI 발전으로 인해

마지막으로 사람이 확인하면 된다.

이런 사고방식은 이해하기 쉽습니다.

하지만 3만 명의 에이전트와 10억 건이 넘는 판단을 앞두고 보면 그 전제는 무너집니다.

그렇다고 해서 인간의 역할이 사라지는 것은 아닙니다.

오히려 그렇습니다.

인간은 개별적인 처리를 하나씩 확인하는 일에서

무엇을 자동으로 통과시킬지

무엇을 기계적으로 멈추는가

사람에게 무엇을 전달할까요?

저는 설계 업무로 옮겨갑니다.

경영자가 AI 도입 시 확인해야 할 점은 “인간의 개입 여부”가 아닌 것입니다.

역행적이고 영향력이 큰 행위는 실행 전에 중단될 수 있는가.

역행 가능성은 사후 감시를 통해 회복 가능한가?

이상 정도를 어느 정도 감지할 수 있는가.

어떤 조건에서 인간으로 에스컬레이션을 할 것입니까?

또한, 그 감시 능력과 인공지능의 능력 및 권한 확장이 얼마나 일치하고 있는가.

AI 에이전트 시대의 인간 통제는 모든 것을 보는 것이 아닙니다.

인간이 보아야 할 것들만이 확실하게 인간에게 닿도록 구조를 설계하는 것입니다.

**출처:** [note 원문](https://note.com/datalyst_ai/n/n436612a422b1)

*번역: Gemma 3(.44) 초벌 + 교정 72청크*

[원문 보기](https://note.com/datalyst_ai/n/n436612a422b1) | 출처: note.com