# Anthropic, AI 연구 개발의 26%를 “Claude가 주도” – 1% 미만에서 반년 만에 급증, 인간은 감독 역할로 전환

> https://bookfactory.kr/board/news/18497
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-25T05:52:49.050Z

---

:::small
이미지 출처: [Anthropic 공식 발표](https://www.anthropic.com/institute/measuring-pace-of-ai-development){target=“_blank”}
:::

Anthropic의 연구 조직인 Anthropic Institute는 2026년 9월 17일(현지 시간) 자사의 AI 연구 개발(R&D)을 AI가 어느 정도까지 담당하고 있는지를 측정하는 시범 지표인 「Anthropic R&D Automation Index」를 공개했다. 2026년 8월 기준으로 Claude가 고수준 지시를 받아 업무의 대부분을 스스로 수행하고, 인간이 감독하는 「AI leads(AI가 주도)」에 해당하는 업무는 26%에 달했다. 2월 시점에서는 1% 미만이었다고 한다.

## 「AI 주도」가 반년 만에 1% 미만에서 26%로

Anthropic은 AI의 관여도를 AL0부터 AL5까지 6단계로 평가했다. AL3의 「collaborates(협 업)」에서는 인간이 밀접하게 지시하면서 AI가 업무의 큰 부분을 담당한다. 반면 AL4의 「leads」에서는 인간이 고수준 지시를 주면 AI가 태스크의 대부분을 엔드‑투‑엔드(end‑to‑end)로 진행하고, 인간은 감독 역할로 전환한다.

발표에 따르면 2026년 8월 기준으로 Claude가 AL4에 도달한 AI 연구·개발 업무는 26%이다. AL3 이상, 즉 ‘협업’ 또는 ‘주도’로 분류되는 업무는 90%를 넘었다. 다만 인간이 개입하지 않고 AI가 자율적으로 업무를 완수하는 AL5 ‘fully autonomous’에 해당하는 업무는 없었다.

AnthropicはAL4の例として、夜間のデータ処理パイプラインで障害が発生したケースを挙げている。人間がClaudeに障害の修正を依頼すると、Claudeがログを調べ、原因を特定し、修正コードを書いてテストし、結果をまとめるところまで進める。実際に本番環境へ反映するかどうかは人間が確認して判断する。AL5になると、障害の検知から修正、本番反映まで、人間が指示しなくてもAIが自律的に行うことになる。

Claude가 “AI leads(AI가 주도)”에 해당하는 모델 연구 개발 업무 비율이 2026년 3월 1%에서 8월에는 26%로 상승했다.  

![31704b297a9350f392f143ea078561f36cd14908-1920x1230.webp](https://storage.googleapis.com/ledge-ai-prd-public-bucket/media/31704b297a9350f392f143ea078561f36cd14908_1920x1230_d7aac24691/31704b297a9350f392f143ea078561f36cd14908_1920x1230_d7aac24691.webp)  

:::small  
이미지 출처: [Anthropic 공식 발표](https://www.anthropic.com/institute/measuring-pace-of-ai-development){target="_blank"}  
:::  

## 약 1만 5,000건의 모델 연구 개발 태스크에서 자동화 정도를 산출  
Anthropic R&D Automation Index는 해당 회사에서 수행되는 AI 연구 개발 업무를 분류하고, 각각의 자동화 수준을 평가한 뒤 집계한다.

Anthropic은 2026년 7월, 모델 연구 개발에 관여하는 각 부서에서 매주 20%의 직원을 무작위로 추출했다. Slack 및 사내 문서 등을 Claude의 리서치 에이전트에 조사하게 하여 약 1만 5,000건의 세부적인 연구 개발 태스크를 추출했다. 이를 542개의 노드로 구성된 계층 구조로 정리하고, 그 중 378개를 구체적인 말단 태스크로 분류했다. 측정 방법의 상세 내용은 공식 발표의 부록에서 [공개](https://www.anthropic.com/institute/measuring-pace-of-ai-development){target="_blank"}하고 있다.

각 업무에 대해 Claude가 사내 작업 실태를 조사하고, 다른 Claude가 AL0~AL5의 자동화 수준을 판정했다. 업무별 가중치에는 인간이 해당 업무에 사용하는 시간을 활용했다.

한편 Anthropic 자체도 이 지표에 한계가 있다고 밝혔다. 자사 모델이 자사의 자동화 수준을 평가하고 있으며, ‘협업’과 ‘주도’의 경계에는 판단 여지가 있다. 인간 평가와의 검증 결과, AI와 인간의 판정은 97%의 사례에서 1단계 이내로 일치했다고 한다. 앞으로는 제3자의 검증도 계획하고 있다.

사내에서 약 3만 개의 AI 에이전트가 동시에 가동되고 있다. 이번 Anthropic은 AI 연구 개발의 자동화 정도뿐 아니라 AI 에이전트의 감시 상황도 같은 발표에서 공개했다.

2026년 8월 기준으로, 해당 회사에서 가장 많이 사용되는 사내 플랫폼에서는 연구 및 엔지니어링 업무를 수행하는 AI 에이전트가 동시에 약 3만 개 가동되고 있다고 한다. 에이전트의 행동은 실행 전 ‘온라인 감시’와 실행 후 ‘오프라인 감시’ 양쪽 모두에서 100% 커버하고 있다고 밝혔다. 8월에 분석한 10억 건 이상의 판단 중, 온라인 감시로 차단된 것은 0.002%로, 약 4만 7,000건당 1건이었다.

Anthropic은 7월 13일부터 20일까지 1주일 동안 사용된 계산 자원의 용도도 조사했다. AI 연구 개발에 사용된 계산 자원의 약 6%가 안전성 관련 연구에, AI를 활용한 AI 연구 개발에만 한정하면 약 12%가 안전성 관련 연구에 사용되었다고 밝혔다.

Anthropic Institute는 이전부터 AI가 차세대 AI 개발을 직접 가속화하는 "AI-driven AI R&D"를 조사하고 있다. 2026년 5월에 공개한 [「When AI builds itself」](https://www.anthropic.com/institute/recursive-self-improvement){target="_blank"}에서는 Anthropic의 코드베이스에 병합되는 코드의 80% 이상을 Claude가 작성하고 있었다는 사실도 밝혀졌다. 반면 연구 주제와 목표를 선택하는 "research taste and judgment"에서는 여전히 인간과 비교했을 때 능력 차이가 남아 있다고 한다.

Anthropic은 AI가 후속 AI를 만드는 “재귀적 자기 개선”에 경종을 울렸다. Claude가 자사 코드의 80% 이상을 작성했으며, 개발 감속·일시 정지 메커니즘을 제안했다.  

Anthropic은 AI가 AI 안전성 연구를 자율적으로 진행하는 “Automated Alignment Researchers”를 공개했다. 인간 연구자의 방식을 크게 앞서는 성과를 보였다.  

AI 에이전트는 어디까지 “자율”하고 있는가──Anthropic이 수백만 건의 데이터를 처음으로 공개 분석했다.  

Claude Code는 누가 어떤 작업에 사용하고, 성과는 어디서 갈리는가──Anthropic이 이용 데이터 40만 건을 분석했다.

![\"31704b297a9350f392f143ea078561f36cd14908-1920x1230.webp\"](\"https://storage.googleapis.com/ledge-ai-prd-public-bucket/media/31704b297a9350f392f143ea078561f36cd14908_1920x1230_d7aac24691/31704b297a9350f392f143ea078561f36cd14908_1920x1230_d7aac24691.webp\")

\n

[원문 보기](https://ledge.ai/articles/anthropic_rnd_automation_index) | 출처: Ledge.ai