# AI 직원 평가 방법은 “실패 20개”부터 시작하기로 — Anthropic 평가 가이드를 경영자가 3단계로 활용하는 방법 분석

> https://bookfactory.kr/board/ai-tech/18002
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-21T02:41:09.884Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/314950549/rectangle_large_type_2_f2a31830342815df0b5bdca337775d3a.png?width=1280)

AI 직원에게 업무를 맡긴 후, 그 결과물을 어떻게 평가하고 있나요?

봐, 생각보다 괜찮아 보이는데 정도로 끝나는 회사들이 많을 거라고 생각해요. 저도 그랬었죠.

그러다 보니 괜찮은데, 인공지능 직원들이 늘어나면 지시서를 고쳐야 직전에 처리했던 업무가 조용히 무너져 버린다.

수리한 부분은 괜찮아졌는데, 다른 곳이 또 고장나네. 이런 경험이 없으신가요.

이 기사가 답하는 질문은 하나입니다. “AI 직원 평가 방법을 어디서부터 어떻게 시작해야 하는가.”

Anthropic에서 공개한 “AI 에이전트 평가 방법론 해부하기”(2026년 1월 9일 공개)를 2026년 9월 18일에 읽고, 그 안에 제시된 평가 방법을 엔지니어 부서에 속하지 않은 경영자가 직접 수행할 수 있는 3단계 절차로 재구성합니다. 공식적으로는 “공식적으로는”이라고 쓰고, 나는 이렇게 생각한다라고 분리하여 작성합니다.

## AI 직원 평가는 대부분 “어떻게든”으로 끝나는 경우가 많습니다.

왜 멈추는 걸까요.

앤트로픽 기사는 그 이유를 첫 번째 단락에서 정확히 짚어내고 있습니다. “좋은 평가가 있으면 팀은 자신감을 가지고 AI 에이전트를 출시할 수 있다. 그렇지 않으면 실전에서 문제를 발견하고 하나를 고치면 또 다른 실패가 생기는 수동적인 굴레에서 벗어나기 어렵다.”

정말 그렇습니다. 지침서를 수정해야 합니다. 다른 부분도 고장 나 또 수정해야 합니다.

왜 평가를 만들지 않는 이유는 다음과 같습니다. 게시글에는 이렇게 나와 있습니다. “수백 가지의 작업이 필요하다고 생각하고 평가를 미루는 팀들을 많이 보아왔습니다. 실제로는 실제 실패를 통해 수집한 20~50개의 간단한 작업만으로도 충분한 출발점이 됩니다.”

천 개도 필요 없다. 20개면 충분하다.

이 글에서 경영자에게 가장 효과적인 한 문장은 바로 이것이라고 생각합니다.

## 용어는 4가지만 익히면 됩니다.

평가라고 하면 어렵게 느껴질 수 있지만, 공식 정의는 놀라울 정도로 단순합니다.

평가(eval)는 “AI 시스템의 테스트. AI에 입력을 제공하고 평가 로직을 적용하는 것”입니다.

기억해야 할 단어는 4개입니다.

과제는 하나의 시험입니다. 입력과 합격 조건이 정해져 있습니다.

시행(トライ얼)은 그 작업을 한 번 수행하는 것을 의미합니다. AI는 매번 같은 답변을 반환하지 않기 때문에, 같은 작업을 여러 번 수행합니다.

채점자는 점수를 매기는 시스템입니다.

기록(트랜스크립트)은 1회의 시도 전체의 기록을 의미하며, 출력 내용, 도구 사용법, 중단된 생각 등을 포함한다.

AI 직원에게 대체해 본 결과, “지난 주 회의록을 요약해 줘”라는 과제를 5번 수행하는 시도가 있었습니다. 평가자는 요약에 모든 결정 사항이 포함되어 있는지 확인하고, AI가 무엇을 읽고 무엇을 썼는지의 일부를 기록했습니다.

이미지가 잘 생생하게 떠오르셨나요?

## 채점 기준은 3가지로 나뉩니다—코드, 모델, 인간.

채점자는 기사에 따라 3가지 유형이 있습니다.

첫 번째 방법은 코드로 채점하는 것입니다. 문자가 일치하는지, 테스트를 통과하는지, 결과물이 존재하는지 확인합니다. 해당 기사에서는 장점으로는 “빠른, 저렴한, 객관적인, 재현 가능, 원인 추적 용이”라고 쓰고, 단점으로는 “정답이지만 형태가 다른 결과에 취약하다”고 설명합니다.

두 번째 방법은 AI 모델을 활용한 채점입니다. 채점 기준표(루브릭)를 제공하여 다른 AI에게 점수를 매기게 합니다. 장점은 “유연하고, 대량의 데이터를 처리하며, 미묘한 차이를 포착할 수 있다”는 점입니다. 단점은 “매번 동일한 점수로 나오지 않는다는 점, 비용이 발생한다는 점, 사람의 판단에 맞춰 조정이 필요하다”는 점입니다.

세 번째는 사람이 평가하는 방식입니다. 게시글의 표현상으로는 “품질의 기준 그 자체”라는 의미를 지니지만, “비싸고, 느리고, 전문가가 필요하다”는 점을 내포합니다.

경영자분들의 현장에서 바로 활용할 수 있는 것은 무엇입니까?

저는 다음과 같이 생각합니다. 첫째, “결정 사항이 5가지 포함되어 있는지”, “수신인이 정확한지”, “금액이 원 데이터와 일치하는지”를 확인합니다. 셀 수 있는 항목은 코드 사용 여부와 상관없이 시각 점검표를 통해 동일하게 확인할 수 있습니다.

그 외에 “문장이 자연스러운가”와 같은 미묘한 부분은 두 번째 AI 평가에 회부한다. 세 번째 사람의 평가는 AI 평가가 엇나가지 않았는지 확인하는 데만 사용한다.

![画像](https://assets.st-note.com/img/1789720792-JPmZeGs9qYAOUWfVdr0vkEpy.png?width=1200)

## 평가 방법은 두 가지가 있습니다 — “무엇을 할 수 있는지”와 “여전히 할 수 있는지”

이것이 바로 지침서를 수리할 때마다 고장 나는 문제의 해결책입니다.

본문은 평가를 2가지 유형으로 나누어 진행하고 있습니다.

첫 번째는 능력 평가입니다. “이 에이전트가 무엇을 잘 할 수 있는지”를 묻는 것입니다. 기사에 따르면, 합격률은 낮은 곳에서 시작하여 점차 높아져야 합니다.

또 다른 하나는 회귀 평가입니다. “이전에 해냈던 일을 아직도 전부 다 해낼 수 있는가”를 묻는 것입니다.こちらは 거의 100%의 합격률을 보이는 것이 되어야 합니다.

지시서를 수리하면 다른 곳이 망가지고 있다는 것은 회귀 평가가 없는 상태입니다. 이전의 일을 기록한 목록이 없기 때문에 고객의 지적을 통해 고장 사실을 인지하게 됩니다.

그래서, 수정할 때마다 “이전에 해왔던 20건”을 다시 수행하도록 하는 것입니다. 이것이 회귀 평가입니다.

AI는 매번 같은 답변을 하지 않으므로, 이 글은 두 가지 관점을 소개하고 있습니다. “k번 시도해서 1회라도 성공할 확률”과 “k번 시도해서 모두 성공할 확률”입니다. 전자는 탐색적인 업무에 적합하며, 후자는 매번 동일한 품질이 요구되는 사무 업무에 적합합니다.

AI 직원에게 맡겨지는 업무 중 많은 것은 바로 그것입니다. 5번 반복하여 결정 사항이 누락되지 않도록 요구합니다.

![画像](https://assets.st-note.com/img/1789720795-85PepgcrYG9LqsOutxFj1JaT.png?width=1200)

## AI 직원 평가 방법, 저희사의 해독(해석) – 3단계

1단계: AI의 목적과 역할 명확화

먼저, 평가 대상인 AI의 목적과 역할을 명확하게 정의합니다. AI가 어떤 작업을 수행하고 어떤 성과를 내도록 기대하는지 구체적으로 파악하는 것이 중요합니다. 예를 들어, 고객 응대 챗봇이라면 “고객 문의에 신속하고 정확하게 응대하여 고객 만족도를 향상시킨다”는 목표가 설정됩니다.

2단계: 평가 지표 설계

다음으로, AI의 목적과 역할을 달성하기 위한 평가 지표를 설계합니다. 평가 지표는 AI의 성과를 객관적으로 측정하기 위한 것입니다. 지표는 SMART(Specific, Measurable, Achievable, Relevant, Time-bound) 원칙에 따라 설계하는 것이 바람직합니다.

*   **구체적:** 평가 대상 명확화
*   **측정 가능:** 정량적·정성적 지표 설정
*   **달성 가능:** 현실적인 목표 설정
*   **관련성:** 목적과 관련된 지표 설정
*   **기한 부착:** 평가 기간 설정

예를 들어, 챗봇이라면 “1일 해결하는 문의 건수”, “고객 만족도(설문 결과)”, “평균 응답 시간”, “오답률” 등이 평가 지표가 될 수 있습니다.

3단계: 정기적인 모니터링 및 피드백

마지막으로, 평가 지표에 따라 AI의 성과를 정기적으로 모니터링하고 피드백을 제공합니다. 모니터링 결과를 분석하여 AI의 개선점을 찾고, AI 개발팀이나 운영팀에 피드백함으로써 AI의 성과를 지속적으로 향상시킬 수 있습니다. 또한, 평가 결과를 AI 스스로 학습시키면 AI는 더욱 효과적으로 작업을 수행할 수 있습니다.

이전 내용에 기반하여, 이제 본론을 시작하겠습니다.

공식의 8단계 절차를 경영자가 직접 실행할 수 있도록 간결화하면,

실패를 축적하고 합격과 불합격을 분리하지 않는 방식으로 기록을 읽는 것을 완성하는 방법

세 가지입니다.

1단계, 실패를 모으십시오. AI 직원들이 저지른 실제 사례를 20개에서 50개, 그대로 적어내십시오. “이 회의록에는 결정 사항이 빠져 있었다”, “이 답변은 수신인이 잘못되었다”와 같이 실제 실패 사례를 활용합니다. 상상으로 만든 업무는 상상 속의 실패만 발견할 수 있습니다.

2단계는 평가 결과가 일관되도록 하는 것입니다. 이 기준은 다음과 같습니다. “좋은 업무는 2명의 전문가가 별개로 판단해도 동일한 평가를 받는 것”입니다. “요약이 좋은가”가 아니라 “결정 사항이 3가지 모두 포함되어 있는가”를 기준으로 합니다.

3단계, 기록을 읽는다. 단순히 점수만 보지 않는다. 기사에는 이렇게 쓰여 있다. “원칙적으로 누군가가 기록의 내용을 파고들어 기록을 몇 권 읽을 때까지 점수를 맹신하지 않는다.” 그리고 실패에 대해서는 “실패는 공정하게 보일べき다. 무엇을 어떻게 잘못했는지 명확하게 드러나는지.” AI가 정확하게 답을 제시했음에도 불구하고 점수가 낮게 나오는 과제는, 기사 측에서 실제로 있었던 사례로, (점검의 지나친 엄격함으로 인해 42%였던 점수가 바로잡으면서 95%로 상승했다는 기록이 있다.)

솔직히 STEP 3가 가장 소홀해지게 만드는 부분입니다. 점수가 나오면 그것에 안심하게 되니까요.

![画像](https://assets.st-note.com/img/1789720798-WVyCnND9u2XYmqesSx7Hlh1R.png?width=1200)

## 저, 그렇게까지 신경 쓸 필요 없어요.

그걸 생각하시는군요.

정말 그렇게 생각할까요?

이 글에서는 평가를 “단위 테스트 유지보수와 같은 당연한 과정”으로 다루어야 한다고 제시하고 있습니다. 또한, 평가를 빠르게 구축한 팀은 “실패를 테스트 케이스로 활용하여, 테스트 케이스가 회귀를 방지하고, 지표가 추론으로 대체되어 개발 속도가 가속화된다”고 설명합니다.

저는 시간 단축에 대한 이야기가 아니라, 노력의 위치를 바꾸는 것에 대한 이야기라고 생각합니다. 고객님으로부터 받은 지적을 반영하여 20개의 목록으로 수정할지 여부를 결정하는 평가 방법을 정하는 것이 바로 이 위치를 결정하는 것입니다.

또 다른 점은, 기사가 솔직하게 지적하는 한계점도 함께 덧붙여 설명하겠습니다. 평가가 모든 것을 포괄하는 것은 아니며, “하나의 평가층으로 모든 문제를 포괄하는 것은 불가능합니다. 여러 방법을 겹치면 하나의 층을 뚫고 나간 실패가 다른 층에서 포착됩니다.” 마치 구멍이 뚫린 치즈를 여러 겹 쌓는 것과 같습니다.

즉, 평가를 만들더라도 시각 검토를 멈추지 않는다. 시각 검토의 부담이 20개의 목록으로 인한 부담만큼 경감된다.

## 요약: AI 직원 평가 방식은 실패 사례 20가지 목록을 참고합니다.

그런 이야기가 있었습니다.

AI 직원 평가는 수백 개의 테스트가 아닌 실제 실패 20건에서 50건부터 시작하는 것이 좋다. 이는 Anthropic의 공식 가이드라인에 나오는 내용이다.

평가 방법은 2가지입니다. 무엇을 할 수 있는지를 보는 능력 평가와 이전에 해왔던 일이 아직 가능한지 보는 회귀 평가입니다. 지시서를 매번 고칠 때마다 망가지는 것은 후자가 없기 때문입니다.

평가 방법은 세 단계입니다. 실패를 모아 2명이 판단해도 깨지지 않는 방식으로 작성하고, 점수가 아닌 기록을 reads.

먼저, 인공지능 직원(社員)이 지난 1개월 동안 저지른 것을 5가지만 적어보세요. 그것이 1번째 과제입니다. 20개가 채워질 때까지 지시서를 수정하지 않아도 됩니다.

관련 기사: AI 직원 템플릿은 6개의 방 나누기로 시작됩니다 — 예전에는 매번 처음부터 작성해야 했던 때의 이야기

### AI 직원과 함께 일하기 위한 12가지 선물

AI 직원과 공존하며 더 나은 업무 방식을 실현하기 위해, 그들이 기뻐할 선물을 12가지 제안합니다.

1. 고성능 헤드폰: 집중력을 높이고 주변 소음을 차단하는 고품질 헤드폰은 AI 직원이 업무에 몰두하는 데 도움이 됩니다. 노이즈 캔슬링 기능이 있는 것을 선택하면 더욱 효과적입니다.

2. 인체공학적 키보드와 마우스: 장시간 작업에도 피로가 덜하도록, 인체공학적 설계의 키보드와 마우스는 AI 직원의 편안한 작업 환경을 지원합니다.

3. 고해상도 모니터: AI 직원이 복잡한 데이터나 이미지를 보기 좋게, 정확하게 분석할 수 있도록 고해상도 모니터를 선물하세요.

4. 휴대용 전원 공급 장치: AI 직원이 이동하면서도, 어디에서나 작업할 수 있도록 휴대용 전원 공급 장치는 필수 아이템입니다.

5. 스마트 워치: AI 직원의 건강 관리를 지원하고 활동량을 기록하는 스마트 워치는 생산성 향상에 기여합니다.

6. 커피 기프트 카드: AI 직원이 집중력을 유지하고 장시간 작업을 지원하는 커피 기프트 카드는 기쁜 선물입니다.

7. 아로마 디퓨저: 이완 효과가 있는 아로마 디퓨저는 AI 직원의 스트레스 완화에 도움이 됩니다.

8. 스탠딩 데스크: AI 직원이 바른 자세를 취하고 건강한 업무 방식을 지원하는 스탠딩 데스크는 추천합니다.

9. 도서 (AI 관련 전문 서적): AI 관련 전문 서적은 AI 직원의 지식 향상에 도움이 됩니다. 예를 들어, ‘딥러닝’이나 ‘머신러닝 실전 입문’과 같이 최신 기술 트렌드를 다룬 서적을 선택하면 좋습니다.

10. 온라인 학습 플랫폼 이용권: AI 직원이 최신 AI 기술을 습득할 수 있도록 온라인 학습 플랫폼 이용권을 선물하세요. Coursera나 Udemy와 같은 플랫폼이 이용 가능합니다.

11. 팀 빌딩 이벤트 참가 비용: AI 직원이 팀원들과 교류하고 소통을 깊게 하는 팀 빌딩 이벤트 참가 비용을 부담하세요.

12. 감사의 메시지 카드: AI 직원에게 감사의 마음을 전하는 메시지 카드는 무엇보다 마음을 움직이는 선물입니다.

AI 직원 설계에 활용되는 지침서 양식이나, 위임할 업무 분배의 실제 사례를 모아놓은 자료 세트입니다. 앞으로 첫 번째 AI 직원(자동화된 직원)을 만드는 경영인 또는 실무자들을 위한 자료입니다.

12가지 선물 받기

지난번 이벤트에서 12가지 선물을 받으셨나요? 이번에도 놓치지 마세요! 

이번 이벤트에서는 더욱 풍성한 12가지 선물을 준비했습니다. 

*   **[책 제목 1]**
*   **[책 제목 2]**
*   **[책 제목 3]**
*   **[책 제목 4]**
*   **[책 제목 5]**
*   **[책 제목 6]**
*   **[책 제목 7]**
*   **[책 제목 8]**
*   **[책 제목 9]**
*   **[책 제목 10]**
*   **[책 제목 11]**
*   **[책 제목 12]**

각 선물은 특별한 의미를 담고 있으며, 여러분의 독서 경험을 더욱 풍요롭게 만들어 줄 것입니다. 

지금 바로 참여하여 12가지 선물을 받아보세요!

**출처:** [note 원문](https://note.com/ripe_peony6219/n/n2d72c77b79cf)

*번역: Gemma 3(.44) 초벌 + 교정 53청크*

[원문 보기](https://note.com/ripe_peony6219/n/n2d72c77b79cf) | 출처: note.com