# # 인공지능 직원에게 100점을 받아도 일을 실행시키지 않는 이유

> https://bookfactory.kr/board/ai-tech/20860
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-10-10T19:19:36.287Z

---

지난번, 저는 인공지능 직원에게 “회사 기억”을 심어주었습니다. 그 결과, 인공지능 직원이 만든 회사 소개 문 QA 점수는 89점에서 100점으로 상승했습니다. 근거 없는 주장은 2건에서 0건으로 줄어들었습니다. 드디어 인공지능 직원이 자신의 회사에 대해 정확하게 설명할 수 있게 된 것이죠. 하지만 한 가지 문제가 남아 있었습니다. 100점을 받은 인공지능 직원에게 저는 SNS 게시 버튼을 누르도록 하지 않았습니다. 왜 그랬을까요? 인공지능이 만든 글이 옳다는 것과 그 글을 세상에 공개해도 되는 것은 완전히 다른 문제이기 때문입니다. 이번에는 인공지능 직원에게 “생각하는 일”뿐만 아니라 “실행하는 일”을 맡기기 위한 시스템을 구축한 이야기입니다. 100점의 점수를 받은 인공지능 직원이라도, 예를 들어 인공지능 직원에게 “AI Company OS 소개 문구를 X에 게시해”라고 지시했을 때 발생할 수 있는 상황을 생각해 볼 수 있습니다. 인공지능 직원이 글을 작성하고, 다른 인공지능 직원이 검토합니다. QA는 100점입니다. 이는 지난번에 성공적으로 수행할 수 있게 된 부분입니다. 하지만 만약 인공지능 직원이 * 잘못된 계정에 게시했을 경우*? CEO가 확인하지 않은 글을 공개했을 경우? * 동일한 글을 두 번 전송했을 경우*? * 게시해서는 안 되는 정보를 포함했을 경우* 글이 100점이라도 회사 입장에서는 사고입니다. 게다가 SNS 게시나 이메일 전송은 실행한 후에 취소해도 이미 본 사람이 있을 수 있습니다. 인공지능의 답변이 틀렸다면 다시 만들어내면 되지만, 외부 세계에 대한 조작은 그렇게 간단히 해결할 수 없습니다. 여기서 저는 인공지능 직원의 업무에는 2가지의 합격이 필요하다는 것을 깨달았습니다. 하나는 결과물로서 합격하는 것, 그리고 다른 하나는 실행해도 되는 것으로 승인받는 것입니다. 지난번의 100점은 단지 전자에 해당했습니다.
AI 직원에게 “회사 규정”을 만들었다.

그 결과 만들어낸 것이 “인간 승인”이었다. 일본어로 번역하면 “인간에 의한 승인”이다. 작동 방식은 간단하다. 먼저, AI 직원이 일을 한다. COO가 계획을 세우고, Worker가 결과물을 만들고, QA가 검토한다. 이것까지는 지금까지와 같다. 다른 점은 바로 그 다음이다. AI 직원이 외부로 무언가를 보내거나 공개할 경우에는 반드시 CEO의 승인을 받아야 한다. 즉, CEO가 요청하는 것이다. COO가 일을 분해한다. Worker가 만든다. QA가 확인한다. 그리고 마지막으로 CEO가 실행을 허가한다. 인간 회사에서 말한다면, 담당자가 만든 자료를 상사가 확인하고 결재를 내려 거래처에 보내는 것과 같다. 여기서 중요한 것은 QA가 100점을 줬다고 해서, QA에게 실행을 허용하는 권한이 없다는 것이다. AI가 AI를 평가하고, 그 AI가 자의적으로 실행까지 결정하는 것이다.

내가 만들고 싶은 것은 AI가 무엇이든 자의적으로 하는 회사, 즉 AI 직원이 자율적으로 일을 진행하면서 중요한 판단은 인간이 쥐고 있는 회사이다.

하지만 승인 버튼만으로는 부족했다. 처음에는 CEO가 승인 버튼을 누르면 충분하다고 생각했다. 하지만 생각해 보면 문제점이 있다. 예를 들어, AI 직원이 다음 문장을 만들었다고 가정해 보자. “AI Company OS를 개발하고 있습니다. AI 직원이 일을 분담하는 시스템을 검증 중입니다.” 내가 확인하고 승인한다. 그런데 그 후에 어떤 결함으로 인해 실행되는 문장이 바뀌었다면? 내가 승인한 것은 첫 번째 문장일 뿐, 변경된 문장이 아니다. 그러므로 승인한 내용을 고정하는 것
저희는 해시라는 기술을 활용한 시스템을 구축했습니다. 해시는 ‘문서의 지문’과 같은 개념으로, 승인된 문서의 내용을 식별하는 값을 생성합니다. 실행 직전에 다시 그 값을 계산하여 일치하는지 확인하고, 일치하지 않으면 실행을 중단합니다. 이렇게 하면 승인된 후에 문서가 변경되어도 동일한 승인을 사용하여 실행할 수 없게 됩니다. 하지만 해시는 문서가 정확한지 보장하는 것은 아닙니다. CEO가 승인한 내용과 실제로 실행되는 내용이 동일한지 확인하는 메커니즘입니다.

다음으로, 두 번 실행되는 문제에 대한 우려가 있었습니다. 예를 들어, AI 직원(AI社員)이 X에 게시물을 올렸다고 가정해 보겠습니다. 하지만 통신 지연으로 성공 여부를 알 수 없는 경우, AI 직원이 “실패했을 가능성이 있다”고 판단하고 다시 실행합니다. 그 결과, 동일한 게시물이 두 번 게시됩니다. 이메일과 마찬가지로, AI 직원의 글 내용와는 상관없이 동일한 수신인에게 두 통의 이메일이 전송될 수 있습니다.

이에 동일한 실행 요청이 중복으로 처리되지 않도록 하는 시스템을 만들었습니다. 더 나아가, Audit Log(감사 로그)를 통해 모든 운영 기록을 남깁니다. 어떤 내용을 실행하려고 했는지, 누가 승인했는지, 언제 실행했는지, 그리고 결과는 어떠했는지 등을 추적할 수 있도록 하는 것입니다. 이는 인간 회사에도 적용되는 결裁記録(결재 기록)나 운영 로그와 동일한 개념입니다. AI 회사에도 이러한 기록이 필요했습니다.

실제로 작동해 보기 위해 1,760건의 테스트를 만들었을 때, 실제 X에 게시물을 올리는 대신 Fake X(가짜 X)를 사용하여 테스트를 진행했습니다. Fake X는 X에 게시물을 올리는 것을 모의하는 테스트 도구입니다.
실제 SNS에 공개하는 대신, 승인부터 실행, 기록의 기록까지의 흐름을 확인합니다. 이번 Execution Phase 1에서는 25개의 테스트 스위트, 총 1,760건의 테스트가 모두 PASS했습니다. 확인한 시스템에는 승인 내용의 해시 충돌, 운영 기록의 기록, 이중 실행 방지 등이 포함되어 있습니다. 1,760건, 전량 PASS. 숫자를 보면 상당히 안심이 됩니다. 하지만 여기서도, 이전과 같은 문제가 발생합니다. 테스트에 합격했다는 의미로 본 때도 안전하게 작동한다는 보장은 없습니다. 이번에 확인한 것은 테스트 환경에서 설계한 동작이 성립하는 것입니다. 실제 X 계정에 게시물이 성공적으로 게시된 것은 아닙니다. 실제 SNS에서는 인증 오류, 통신 장애, 외부 서비스 측의 사양 변경 등 더 고려해야 할 사항들이 있습니다. 그래서 1,760건 PASS라는 결과를 중요하게 생각하면서도, 이것으로 완성되었다고 판단하지 않았습니다. 사실, 또 다른 두려운 문제가 있었는데, 바로 게시물에 사용되는 계정입니다. 저는 AI Company OS뿐만 아니라, 개인 개발이나 SNS 운영도 하고 있습니다. 미래에는 AI 직원에게 여러 SNS 계정을 관리하도록 하고 싶습니다. 하지만 만약 AI 직원이 계정을 잘못 사용한다면? AI Company OS의 소개 문구를 다른 계정에 게시할 수도 있습니다. 반대로, 다른 사업의 정보를 AI Company OS 계정에 공개할 수도 있습니다. 그래서 게시물 대상 계정 또한 승인의 대상으로 삼는 설계를 진행했습니다. 문장뿐만 아니라 “어떤 계정으로”, “무엇을”, “어떤 방식으로 실행하는지”까지 확인합니다. AI에게 게시물 대상 계정을 자유롭게 선택하도록 하는 것이 아니라, 인간이 게시물 대상 계정을 확인하도록 합니다.
녹화된 계정과 실행 직전의 인증 위치를 비교하는 방식입니다. 이 부분은 실제 계정에서의 게시물 검증까지 완료된 것은 아니지만, 외부 조작을 맡기는 경우에는 피할 수 없는 문제라고 생각합니다. AI 직원에게 자유를 주고 싶지만, 제한만 계속 늘어가는 것이 조금 신기한 마음이 들었습니다. 제가 만들고 싶은 것은 AI 직원이 스스로 생각하고 스스로 일을 진행하는 회사입니다. 인간 직원을 여러 명 고용하지 않아도 일이 돌아가는 시스템을 만들고 싶습니다. 그런데 개발을 진행할수록 승인을 받아야 하고 권한이 제한되며, 조작 기록을 하고, 억지로 변경하지 못하게 합니다. 이러한 시스템만 계속 늘어갑니다. 일견 보면 자동화와는 반대로 진행되는 것처럼 보일 수도 있습니다. 하지만 생각해보면 인간 회사도 똑같습니다. 뛰어난 직원이어서 그렇지, 회사의 돈을 마음대로 쓸 수 있는 것은 아닙니다. 영업 성적이 좋아서 계약서를 확인하지 않고 계약을 체결해도 되는 것은 아닙니다. 능력은 높지만 권한을 가지고 있는 것은 별개입니다. AI 직원도 마찬가지였습니다. AI 직원을 자유롭게 일하게 하려면, 자유롭게 할 수 없는 범위를 정해야 했습니다. 100점은 실행해도 되는 이유가 될 수 없는, 3화에서는 AI 직원에게 처음으로 실제 일을 맡겨 59점을 받았습니다. 5화에서는 99점을 그대로 믿지 않는 시스템을 구상했습니다. 8화에서는 회사의 기억을 부여받아 100점이 되었습니다. 그리고 이번에. 100점에도 불구하고 실행하지 않는 시스템을 만들었습니다. 되돌아보면 조금씩 AI 회사의 생각이 바뀌어 왔습니다. 처음에는 어떻게 하면 AI가 좋은 일을 해줄 수 있을지를 생각했습니다. 지금은 어떻게 하면 AI를 안심하고 맡길 수 있을지를 생각합니다.
저는 일을 맡길 수 있는지 고려하고 있습니다. AI의 능력을 향상시키는 것과, 회사가 안전하게 운영하는 것. 그 두 가지 모두 필요한 것 같습니다. 다음은 AI 직원들이 정말 외부 세계에서 일하는 이번, AI Company OS에는 외부 조작을 실행하기 위한 기반이 마련되었습니다. CEO 승인. 승인 내용의 확인. 이중 실행 방지. 운영 기록의 기록. 테스트 환경에서는 승인부터 실행까지의 흐름도 확인했습니다. 하지만 아직 실제 SNS에 게시한 것은 아닙니다. 다음은 실제 외부 서비스에 연결합니다. 우선 X. AI 직원이 게시문을 만들고, QA가 검토하고, CEO가 승인합니다. 그리고 승인된 내용만 지정된 계정에 게시합니다. 그렇게까지 진행되고 나서야 “AI 직원이 외부 세계에서 일했다”라고 말할 수 있을 것 같습니다. 최종적으로는 SNS 운영뿐만 아니라 조사, 영업, 고객 응대, 서비스 운영 등도 AI 직원에게 맡기고 싶습니다. 하지만 갑자기 모든 것을 하지는 않습니다. 우선 작은 일을 하나로 시작합니다. 안전하고 확실하게 실행할 수 있도록 하는 것입니다. 직원 0명의 회사는 드디어 “생각하는 회사”에서 “일하는 회사”로 나아가려고 합니다. AI 회사의 실험은 아직 계속됩니다. AI 회사의 전체 설계와 COO, Research, Worker의 지시문, QA의 채점 기준, 실제로 작동했을 때의 기록은 실전편에 모았습니다. ※ 이번에 소개한 Execution Phase의 구현 내용은 실전편에는 아직 반영되지 않았습니다. 자신도 AI 직원을 작동시켜 보기를 원하시면, 좋은 기회를 찾아보세요. [실전편] AI 직원만으로 일이 돌아가는 ‘혼자 회사’ 만들기 | 실제로 작동한 설계, 프롬프트, 템플릿 공개 https://note.com/tokyo
작업 기록

#AI #생성AI #AI에이전트 #개인개발 #AI활용 #자동화 #AI회사OS

**출처:** [note 원문](https://note.com/tokyo_worklog/n/nd69288eaf158)

*번역: Gemma 3(.44) 초벌 + 교정 검수*

[원문 보기](https://note.com/tokyo_worklog/n/nd69288eaf158) | 출처: note.com