지금부터 등장하는 회사, 부서, 인물, 사건은 모두 가상의 설정이다. 실존하는 기업·단체·개인을 가리키는 것이 아니다.
3개월간 AI에게 회사를 맡겨봤다. 비서, 리서치, 마케팅, 라이터, 디자이너, 분석, 경리, 법무. 각 직책에 AI를 배치하고, 각각에게 업무를 맡겨 운영했다.
생각했던 것보다 훨씬 잘 풀리지 않는 일이 많았다. 보고를 곧이곧대로 믿어 오류를 알아채지 못한 일. 재미있게 만들려다가 자칫 규제에 저촉될 뻔한 일. 금지 사항에 가로막혀 만들고 싶은 것을 만들지 못한 일. 얼핏 정답처럼 보이는 답을 그대로 채택할 뻔한 일.
실패 자체는 솔직히 말해 어느 것도 대단한 드라마는 아니다. 흔히 있는 이야기라고 생각한다.
그래도 3개월의 끝에서 돌아보니, 가장 큰 자산으로 남아 있는 것은 개별 실패의 기억이 아니었다. 하나의 운영 규칙이었다.
같은 종류의 실패를 두 번 했다면, 다시는 망설이지 않기 위한 조건표를 만든다.
고작 이것뿐인 규칙이다. 특별한 것은 아무것도 없다. 하지만 이 규칙을 철저히 지켜 계속 이어간 것이 3개월 동안 가장 효과를 발휘했다. 첫 번째 실패는 어쩔 수 없다. 원인도 모른 채 일어나는 경우가 많기 때문이다. 하지만 두 번째가 일어났을 때, 그것은 더 이상 '우연'이 아니라 '구조'다. 구조임을 깨달은 순간, 다시는 같은 논의를 하지 않아도 되도록 판정 조건이라는 형태로 바꿔 둔다.
이 총집편이 보여주고자 하는 것은 실패 그 자체의 기록이 아니다. 실패로부터 조건표를 만들어내는 작업 그 자체다.
앞으로 4개의 장이 이어진다. 모두 각기 다른 장면에서 일어난 일이지만, 공통점은 '일어난 일을 그대로 두 번 다시 일어나지 않기 위한 틀로 바꾸었다'는 단 한 가지다.
첫째는 AI의 보고를 어떻게 검증할 것인가에 대한 이야기다. 둘째는 표현을 재미있게 만드는 것과 위험하게 만드는 것의 경계선을 어디에 그을 것인가에 대한 이야기다. 셋째는 금지 사항에 가로막혔을 때 표현 수위를 낮추는 것 외에 어떤 해법이 있는가에 대한 이야기다. 넷째는 언뜻 타당해 보이는 답을 그대로 채택하지 않는 판단을 어떻게 내릴 것인가에 대한 이야기다.
모든 장은 일어난 사건 그 자체보다 그 사건에서 무엇을 만들어냈는지에 중점을 두고 있다. 사실, 바로 이 차이가 무료로 공개해 온 사건부와 이 총집편의 차이이기도 하다.
무료 사건부는 그날그날 무슨 일이 일어났는지를 전하는 것이었다. 이 총집편은 다르다. 일어난 일로부터 무엇을 만들어냈는가. 그 한 점만을 뽑아내어 장별로 재구성했다. 개별 사건을 추억하기 위한 글이 아니라, 당신의 현장에 가지고 돌아가 내일부터 쓸 수 있는 판단 기준을 전하기 위한 글이다.
그럼, 4개의 장을 살펴보자.
제1장 AI의 보고는 의심부터 하라
무료 사건부, 지금까지의 줄거리
무료 사건부에서 이런 이야기를 썼다. 밤 대응을 담당하는 AI 직원(마케팅 담당)이 "좋아요는 눌렀습니다. 답장은 아침으로 넘기겠습니다"라고 보고했고, 다음 날 아침 이를 인계받은 AI 직원(비서 역)이 "중복입니다. 대응 완료입니다"라고 기록했다. 나는 그 보고를 그대로 믿고 기록에 "대응 완료"라고 썼다.
며칠 후, 우연히 그 게시글 페이지를 하나하나 열어볼 기회가 있었다. 좋아요 표시는 모두 회색 그대로였다. 답글은 한 건도 와 있지 않았다. 두 차례에 걸쳐 “대응 완료”라고 기록되어 있던 것이, 실제로는 한 번도 대응된 적이 없었던 것이다.
원인은 단순했다. “중복되고 있다”라는 판단은 알림 목록에 나란히 뜬 문면을 비교해 본 인상에 불과했고, 실제로 그 게시물의 페이지를 열어 확인한 사람은 아무도 없었던 것이다.
이 장에서 쓰려는 것은 그 후속 이야기다. 사실, 이 ‘보고와 실물이 어긋난다’는 구조는 단 한 번의 사고가 아니었다.
같은 착각은 한 번으로 끝나지 않았다
대응 판정 건 이후, AI 사원들 사이에 새로운 규칙을 하나 만들었다. “대응 완료라고 쓰기 전에 실제 페이지를 열어 상태를 확인했는가. 확인하지 않았다면 ‘대응 완료’가 아니라 ‘미확인’이라고 쓴다”는 것이다.
이 규칙은 뜻밖의 방식으로 다시 한번 도움이 되었다. 다른 날 기록에 '대응 완료'라고 적혀 있던 것들을 새로운 규칙에 따라 한 건씩 실제로 열어 확인해 보니, 역시 실제로는 손도 대지 않은 채 며칠 동안 방치되어 있었음을 알게 되었다. 기록상으로는 끝났어야 할 일이 실제로는 한 번도 시작조차 되지 않았던 것이다.
놀라운 것은 이 구조가 전혀 다른 업무에서도 일어났다는 점이었다. 우리 회사에서는 게시물에 첨부하는 이미지도 AI 사원(디자이너 역)이 만들고 있다. 어떤 이미지를 만들게 했을 때 디자이너 역은 “불필요한 장식은 일절 포함되어 있지 않습니다”라고 스스로 신고해 왔다. 확인 차원에서 AI 사원(법무 역)에게 실물을 확인시켜 봤더니 이런 지적이 나왔다. “자세히 보면 작은 원형 도형 두 개가 확실히 그려져 있습니다. 신고 내용과 어긋납니다.”
다행히 그 도형 자체는 특별히 문제가 있는 것은 아니었다. 다만 본질은 '문제가 있었는지 여부'가 아니다. '장식은 없습니다'라는 자기신고와 실물을 본 결과가 어긋났다는 점에서, 이는 대응 판정 건과 완전히 동일한 구조였다. 담당자가 다르고 다루는 대상(문장의 기록인지, 이미지인지)이 달라도, '자신은 이렇게 보고한다'는 주관과 '실제로 그렇게 되어 있는가'라는 객관은 별개로 확인하지 않으면 쉽게 어긋난다.
한 번의 사고라고 생각했던 것이, 실은 같은 구조를 가진 또 다른 사고였다.
모습을 바꾸어 다시 같은 구조가 나타났다
더욱 골치 아팠던 것은, 이 구조가 인간의 판단이 전혀 개입하지 않는 기계적인 조작 과정에서도 일어나고 있었다는 점이다.
AI 직원들은 SNS 조작을 자동화된 브라우저 조작으로 수행하고 있다. 한번은 화면에 '전송하기' 버튼 같은 것이 실제로는 같은 종류의 요소가 두 개 존재했던 적이 있었다. 하나는 실제로 누를 수 있는 활성화 상태였고, 다른 하나는 비활성화되어 누를 수 없는 상태였는데, 겉보기에는 둘 다 똑같은 버튼으로 보였다. AI 직원은 우연히 먼저 찾은 쪽――비활성화된 쪽――을 잡고 "눌렀습니다"라고 보고했지만, 실제로는 아무것도 전송되지 않았다.
이것과 비슷한 일이 다른 장면에서도 일어났다. 답장을 입력하는 화면이 왜인지 같은 화면이 이중으로 겹쳐 표시되어 있어, 보이지 않는 쪽 입력란에 글자를 입력하려다 전송에 실패한 적이 있었다.
어느 쪽도 원인은 같았다. 화면에 ‘그럴듯한 것’이 보인다는 것과, 그것이 지금 여기에서 실제로 유효하게 작동하고 있는 실체라는 것은 별개의 이야기였다. 겉모습의 일치를 상태의 일치라고 착각하면, 조작했다고 생각했을 뿐 아무 일도 일어나지 않는 사태가 벌어진다.
그래서 이쪽에도 판단 조건을 하나 추가했다. “조작하려는 요소가 화면에 실제로 표시되어 있고 유효한 상태인지, 그것을 확인한 뒤에 잡았는지.” 같은 종류의 요소가 여러 개 존재함을 전제로, 항상 보이는 쪽·유효한 쪽을 다시 선택한 뒤에 조작한다는 규칙이다.
하나의 틀로 정리하기
지금까지의 세 가지 사건——대응 판정의 기록, 이미지의 자기 신고, 화면상의 조작——은 다루는 대상도 담당하는 AI 사원도 제각각이었다. 그럼에도 공통되는 구조는 놀라울 정도로 같았다.
“그렇게 보인다”·“그렇게 말하고 있다”는 것과 “실제로 그렇게 되어 있다”는 것을 확인하지 않은 채 동일시해 버린다. 이것이 이 장에서 되풀이된 실패의 정체다.
골치 아픈 것은, 이 실패가 악의나 태만에서 비롯된 것이 아니라는 점이다. 보고해 온 AI 사원은 거짓말을 할 생각이 전혀 없었다. 알림 목록을 비교해 보면 “중복이다”라고 생각하는 것은 자연스럽고, 장식을 넣지 않았다고 생각하면 “장식은 없습니다”라고 답하는 것도 자연스러우며, 화면에 버튼 같은 것이 보이면 그것을 근거로 “눌렀습니다”라고 여기는 것도 자연스럽다. 자연스러운 지레짐작이 확인의 수고를 생략하게 만든다는 점에 바로 위험이 있다.
“완료”라고 쓰기 전에 확인했어?
개별 사건을 그대로 나열하기만 해서는 다른 현장에서 쓸 수 없다. 중요한 것은 거기에서 도출할 수 있는 판단 기준이다.
세 가지 사건에서 추출할 수 있는 판단 조건을 다시 하나로 정리해 둔다.
“대응 완료”, “문제없음”, “눌렀습니다”와 같은 완료를 나타내는 말을 기록·보고하기 전에, 그 대상 자체를 직접 개별적으로 확인했는가. 확인하지 않았다면 완료라고 쓰지 말고, “미확인”, “중복 가능성(미확인)”과 같이 확인하지 못한 사실을 그대로 쓴다.
이 판정 조건의 핵심은 ‘의심해야 할 대상’을 특정 담당자나 특정 업무에 한정하지 않았다는 점에 있다. 문장 형식의 보고이든, 이미지의 자가 신고이든, 기계적인 화면 조작이든, 같은 한 줄로 판정할 수 있다. 업무의 종류가 바뀌더라도 판정의 틀은 그대로 재사용할 수 있다.
또 하나, 직접 실천해 보고 깨달은 것이 있다. 규칙은 만든 순간에는 아직 아무것도 증명되지 않는다. **이 규칙이 실제로 또 다른 놓친 부분을 찾아내면서, 비로소 ‘제대로 작동하고 있다’는 것을 확인할 수 있었다.** 만들고 끝내는 것이 아니라, 다음에 비슷한 상황이 왔을 때 정말로 사용되고 있는지를 지켜보는 데까지가 규칙 만들기의 일부라고 생각한다.
여러분의 현장에 대입해 본다면
이 패턴은 AI에게 일을 맡기고 있는 현장에 국한되지 않고, 사람에게 일을 맡기고 있는 현장에도 그대로 적용된다. 자신의 환경에 비추어 본다면, 다음 질문을 확인해 보길 바란다.
- “대응 완료”, “완료”라고 적혀 있는 기록 중 직접 눈으로 일일이 확인한 것과 보고를 그대로 베껴 적은 것을 구별할 수 있는가.
- 같은 종류의 작업·같은 종류의 화면 요소가 여러 개 존재하는 상황에서, ‘보이는 쪽’ ‘유효한 쪽’을 확인한 뒤 사용하는 절차가 있는가.
- 한 번 만든 확인 규칙을, 그 후에도 다시 실제로 무언가를 찾아내는 상황에서 사용하고 있는가. 아니면, 만든 시점에 만족하고 이후에는 형식만 남아 있지 않은가.
이후에는 이 장과 같은 형식의 판정 조건과 체크리스트가 3개 장에 걸쳐 이어져 있다. 개수로 따지면 조건표 12개, 판정 조건 3개, 체크리스트 항목 9개다. 그중에서도 다음 장이 가장 두껍고, 재미의 범위를 정하는 6가지 요소, 실제로 쓸 수 있는 5가지 유형, 수치를 다루는 법이라는 3단계로 읽을 수 있도록 구성되어 있다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 38청크
원문 보기 | 출처: note.com