AI에게 업무를 맡길수록 점점 걱정되는 것이 이용료입니다. 저희는 Claude Code를 정액 요금제로 사용하고 있지만, 그것과는 별도로 사용한 만큼 요금이 부과되는 방식(API)으로 운영되는 사내 앱도 있습니다. 해당 앱을 방치하면 청구가 늘어납니다.
최근에 그 과금 시스템을 재검토한 결과, AI가 매번 읽어들이던 파일 총 30.5KB를 23.1KB까지 줄였고, 회사 내 “AI 직원” 19체 중 10체를 경량 모델로 전환했습니다. 이 글은 어떤 부분을 줄이고 어떤 부분을 남겼는지 기록입니다.
사건의 발단은 사장의 사무실로 전달된 한 편의 유튜브 영상이었습니다. AI의 처리량을 줄이는 절약법을 소개하는 영상이었죠. 하지만 영상을 끝까지 보는 시간이 부족했기에, 구글의 AI ‘노트북 르메’에 내용을 읽어주고, 어떤 주장을 펼치고 있는지 핵심 내용을 나열하도록 했습니다. 거기서부터 당사에 적용 가능한 것들만 골라 실제로 실행에 옮긴 것이 이번 작업의 배경입니다.
왜 “지침서의 길이”가 매번 비용이 되는 걸까요
클루드 코드에는 작업을 시작할 때마다 반드시 읽어들이게 하는 파일이 2개 있습니다.
- 회사의 규칙과 내부 시스템에 대한 설명서입니다. “삭제하기 전에 반드시 확인해야 한다” “개발 중인 앱은 구간별로 클라우드로 동기화한다” 등의 규정 사항이 기재되어 있습니다.
- 메모리.md: 과거 기억의 색인. “그 앱의 소유주가 어떤 계정이었는지”, “그 동기가 어디에서 실패했는지”와 같은 기억이 90건 이상 있으며, 그 목록입니다.
이 두 항목은 새로운 작업을 시작할 때마다 매번 완전히 다시 로드됩니다. 인간적으로 비유하자면, 업무를 시작하기 전에 반드시 규정 및 업무 일지의 목차를 다시 검토하는 것과 같습니다.
또한 생성 AI의 과금은 읽어들인 문장의 양에 비례합니다. 즉, 이 두 파일이 길수록 1회당 작업 비용이 계속 증가하며, 1회분이라도 하루에 수십 회로 작업을 시작하기 때문에 누적됩니다.
조사를 해본 결과, 저희의 2파일 합계는 30.5KB(CLAUDE.md 10.3KB + MEMORY.md 20.2KB)였습니다. 일본어로 약 1만 5천 자 정도 분량입니다.
깎는 방법 1: 같은 설명을 두 지점에 반복하지 마세요.
CLAUDE.md에서 가장 많은 내용은 AI 직원 19명 각각의 담당 범위 설명이었습니다. “이 담당은 무엇을 하고, 어디까지가 범위이며, 누구에게 인계할 것인가”를 1명씩 작성했는데, 이것만으로도 수 KB에 달하는 양이었습니다.
그러나 이 설명은 각 AI 직원 정의 파일 측에도 동일한 내용이 기재되어 있습니다. 그것이 원래 저장 위치였으며, 즉 동일한 내용을 2군데나 가지고 있었고, 특히 그 중 하나는 매번 읽혀지고 있었습니다.
그러자 클라우드(CLAUDE.md) 측에서는 역할 목록표(어느 시스템에 누가 있는지)만 남기고, 상세한 담당 범위는 “각각의 정의 파일이 맞다”라는 문구를 참조로 전환했습니다. 이렇게 되면서 10.3KB → 8.1KB로 줄었습니다.
이 작업의 부수적인 결과로, 기록이 오래된 채로 남아있다는 점도 알아차렸습니다. “AI社員18体”라고 쓰여 있었지만, 실제로는 19체로 늘어난 상태였습니다. 두 곳에 동일한 내용을 작성하여, 한쪽만 오래되도록 하는 것이 줄이는 것 자체보다 더 실질적인 피해 예방에 도움이 될 수도 있습니다.
절단 방법 2: 기억 지수는 “단문”과 “아카이브”로 분류한다.
MEMORY.md는 기억 90건 이상의 인덱스로, 각 인덱스당 “제목 + 어떤 내용인지”라는 1행으로 구성되어 있었고, 설명문이 길어지는 경우가 많았습니다.
진행한 일은 두 가지입니다.
- 어떤 사유 때문에, 어떤 판단을 내리고, 주의해야 할 사항이 있었습니다. 내용은 기억 파일 본문에 적혀 있기 때문에, 색인은 “어떤 것을 열어야 할지 알 수 있도록” 돕는 역할만 합니다.
- “아카이브” 섹션을 만들어 완료된 업무를 아래로 모았다. 이전 이관 작업의 경과 등, 완료되었지만 평소에는 참조하지 않는 항목들이다. 삭제하지 않고, 경과를 추적하고 싶을 때 필요하기 때문에 색인에는 그대로 두고 위치만 아래로 내렸다.
결과적으로 20.2KB에서 15.0KB로 감소했습니다. 기억의 개수는 90건 이상을 유지하면서, 인덱스만 단축되었습니다. 오히려 이 작업 중에 인덱스에서 누락되었던 기억이 1건 발견되어 추가하고 있습니다.
깎는 방법 3: 19체 중 10체를 가벼운 모델에 떨어뜨린다.
또 다른 효과적인 방법은 어떤 AI 직원에게 어떤 모델을 사용하게 할지 결정하는 것입니다. 고성능 모델일수록 비용이 높기 때문에 모든 직원에게 최고급 모델을 사용하게 할 필요는 없습니다.
선을 그리는 방법은 이렇게 했습니다.
- 가벼운 모델로 축소한 10개: 회계, 세무, 노무, 고객 지원, SEO·콘텐츠, 마케팅, LP 제작, 수리·평가, 게임 시나리오, 게임 시각 디자인
- 보류된 9명: 기술 총괄, 선임 엔지니어, GAS 개발, 웹 제작, 품질 보증, 보안 인프라, 영상 제작, 애니메이터, 게임 기획
기준은 “조사를 바탕으로 글을 정리하는 업무인지, 아니면 설계를 판단하고 구현하는 업무인지”입니다. 전자는 가벼운 모델이라도 실전에 견딜 수 있지만, 후자는 판단의 질이 결과물의 품질에 직접적으로 영향을 미치므로 간소화할 수 없습니다.
가장 중요한 것은, 다시 원상복구할 수 있도록 대비하는 것입니다. 저희는 “주간 보고서 등에서 품질 저하가 발견된 롤(Roll)에 대해서만, 개별적으로 원래대로 돌려놓는” 규칙을 함께 설정했습니다. 일률적으로 낮추면, 알아채지 못한 채로 품질이 떨어지는 것이 가장 잘못된 것이므로, 복구 조건을 먼저 정해둡니다.
컴퓨터 사용자 이름이 설정에 섞여 있었다.
이 작업 중에 다른 문제점을 발견했습니다. 공유하고 있던 설정 파일에는 특정 컴퓨터의 사용자 이름이 직접 기록되어 있었습니다.
저희는 여러 대의 컴퓨터에서 AI를 실행하고 있으며, 설정은 모든 기기에서 공유하고 있습니다. 그런데 “C:¥Users¥(특정 이름)¥…”와 같이 특정 사용자 이름으로 되어 있는 설정이 다른 모든 기기로 배포되면서 문제가 발생했습니다. 실제로 다른 컴퓨터에서 파일이 읽히지 않는 부작용이 나타났습니다.
공유 설정에서부터 PC 고유의 값을 제외하고 각 PC 전용 설정 파일 쪽에 이동했습니다. 이는 축소의 이야기가 아니지만 “공유하고 있는 파일을 재검토”하는 작업을 통해 발견한 것입니다.
결과와 하지 않았던 일들
- 회사 규정(CLAUDE.md): 10.3KB → 8.1KB
- 기억의 색인(MEMORY.md): 20.2KB → 15.0KB
- 매번 로딩되는 총합: 23.1KB
- 가벼운 모델로 실행하는 AI 직원: 0명 → 19명 중 10명
감축률은 약 24%입니다. 괄목할 만한 수준은 아니지만, 매번의 작업 모두에 효과가 있어서, 횟수가 늘어날수록 차이가 커집니다.
물론, 그렇지 않은 경우도 있었습니다.
- 기억 자체를 지우는 것은 아닙니다. 색인을 간결하게 설정했지만 기억의 개수는 줄이지 않았습니다. 과거의 실패 기록은 같은 실수를 반복하지 않기 위한 자산입니다. 읽기량 감소를 이유로 지우는 것은 본질적으로 반대라고 생각했습니다.
- 규칙을 줄이는 방법: “삭제하기 전에 반드시 확인한다”와 같은 안전을 우선시하는 규칙은 길게 하더라도 줄이지 않습니다. 짧게 해서 해석의 여지가 생기는 것이 오히려 위험합니다.
- 모두를 가벼운 모델로 만들기: 위에서 언급한 바와 같이 판단이 필요한 9대는 보류했습니다.
똑같은 일을 하려고 한다면 어디서부터 시작해야 할지 보라.
제 회사에서 시도해 볼 때는 순서는 이렇게 생각합니다.
- AI에게 매번 읽어달라고 하는 파일의 크기를 측정한다. 대부분, 측정되지 않았어야 할 셈이다. 먼저 그 점부터
- 같은 설명을 두 곳 이상에서 찾아 중복된 내용을 한 곳으로 합치고, 필요하다면 참조로 변경한다. 이는 줄어드는 양뿐만 아니라 오래된 정보도 감소시킨다.
- 종결된 사건의 기록을 삭제하는 대신 아래로 묶는다.
- 역할에 따라 필요한 성능을 고려하고, 조사 및 기록 업무와 설계 및 판단 업무를 분리한다. 또한, 반환 조건을 먼저 결정한다.
화려하지는 않지만, 일회성 작업으로 매번 발생하는 비용에 효과가 있습니다.
이번 주말에 츠키시마 료의 ‘나를 껴안아줘’를 읽었습니다. 료의 섬세한 감정 묘사와 아름다운 문체가 정말 좋았습니다. 특히, 주인공 아키라와 그의 삶의 고뇌를 다룬 부분에서 깊은 감동을 받았습니다. 츠키시마 료의 작품은 앞으로도 계속 읽어보고 싶습니다.
- AI가 작업의 횟수마다 읽어들이는 파일이 길수록 매번 발생하는 비용이 커진다. 저희 집의 총 파일 크기는 30.5KB였다.
- 중복되던 설명이 참조로 전환되면서 10.3KB에서 8.1KB로 감소했습니다. 이 과정에서 “18체”라는 오래된 기록상의 오류가 발견되었습니다.
- 기억 지표는 설명문을 간결하게 하고, 완료된 사례를 아카이브 섹션으로 보관합니다. 20.2KB → 15.0KB. 건수는 줄이지 않았습니다.
- AI 직원 19기 중, 조사 및 작성 역할을 수행하는 10기는 경량 모델로 설정했으며, 판단이 필요한 9기는 고정형으로 설정하고, 품질 저하 시 개별적으로 복구할 수 있도록 규칙을 설정했습니다.
- 총 30.5KB에서 23.1KB(약 24% 감소)했습니다. 또한, 공유 설정에 섞여 있던 컴퓨터 고유의 값을 찾아 수정했습니다.
자신의 회사에서도 AI를 사용하고 있지만, 비용 내역이 불투명한 경우에 대비하여 중고 PC를 AI 직원으로 활용하여 모든 업무를 대행해주는 서비스를 제공하고 있습니다. 자세한 내용은 여기 → https://www.cyclebridgeokinawa.com/ai-shainka/
이 기사에서 사용된 “사브 에이전트”, “모델” 등의 용어에 대한 설명을 종합적으로 정리한 기사가 여기 있습니다 → https://note.com/honest_walrus257/n/n998f28a05eb3
AI 활용 사례를 영상으로도 상세히 설명하고 있습니다. ▶ 유튜브 채널 “사이클브리지오키나와 | AI 활용 랩” https://www.youtube.com/channel/UCKfBG387F7g-t6SCbkFnhzw
이 기사의 내용에 대해 질문이나 소감이 있다면 댓글로 편하게 문의해주세요
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 40청크
원문 보기 | 출처: note.com