새로운 AI가 나올 때마다, 이렇게 생각하지 않으세요?
결국, 가장 현명한 AI를 사용하면 되는 거겠죠.
솔직히, 저도 얼마 전까지는 그렇게 생각했습니다.
하지만 회사에서 매일 AI를 작동시키고 보니까, 답은 반대로 나왔습니다.
가장 현명한 AI를 모든 일에 사용하면 회사는 오히려 혼란스러워질 수 있다.
지금 보고 있는 것은 2026년 9월 16일부터 9월 23일까지의 움직임입니다.
지난 일주일 동안 OpenAI는 어려운 작업에 적합한 GPT-6 솔과 대량의 반복적인 작업에 적합한 GPT-6 루나를 발표했습니다. Anthropic 또한 Claude Opus 5.5를 발표하며 성능뿐만 아니라 가격, 속도, 안전성을 강조하고 있습니다.
GitHub에서는 AI가 비용, 품질, 응답 속도 중 어떤 것을 우선시할지 선택할 수 있는 기능과 여러 AI로 코드를 검토하는 기능이 발전했습니다.
뉴스만으로는 “또 새로운 모델이 늘어났다”라는 식으로만 보일 수 있습니다.
하지만, 오르류 총본가에서 AI팩토리를 운영하는 입장에서 보면, 이것은 모델 경쟁의 문제가 아닙니다.
AI 직원들을 업무에 맞춰 배치하는 시대가 시작되었다는 이야기가 있습니다.
사장님께서 전 직원에게 최고 연봉을 지급하지 않는 것과 같습니다.
회사에는 생각하는 일도 있고, 반복하는 일도 있습니다.
신상품 정책을 결정하는 것은 어려운 일입니다.
한편, 정해진 형식으로 100건을 입력한다. 이 경우는 수가 많아 실수를 내지 않고 계속하는 것이 중요하다.
이 두 가지를 같은 사람에게 같은 방식으로 맡기는 회사는 없습니다.
AI도 같습니다.
OpenAI는 9월 22일, GPT-6 솔(Sol)을 복잡한 코딩이나 에이전트 작업에 적합하고, GPT-6 루나(Luna)를 특정 목표를 가진 대량 작업에 적합하게 발표했습니다. 최상위 모델인 Astra를 포함하여, 난이도, 속도, 비용 등을 고려하여 유연하게 활용하는 방식을 제시했습니다.
전문 용어로는 “모델 라우팅”이라고 합니다.
들리는 대로 어렵지만, 결국에는 배치입니다.
점장에게 맡기는 업무, 숙련된 전문가에게 맡기는 업무, 표준 절차에 따라 진행하는 업무를 분리한다. AI로도 충분히 처리할 수 있다.
저희는 100개 상품과 4개 상품으로 주문 방식을 변경했습니다.
지난 일주일 동안 저희에서는 ShopServe의 상품 페이지를 매일 100건씩 확인하고, 검색 결과에 나타나는 페이지 제목을 정비했습니다.
9월 23일에는 100건 중 100건을 업데이트하고 공개 페이지까지 확인하여 누적 건수 6,520개 상품을 확인했습니다.
다만, AI에게 “6,520건을 깔끔하게 정리해달라”고 요청한 적은 없습니다.
수정 가능한 부분은 페이지 제목 하나뿐입니다. 상품명, 가격, 재고, 설명문, 상품 ID, URL은 변경하지 않습니다. 수정 전에는 반드시 백업을 하고, 저장 후에는 공개 페이지의 H1, 제목, URL, canonical을 확인합니다.
따라서 대량 작업을 고려하여 생각할 여지를 좁혔습니다.
이는 루나처럼 가볍고 대량 처리에 능한 AI에게 적합한 업무입니다.
반대로, 아마존 상품 개선은 같은 방식으로 임해서는 위험합니다.
9월 22일에는 숫자 하락의 이유를 확인한うえ로 명태, 사코쉬 2개 상품, 전掛け 상품 등 총 4개 상품을 개선했습니다.
여기에는 상품 설명 및 사양은 직접 수정했지만 가격, 재고, 광고, 배송 기간은 변경하지 않았습니다.
숫자가 하락했다고 해서 바로 할인하지 않는다. 광고비를 늘리고 재고를 관리해야 한다. 그렇게 함부로 진행하면 개선이 아닌 사고로 이어진다.
원인을 파악하고, 만져도 되는 곳과 만져서는 안 되는 곳을 분리한다.
이는 판단력이 높은 AI와 인간의 확인이 필요한 작업입니다.
같은 이커머스 운영자라도 100건의 반복 작업과 4가지 상품에 대한 의사 결정에서는 배치하는 AI가 다릅니다.
단순히 저렴한 AI를 사용하는 목적이 아닙니다.
전체적으로 저렴한 AI로 바꾸려는 이야기가 아니라는 점을 혼동하지 않기를 바랍니다.
중요한 것은 1회 요금이 아니라, 일처리가 완료될 때까지의 총 비용입니다.
저렴한 AI가 3번이나 잘못 대답하여 사람이 수정하고, 결국 다시 진행하면 비용이 많이 듭니다.
반대로, 샘플대로 분류 작업을 1,000건만 수행해도 최고 AI에 장시간 심사하는 것은 낭비입니다.
식당에서 비유하자면, 접시 씻는 일을 셰프에게 계속 맡겨대는 것과 같습니다.
요리사는 접시를 씻지 못하는 것이 아닙니다.
하지만 그 시간에 새로운 메뉴를 기획해 주시는 것이 가게 입장에서는 훨씬 더 유리합니다.
AI는 “할 수 있는가”가 아니라 “이 일에 활용하는 것이 이득인가”를 기준으로 판단해야 합니다.
작동하는 AI와 검증하는 AI를 분리
또 다른 중요한 점은 AI가 자신의 업무를 스스로 검토하는 흐름입니다.
GitHub은 9월 18일, Copilot의 코드 검토에서 여러 AI가 서로 다른 관점에서 확인하고 결과를 하나로 통합하는 시스템을 소개했습니다. 빌드 및 테스트와 같은 도구를 활용하여 수정된 사항과 남아있는 문제를 분리합니다.
저희 AI_FACTORY에서도 같은 방식/접근 방식을 사용하고 있습니다.
9월 23일 정기 점검 결과, LINE 메커니즘에서 808건, 관리 화면에서 21건, 광고 AI에서 46건, 상품 카탈로그에서 32건, SNS 게시물 공장(工場)에서 6건을 확인했으며, 총 913건의 테스트를 검증했습니다.
상품 카탈로그도 일반 대상과 도매 대상 각각 1,593건을 생성하여 확인하고 있습니다.
만들어진 AI가 “성공했습니다”라고 말하는 것만으로는 끝나지 않습니다.
테스트 AI, 공개 페이지 AI, 숫자 일치 AI로 분류한다.
사람 회사의 경우, 영업 담당자가 직접 전표를 만들고, 직접 승인하고, 직접 감사까지 수행하면 끔찍한 일입니다.
AI도 마찬가지입니다.
작업자와 검토자를 분리하면 실수를 더 쉽게 찾아낼 수 있습니다.
성능이 향상된 만큼 “터치 금지” 경고가 필요합니다.
Anthropic은 9월 22일에 Claude Opus 5.5를 발표했습니다. Opus 5보다 빠르며, 일반적인 작업에서는 비용을 절감하면서도 회복 불가능한 수준의 오류나 요청 범위를 벗어나는 행동을 줄였다고 설명하고 있습니다.
이는 경영자로서 매우 중요합니다.
AI가 지혜로워짐에 따라, 이 짧은 지시에서 많은 것을 파악하고 실행할 수 있게 됩니다.
편리하지만, 지나치게 융통성이 부족하다고 비난받을 위험도 있습니다.
상품을 개선하라”라고 말하면 설명문뿐만 아니라 가격이나 광고까지 변경될 수 있다.
그래서 일을 부탁할 때는 “해야 할 일”뿐만 아니라 “하지 말아야 할 일”도 함께 전달합니다.
중요한 고객 대응, 금액, 계약, 삭제, 공개, 광고비 변경 등은 담당자에게 직접 전달합니다.
전문 용어로는 가드 레일, 즉 AI가 넘어서서는 안 되는 장벽입니다.
강력한 차일수록 제동이 중요합니다.
처음이시라면, 일을 네 가지 상자에 나누어 주세요.
중소기업은 갑자기 여러 모델을 세밀하게 설정할 필요가 없습니다.
먼저, AI에게 맡길 일을 네 가지 범주로 나누는 것만으로도 충분합니다.
첫 번째는 “반복적인 업무”입니다. 분류, 목록화, 정해진 형식으로 변환하는 것입니다.
두 번째는 “기본 실무”입니다. 문단 작성, 조사 정리, 간단한 수정이 해당합니다.
세 번째는 “실수를 하면 고통스러운 판단”입니다. 원인 분석, 설계, 중요한 검토입니다.
네 번째는 “인간 폰트”입니다. 공개, 전송, 삭제, 금액, 계약을 의미합니다.
이 네 가지를 분리하는 것만으로도, 어디에 빠른 AI를 사용하고, 어디에 강력한 AI를 사용하며, 인간이 멈추는 지점을 명확히 알 수 있습니다.
처음부터 정답을 맞히려고 애쓸 필요도 없습니다.
똑같은 일을 다른 AI에게 한 번씩만 부탁하여 품질, 속도, 재작업 횟수를 비교하는 것이 좋습니다.
AI 선택은, 카탈로그의 점수만 보는 것보다 실제 자사의 업무에서 면접을 진행하는 것이 훨씬 빠릅니다.
다가오는 인공지능 도입은 채용보다 인사에 더 가까워질 것이다.
지난번 글에서는 AI가 한 명의 편리한 존재에서 팀으로 발전해 왔다고 언급했습니다.
지난 일주일 동안, 다음 단계가 보이기 시작했습니다.
단순히 팀을 만드는 것만으로는 부족합니다.
누가 무엇을 맡고, 누가 확인하고, 어디로 인간으로 되돌려 보내는지를 결정해야 합니다.
다가오는 인공지능 도입은 “가장 현명한 AI를 구매하는” 일이 아닙니다.
AI 직원 채용, 배치, 권한, 평가에 관한 이야기입니다.
저 역시 오르 흐(俺流) 총본가이지만, 어려운 판단은 강력한 인공지능에게, 대량 처리 작업은 가벼운 인공지능에게, 외부로 나가기 전의 확인은 다른 인공지능과 인간에게 맡기는 등, 이러한 형태를 늘려가고 있습니다.
아마도 더 강할 것이다.
다만, 우리 경우 상품이 6,520개 있습니다.
모두를 최강 AI로 만들면, 인공지능 직원들이 고급 정장을 입고 6,520건의 회의를 시작합니다.
그렇다고 해서 일이 끝나는 건 아니에요.
참고한 주요 공식 발표
- OpenAI, GPT-6 솔과 루나 소개
- OpenAI 모델 선택에 대한 내용입니다.
OpenAI에서 제공하는 다양한 모델 중에서 어떤 모델을 선택해야 할지 고민이 많으실 텐데요. 모델 선택은 프로젝트의 목표, 예산, 그리고 필요한 성능에 따라 달라집니다.
OpenAI는 현재 GPT-4, GPT-3.5, DALL-E 3, 그리고 다양한 파인튜닝 모델을 제공하고 있습니다. 각 모델은 서로 다른 강점과 약점을 가지고 있으며, 특정 작업에 더 적합한 모델이 있을 수 있습니다.
**GPT-4**는 가장 강력한 모델 중 하나로, 복잡한 추론, 창의적인 콘텐츠 생성, 그리고 다양한 언어 작업에서 뛰어난 성능을 보여줍니다. 하지만 GPT-3.5에 비해 비용이 비싸고, 사용량 제한이 있을 수 있습니다.
**GPT-3.5**는 GPT-4보다 저렴하고 빠르며, 대부분의 일반적인 작업에 충분한 성능을 제공합니다. 텍스트 생성, 요약, 번역 등 다양한 작업에 활용할 수 있습니다.
**DALL-E 3**는 텍스트 설명을 기반으로 고품질 이미지를 생성하는 모델입니다. 창의적인 시각 콘텐츠를 제작하는 데 유용하며, GPT-4와 통합되어 더욱 강력한 기능을 제공합니다.
**파인튜닝 모델**은 특정 작업에 맞게 OpenAI의 기본 모델을 추가적으로 학습시킨 모델입니다. 예를 들어, 특정 분야의 전문 용어에 익숙한 모델이나 특정 스타일의 텍스트를 생성하는 모델을 파인튜닝할 수 있습니다.
모델 선택 시 고려해야 할 요소는 다음과 같습니다.
* **작업의 복잡성:** 복잡한 작업에는 GPT-4와 같은 강력한 모델이 필요할 수 있습니다.
* **예산:** GPT-4는 GPT-3.5보다 비용이 비싸므로, 예산을 고려하여 모델을 선택해야 합니다.
* **성능 요구 사항:** 필요한 성능 수준에 따라 모델을 선택해야 합니다.
* **데이터 가용성:** 파인튜닝 모델을 사용하려면 충분한 양의 학습 데이터가 필요합니다.
OpenAI는 모델 선택을 돕기 위해 다양한 도구와 리소스를 제공하고 있습니다. OpenAI API 문서, 모델 비교 자료, 그리고 데모 환경을 통해 모델을 직접 체험해 볼 수 있습니다.
궁금한 점이 있다면 언제든지 OpenAI 지원팀에 문의하십시오.
- GitHub「GitHub Copilot 주간 릴리즈 — 2026년 9월 14일」
- GitHub「Copilot 코드 검토: 향상된 검토 경험」2026년 9월 18일
- Anthropic「클로드 오퍼스 5.5」2026년 9월 22일
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 55청크
원문 보기 | 출처: note.com