새 모델의 “40% 할인”, “점수에서 우세”를 보고, 사용법을 바꾸는 것이 좋을지 고민하고 계신가요.
클루드(Claude)를 업무에 활용하는 비전문가를 위한 안내입니다.
읽어 내려오면 발표의 숫자를 자신의 방식으로 다시 읽어볼 수 있습니다.
#44 sonnet5.0에서 제작한 기사는 여기서 확인하실 수 있습니다.
우리는 다음과 같은 일을 하기로 했습니다. 전환은 할 것이며, 역할 분담은 문제가 발생한 실제 사례가 나올 때까지 미룹니다.
지금까지 Opus를 사용하던 공정은 Opus 5.5로 전환했습니다. 금액의 읽기처럼 정확도가 최우선인 공정만은 심층 분석 설정을 “높음”으로 명시하여 사용합니다.
한편으로 조사 및 검증의 일부를 Opus 5.5에 맡기는 방안은 현재 보류됩니다. 현재의 분담으로 실제로 어려움을 겪는 상황이 아직 없고, 비교 대상 모델도 수 주 이내에 새롭게 변경될 예정입니다.
가지고 가야 할 관점: 발표의 숫자는 “어떤 기준으로 측정했는지, 어떤 설정이었는지”까지 꼼꼼히 읽고 사용해야 합니다.
새로운 모델의 숫자가 개선되었고, 귀하의 업무에서 발생하는 문제들이 줄어드는 것은 별개로 확인해야 합니다.
점수는 측정 오차의 정확도가 떨어지면 차이를 정확하게 반영하지 못합니다. 할인율은 자신이 기본 설정과 다르게 사용하고 있다면 그대로 맞지 않습니다. 숫자 옆에 쓰여진 조건을 읽고, “지금 실제로 어려움을 겪고 있는 상황이 있는가”를 확인한 후 움직입니다. 이렇게 하면 발표할 때마다 휘둘리지 않고 지낼 수 있습니다.
무슨 일이 일어났는지
저희는 원래 계획 및 설계는 Opus, 실행 및 조사, 검증은 Sonnet, 최종 점검은 다시 Opus로 Claude를 사용하는 시스템입니다.
9월 21일, 제 계약에서는 최상위 모델 중 하나인 페이블이 정액 요금 범위에서 벗어나 시간제 요금제로 변경되어, 기본적으로 사용하지 않기로 결정했습니다.
9월 22일, 그날 Opus 5.5가 공개되었고, 정액 플랜에서 추가 요금 없이 이용할 수 있습니다. 다만, ‘effort’(AI에 대한 심도 설정)의 기본값이 Opus 5의 ‘고(high)’에서 ‘중(medium)’으로 변경되었습니다.
9월 24일, 사내에서 “결정하기 전에 의도적으로 반대 의견을 제기하여 확인하는 자리를 마련하여” 해당 건을 논의했습니다. 테이블 위에 놓여 있던 것은 ①Opus 5.5로 전환하는 것, ②조사 및 검증의 일부를 Sonnet에서 Opus 5.5로 격상하는 것이었습니다. 결과, ①은 채택했으며, ②는 보류했습니다.
왜 그렇게 된 이유인지
보낸 이유는 저희 현장의 사정입니다(3번째 소제목에서 설명합니다). 먼저 공식 페이지에 기재된 내용과 이 보낸 것을 뒷받침하는 두 가지 사항을 설명하겠습니다.
벤치마크의 점수 차이는 제작 측에서도 “예상하기 어렵다”고 보고 있다.
벤치마크는 AI의 능력을 측정하기 위한 표준화된 테스트입니다. 새로운 모델이 출시될 때마다 점수표가 발표됩니다.
오пус 5.5 공식 페이지에는 다음과 같이 쓰여 있습니다.
이러한 수준의 역량에서는 벤치마크 점차가 실제 차이를 파악하는 데 있어 신뢰성이 떨어지는 것을 발견했습니다.
같은 페이지에는 자신들이 직접 사용해보면 Opus 5.5와 상위 버전인 Fable 5.1의 차이가 점수만으로 보여주는 것보다 훨씬 작다는 내용의 문구도 있습니다.
이는 “느낌은 사람마다 다를 수 있는 문제”가 아닙니다. 성능이 이렇게까지 향상되면, 기준이 되는 벤치마크의 눈금 자체가 차이를 정확하게 반영하기 어려워지고 있으며, 제작 측에서도 이를 인정하고 있습니다.
40% 할인율은 단가 20% 감소와 사용량 감소를 곱한 값입니다.
공식 자료에는 “Opus 5보다 40% 저렴하게 이용 가능하다”고 명시되어 있습니다. 그러나 요금표에는 Opus 5.5의 경우 입력 4달러, 출력 20달러, Opus 5의 경우 입력 5달러, 출력 25달러로 되어 있습니다. 두 모델 모두 할인 폭은 20%입니다.
남은 차이는 아래로 내려간 것이 하나 더 있기 때문에 설명됩니다.
첫 번째는 단가입니다. 입력은 20%, 캐시 읽기(한 번 읽은 내용을 재사용할 때의 요금)는 $0.50에서 $0.20으로 60% 인하되었습니다.
두 번째는 동일한 작업에 사용되는 토큰(AI가 읽고 쓰는 양의 단위)의 수가 그 자체입니다. 공식 예시에서는 특정 감사 작업이 Opus 5에서는 20시간 이상 소요되었고, 토큰 사용량도 2.5배를 사용했던 반면, Opus 5.5에서는 3시간 미만으로 완료되었습니다.
요청 금액은 “단가 × 사용량”으로 결정됩니다. 단가가 낮아지고 사용량도 줄어들었기 때문에 감소 폭은 단가의 20%보다 커지며, 일반적인 작업의 평균으로는 40% 정도가 됩니다.
하지만 공식 원문에는 “기본 설정에서”라는 조건이 붙어 있습니다. 기본 노력은 “중”입니다. 정확도를 우선하여 노력을 “높”으로 올리면, 고려하는 양이 늘어나는 만큼 토큰도 늘어나므로 40%는 완전히 적용되지 않습니다. 저희는 금액 판독 등을 “높”으로 사용하기로 결정했기 때문에, 해당 과정에서는 40%를 그대로 간과하지 않았습니다.
점수와 할인율이 흔들린다면 분담은 어려운 실제 사례로 실행하기가 곤란합니다.
급등안을 재검토한 이유는 두 가지입니다.
첫째, 현재의 분담으로 실제로 문제가 된 사례가 아직 없는 것으로 보입니다. 둘째, 공식 페이지에 “Claude Sonnet 5.5와 Claude Haiku 5.5는 다가오는 몇 주 안에 출시될 예정”이라고 되어 있으며, 비교 대상인 Sonnet도 곧 새로운 버전으로 업데이트될 예정입니다. 현재의 가격 차이로 비교해도 곧 구식이 되어버릴 것입니다.
위 두 항목을 합치면 이 중단은 실마리를 제공해 줄 수 있습니다. 점수 차이가 실제 감각과 일치하지 않을 수 있으며, 할인율 또한 노력 설정에 따라 달라집니다. 그렇다면 점수표만 보고 분담을 바꾸는 것은 위험합니다. 재검토는 소네트의 새로운 버전이 나온 후에, 실제로 문제가 발생했을 때 하는 것이 좋습니다.
내일 당신이 할 수 있는 일
다음으로 ‘교환하고 싶은’ 모델의 발표 페이지를 하나 열어, 손안의 메모지에 2줄만 적어 보세요.
- “40% 할인”, “점수에서 우세”와 같은 숫자를 하나 선택하여 그 바로 옆에 있는 조건의 단어를 적고, 당신이 그 조건에 따라 사용하고 있는지 ○ 또는 ×를 표시하시오.
- 그 옆에는 “현재의 방식으로는 실제로 겪었던 문제 상황”을 하나 적어 주세요.
2행이 완성되지 않으면 이번에는 취소하고 넘긴다고 결정합니다.
위 조건의 용어는 저희가 이번 Opus 5.5 공식 페이지에서 실제로 찾은 것입니다. 숫자나 조건은 모델마다 다르므로, 저희의 기준으로 사용하지 마시고, 참고 자료로만 활용해 주십시오.
이렇게 하면 어떻게 될까. 우리 경우에는 이 두 가지를 묶어 “보류 이유”와 “다음으로 재검토할 계기”가 각각 한 문장으로 정해졌습니다. 발표가 될 때마다 처음부터 헤매지 않고, 쓴 한 문장에 충실했는지만 확인해도 충분합니다.
똑같은 일이 벌어지는 사람 / 일이 벌어지지 않는 사람
- 똑같은 일이 발생하는 사람: 새로운 모델이 나올 때마다 점수표나 “〇% 저렴” 문구로 사용 방식을 바꾸고 싶어하는 사람
- 똑같은 일이 일어나는 사람: AI 설정(노력 등)을 기본값에서 변경해서 사용하고 있는데, 발표 숫자를 그대로 자신에게 적용하는 사람
- 일어나는 데 어려움을 느끼는 사람: 기본 설정을 유지하고 단일 모델만 사용하는 사람(업무 분담 변경이 잦지 않은 경우)
- 일어나는 데 어려움을 겪는 분: 현재의 분담 방식으로는 이미 문제가 명확하게 드러나 있는 분(그 경우, 점수보다 먼저 해당 사례로 판단할 수 있습니다).
저희 환경과 시도한 조건
- 무슨 이야기인지: Opus 5.5 공개를 계기로 자사의 AI 모델 활용 방식을 재검토
- 체제: 소규모 법인
- 환경: 클로드(클로드 코드)를 정액 요금제에서 이용
- 비교 대상 모델: Opus 5.5 (2026년 9월 22일 공개)와 Opus 5. 조사 및 검증 측은 Sonnet (5.5 공개 이전 버전)의 상태를 유지합니다.
- 시기: 2026년 9월 21일 (페이블 사용은 원칙적으로 배제) / 9월 22일 (오퍼스 5.5 공개) / 9월 24일 (검토 필요 여부 판단)
- 소요 비용: 추가 지불 없음 (정액 요금제의 범위 내)
- “40% 할인”, “단가 20% 감소”는 Anthropic 공식 수치이며, 저희가 측정한 값은 아닙니다. 벤치마크 역시 저희에서 점수를 재조정한 것은 아니며, 공식적으로 기재된 내용을 바탕으로 판단한 것입니다.
좀 더 넓게 펼치면
숫자는 측정한 물도시와 조건이 함께 설정되어야 의미를 갖습니다. 물도시가 제대로 작동하지 않거나, 혹은 조건이 사용자의 방식과 다르면 그 숫자는 당신의 판단 자료로는 절반밖에 활용할 수 없습니다. 남은 절반은 당신의 현장에서 실제로 어려움을 겪고 있는지에 따라 채워주세요.
이 이야기가 이어지는 사람에게
이 부분까지는 “발표 숫자를 어떻게 읽어내릴지”에 대한 논의를 마무리하지만, 실제로 결정하는 상황의 절차—반대 의견을 어떻게 반박할지, 거절 이유와 재검토 계기를 어떻게 남겨두고, 이후 어떻게 이끌어갈지—는 여전히 남아 있습니다.
유료 기사 “비엔지니어(엔지니어)가 AI와 경영 판단을 수행할 때, 결정·기록·추출·평가 체크리스트(2026년 9월판)”에는 그 4가지 상황에 따른 확인 항목이 포함되어 있어, 판단할 때마다 동일한 절차를 스스로 반복할 수 있습니다.
다음 새로운 모델 발표를 보게 되었을 때, 결정하기 전에 확인해야 할 사항들과, 결정한 후에는 남겨두어야 할 사항들을 제 개인적으로 정리한 항목으로 모두 갖출 수 있는 상태가 됩니다. (매출이나 성과를 보장하는 내용은 아닙니다.)
이 기사에 대해
안녕하세요, 여러분. 오늘은 제가 최근에 읽고 재미있었던 책에 대해 이야기하고 싶습니다. 그 책은 야마구치 쇼헤이의 ‘바닷가 카후카’입니다.
이 책은 주인공 후지노 아카리우고가 어느 날 갑자기 자신의 인생이 완전히 바뀌어 버린 이야기입니다. 그는 자신이 전혀 모르는 곳에 있는 자신을 발견하고, 그곳에서 만나는 사람들과의 교류를 통해 자신의 삶의 의미를 되돌아보게 됩니다.
야마구치 쇼헤이의 작품은 독특한 세계관과 등장인물들의 섬세한 심리 묘사가 매력적입니다. ‘바닷가 카후카’ 역시 이러한 특징을 잘 보여주고 있으며, 읽고 나면 깊은 감동과 여운이 남습니다.
특히 기억에 남았던 장면은 후지노 아카리우고가 한 여성과의 만남을 통해 자신의 삶에 혼란을 느끼는 장면입니다. 그는 그 여성과의 대화 속에서 자신의 존재 의미에 대해 깊이 생각하고 갈등합니다.
이 책은 독자들에게 자신의 삶을 되돌아보게 하는 계기를 줍니다. 그리고 자신에게 정말 중요한 것이 무엇인지 다시 한번 생각해 볼 수 있도록 해 줄 것입니다.
참고로 저는 이 책을 읽고 난 후, 잠시 동안 자신의 일상에 의문을 느끼며 지냈습니다. 하지만 그 과정에서 자신과 마주하는 시간을 갖는 것의 중요성을 깨달았습니다.
‘바닷가 카후카’는 읽는 사람마다 다른 해석과 감동을 선사하는 훌륭한 작품입니다. 꼭 한번 읽어보시길 바랍니다.
이 글은 Opus 5.5(노력=중간, 기본)가 작성했습니다. 같은 재료와 규칙을 Sonnet(노력=높음)에 전달하여 작성하게 했더니, 내용이 같음에도 불구하고 표현 방식이 상당히 달랐습니다. 또 다른 글(44)과 2개를 비교한 칼럼(46)도 있습니다. 어느 설명이 자신에게 맞았는지 비교하여 읽어보세요.
또한 댓글에서 #44와 #45 중 어느 쪽이 더 이해하기 쉽고 읽기 쉬웠는지 알려주세요.
ao Lab.은 ao.create가 실제로 시도한 내용을 담은 무료 시리즈입니다. 궁금한 점이나 질문이 있다면 댓글欄이나 메시지를 통해 편하게 문의해주세요.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 48청크
원문 보기 | 출처: note.com