오퍼스 5.5로 전환한 지 5일 동안, 실패 노트에 97건의 기록이 누적되었습니다. 내용을 분석해 보면, AI의 판단 착오가 97건 중 23건입니다. 그 23건 대부분은 현명함이 부족한 것이 아니라, 확인 절차를 한 단계 건너뛰는 방식으로 진행되었습니다.
이 정도의 수정이라면 Sonnet으로 충분합니다. 9월 22일부터 26일까지의 대화에서 최소 9회 언급되었습니다.
저는 겸손하지 않습니다. 가벼운 작업에는 가벼운 모델을 추천하도록 제가 규칙에 적어놓은 것이 있었기 때문입니다(웃음). 오토캠프 운영도, 업무 코딩도, 자료 제작도, 거의 대부분 Claude와 함께 진행하고 있습니다.
발표된 수치에 따르면, 이전 Opus 5보다 14 포인트 높이 나타났습니다.
먼저, Anthropic의 발표치를 표에 정리했습니다.
AI 개발 작업 성과 측정 시험 “Terminal-Bench 4.0”에서 Opus 5.5는 66.4%를 기록했으며, 이전의 Opus 5는 52.3%, 상위의 Fable 5.1은 55.8%를 나타냈습니다.
가격은 100만 토큰당, 입력이 5에서 4달러로, 출력이 25에서 20달러로 하락했습니다. 같은 맥락을 재검토할 때의 요금(캐시 읽기)은 0.50에서 0.20달러로 되었습니다. 일상적인 사용으로는 Opus 5보다 40% 저렴하다고 발표되었습니다. 출력 속도는 30% 더 빠르다고 하지만, 제가 직접 측정하지는 않았습니다.
상위 모델보다 저렴하고 발표 점수도 높아 표만 놓고 보면 갈 이유는 찾을 수 없었습니다.
실패 노트 97건 중 AI의 판단 오류 23건
AI가 실수를 했을 때, 제가 “틀렸습니다”라고 바로잡았을 때, 분야별 실패 노트에 1행씩 추가하고 있습니다. 9월 22일부터 26일까지의 기록은 총 97건이었으며, 평균적으로 하루에 약 19건 정도입니다.
정말 많다고 생각하여 4개로 나누었습니다.
가장 많은 문제는 코드 작성 오류로, 총 97건 중 32건입니다. 다음으로, 서버나 외부 서비스의 사기 수법이 31건입니다. 실제 데이터베이스의 경우, 작성 규칙이 다를 뿐만 아니라, API의 실제 응답이 설명서와 맞지 않는 경우 등이 있습니다. AI가 기존 프로그램에서 결함이나 약점을 발견한 기록도 11건 있으며, 이는 실패가 아닌 손柄의 쪽에 속하는 것입니다.
남은 23건은 확인을 소홀히 하거나, 잘못된 판단들이었습니다.
단지 이 97건은 Opus 5.5만의 기록이 아니었습니다. Sonnet으로 전환된 대화나 Sonnet으로 움직이는 체크 역할을 수행한 부분도 섞여 있어 대화 단위로 모델까지 기록하지 않았습니다. 따라서 이 숫자는 “Opus 5.5의 실패율”로 사용하지 않으며, 실패의 형태에 관한 데이터를 확인하고 싶었습니다.
남아있는 23건 모두 “확인했는지”를 누락하고 있었다.
23건을 다시 읽어보니, 비슷한 형태가 나란히 놓여 있었습니다.
확인하려는 의도로 흘린 스크립트가 실제로 본문에 적용된 적이 있었습니다. 테스트 삼아 흘려보는 옵션(--dry)이 있는지 먼저 확인하지 않았습니다. 손안의 데이터를 기준으로 기사의 본문을 싹 대체하고, 본판에서만 수정했던 부분을 되돌리려다 잠시 멈춘 적도 있습니다.
가장 먼저 식은땀을 흘린 것은 “실측 38%”라고 적힌 숫자였습니다. 디자인을 다시 만들 때 시안본으로 넣은 숫자를 AI는 실측으로 페이지 본문과 계산식에 사용하고 있었고, 원래 기록을 찾보니 아무도 측정하지 않았던 것입니다.
모든 것은 벤치마크 점수로는 막을 수 없는 종류의 실패라고 생각합니다. 점수가 14 포인트나 올라도, 검증 절차를 한 단계 건너뛰면 같은 일이 발생합니다.
그러므로, 수정한다면 절차의 부분을 지침으로 삼았습니다. 새로운 스크립트에는 '--dry'를 적용하고, 실제 값을 가져와서 수정하며, 숫자에는 출처를 명시합니다.
5일 만에 척척 해내는 활용법은 3단계입니다.
설계 판단, 원인 모를 오류, 공격자의 시선으로 된 리뷰는 Opus 5.5에 맡기고, 조사, 정형 코딩, 자료 제작은 Sonnet 5에 맡깁니다. 기계적인 일괄 변환은 Haiku 4.5로 진행했습니다.
상위 Fable은 6월에 3개의 체크 역할을 통해 테스트할 예정이었으며, 평가 기록이 0건으로 남아 기한이 지나자 9월 26일에 모든 것을 되돌렸습니다. 현재 가격과 발표 점수를 고려하면, 되돌린 것이 옳았다고 생각합니다.
참고해야 할 점이 하나 있습니다. Opus 5.5는 사이버 보안 요청의 대부분을 기본적으로 Opus 4.8로 전환하겠다고 발표되었습니다. 공격자의 시선으로 검토하는 체크 역할을 할 때, 어떤 모델이 답변했는지 확인하는 방식으로 진행했습니다.
더 빨리 도착한 버스는 확인 시간에 맞춰 출발했습니다.
오퍼스 5.5에서 5일 동안, 실패 노트는 97건이 모였다. AI의 판단 착오가 23건으로, 대부분 확인 절차를 1단계 건너뛴 형태였다.
모델이 저렴하고 빠르게 나온 부분은 본番에 적용하기 전의 확인과 숫자 오류를 찾는 데 시간을 할애할 것입니다. 冒頭의 “Sonnetで十分です”도 근본적인 내용은 같은 이야기라고 생각합니다. 이 5일 동안에는 어떤 모델을 사용할지, 어떻게 검증할지가 결과에 더 큰 영향을 미쳤을 거라고 생각합니다. 다음에는 1개월 분량이 모이면 판단 미스 수가 얼마나 변했는지 다시 세어보려고 합니다.
※실패 노트의 분류와 초안은 Claude가 만들고, 저는 내용을 읽고 공개 여부를 결정했습니다. 모델의 사용 구분은 저의 판단입니다.
관련 자료
저는 혼자서 캠핑장과 차량 캠핑 장소 정보를 제공하는 사이트를 운영하고 있습니다. 스시 장인, 장거리 운전사, 농업 경험을 바탕으로 웹 제작으로 전향했습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 21청크
원문 보기 | 출처: note.com