미군은 인공지능(AI)의 오보로 인해 중국 선박을 정밀 검사 직전까지 갔었다.
이 게시물은 AI가 생성한 것입니다. 이노우에의 의견이나 견해는 전혀 포함되어 있지 않습니다.
오늘의 뉴스는 인공지능의 “언어”와 “실제 피해”가 같은 날 동시에 보도되었다. 한쪽에서는 인공지능 기업이 자신들을 감시하도록 막대한 비용을 지불한다고 발표했다. 다른 한쪽에서는 미국 군의 분석관이 챗봇에게 들은 답변을 그대로 보고서로 작성하여, 무장한 병사들이 중국 선박에 오르기 직전까지 상황이 전개되었다. 안전을 둘러싼 제도 설계의 논의와 이미 발생한 사고의 사례가 함께 등장한 것이다. 이 두 이야기가 같은 24시간 안에 함께 나타난 것은 현재 인공지능의 위치를 잘 보여준다. 제도가 따라오기 전에 이미 운영이 시작되고 있기 때문이다.
앤서니크(Anthropic)와 Accenture의 협업—“평가자 배치 서비스”로 5년 안에 10억 달러 달성 목표
Anthropic는 9월 18일, Accenture와 협력하여 사내에 독립 평가자를 상주시키겠다고 발표했다. 실무를 담당하는 것은 Accenture의 AI 전문 조직 Faculty이다. 양측은 평가 능력 구축에 5년 동안 최소 10억 달러를 투자할 계획이며, Anthropic는 비영리 평가 기관 METR과도 병행하여 제휴하고, 더불어 평가자를 늘리는 계획이다.
왜 “상주”인지 궁금하신가요? 외부 평가자는 기업이 보여준 것만 확인할 수 있습니다. 상주 평가자는 직원과 동등한 접근 권한을 가지고 있으며, 모델 개발 과정, 훈련 시의 판단, 내부 운영 자체를 관찰합니다. Anthropic의 설명에 따르면, 이는 회사가 안전상의 약속을 지키고 있다는 것을 “검증 가능하게” 만드는 메커니즘이며, “책임을 줄이는 것이 아니라 검증하기 쉽게 만드는 것”으로 간주됩니다. 이 발표는 CEO 다리오 아모디가 공개한 에세이 “We Must Pace the Frontier”에서 약속한 내용의 이행에 해당합니다.
이전 이 欄에서 다뤘을 때, Anthropic과 OpenAI의 상주 연구원에 대한 외부 평가 단체는 조건부로 환영했지만, NDA, 공개 권한, 조사 기간의 짧음을 쟁점으로 지적했다. 이번에 결정된 것은 금액과 상대방이다. 연구 기관이 아닌 컨설팅 업체를 선택하여 5년 10억 달러라는 숫자를 제시했다. 이는 평가를 “프로젝트”가 아닌 “사업”으로 설정하겠다는 의사 표시가 된다. 하지만 독립성의 문제는 금액으로는 해결할 수 없다. 평가자에게 지급되는 보상금을 피평가가 부담하는 구조는 변하지 않았기 때문이다. 다음으로 살펴봐야 할 것은 이 상주 평가원이 무엇을 공개할 수 있는가, 그 권한이 어떻게 문서화되는가이다.
미군 AI 오보—중국 선을 임검 직전까지 진전
CNN은 9월 18일, 독점적으로 보도한 바와 같이, 2026년 봄, 이란과의 전쟁 상황 속에서 미 특수 작전군 분석관이 챗봇에게 중동 지역의 중국 선박 화물에 대해 문의했다. 챗봇은 공개 정보와 기밀 신호 정보를 결합하여 “그 선박은 핵무기 계획과 관련된 부품을 운반하고 있다”는 결론을 내렸다. 분석관은 그 결과를 다시 한번 AI를 활용하여 공식 정보 보고서 형태로 정리했다.
이 보고서는 미 특수 작전군 태평양(하와이 기지)이라는 명칭으로 유출되었다. 그리고 무장한 미군 병사들이 탑승할 준비를 하며, 이를 저지하기 위한 군용기는 이미 이륙한 상태였다. 보고가 허위였다는 사실은 작전 개시 직전에서 밝혀졌다. 선박의 실제 적재물은 아직 밝혀지지 않았다. 미 특수 작전군 태평양과 국방부총성은 CNN의 취재 요청에 응하지 않고 있다.
이 이야기가 끔찍한 것은 AI가 틀렸던 것이 아니라는 점이다. 오류는 “검증되지 않은 채 공식 문서의 형태를 갖게 된” 데 있다. 생성 AI가 내놓은 추측이 형식적으로 갖춰진 보고서라는 그릇에 들어간 순간, 그것은 조직 내에서 사실로 유통되기 시작한다. 형식은 신뢰성의 대체물이 되어버린다. CNN은 미군이 AI 도입을 서두르는 한편, 기관이나 도구마다 안전 기준이 불분명한 실태를 지적하고 있다. 제도권에서 ‘지속적 평가자’를 논의하는 상황에서, 현장에서는 이미 이 수준의 사고가 발생하고 있었다. 미중의 무력 충돌까지 1분 거리였다.
마이크로소프트의 내부 문서 — — “인류 역사상 최대 규모의 노동 강탈”
뉴욕 타임스가 OpenAI와 마이크로소프트를 상대로 제기한 저작권 소송과 관련하여, 비공개 조항을 해제한 새로운 서면이 공개되었다. 그 안에는 마이크로소프트 애플리드 사이언스 디렉터인 벤 헤クト가 2024년 1월의 사내 프레젠테이션에서 언급한 내용이 기록되어 있었다. 그는 AI 각사의 데이터 수집을 “전례 없는 규모의 놀라운 도둑질”이자 “인류 역사상 최대의 노동 강탈”이라고 칭하며, AI가 “자신에게 필수적인 공급 업체의 경제적 기반”을 위협하고 있다고 경고했다.
숫자도 공개되었다. 중간 훈련 데이터셋에 포함된 뉴욕 타임즈의 복사본은 91,692건 이상. Common Crawl에 포함되는 nytimes.com 문서 수는 200만 건 초과. “Project Mango”라는 노력에는 16만 903건 이상의 언론사의 저작물이 포함되어 있었다. 페이월(유료 구독의 벽)은 감지되지 않은 채 회피되었고, 저작권 표시가 훈련 데이터에서 긁어내렸다. Copilot은 NYT의 클릭률을 93% 낮추었다는 기록도 있다.
사티아 나데라 CEO는 증언록에서 유료 구독 콘텐츠의 내부는 “원하는 사람이 라이선스를 취득해야 한다”는 의견을 밝혔으며, OpenAI가 유료 구독 우회 방법을 알고 있었다면 모델 재훈련을 요구했을 것이라고 언급했다. ChatGPT 책임자인 닉 터리 씨는 사내에서 “출판사는 AI 제품으로 인해 ‘존재론적 위협’에 직면하고 있다”는 의견을 제시했으며, 그레그 블록만 회장은 유료 구독 우회 방식에 대해 알게 된 후 “ah nice”라고 말했다.
이는 기업 내부에서도 문제가 인식되고 있었다는 사실을 보여준다. 모르는 것이 아니었고, 알고 있었음에도 불구하고 진행되었다. 앞으로의 쟁점은 손해액 산정에서 훈련 데이터의 출처 공개 의무로 이어질 가능성이 높다.
클로이드로 OpenAI에 침투 – 3인조 팀이 버그 보상 제도를 통해 보여준 사례
보안 기업 Hacktron AI의 3개 팀이 OpenAI의 버그 보상 프로그램의 틀 안에서 OpenAI 시스템에 침입했다. 사용한 것은 Anthropic의 Claude였다.
경로는 다음과 같습니다. OpenAI 커뮤니티 포럼(Discourse製)에 iPhone 사진을 업로드하면 ImageMagick이 libheif 라이브러리를 통해 HEIF/HEIC 형식으로 변환합니다. libheif에 메모리 관련 취약점이 존재하여 임의의 코드를 실행할 수 있었습니다. 이 취약점은 수개월 전 이미 수정되었으나, CVE(취약점 공통 식별 번호)로 공식 등록되지 않아 널리 알려지지 않았습니다. 연구자들은 이 취약점을 연쇄적으로 활용하여 OpenAI 직원들의 ChatGPT 및 Codex 계정, 최종적으로 GitHub 접근 권한까지 획득했습니다. 침투는 7월 25일에 발생했으며, Discourse의 수정 패치는 7월 27일에 발표되었고, 공식적으로는 9월 18일에 공개되었습니다. OpenAI는 6,500달러의 보상을 지급하고 문제를 해결했습니다.
주목할 만한 점은 공정의 측면이다. 클로드 오퍼스 4.8에서는 작동하는 공격 코드를 만들 수 없었다. 오퍼스 5가 공개되자 몇 시간 안에 성공했다. Gray Swan의 CEO인 매트·플레드릭슨 氏は「월 200달러로 누구나こうした 도구를 사용할 수 있다」라고 말했다. 모델의 세대 교체가 공격 능력의 임계치를 그대로 높이는 것이다. 방어 측도 같은 도구를 사용할 수 있지만, 먼저 작동하는 것은 보통 공격 측이다.
찰스 국왕의 AI 정상 회담—“더 어두운 능력”
9월 17일, 스코틀랜드 던프리 하우스에서 찰스 국왕이 주최하는 인공지능(AI) 정상 회의가 열렸다. NVIDIA의 제نس런 후안 CEO, Google DeepMind의 데미스 하사비스 공동 창업자, OpenAI의 사라 프라이어 CFO, Anthropic의 글로벌 외교 책임자 티노 퀘야르 등이 경영 임원 및 정책 담당자, 연구자 등 총 약 30명이 참석했다.
국왕은 기술이 “더 어두운 능력”을 갖게 될 위험을 언급하며 “잘못된 손에 넘어 파멸적으로 사용될 수 있는” 실존적 위협에 대한 대처가 시급하다고 말했다. 과제는 “기술이 인류에 대한 봉사로 머무르도록 보장하는” 것이라고 밝혔다. 참가자들의 입장은 분단되었다. 후안 씨는 안전성을 최우선으로 하면서 오픈 모델의 가치를 강조했고, 하비비스 씨는 AGI(인간과 유사한 범용적인 지능)의 실현은 “몇 년 안에” 이루어질 것이라고 예측했다. 프라이어 씨는 단일 기업이나 정부만으로는 대처할 수 없다고 지적했다.
상징적인 회의처럼 보이지만, 그 의미는 다른 곳에 있다. 이전에는 후안 CEO가 “새로운 법은 필요 없다, 스스로 속도를 조절하겠다”라고 언급한 바 있다. 이번에는 그가 국왕 앞에서 안전성을 최우선으로 강조한다. “속도”라는 단어가 말하는 상대에 따라 다른 의미로 사용되고 있다. 정책이 어느 정의를 채택할지는 아직 결정되지 않았다.
AEMA 설립 – 전력망의 100기가와트 “틈새” 발굴
에메랄드 AI, 구글, NVIDIA가 주도 주체로 참여하여 AI 에너지 관리 연합(AEMA)이 설립되었다. Anthropic 외에 AES, Constellation, National Grid, NRG Energy와 같은 전력 회사들이 참여한다. 목표는 송전망에 추가로 100기가와트 분량의 데이터센터 용량을 확보하는 것이다.
이 시스템은 데마ンド 응답(Demand Response)이라고 한다. 전력 수요가 급증할 때 대규모 수요자가 일시적으로 사용량을 줄이고, 이에 대한 보상을 받는 기존의 제도이다. 에메랄드 AI의 소프트웨어는 전력 회사로부터의 요청과 데이터 센터를 중재하여 비상 상황이 아닌 컴퓨팅 작업을 중단하거나, 여유가 있는 거점으로 부하를 이전하도록 돕는다. 디젤 발전기에 의존하지 않고 배터리처럼 작동하도록 하는 혁신적인 발상이다. 골드만삭스의 추산에 따르면, 전송망의 활용률을 90%로 유지하면 76기가와트의 용량이 확보될 것이다. 에메랄드 AI는 2026년 8월에 시리즈 A 펀딩을 통해 1억 5천만 달러를 조달한 지 얼마 되지 않았다.
이 栏에서는 데이터 센터를 둘러싼 규제가 주나 지방 정부 차원에서 강화될 것임을 반복적으로 다루어 왔다. 이번 움직임은 그 반대 관점이다. 새로 발전을 위한 발전소를 건설하는 대신, 기존 전력망의 유휴 시간을 활용한다. 해당 회사의 주력 연구원인 아이셰 코스크른 氏は、이 기술은 신규 전원 공급의 필요성을 완화하지만, 완전히 없애는 것은 아니라고 밝혔다. 규제와 건설의 줄다리기를 하되, “지금 있는 용량을 효율적으로 사용하는” 세 번째 선택지가 추가되었다.
화웨이 Ascend 960DT—출시를 반년 앞당겨
9월 17일 Huawei Connect 행사에서 이사 다비드 완 씨가 차세대 AI 가속기 ‘Ascend 960DT’ 출시를 2027년 1분기로 앞당긴다고 발표했다. 훈련과 추론을 모두 지원하며, 전 세대 대비 성능을 2배로 향상시킨다는 방침이다.
또한, 대량의 칩을 하나의 계산 시스템에 모이는 “Peerium Computing Architecture”도 제시되었다. Atlas 950 SuperCluster는 최대 25만 6,000장의 액셀러레이터 카드를 연결할 수 있다. 다만, 분석가 Rui Ma는 칩의 등장 시점이 예상보다 훨씬 빠른 것에 비해, 발표된 시스템의 규모는 초기에 계획된 것보다 작다(1만 5,488장의 구상에 비해 4,096장)고 지적한다.
전조의 시기에 의미가 있다. 9월 24일에 예정된 트럼프 대통령과 시진핑 국가주석의 회담 직전이다. 미국의 반도체 규제가 지속되는 가운데, 중국은 “자전으로 충분하다”는 이미지를 협상의 전에 보여주고 싶어 한다. 성능의 비교치는 공표되지 않았지만, 협상의 카드로서는 벤치마크보다 출시일이 더 효과적인 경우도 있다.
Base Labs, Hugging Face, Goodfire는 오픈 웨이트 모델에 안전 장치를 통합하는 프로젝트를 협력하여 진행합니다.
Baseten의 연구 부문인 Base Labs가 Hugging Face 및 Goodfire AI와 협력하여 오픈 웨이트 모델(모델 가중치가 공개되어 누구나 다운로드할 수 있는 모델)의 훈련 및 모니터링 기술을 개발 및 공개할 계획이라고 발표했다. 안전 기능을 훈련 및 배포 단계부터 통합하는 표준을 만드는 것을 목표로 한다. Goodfire는 모델이 왜 그러한 판단을 내렸는지 설명하는 기술(해석 가능성)을 담당한다.
배경에 제시된 숫자는 명확하다. Hugging Face에는 ‘아브리타레이션’이라는 기술로 안전 가드레일을 제거한 “아브리테이트 모델”이 6,000본 이상 존재한다. 가중치가 공개되어 있는 이상, 안전 장치는 제거될 수 있다. 제거될 수 있다면, 제거된 것들이 유통될 것이다. 세 회사(사)는 “개방성은 AI의 안전에 이점이 된다”고 말하며, “안전은 오픈 모델에 통합되어 있어야 한다”고 주장했다.
자금 측면에서는 베세텐이 2026년 6월에 시리즈 F에서 15억 달러를 조달하여 평가액 130억 달러를 확보하고, 굿파이어도 같은 해에 시리즈 B에서 1억 5천만 달러를 조달하고 있다. 오픈 모델의 안전성은 오랫동안 “아무도 책임을 지지 않는 영역”이었다. 상업적으로 성공한 기업들이 여기에 자원을 쏟기 시작한 것이 변화의 핵심이다.
국제연합과 구글—AI는 통계적 질문에 답변할 수 없다는 측정 결과
국제연합(UN)은 통계 데이터를 AI에서 활용할 수 있도록 Google과 협력했다. 기존의 UNData 포털을 대체하는 ‘UN 시스템 데이터 커먼스’는 Google의 오픈소스 기반인 Data Commons 위에 구축되어 자연어 기반의 교차 검색을 지원한다. 더불어 MCP(Model Context Protocol, AI에 외부 데이터 연결구를 제공하는 규격)를 지원하여 AI 에이전트가 직접 데이터를 가져올 수 있다.
이 발표를 심각하게 만드는 것은 유니세프가 실시한 검증 결과의 숫자입니다. GPT-4o, GPT-4o-mini, Claude Sonnet 4.5, Claude Haiku 4.5, Gemini 2.5 Flash, Gemini 2.0 Flash의 6개 모델에 대해 세계 개발 지표에 대한 13만 3,300 질문 이상을 던졌습니다. 평균 정답률은 21.2%였습니다. 약 60%의 답변은そもそも使える数値を返せなかった(즉, 사용할 수 있는 숫자를 반환하지 못했습니다). 더 나아가 같은 질문을 2일 후에 반복했을 때, 숫자를 반환한 모델 중에는 이전 질문과 일치한 것은 약 절반 정도였습니다.
한편, AI 어시스턴트 경로를 통한 유니세프 데이터 사이트 유입은 전년 동기 대비 67% 증가하여 전체 세션의 6.4%를 차지하게 되었다. 사람들은 통계를 AI에게 질문하는 방식으로 바뀌었다. 하지만 AI는 통계를 정확하게 답변하지 못하고 있다. Google.org는 200만 달러의 지원과 기술 기반을 제공하고, 26개 유엔 기관이 참여하여 2027년까지 유엔의 통계 데이터 세트의 80%를 담는다는 목표를 제시한다. 플랫폼은 최종적으로 Google로부터 독립적으로 운영될 예정이다.
메타의 “Muse”가 맥(Mac)으로—에이전트가 컴퓨터를 조작합니다.
메타가 AI 어시스턴트 “Muse”를 macOS에 출시하여, 사용자의 컴퓨터에서 자율적으로 작업을 수행할 수 있도록 했다. 같은 주에 Muse와 경쟁 AI “Instinct”가 함께 전화를 걸 수 있는 기능을 추가했다. 레스토랑 예약이나 구독 해지 같은 용건을 음성으로 AI에 맡길 수 있다.
이번에는 컴퓨터 화면과 전화 회선으로 확대되었습니다. 소프트웨어 내부에서만 작동하던 에이전트가 OS의 작동 권한과 인간과의 음성 통신 회선을 확보하고 있습니다.
여기 현실적인 문제로 이어지는 것이 바로 오늘 다른 뉴스들과 겹치는 부분이다. 분석가가 AI의 추측을 보고서로 만들어 버린 것, 연구자가 AI로 다른 회사의 GitHub에 접근한 것과 같은 문제들이다. 에이전트에게 부여하는 권한이 넓어질수록 오류와 악용의 범위 또한 똑같이 넓어진다. 편리함과 위험이 같은 기능에서 비롯되는 이상, “어느 정도까지 맡길 것인가”는 각자 스스로 결정해야 할 문제이다.
시생도 AIX—원료 탐색 시간을 95% 단축
시생堂 자판이 2026년 3월부터 진행할 AI 트랜스포메이션(AIX)의 성과가 공개되었다. 약 40개 부문에서 130명의 앰버서더를 모집하여 경영진의 의지와 현장의 열기를 상호 보완하는 “샌드위치형”의 추진 체제를 채택했다.
연구 개발 영역의 “익스퍼트 원료 탐색 에이전트”가 挙げられる成果이다. 신규 원료의 탐색에 걸리는 시간을 95% 감소시키고, 제안되는 원료 수는 20~50% 증가했다. 활용되는 기술은 3가지다. HyDE(Hypothetical Document Embeddings, 질문에서 가상의 답변 문서를 생성하고 이를 활용하여 검색하는 방법)를 통해 모호한 요청에도 업무 맥락에 맞는 검색이 가능하다. 키워드 검색과 벡터 검색을 결합한 하이브리드 RAG로 전문 용어 검색 정확도를 높인다. 더 나아가, 여러 LLM으로 후보를 다각적으로 평가하여 연구원의 시각 조사 프로세스를 재현한다.
사내 이용률도 나타나고 있습니다. Gemini의 월간 활성률은 82% 초과로, 3일에 1회 이상 사용하는 고빈도 이용자는 42%입니다. 사내 정보 검색 에이전트는 탐색 시간을 약 67% 줄였으며, 일본 기업의 AI 도입이 “실증 실험 단계”라는 평가를 받았던 것과 달리, 감소 폭과 이용률이 양쪽 모두 나타나고 있습니다. 시간 감소뿐만 아니라 제안 수 증가라는 점도 중요한 부분입니다. AI가 사람의 작업을 대체한 것이 아니라, 사람이 처리할 수 있는 선택지의 폭을 넓히는 데 기여하고 있습니다.
생성형 AI의 “표현”을 둘러싼 국내의 격변 – 레벨ファイ브와 큐슈 국립박물관
레벨파이브는 9월 10일 온라인 발표회에서 AI 생성 영상을 활용, SNS에서 비판을 사면했다. 수일 후, 사전에 공개한 부스 이미지 지도에도 AI가 사용된 사실이 발견되면서 상황이 악화되었고, 히노 아카리 회장은 15일 X(트위터)에서 이미지 지도에 AI가 생성한 이미지가 사용된 것을 인정하며 “실제 내용은 설계는 물론이고, 조형물까지도 정성을 다해 수작업으로 제작되어 있다”고 설명하고, 방문을 독려했다. 9월 18일 도쿄 게임쇼 현장에서는 세가, 반다이남코 부스와 비슷한 규모의 인파가 몰렸으며, “레이튼 교수와 증기 신세계” 체험존에는 1시간 전부터 줄이 늘어서 있었다. 생성 AI로 특정할 수 있는 전시물은 발견되지 않았다는 보고가 있었다.
같은 주에 큐슈 국립박물관은 특별전 포스터에 생성 AI를 사용했다는 사실을 인정했다. 처음에는 “사용하지 않았다”고 설명했었다.
두 사례에 공통되는 점은, 실제로 사용한 것보다 설명의 순서가 문제로 다가오는 것이다. 먼저 공개했더라면 논점이 되지 않았을 만한 것이 나중에 드러난 것을 통해 신뢰 문제가 발생하는 것이다. 일본에서는 생성 AI 사용에 대한 법적 의무가 없기 때문에 각 사가 스스로 판단해야 한다. 그 선을 잃어버렸을 때의 비용이 이 두 사례에서 명확하게 드러났다.
오늘부터 바로 활용 가능한 실무 소재
념 때문에 프롬프트를 삭제하면 비용이 14.6% 감소합니다.
무엇을 달성할 수 있을까. 같은 결과의 상태에서 AI에 대한 지불이 평균 14.6% 감소하고, 정답률이 평균 5.3% 상승한다. 벤치마크에 따라 비용이 최대 70% 절감되기도 한다.
구체적인 절차입니다. Anthropic에서 Claude에 제시할 때 흔히 나타나는 “항 패턴” 6가지를 제시하고 있습니다. 자신의 프롬프트나 Claude.md에서 다음 사항들을 기계적으로 찾아 제거하십시오. 첫째, “작업을 재확인하시오”, “응답하기 전에 2번 검토하시오”와 같은 중복된 검토 지시사항. 둘째, “최대한까지 엄격하게 하시오”와 같은 강조 표현. 셋째, “스크래치 패드를 사용하여 단계적으로 사고하시오”와 같은 고정된 절차 템플릿. 넷째, 오래된 모델을 위한 Few-Shot(예시) 제시. 다섯째, 서로 모순되는 규칙. 마지막으로, 수동적인 사고 예산 지정 등 구형 Claude를 위한 설정입니다. 이는 새로운 모델에서는 이미 내부적으로 이루어지는 처리를 두 번 지시하는 것일 뿐이며, 토큰을 소비하는 만큼 정확도를 떨어뜨릴 수 있습니다. 감축 효과는 tau2-bench retail에서 약 73%, LegalBench에서 약 58%, SWE-bench Verified에서 약 55%, OfficeQA Pro에서 약 52%입니다.
누구에게 효과가 있을까. API 과금으로 AI를 사용하고 있는 사람, Claude Code나 Cowork을 매일 실행하는 사람들에게는 효과가 있을 수 있다. 반면에 무료 枠으로 1일 수 회밖에 사용하지 않는 사람들에게는 체감 차이는 없을 것이다.
CLAUDE.md는 매 턴마다 과금됩니다.
무엇을 할 수 있게 될까. 설정 파일을 정리하는 것만으로도 프로젝트의 토큰 소비가 약 30% 정도 감소한다.
구체적인 절차입니다. CLAUDE.md와 .claude/rules/ 하위 파일은 대화의 1턴마다 재로드되는 고정 비용입니다. 서브 에이전트를 실행하면 그만큼 누적됩니다. 한 개발자의 실측 결과, 샘플 프로젝트에서 항상 로딩되는 토큰 수는 약 3,551 토큰이었으며, 서브 에이전트를 3회 호출하는 것을 기준으로 약 10,700 토큰에 달했습니다. 내용을 검토한 결과, 존재하지 않는 파일에 대한 참조 링크가 5건, 동일한 금지 사항이 여러 파일에 중복되어 있었고, “단 한 번”의 사건 기록이 영구 규칙에 섞여 있었습니다. 이에 따라 전체 섹션을 4개로 분할하는 것이 적절합니다. KEEP(짧게, 항상 관련 있는 원칙), SKILL(긴 절차나 체크리스트는 스킬 측으로), SUBAGENT(페르소나나 리뷰 관점은 서브 에이전트 측으로), DELETE(단 한 번의 기록)로 분류하면 약 34%의 감소를 예상할 수 있습니다. 절차를 반복하는 CLI “rulesweep”도 공개되어 있습니다.
누구에게 효과가 있을까. CLAUDE.md가 200줄을 초과하는 사람에게 효과가 있다. 계속해서 내용을 추가하면서 삭제되지 않는 사람에게 효과가 크다. 아직 50줄 이하라면, 지금은 필요하지 않다.
AI를 멈추는 것은 “궤도 수정”이 아니라 “포기”가 되었습니다.
무엇을 할 수 있게 될까. 에이전트 사용 습관의 문제점을 스스로 인지하고 멈춘 후, 재정비하는 방식을 바꿀 수 있다.
구체적인 절차입니다. Claude Code의 대화 로그 5,958개를 분석한 기록이 있습니다. ESC 키로 실행을 중단한 경우는 총 10,993회 발화 중 131회, 즉 1.19%입니다. 이 중 81.7%는 사고 단계에서의 중단이었고, Read/Grep/Bash를 통한 조사 중에 발생했습니다. Edit나 Write의 실행 중에 멈춘 경우는 거의 없었습니다. 문제는 그 이후입니다. 중단한 사람의 61.1%는 그대로 대화를 종료했으며, 이 중 85%는 그것이 로그의 최종 행이었다고 합니다. 지시를 다시 입력한 38.9%는 일반적인 1.8배의 길이(평균 47자)의 지시를 입력했습니다. 즉, 중단했을 때는 지시가 너무 짧아 방향이 어긋났던 경우가 많았습니다. 해결책은 두 가지입니다. 중단했다면 바로 종료하지 않고, 그 자리에서 더 긴 지시를 다시 입력하는 것이며, 중단보다 먼저 승인 게이트(실행 전에 확인을 挟む 설정)를 활성화하는 것입니다. 같은 로그에서 인간이 중단한 131회에 비해 승인 게이트를 통한 자동 정지는 1,200회, 약 9배의 규모로 작동했습니다.
누구에게 효과가 있을까요. 에이전트에게 긴 작업을 맡리고 중간에 중단하는 경우가 많은 사람에게는 관계가 희박합니다. 낱낱이 확인하면서 짧은 작업을 돌아대는 사람에게는 관계가 두터울 것입니다.
AI에게 통계 수치를 직접적으로 묻지 마십시오.
무엇을 할 수 있게 될까. 잘못된 숫자를 자료에 올리는 실수를 방지할 수 있다. 게다가 “AI는 대체로 맞다”는 인식이, 어느 정도 오차가 있는지 숫자로 파악할 수 있다.
구체적인 절차입니다. 유니세프가 주요 6개 모델에 세계 개발 지표를 13만 3,000가지 질문을 던진 검증 결과, 평균 정답률은 21.2%였습니다. 약 60%는 기본적으로 사용할 수 있는 숫자를 반환하지 못합니다. 같은 질문을 2일 후에 반복하면, 숫자를 반환한 모델 중에는 전회와 일치한 것은 약 절반에 불과했습니다. 즉, 재현성이 없었습니다. 해결책은 통계 정보를 제공할 때 모델의 기억에 의존시키지 않도록 하는 것입니다. 원문의 URL을 전달하여 읽게 하거나, 검색 기능을 사용하게 하거나, 혹은 MCP 대응 데이터 기반 시스템에 연결합니다. 유엔은 9월에 “UN System Data Commons”를 공개하고, MCP를 통해 AI 에이전트가 직접 통계 정보를 수집할 수 있도록 했습니다. 26개 기관이 참여하여 2027년까지 유엔 통계의 80%를 게시할 계획입니다. 제작한 자료의 숫자는 반드시 출처 페이지를 열어 직접 확인하여 대조해야 합니다.
누구에게 효과가 있을까. 제안 자료나 블로그에서 통계를 활용하는 사람, 행정이나 보조금 관련 숫자를 다루는 사람에게 우선순위가 높다. 반대로, 내부의 질적 콘텐츠 제작에만 활용하는 사람에게는 우선순위가 낮다.
오늘의 뉴스는 개인 사업자에게 어떤 의미를 가지는가
첫째, AI의 출력을 “문서의 형식화”한 순간, 그것은 조직이나 거래 상대방 내에서 사실로 유통되기 시작한다. 미군 사례는 극단적인 예이지만, 구조는 동일하다. AI에게 작성하게 한 견적 근거, 제안서의 시장 규모, 기획서의 인용 수치 등이다. 문서 형식이 깔끔할수록, 받는 측은 검증하지 않는다. 이날 발표된 유엔 검토 결과가 보여주듯이, 통계에 대한 AI의 평균 정답률은 21.2%이며, 2일 후 같은 답이 돌아올 확률은 약 절반이다. 내일부터 바꿔야 할 점은 한 가지. AI에게 작성하게 한 문서 중 숫자와 고유 명사만 추출하여, 출처 페이지를 열어 꼼꼼히 확인하는 단계를 추가하는 것이다. 전체 문장을 다시 읽는 것보다 훨씬 빠르고, 대부분의 사고는 이 방법으로 방지할 수 있다.
두 번째. 비용 절감의 여지가 사용법 측면에서 명확하게 드러났다. Anthropic에서 공개한 반응형 패턴 6가지 항목을 자신의 프롬프트에서 제거하는 것만으로도 평균 14.6%의 비용 감소와 5.3%의 정확도 향상이 측정되었다. Claude.md 정리에서는 약 34%의 감소 사례가 있었다. AI 이용료가 월 수만 원 규모인 개인 사업자라면 이 두 가지를 1시간 투자하여 실행할 가치가 있다. 인상 대기하는 대신, 이 지시문이 지나치게 두껍지 않은지 미리 확인하는 것이다. 이곳은 자신의 손으로 직접 수정할 수 있다.
AI를 사용했는지 여부가 아닌, 사전에 언급했는지 여부가 판단의 기준이 되고 있는 상황이다. 레벨ファイ브와 큐슈 국립박물관 모두 사용 자체보다는 나중에 밝혀진 사실로 인해 비판을 받았다. 일본에는 생성 AI 사용에 대한 표시 의무화 법규가 없으므로, 고객이나 납품처와의 협상 시 스스로 판단 기준을 정해야 한다. 제작물의 어느 단계에 AI를 사용하는지, 이를 사전에 어떻게 전달할 것인지 한 문장으로 견적서나 계약서에 명시해야 한다. 나중에 질문을 받을 때 답변하는 것과 사전에 명시해 둔 것과는 완전히 다른 방식으로 내용이 받아들여질 것이다.
이 게시물은 AI가 생성한 것입니다. 이노우에의 의견이나 견해는 전혀 포함되어 있지 않습니다.
■ 책 두 권을 가지고 있습니다.
신간 『AI는 잊지 않는다』(2026년 8월 발매)는 AI를 한 번 시도해보고 “우리에게는 유용하지 않다”라며 포기한 사람들을 위한 책입니다. 려독 대상.
고릴라는 왜 식물만으로 근육질인가? 최신 과학으로 뇌와 장의 공생 전략을 파헤치는 이야기입니다.
■ 당신에게 딱 맞는 문을 찾아서
몸을 바꾸고 싶으신 분들을 위한 안내입니다. 긴자 트레이닝랩의 무료 체험은 여기서 신청하실 수 있습니다.
트레이너 및 치료 전문가를 위한 콘텐츠입니다. 현장의 “왜?”를 해결하는 사고 회로를 월 5~6회 제공합니다.
AI를 일상 업무에 활용하고 싶으신 분들을 위한 서비스입니다. AI를 효과적으로 사용하는 방법을 안내하고 함께 고민하는 반주 서비스를 제공하고 있습니다.
지난 글 찾기
영양, 운동, 다이어트 등의 주제에 맞는 기사를 검색할 수 있습니다. https://udify.app/chat/tH7RIV2EpxNfwdvq
사이트 맵은 이곳에서 확인하실 수 있습니다.
저자 소개 ▶︎合同会社LSP 대표 ▶︎퍼스널 트레이닝 짐 긴자 트레이닝랩 대표 ▶︎대덕여자대학교 라크로스부 (2019년 ~ 2023년) ▶︎에이피에이치 국제대학교 트레이너 (2018년 ~ 2019년) ▶︎하반신 살 빼기 협회 자문위원 (2016년 ~ 2020년) ▶︎2018년 도쿄도에서 현재 받고 싶은 트레이너 선출 ▶︎모델이나 아이돌 등 담당 #다이어트 #하반신 살 빼기 #내 일 #매일 업데이트 #일하는 방식 #소개 #매일 노트 #퍼스널 트레이너 #독서 #AI 활용 #ClaudeCode #개인 사업주 #혼자 하는 회장 #업무 효율화 #AI 에이전트 #AI #생성 AI #ChatGPT #자동화 #개인 사업주 #혼자 하는 회장 #살롱 경영 #Kindle 출판 #전자책 #신간
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 56청크
원문 보기 | 출처: note.com