25% 인상이 실질 17% 감소했던 날, 벤치마크의 절반에는 오염의 증거가 발견되었다.
이 게시물은 AI가 생성한 것입니다. 이노마의 의견이나 견해는 전혀 포함되어 있지 않습니다.
오늘의 뉴스는 “주장과 실측이 다르고, 이를 재정비할 수 있다”는 한 가지 점에 집중된다. Anthropic은 주간 이용 제한을 “25% 인상”이라고 발표했다가, 해당 게시물을 삭제하고 현재보다 17% 감소했다고 수정하여 다시 게시했다. Google DeepMind는 AI의 성적표 자체가 신뢰할 수 없다는 전제 하에, 출제자와 모델 모두 답안을 볼 수 없는 평가 방식을 시연했다. 인용된 연구에 따르면, 검사한 모델의 약 절반에 대해 벤치마크 유출의 증거가 발견되었다. X는 AI 데이터센터에 대한 반대 여론을 부추겼던 약 20만 건의 중국계 계정 네트워크를 적발했다고 발표했다. 그러나 같은 주, 뉴저지 주의 실제 데이터센터에서는 무허가 가스터빈이 62대에 설치된 사실이 보도되었다. 작전은 실제로 존재했다. 문제 또한 실제로 존재했다. 숫자는 어느 쪽의 입장에 맞춰 사용될 수 있다. 오늘 당신이 읽은 AI의 숫자는 누가, 어떤 입장에서 측정한 것일까.
앤서니의 주간 제한——“25% 인상”은 현재보다 17% 적습니다.
Anthropic는 9월 14일부터 Claude Code의 주간 이용 제한을 변경하겠다고 발표했다. 처음에는 “표준 주간 제한을 영구적으로 25% 늘린다”고 설명했지만, 이 회사는 이 게시물을 일시적으로 삭제하고 수정하여 다시 게시했다. 추가된 문구는 핵심 내용이다. “현재 상황과 비교하면, 이는 Claude Code의 주간 제한을 17% 축소하는 것”에 해당한다. 대상은 Pro, Max, Team, 그리고 좌석 요금 기반의 Enterprise이다.
숫자 방식은 단순하다. 기준을 100으로 한다. 올해 5월에 일시적인 증枠이 들어가 현재는 150이 되었다. 9월 14일부터 시작되는 恒久枠은 125이다. 기준에서 25% 증가하고, 지금부터는 17% 감소한다. 둘 다 거짓이 아니다. 기준을 어디에 두느냐만 다른 것이다.
왜 수정했나. 이용자가 실제로 체감하는 것은 “기준 100에서부터의 차이”가 아닌 “어제부터의 차이”이기 때문이다. 일시적인 증枠이 반년 가까이 지속되면, 그것이 일상으로 된다. 일상이 깎이는 이야기를 기준에서부터의 증가로 알린다면, 반드시 반발이 일 것이다. 해당 회사는 “사용하고 있다는 실감이 더 많이 얻어지고, 이용 상황의 시각성과 통제성이 높아지는 변경에 참여하고 있다”고도 설명하고 있다. 반대로 생각하면, 현재 시점에서는 사용량 자체가 보이지 않는다는 자질감을 인정하는 것일지도 모른다.
단기적으로는 정액 플랜으로 장시간 코딩을 하는 사용자들이 9월 14일부터 데이터 상한에 달리기 쉬워진다. 중기적인 논점은 정액제의 지속 가능성이다. AI 추론에는 실비가 발생한다. 사용하기 무제한에 가까운 정액은 평균적인 이용자를 전제로 한다. 무거운 이용자가 늘어나면 가격 인상 또는 데이터 상한의 하락이 예상된다. 이번에는 하락했다. 다음에는 무엇이 될까.
소네트 5의 인상 가격은 시행되지 않았다. 9월 1일이라는 기일이 지났지만 아무 일도 일어나지 않았다.
Anthropic의 공식 문서에는 명확한 설명이 있다. Claude Sonnet 5의 100만 토큰당 입력 2달러, 출력 10달러라는 가격은 발표 당시 2026년 8월 31일까지 적용될 예정이었으나, 9월 1일부터 입력 3달러, 출력 15달러로 인상될 예정이었으나 취소되었고, 2달러와 10달러가 표준 가격으로 확정되었다. 오늘이 바로 그 9월 1일이다. 예정대로라면 오늘부터 50% 인상된 가격이 적용되었을 것이다.
전후 가격도 함께 나열해 두겠습니다. Claude Opus 5는 입력 5달러, 출력 25달러, Claude Haiku 4.5는 입력 1달러, 출력 5달러입니다. 배치 처리를 사용하면 입력과 출력이 모두 절반 가격이 되며, 캐시에서 읽어오는 경우 0.1배가 됩니다. 미국 내에서만 선택하는 추론을 선택하면 1.1배가 됩니다.
왜 인상이 취소되었는지 공식적인 설명은 없다. 하지만 뉘앙스는 읽을 수 있다. 같은 회사가 같은 시기에 정액 요금제의 주간 한도를 17% 줄일 것임을 발표하고 있으며, 과금 방식의 API 가격은 동결하고 정액의 무제한 혜택은 축소한다. 이러한 변화가 시사하는 방향은 하나다. 사용한 만큼만 내는 고객은 환영하지만, 정액으로 과도하게 사용하는 고객은 그렇지 않다.
단기적으로는 API를 통해 자동 처리를 구현하고 있는 사업자의 다음 기 사업비가 움직이지 않고 해결될 수 있습니다. 중기적인 논점은 가격이 하락하는 방향으로 움직이지 않고 있다는 점입니다. 데스크톱은 인하가 아닌, 상승하지 않은 것일 뿐입니다. 지난 2년간 AI 추론 가격은 계속 하락할 것이라는 전제하에 많은 사업 계획이 작성되었으며, 현재 그 전제는 일시적으로 멈추어 있습니다.
ChatGPT 광고가 연환산 10억 달러를 기록했다. 200일이 채 안 되는 기간 동안, 검색 외부에 시장이 형성되었다.
OpenAI는 8월 31일, ChatGPT 광고 사업이 연간 기준으로 매출액이 10억 달러에 도달했다고 발표했다. 시작 후 200일 미만으로 달성한 것이다. 광고주 수는 5만 개 이상의 기업이다. ChatGPT의 주간 이용자는 10억 명을 넘어섰다.
내용도 구체적입니다. 제공 국가는 40개를 넘어섰습니다. 이번에는 광고주가 직접 광고를 집행할 수 있는 시스템이 인도, 유럽, 중동, 북아프리카로 확대됩니다. 기존에는 북미, 동아시아, 호주, 뉴질랜드, 브라질이었습니다. 기술 및 효과 측정의 협력 파트너는 50개사를 초과합니다. 사례로, 특정 이커머스 사업자가 28일간의 운영으로 광고 비용의 3배에 달하는 매출을 올렸다고 소개되고 있습니다. 해당 회사가 반복하는 말은 “광고가 ChatGPT의 답변 내용에 영향을 주지 않는다”는 것입니다.
왜 이 속도가 나타난 것일까요. 이유는 재고의 질에 있습니다. 검색 광고는 사용자가 입력한 몇 단어의 키워드에서 의도를 추측하여 광고를 노출하는 방식이었습니다. 대화형 AI의 경우, 사용자는 자신의 상황을 문단으로 설명합니다. 예산, 시기, 제약, 망설이는 이유까지 모두 기재합니다. 광고의 노출 대상으로는 검색보다 훨씬 더 짙습니다. 수만社가 수개월 동안 몰려든 배경에는 이것이 있습니다.
단기적으로는 광고 출稿의 선택지가 하나 더 늘어날 것이다. 중기적인 논점은 10억 달러라는 수치이다. 이는 연환산, 즉 직근 실적을 12배 한 값이며, 1년 동안 벌어들인 금액은 아니다. 급성장하는 사업에서는 실액보다 훨씬 크게 보일 수 있다. 그럼에도 불구하고 의미는 남는다. 무료로 AI를 사용하는 이용자의 비용을 누군가 지불해야 하며, 그 누군가가 오늘부터 명확하게 광고주가 되었다. 무료 AI가 반환하는 답변 옆에 돈을 지불한 누군가가 서 있는 구조가 만들어진 것이다.
X(엑스)는 약 20만 건의 중국계 계정 네트워크를 적발했으며, 목표는 AI 데이터 센터의 여론이었다.
X의 渉外部門이 8월 28일, 약 20만 건의 중국 관련으로 의심되는 가짜 계정 네트워크를 적발했다고 발표했다. 이 중 실제로 게시물을 올려 여론 조작을 시도했던 것은 약 200건으로 추정된다.
게시물의 내용은 구체적이다. AI 데이터 센터가 가정의 전기 요금을 높이고 송전망에 부담을 주고 있다는 주장이다. 데이터 센터 사업자가 공공의 부담으로 사욕을 채우는 모습을 그린 AI 생성의 풍자 그림이 게시물 내용에 포함되어 있다. 계정에는 미국인 같은 이름이 사용되었으며, 실제 존재하는 지방 신문 기사를 인용하고, 선동적인 논평을 덧붙이는 수법이 확인되고 있다.
왜 AI 데이터 센터가 표적이 되는 걸까요? 이 분야는 미국 내에서 가장 첨예한 쟁점 문제이기 때문입니다. 전기 요금, 물 사용, 소음, 고용 문제 모두 지역 주민들의 삶에 직접적인 영향을 미칩니다. 또한 기술적 검증에는 전문 지식이 필요합니다. 쟁점으로서 이상적인 조건이 모두 갖춰져 있습니다.
다만, 보도 측에서도 신중한 부록을 덧붙이고 있다. 데이터 센터 반대 주장이 모두 외국의 공작에 의한 것이 아니라는 점을 강조한 것이다. 게다가, 이 발표를 진행한 X의 소유주 본인 역시 AI 인프라에 경제적인 이해 관계가 있는 상황이다. 공작을 적발하는 주체가 그 공작의 표적이 되기도 한 사업의 당사자이기도 하다.
단기적으로는 데이터센터 반대 운동에 “외국의 개입인지”라는 의심의 시선이 향할 것이다. 중기적인 논점은 훨씬 더 복잡하다. 실제 주민의 우려와 개입에 의한 선동이 같은 말로 쓰일 때, 그 차이를 구분할 수 있을까? 다음 항목이 그 어려움을 보여주고 있다.
뉴저지에서 발견된 실제 물품들——무허가 가스터빈 62기 및 150만 갤런의 LNG 탱크
뉴저지주 베인랜드에서 건설 중인 데이터센터 ‘DataOne’에 대해 지역 주민과 환경 단체로부터 여러 건의 민원이 제기되었다. 보도된 내용은 구체적이다. 설치된 가스터빈은 62기 중 최소 45기가 허가 없이 가동되고 있었으며, 150만 갤런 규모의 액화천연가스 탱크도 무허가 상태였다.
불만 사항이 심각한 문제로 지지된다. 특히 밤에는 800미터 이내에서 발생하는 소음이 문제이다. 주민들은 “발전기처럼 낮은 웅성거림”이라고 표현하고 있다. 배기가스가 두 학교 근처에 배출되는 문제도 있다. 물 관리가 주 정부 규정에 부합하지 않아, 제3자 기술 심사에서는 지하수의 연간 사용량이 2000만 갤런 규모로 과소 추정되고 있다는 지적이 나왔다. 하천 수질 고갈과 홍수 위험이 제기되었다. 부지 면적은 55에이커이다.
경위는 기록되어 있다. 건설이 시작된 것은 2025년으로, 공표보다 앞이었다. 마이크로소프트와 네비우스의 계약이 공표된 것은 2025년 10월. 주민 설명회는 2026년 1월에 개최되었으며, 운영 회사의 경영자 스스로가 “수개월 전에 열어야 했다”고 인정하고 있다. 민원을 제기한 것은 Sustain South Jersey와 stand.earth를 포함한 단체와 현지 주민이다.
이전 항목과 비교하면 오늘의 어려움이 드러난다. X가 축적한 계정망은 “데이터 센터의 전기 요금이 상승하여 송전망에 부담을 주고 있다”는 게시물을 올렸다. 바인란드에서 실제로 일어나는 일은 무허가 터빈과 무허가 LNG 탱크, 그리고 과소 보고된 지하수 이용이다. 주장이 선전임을 주장하거나 문제가 실제로 존재하지 않는다는 것은 또 다른 이야기다. 단기적으로는 이러한 지역 분쟁이 여러 지역에서 증가할 것이다. 중기적인 논점은 허가 속도이다. AI 데이터 센터 건설 속도에 지방 자치 단체의 심사 능력이 따라가지 못하는 상황이다. 따라가지 못하는 지역에서는 먼저 건설하고 나중에 다툼을 벌이는 형태로 진행될 것이다.
마이크로소프트가 330억 달러를 다른 회사의 데이터 센터에 지불하고, 자체 시설은 임대한다.
마이크로소프트가 ‘네오클라우드’라는 신규 AI 컴퓨팅 자원 대여 사업에 총 330억 달러를 투자할 계획이라고 보도되었다. 가장 큰 계약은 네비우스(Nebius)와의 194억 달러 규모이며, NVIDIA의 GB300을 약 10만 개 확보한다. 나머지 약 130억 달러는 CoreWeave, Nscale, Lambda 등으로 향할 예정이다. CoreWeave는 암호 자산 채굴에서 AI 기반으로 전환한 회사이다.
10만 기라는 숫자를 실감나게 하려면, 풀 장비가 갖춰진 서버 랙 약 1400대에 해당하며, 1대당 가격은 약 300만 달러로 추정됩니다.
신기한 점은 마이크로소프트가 자체적으로 세계 최대 규모의 데이터 센터를 보유하고 있다는 것이다. 그것을 사용하지 않고 다른 회사로부터 빌리는 이유는 보도된 내용에 설명되어 있다. 자체 시설은 외부 고객에게 대여하기 위해 확보되어 있으며, 대여하면 매출이 발생한다. 매출이 발생하면 AI 투자로 이익을 낼 수 있다는 설명이 투자자에게 설득력을 갖게 된다. 자사가 사용하는 부분은 외부에서 빌리면 된다.
왜 이 구도가 발생하는 걸까요. 이는 ‘결산’이라는 제도 자체의 성질 때문입니다. 자사에서 사용하는 경우는 비용으로 계상되고, 외부로 대여하는 경우는 매출로 인식됩니다. 같은 서버라도, 누가 사용하는지에 따라 재무제표상으로 보이는 모습이 달라집니다.
단기적으로는 네오클라우드 각사에 안정적인 수요가 유입될 것이다. 중장기적인 논점은 반복적이다. 이 欄에서는 최근 2026년 AI 관련 부채 조달이 세계적으로 4000억 달러를 초과한 것과, Lambda가 10억 달러를 빌려 NVIDIA 칩을 구매하고 Microsoft에 대여하는 것을 다뤘다. 오늘 보도 내용은 그 반대 측에서 동일한 구조를 반영하고 있다. 칩 제조업체가 투자하고, 네오클라우드가 차입하여 구매하며, 하이퍼스케일러가 대출을 받고, 그 상환액이 각사의 매출로 인식된다. 圈 안에서 자금이 순환되는 과정에서 외부에서 유입되는 자금 규모는 별도로 계산해야 한다.
DeepMind의 이중맹검 평가 결과 – 벤치마크의 약 절반에 유출 증거가 발견되었습니다.
Google DeepMind는 8월 27일, AI 모델의 이중맹검 평가를 실시했다고 발표했다. 평가하는 측은 모델의 가중치를 보지 못하고, 개발하는 측은 시험 문제를 보지 못한다. 양자가 내용 자체를 보지 않음에도 불구하고 채점만으로만 평가가 성립하는 시스템이다.
구성 방식은 구체적이다. Google Cloud의 Confidential Space라는 기밀 컴퓨팅 환경을 활용하여 NVIDIA의 H100 Confidential GPU와 Intel의 TDX를 통한 메모리 암호화를 결합한다. 모델의 가중치는 GPU 메모리 내에서 암호화된 상태로, 시험 문제는 호스트 측 메모리 내에서 암호화된 상태로 처리된다. 데이터를 전송하기 전에 원격으로 환경의 정당성을 검증하는 절차가 삽입된다. 평가용 코드가 외부와 통신하지 않도록 OpenMined의 PySyft가 감시한다. 이번 실험에서는 Gemini 2.5 Flash Lite를 H100 하나로 실행했으며, MLCommons, 싱가포르의 AI 안전 연구소, OpenMined, AVERI가 협력했다.
왜 이러한 메커니즘이 필요한가. 언급된 연구가 답이다. 검사된 모델의 약 절반에 대해 벤치마크 문제의 학습 데이터 혼입 증거가 발견되었으며, 오염으로 인한 점수 부풀리기는 큰 모델일수록 더욱 크게 나타난다. 즉, 지난 2년간 우리가 보았던 벤치마크 성장의 중 어디까지가 실제 능력 향상인지 알 수 없다. “사전에 시험 문제를 엿볼 수 있다면 점수는 인위적으로 부풀어 오르고 신뢰가 훼손된다”고 발표문은 쓰고 있다.
처리 부하는 5% 미만으로 보고되었으며, 기술적인 장벽은 작습니다. 오히려 조직 간의 법적 합의와 코드 리뷰가 주요 과제로 지적되고 있습니다. 계약이 기술보다 우선순위를 두고 있습니다.
단기적으로는 벤치마크 숫자를 근거로 한 모델 비교의 신뢰도가 재고될 것이다. 중기적인 논점은 이 방식이 업계 표준으로 이어질지 여부다. 각사가 자사에 불리한 결과가 나올 가능성이 있는 검증에 스스로 참여할 것인지가 중요하다. 이번에 참가한 모델은 비교적 소규모였다.
Anthropic에서 물리 기기 작동 공통 사양 공개 – AI가 기계를 움직이는 것을 먼저 결정한다는 전제
Anthropic는 8월 27일, 모델 하드웨어 표준(MHS)의 리서치 프리뷰를 공개했다. 해당 회사의 설명에 따르면, AI 에이전트가 물리적 장치를 안전하게 작동하기 위한 공통 사양이다.
왜 “사양”일까요. 지금까지의 AI 에이전트는 화면 안에서 완결되어 있었습니다. 파일을 쓰거나, API를 호출하거나, 브라우저를 조작하는 것 외에는 달리 할 수 없었습니다. 실패하더라도 피해는 원래 상태로 되돌릴 수 있는 범위 안에 국한되는 경우가 많았습니다. 물리적 장치와는 달랐습니다. 모터가 돌아가고, 문이 열리고, 기계가 움직이는 것이었습니다. 취소가 불가능했습니다. 그래서 각 사는 개별적으로 구현하기 전에 공통화하려는 움직임이 나타났습니다.
구성 측면에서 볼 때 고려해야 할 점이 있습니다. 이 栏에서는 최근 타이미(Timey)와 지얼즈(ZEALS)가 하이퍼노이드(휴머노이드)를 위한 학습 데이터 수집을 업무로 하는 제휴를 다뤘습니다. 저렴한 로봇이 학습의 입문 비용을 낮추고, 현장 데이터를 사람들이 수집하며, 작동 방식의 공통 사양이 등장합니다. 순서대로 데이터, 기체, 규격이 동시에 움직이는 상태입니다.
단기적인 영향은 거의 없다. 이는 리서치 프리뷰이며, 실제 구현이 보급되는 것은 앞으로다. 중장기적인 논점은 누가 어떤 사양을 표준으로 할 것인가 하는 것이다. 표준을 정한 측은 그 표준에 맞춰 제품을 처음부터 만들 수 있다. 물리 세계에서 AI를 움직이는 경쟁은 기계의 성능이 아닌, 연결 방식에서 시작되고 있다.
国内:パナソニックHDがAI・ロボティクス研究開発本部を新設
パナソニック 홀딩스가 기술 부문을 재편하고 “AI·로보틱스 연구 개발 본부”를 신설할 것으로 보도되었다. 그룹의 CAIO, 즉 최고 AI 책임자격인 사케하라 아키오 씨가 수장에 오르는 것으로 예상된다.
주목할 만한 점은 AI와 로봇틱스를 하나의 본부에 모았다는 것이다. 많은 기업에서는 이 두 가지가 별도의 조직에 존재하며, AI는 소프트웨어 부문, 로봇은 기계 부문으로 나뉜다. 담당자의 출신과 평가 지표도 다르다. 이를 하나로 통합한다는 것은 화면 속의 AI와 실제 물건을 움직이는 기술을 동일한 의사 결정 하에 놓는다는 판단을 의미한다.
왜 지금일까요. 같은 주에 Anthropic이 물리 기기 조작의 공통 사양을 발표하고 있습니다. ‘피지컬 AI’, 즉 현실 세계에서 물건을 움직이는 AI 분야에서 표준과 조직의 정비가 동시에 진행되고 있는 것입니다. 일본의 제조업에게 이 영역은 역사적으로 강한 지역이었으며, 공장, 부품, 제어 시스템 등이 있었습니다. 하지만 강했던 것은 기계의 측면이었고, 그것을 움직이는 AI의 측면은 아니었습니다. 조직을 통합하는 판단은 그 차이를 내부에 채우려는 움직임으로 해석될 수 있습니다.
단기적인 변화는 명확하게 드러나기 어렵다. 연구 개발 본부 신설은 제품으로는 몇 년이나 앞서 있을 것이다. 중기적인 논점은 인재다. AI와 로봇 공학 모두를 이해하는 사람은 어느 분야든 부족하다. 조직도를 통합한다고 해도 그 교차점에 설 수 있는 사람이 없었다면 두 부서가 함께 있는 것일 뿐이다.
오늘부터 바로 쓸 수 있는 실무 소재
이제부터는 업계 동향이 아닌, 실제로 손을 움직이는 사람이 오늘부터 바로 따라 할 수 있는 구체적인 방법을 다룰 것이다.
실무 내용 1: AI가 쓴 규칙 중 기계가 14%를 막을 수 있었다.
어떤 능력을 갖추게 될지에 대한 “CLAUDE.md에 작성했으나 지켜지지 않는” 현상의 원인이 글의 방식이 아닌 위치에 있다는 것을 특정할 수 있다.
Qiita에 8월 31일에 게시된 조사 결과가 구체적이다. 저자는 자신이 관리하는 96개의 Git 리포지토리를 검사했다. 에이전트용 규약 파일(CLAUDE.md, AGENTS.md 등)을 가지고 있는 것은 33개, 34%였다. 총 문자 수는 32만 3833자이며, 1개당 중앙값은 3290자이다. 여기까지가 “많이 쓰고 있다”는 이야기다. 문제는 그 다음이다. 규약 속에 쓰여진 명령어는 93개였다. 그 중에서도 실제로 위반을 막아내는 곳, 즉 CI, pre-commit, husky에서 실행되고 있는 것은 13개뿐이었다. 14.0%이다. 나머지 86%는 어디에서도 실행되지 않고 그대로 놓여 있다.
중단 메커니즘의 배치도도 계산되고 있다. GitHub Actions는 총 33개 중 22개(67%), Husky는 9개(27%), pre-commit는 3개(9%)이다. 또한 .claude/hooks는 0개, 0%였다. 여기서 핵심은 GitHub Actions가 세션이 끝난 후에 작동한다는 점이며, 에이전트가 작업 중일 때 중단될 수 있는 유일한 장소가 .claude/hooks인데, 아무도 사용하지 않고 있다는 것이다.
저자의 초동 가설은 “규약이 낡았다”는 것이었다. 이는 틀렸다. 규약에 기록된 파일 경로 207개 중 동일한 이름의 파일이 존재하지 않는 경우는 24개, 11.6%에 불과했다. 참조는 거의 살아있다. 문제는 신선함이 아닌 실행 형식이다. 또 한 가지 기록된 것은 저자 자신의 측정 오차다. 첫 번째 집계에서는 29.0%가 나왔는데, npm run 계열의 명령어 식별이 부족했기 때문이다. 정확한 수치는 14.0%였다. 엉성한 검사는 보호받는 측으로 흘러간다. 오늘 뉴스 전체와 같은 이야기이다.
구체적인 작업은 세 가지입니다. 첫째, 규약의 각 항목에 “어디에서 멈추는지”를 명시합니다. 적을 수 없는 항목은 멈춤 지점이 없음을 의미합니다. 둘째, “추천”, “필요에 따라”와 같은 조건부 표현을 삭제합니다. 기계는 조건을 판단하지 않습니다. 셋째, .claude/hooks에 파일 검사를 배치합니다.
누구에게 효과적일까요. AI에게 코드나 문서를 작성하게 하고, 똑같은 지적을 매번 하는 사람. 반대로, 혼자서 짧은 작업을 매번 확인하는 것만 한다면, 규약 파일 자체가 필요하지 않습니다.
실무 팁 2: 지역 전용으로 설계된 AI 처리 방식이 하나의 문자열만으로 외부 유출을 방지
어떤 능력을 얻을 수 있는지에 대한 검증을 할 수 있습니다. “외부로 공유할 수 없는 코드를 개인 AI로만 처리하고 있었다”는 전제가 실제로 성립하는지 확인할 수 있습니다.
Zenn에 8월 30일에 공개된 보고서는 구체적이다. 저자는 지역 전용 AI 처리 게이트웨이를 운영하며, 특정 마커 문자열이 포함될 때만 클라우드 API로 연결되는 설계를 채택했다. 이 설계에는 두 가지 약점이 존재했다.
첫 번째 문제는 설정의 불일치입니다. 게이트웨이 측은 “[flash]”라는 문자열을 클라우드 전송 신호로 인식합니다. 그러나 클라이언트 측 가드 함수가 검사하고 있던 것은 “[cloud]”, “[pro]”, “[premium]” 세 가지뿐이었고, “[flash]”가 표에서 누락되었습니다. 두 번째 문제는 검사 범위입니다. 가드 함수는 작업 지시문만 확인하고 있으며, "--files"로 첨부한 파일의 본문을 검사 대상으로 포함시키지 않았습니다. logfile이나 코드에 우연히 해당 문자열이 포함되어 있어도 그대로 통과합니다.
작가는 5月末부터 현재까지의 게이트웨이 로그와 감사 로그를 검토하여 기존 경로를 통한 의도된 전송만 확인되었음을 기록하고 있습니다. 다만, 개인정보 보호 설계상 파일 내용은 로그에 남아있지 않으므로 완전한 결론을 내리기는 어렵다고 덧붙였습니다. 이러한 솔직함이 결론보다 더 유용합니다.
추출 가능한 원칙은 두 가지입니다. 첫째, 판단의 최종 권위는 서버 측에 있으며, 클라이언트 측의 가드는 모조품일 뿐입니다. 둘째, 서로 멀어지는 것을 막기 위해 설계에서 채워야 합니다. 둘째, 검사 대상은 페이로드를 전체로 해야 하며, 지시문, 역할 설정, 태그, 그리고 파일 본문까지 포함합니다. 저자는 의존 패키지 없이, 설정이 TOML 한 장짜리라는 구조의 도구를 공개하고, 기본 설정으로 파일 내용의 외부 전송을 거부하는 설계로 하고 있습니다.
누구에게 효과적일까요. 손안의 AI와 클라우드 AI를 분리해서 사용하고 있는 사람. 전부 클라우드로 보내면, 이 검증은 필요하지 않습니다. 다만 “이것은 로컬에서 처리하고 있다”라고 고객에게 설명하고 있다면 상황이 달라집니다.
실무 3: AI의 판단 정확도를 학생 시험 방식으로 측정
AI에게 문서를 검토를 맡겨놓고 있는데, 어느 정도까지 정확한지 알 수 없는 상태를 숫자로 표현할 수 있습니다.
8월 30일 Zenn에 공개된 이 설계는 참고할 만하다. 저자는 97개의 규칙에 기반하여 AI 생성 텍스트를 검토하는 업무를 수행하고 있었지만, 판단의 정확성을 측정할 수 있는 방법이 없었다. 아이디어는 간단하다. 정답이 정해진 문제를 제시하면, AI가 먼저 인간이 만든 정답을 풀어보고 정답률을 확인하는 방식이다.
설계의 세부 사항에는 근거가 있다. 첫째, 선택지에는 A·B·C와 같은 기호를 사용하지 않는다. 기호를 지워 단어로 답을 요구하면 선택 위치에 따른 편차가 8.1에서 1.0으로 감소한다는 연구 결과가 있다. 둘째, “해당 없음”이라는 탈출구를 제거한다. 연구에 따르면 “해당 없음”이라는 선택지가 있는 것만으로도 정답률이 49.3%에서 14.2%로 떨어지는 모델이 있었다. 따라서 질문을 두 단계로 쪼개서, 먼저 “이 규칙은 적용 대상인가”를 묻고, 다음으로 “준수하고 있는가”를 묻는다. 둘 다 이진 선택으로 제시한다. 셋째, 측정하는 것은 판정가의 분별력에 관한 것이며, 작성자의 집필력과는 관련이 없다. 양자 간의 일치율은 낮고, “선택식으로는 정답을 내지만, 쓰게 하면 틀린다”는 경우가 85%를 차지한다는 연구가 인용되고 있다.
수치화 방침 또한 구체적이다. 정답률을 ±10% 범위로 제시하기 위해서는 1규칙당 60문항 전후가 필요하다. 지표는 정답률 한 항목만이 아닌, 진양성률과 진음성률을 분리한다. 놓치거나 과검출은 또 다른 문제이기 때문이다. 순서에 따른 편차를 제거하기 위해 동일한 문제를 양방향으로 출제하고, 양쪽 모두 정답을 맞춘 경우에만 정답으로 셈한다.
작성자는 설계와 근거를 마련했으나, 문제집과 채점 프로그램은 아직 제작하지 않았다고 명시하고 있습니다. 활용 가능한 것은 설계 사상에 한정됩니다.
누구에게 효과적일까. AI에 검사나 분류를 맡기고 그 정확성을 사람에게 설명해야 하는 사람에게는 자신만 사용하는 초안 생성에는 그럴 노력이 필요하지 않다.
실무 4: AI의 병렬 운용은 실행만 나열하는 것이 아니라, 최종 결정 권한은 별도로 관리한다.
무엇을 할 수 있게 될까요. AI 에이전트에게 여러 작업을 동시에 진행시켰을 때 대기 시간과 사고를 모두 줄일 수 있습니다.
Zenn에 8월 30일에 공개된 운영 기록이 구체적이다. 8월 초 주에서는 하루 평균 1.43건의 완료가 있었고, 병렬 운영으로 전환한 주에는 16.0건이었다. 동시에 진행되는 내역은 실행 중 17건, 내부 검토 대기 12건, 판단 대기 2건이다.
이 방법의 핵심은 의존 관계를 4단계로 나누는 것이다. 독립적인 것은 평행으로 진행한다. 약한 의존 관계가 있는 것은 준비 단계부터 먼저 시작한다. 임시로 설정 가능한 것은 검증 가능한 가정을 세워 범위를 제한하여 진행한다. 굳건한 의존 관계가 있는 것은 기다리거나 직렬로 진행한다. 임시 설정 진행 여부 판단 기준도 제시되어 있다. 절약할 수 있는 대기 시간이 실패 확률 × 복구 시간 + 검증 추가 시간보다 높을 때만 실행한다.
실패 기록도 남아 있었다. 첫째, 상태 업데이트 과다. 총 979개의 커밋 중 508건이 작업 기록 업데이트뿐이었다. 이에 대한 대책으로, 상태는 Git, 프로세스, 작업 관리 시스템으로부터 동적으로 재구성하는 방식으로 변경했다. 둘째, 처리할 수 있는 오케스트레이터 층, 즉 중간 관리자 역할을 하는 AI가 증가한 문제였다. 구현층은 늘리되 관리층은 최소화하는 방향으로 조정했다. 셋째, 완료 판정의 느슨함. “테스트 통과 = 완료”로 처리했는데, 이후 후속 검토에서 수정 사항이 빈번하게 발생했다. 최종 버전에서 모든 체크 합격 조건을 완료 조건으로 변경했다.
가장 가져가야 할 가치는 한 문장이다. 실행은 병렬로 하더라도, 확정하는 권한은 병렬로 하지 않는다. 병합, 전송, 배포와 같은 취소 불가능한 작업은 단일 승인자에게만 제한한다.
누구에게 효과적일까요. AI에 여러 작업을 동시에 던지는 사람. 건별로 확인하면서 진행한다면, 우선 병렬화 전에 최종 작업의 소유권을 누가 가지는지를 결정하는 부분만 가져가면 됩니다.
오늘의 뉴스는 개인 사업자에게 어떤 의미를 가지는가
첫째, 계약 중인 AI 정액 요금제를 9월 14일 전에 한 번 검토한다. Anthropic이 발표한 내용은 “25% 인상”이었지만, 해당 회사가 스스로 재작성하여 “현재 상황과 비교하면 17% 감소”라고 인정하고 있다. 대상은 Pro, Max, Team, 인원 부당 요금 방식의 Enterprise이다. 같은 시기에 API 측의 Sonnet 5는 입력 2달러, 출력 10달러로 그대로 유지되었고, 9월 1일에 예정되었던 3달러, 15달러로의 인상은 진행되지 않았다. 이 두 가지를 나열하면 방향이 명확해진다. 사용한 만큼만 내는 고객의 가격은 변동하지 않으며, 정액으로 많이 사용하는 고객의 枠은 줄어든다. 개인 사업자가 내일 해야 할 일은 두 가지이다. 첫째, 자신이 정액 요금제로 사용한 시간과 횟수를 실제로 계산한다. 직감이나 횟수이다. 둘째, 그 사용량이 새로운 枠에 들어맞는지 확인하고, 들어맞지 않는다면 소량 사용 방식으로 전환을 시도해 본다. 정액으로 이득을 보는지 손해 보는지는 평균이 아닌 자신의 사용 방식으로 결정된다. 이번에는 17%였다. 다음 조정이 오면 당황하지 않고 계산할 수 있는 상태로 유지해 두는 것이 더 큰 가치를 가진다.
두 번째. 인공지능 성능을 벤치마크 숫자로만 선택하는 것을 그만둬야 한다. 오늘 DeepMind가 제시한 방식의 근본적인 전제가 무겁다. 인용된 연구에서는 검사된 모델의 약 절반에 시험 문제가 학습 데이터에 혼입되어 있었다는 증거가 발견되었으며, 규모가 클수록 물은 더 많이 나온다. 즉, 공개된 점수 비교는 근본적으로 동일한 조건의 경쟁이 아니었을 가능성이 있다. 이중 맹검 방식 자체는 처리 부하 5% 미만으로 작동 가능하고, 기술적인 장벽은 크지 않다. 큰 벽으로 지적된 것은 조직 간의 법적 합의였다. 표준이 될지는 앞으로 결정될 것이다. 여기서 끌어낼 수 있는 실무적인 지침은 구체적이다. 모델을 선택하는 기준을 다른 사람이 공개한 점수에서, 자신의 업무로 직접 만든 검사 결과로 옮긴다. 실무 팁 3의 설계가 그대로 사용 가능하다. 자신의 업무에서 실제로 나온 입력 20건으로 충분하고, 정답은 사람이 먼저 정하고 후보 모델에 풀어 정답률을 비교한다. 다른 사람의 벤치마크는 다른 사람의 업무 성적표다. 당신의 업무 성적표가 아니다.
세 번째. 무료로 사용할 수 있는 AI 옆에는 돈을 지불한 사람들이 하나둘 자리를 잡기 시작했다. ChatGPT의 광고 사업은 200일도 채 안 되는 기간 동안 연간 10억 달러를 돌파했으며, 광고주는 수만 개에 달하는 기업들과 광고를 제공하는 국가 40개국 이상으로 확대되었다. 이번에는 광고주가 직접 광고를 집행할 수 있는 시스템이 인도, 유럽, 중동, 북아프리카 지역으로 확산되고 있다. OpenAI는 “광고는 답변 내용에 영향을 주지 않는다”라고 명확히 밝히고 있다. 이 문장은 겉으로 보기에는 그대로 받아들여도 좋다. 하지만 영향을 받지 않는 것은 답변의 내용 자체이고, 답변 옆에 무엇이 놓이는지는 아니다. 개인 사업주에게는 기회가 존재한다. 수만 개의 기업들이 광고를 집행하고, 특정 이커머스 사업자는 28일 동안 광고비의 3배를 매출했다고 알려져 있다. 스스로 광고를 집행할 수 있는 시스템이 확산됨으로써, 검색 광고 외의 다른 유입 경로가 하나 더 늘어난 셈이다. 일본을 포함한 동아시아는 이번 확대 이전부터 제공된 지역으로 언급되고 있다. 자신의 관리 화면에서 직접 광고를 집행할 수 있는지 여부는 한 번 확인해 보는 것이 좋다. 또한, 부담이라는 측면도 고려해야 한다. 자신의 사업 분야에서 경쟁 업체들이 광고를 시작한다면, 이용자가 AI에 질문했을 때, 답변이 중립적이라 하더라도 그 옆에 경쟁사의 이름이 나타날 수 있다. 이 칸에서는 최근 Google의 검색 AI가 여행 예약까지 완료하는 사례를 다뤘다. 오늘의 광고는 바로 그 옆의 공간에 위치한다. 답변의 내용과 답변 옆에 놓이는 경로, 둘 다 현재는 게재되는 쪽에 있는지 여부에 따라 결정된다.
이 게시물은 AI가 생성한 것입니다. 이노우에의 의견이나 견해는 전혀 포함되어 있지 않습니다.
■ 책 두 권을 가지고 있습니다.
신간 『AI는, 잊지 않는다』(2026년 8월 발매)는 AI를 한 번 시도해보고 “우리에게는 유용하지 않다”라며 포기한 사람들을 위한 책입니다. 런닝맨 대상.
고릴라는 왜 식물만으로 근육이 부풀어 오를까? 최신 과학으로 탐구하는 “뇌”와 “장”의 공생 전략에 대한 이야기입니다.
■ 당신에게 맞는 현관
몸을 바꾸고 싶으신 분들을 위한 안내입니다. 긴자 트레이닝랩의 무료 체험은 여기서 신청하실 수 있습니다.
트레이너 및 치료 전문가 여러분을 위한 콘텐츠입니다. 현장의 “왜?”를 풀어내는 사고 회로를 월 5~6회 제공합니다.
AI를 일상 업무에 활용하고 싶으신 분들을 위한 서비스입니다. AI를 효과적으로 사용하는 방법을 안내하고 함께 고민하는 伴走(반주) 서비스를 제공하고 있습니다.
저는 최근에 류지마 히로시의 ‘나를 잊으렵니다’를 읽었습니다. 류지마 히로시는 1983년 11월 15일에 발생한 ‘가와고에 사건’의 피해자 중 한 명입니다. 그는 사건 이후 자신의 경험을 바탕으로 사회에 류지마 증후군이라는 용어를 낳게 했습니다. 류지마 히로시는 이 책에서 사건 당시의 기억과 그 이후의 삶을 솔직하고 섬세하게 묘사하고 있습니다. 특히, 그는 사건 이후 겪었던 혼란, 고통, 그리고 희망을 구체적인 에피소드를 통해 보여줍니다. 류지마 히로시의 이야기는 단순한 범죄 피해자의 경험을 넘어 사회의 책임과 인간의 존엄성에 대한 깊은 질문을 던집니다. 이 책을 읽고 나서 저는 사회 문제에 대한 인식을 다시 한번 되돌아보게 되었고, 피해자들의 목소리에 귀 기울이는 것의 중요성을 깨달았습니다. 류지마 히로시의 ‘나를 잊으렵니다’는 앞으로도 오랫동안 기억될 감동적인 작품이 될 것입니다.
영양, 운동, 다이어트 등의 주제에 맞는 기사를 검색할 수 있습니다. https://udify.app/chat/tH7RIV2EpxNfwdvq
사이트 맵은 이곳에서 확인하실 수 있습니다.
저자 소개 ▶︎合同会社LSP 대표 ▶︎퍼스널 트레이닝 짐 ギンザ 트레이닝ラボ 대표 ▶︎大妻女子大学 라クロス부 (2019년〜2023년) ▶︎平成국제대학 트레이너 (2018년〜2019년) ▶︎하반신 슬림 협회 자문위원 (2016년〜2020년) ▶︎2018년 도쿄도에서 지금 받고 싶은 트레이너 선출 ▶︎모델이나 아이돌 등 담당 #다이어트 #하반신 슬림 #내 일 #매일 업데이트 #근무 방식 #소개 #매일 노트 #퍼스널 트레이너 #독서 #AI 활용 #ClaudeCode #개인 사업주 #혼자 하는 회장 #업무 효율화 #AI 에이전트 #AI #생성 AI #ChatGPT #자동화 #개인 사업주 #혼자 하는 회장 #살롱 경영 #Kindle 출판 #전자 책 #신간
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 70청크
원문 보기 | 출처: note.com