OpenAI의 테스트 모델에 의한 Hugging Face 공격 사건으로 인해 OpenAI는 대응의 일환으로 AI 감시 조직 “METR(Model Evaluation and Threat Research: 모델의 평가와 위협의 조사)”에 감사를 요청하고 있습니다. 또한, Anthropic도 AI 안전성 강화하기 위해 METR과 제휴한 것을 발표했습니다. 이 METR이 대체로 어떤 조직인지에 대해, 대표를 맡는 크리스·페인터 氏가 자세히 설명하고 있습니다. About METR https://metr.org/about
제 이름은 크리스·페인터이고, METR (Model Evaluation and Threat Research: 모델의 평가와 위협의 조사)의 회장입니다. 지난 몇 일 동안 인터넷에서 많은 새로운 친구들을 만든 것을 알고 있으며, 이 기회를 이용하여 저희가 무엇을 하고 왜 하는지 다시 한번 설명드리고 싶습니다. 저희의 업무는…
METR는 캘리포니아주 버클리에 본사를 둔 비영리 독립 연구 기관으로, 최첨단 AI 모델의 자율 능력 및 사회적 위험 등을 평가 및 검증합니다.
페인터 氏は自分들의 일을 “AI가 ‘폭주’와 유사한 상태가 되었을 때, 사람들이 그것을 알 수 있도록 하는 것”이며, “AI 기업 내부에서 ‘AI의 통제를 잃어가고 있다’는 증거가 있을 경우, 그 정보가 전 세계적으로 확실하게 공유되도록 하는 것”이라고 표현했습니다. METR는 2022년 설립 이후 OpenAI, Anthropic, Google DeepMind, Meta, Amazon과 같은 AI 개발 기업과 협력하여 제3자 기관으로서 AI 모델의 평가 및 조사를 담당해 왔습니다. 지금까지의 성과로 METR는 AI의 능력이 급속하게 향상되고 있음을 보여주는 여러 강력한 증거를 발견한 것과 동시에 다양한 측면에서 AI의 능력이 과대 평가되고 있을 가능성을 제시하는 강력한 근거를 제시한 것을 언급했습니다. AI 코딩 도구가 생산성을 19%까지 감소시킨다는 조사 결과, AI 출력을 평가하고 수정하고 재출력하는 과정에서 막대한 양의 불필요한 시간이 발생하고 있으며 - GIGAZINE
AI 기업이 AI 모델의 평가 및 테스트에서 제3자 기관이나 외부 테스트 업계와 협력하는 것은 완전히 자의적인 것이며, 종종 기밀 유지 계약이나 정보의 비공개화를 수반합니다. 이에 대응하기 위해 METR은 체결한 계약 조건을 일반 공개할 권리를 보유하고 있으며, 기업이 비공개로 하려 시도한 내용을 밝히도록 노력하고 있다고 합니다. 최근에는 METR이 2026년 8월에 발생한 OpenAI의 AI 에이전트가 Hugging Face에 무허가 액세스 사건에 대한 독립 조사 보고서를 공개했습니다. OpenAI가 Hugging Face를 실수로 해킹하여 발생한 사건에 대한 분석 결과를 보고, 격리된 여러 에이전트가 서로의 존재를 발견하는 것부터 웅대한 협력 작전이 시작됨 – GIGAZINE
또한, 2026년 9월에는 Anthropic과 합의에 이르렀으며, “AI 모델의 인시던트와 얼라인먼트 특성에 대한 독립적인 조사 실시”라는 역할을 담당할 것이라고 보고했습니다. Anthropic은 METR 등의 감사 인력에게 입퇴실 배지 및 회사支給 PC를 지급하고, 자사의 직원과 동등한 접근 권한을 부여할 것을 표명했습니다.
앤서니와의 협약을 통해, 당사 내 에이전트 사고 및 모델의 정렬 특성에 대한 독립적인 조사(감사)를 진행하게 됩니다. 조사 결과와 계약 조건들을 공유하는 1건 이상의 보고서를 발표할 예정입니다.
페인터(ペインター)氏は監査를 진행함에 있어, “물(物)을 안전(安全)한지 여부만으로 함부로 승인(承認)하는 ‘밀실(密室)’을 형성(形成)하지 않도록 노력(努力)하고 있다”고 밝혔습니다. 또한, 페인터(ペインター)氏は “METR(METR)의監査만으로는 AI(人工知能)의監査에는 불충분(不十分)하다”고 지적(指摘)하며, METR(METR)뿐만 아니라 여러(複数の) 기관(機関)에 의한監査가 중요(重要)하다고 설(説)했습니다.
원문 보기 | 출처: Gigazine