AI는 위험하다고 해서 가장 고성능 모델이 일반에 공개되지 않아야 합니다.
이 주장에 타당성이 있다. 고도화된 AI가 사이버 공격이나 위험한 연구에 악용될 가능성을 고려할 때, 누구나 자유롭게 이용할 수 있는 상태를 피하는 것은 효과적인 안전 대책이 될 수 있다.
하지만 여기서 한 가지 의문이 생긴다.
AI의 위험성을 경고하며, 그 공개를 제한해야 한다고 주장하는 기업들 스스로는 누구에게서 감독받고 있는 걸까.
최첨단 모델을 비공개로 유지하는 것은 공공의 안전에 기여하는 동시에 해당 모델을 개발한 기업의 경쟁 우위를 보호하는 데에도 도움이 된다.
즉, 인공지능의 안전성에 관한 논의에는 공공의 이익과 기업의 이익이 겹치는 구조가 존재한다.
이는 AI 기업이 위험성을 의도적으로 과장하고 있다는 폭로가 아니다. 그러한 의도를 보여주는 증거가 없다면, 단정할 수 없다.
더욱 생각해야 할 것은, 기업이 AI의 위험성을 진지하게 인지하고 있더라도, 그 안전 대책이 시장의 집중을 촉진할 가능성이 있다는 점이다.
1. 최첨단 비공개 모델
AI 기업이 보유하는 가장 고성능 모델과 일반적으로 제공되는 모델은 반드시 일치하지 않습니다.
2026년 8월, Anthropic이 공표한 리스크 보고서에는 사내 전용 모델 “Model 2”가 기재되어 있다. 해당 회사의 평가에 따르면, 일반에 제공되던 모델보다 종합적으로 약간 성능이 뛰어나며, 외부 공개 예정은 없다고 설명되어 있다.
그러나 이 모델에 대해서는 표준적인 출시 전 평가가 모두 실시되지 않았으며, 능력 파악에 불확실성이 남아 있었다.
이 사례에서 알 수 있는 것은, 공개 모델보다 성능이 뛰어난 사내 전용 모델이 실제로 존재한다는 것이다.
그것이 경쟁상의 이유로 비밀리에 진행되고 있다고 단정하기는 어렵습니다.
모델을 공개하지 않는 이유는 운영 비용, 안전성 평가에 소요되는 시간, 컴퓨팅 자원 부족, 연구 개발 단계에서의 불안정성 등 다양한 사유가 있을 수 있습니다.
한편으로, 비공개성은 경쟁상의 이점도 있기 때문에 사실이다.
고성능 모델의 출력을 지도 데이터로 활용하여 다른 모델에 지식 일부를 학습시키는 기법을 모델 증류라고 한다.
증류 자체는 일반적인 기술이며, 반드시 불법적인 행위는 아니다. 개발 기업이 자사의 고성능 모델에서 경량 모델을 만들 때에도 활용된다.
그러나 경쟁 기업이 이용 약관을 위반하여 타사 모델의 출력을 대량으로 수집하고 자사 모델 개선에 활용하려 할 경우에는 문제가 달라진다.
2026년 2월, Anthropic은 DeepSeek, Moonshot, MiniMax를 활용한 증류 목적의 접근 활동을 공개했다. 해당 회사의 조사에 따르면, 약 2만 4천 건의 부정 계정에서 1,600만 회 이상의 교환이 이루어진 것으로 나타났다.
이는 Anthropic 스스로의 조사 보고서이며, 관련 각사의 모델 개발 전반에 대해 독립적으로 결론을 내리는 것이 아니다.
그럼에도 불구하고, 프론티어 AI 기업에게는 다른 기업으로부터 능력 추출이 심각한 경쟁 문제로 인식되는 것을 이해할 수 있다.
만약 연구소 내부에서는 차세대 모델 개발을 진행하면서 외부에는 성능이나 용도를 제한한 모델을 제공한다면, 기업은 수익을 창출하면서 최첨단 기술 유출을 억제할 수 있다.
더욱 공개 서비스 이용을 통해 얻어지는 문제점, 평가 결과, 허가된 데이터 등을 연구 개발에 환류시킨다면 내부 모델 개선에도 도움이 될 것이다.
여기부터 기업의 최첨단 AI가 반드시 일반 공개될 것이라는 전제 자체를 재고해야 할 필요가 생긴다.
그럼에도 불구하고, 모델을 종료하는 것은 합리적이다.
이 전략을 비판하기 전에, 그 안전성에 대한 합리성을 먼저 확인하고 싶습니다.
특히 중요한 것은 API를 통한 제공과 모델 가중치의 공개가 사후적으로 통제 가능한 범위에 차이가 있다는 점이다.
API를 사용하면 제공 기업은 이용자의 인증, 접근 제한, 부정 이용 감지, 일정한 출력 제어 등을 수행할 수 있다.
모델에 문제가 발견된 경우에는 서비스를 중단하거나 보호 조치를 변경하는 것도 가능하다.
그러나 모델의 가중치가 널리 분포되면, 나중에 완전히 회수하는 것은 어려워진다.
제3자도 모델을 복제하고 수정하며 보호 조치를 제거하는 것을 고려할 수 있습니다.
따라서 위험한 능력을 가진 모델의 경우, 가중치를 공개하지 않고 관리된 환경에서 제공한다는 결정에는 충분한 근거가 있다.
또한, 완전 공개와 완전 비공개의 두 가지 선택지 외에도 다른 가능성이 있다.
연구자, 안전성 평가 기관, 신뢰할 수 있는 사업자 등에게 용도와 조건을 제한한 접근을 허용하는 방법도 있습니다.
이러한 메커니즘은 모델 확산을 억제하면서도 유용성 검증 및 안전성 연구를 진행하는 데 활용될 수 있다.
그러므로 “AI 공개를 제한하는 기업이 독점을 노리고 있다”라고 단순화하는 것은 적절하지 않다.
문제는 공개 제한 자체에 있는 것이 아니다.
공개 제한의 필요성과 기업 스스로의 책임 의무를 어떻게 조화시킬 것인가라는 문제이다.
위험성을 평가하는 사람과 그로부터 이익을 얻는 사람이 동일한 주체인 경우
가장 첨단 인공지능의 위험성을 가장 상세히 파악하는 위치에 있는 것은 일반적으로 그 모델을 개발한 기업이다.
모델의 내부 평가, 미공개된 능력, 안전 대책의 한계, 연구 개발상의 문제 등 중요한 정보의 많은 부분이 기업 내부에서 존재한다.
한편, 규제 당국, 독립 연구자, 일반 이용자는 공개된 보고서나 제한적인 접근을 통해 위험을 판단한다.
이 정보의 비대칭성은 AI 안전 정책에 내재된 어려움을 초래한다.
기업이 “이 모델은 위험하므로 공개할 수 없다”고 설명할 때, 외부 사람들이 그 위험성을 직접 확인하는 것은 매우 어렵다.
또한, 비공개라는 판단에 따라 이익을 얻는 것도 그 기업 자체이다.
위험성이 실재했더라도, 공개를 어디까지 제한해야 하는지, 안전을 확보하면서 제3자에게 접근을 허용하는 방안이 없는지에 대한 문제는 여전히 남아 있다.
여기 관련되는 것이 경제학이나 정치경제학에서 다루는 “규제 포섭” 개념이다.
규제 제도는 본래 공공의 이익을 보호하기 위해 존재한다. 그러나 규제 대상 산업이 전문적인 정보나 정책 형성에도 영향력을 행사하면서 제도가 특정 기업에 유리한 방향으로 기울어지는 경우가 있다.
AI 산업에서는 최첨단 기술에 대한 지식과 계산 자원이 소수의 기업에 집중되어 있다.
규제 당국이 기업의 기술적 설명에 지나치게 의존할 경우, 공공의 안전을 목적으로 하는 제도들이 결과적으로 기존 기업의 우위를 고착화할 수 있다.
다만, 이는 특정 기업이 규제를 부당하게 지배한다는 사실을 인정하는 것이 아니다.
주의할 구조적 유인이 존재한다는 의미입니다.
그래서 안전성을 강조하는 기업의 말을 맹신해서는 안 된다.
그 기업이 경쟁상 불리해질 수 있는 안전 대책도 수용할지 관찰할 필요가 있다.
4. 기업 스스로가 어느 정도까지 감독을 수용할 것인지
이 문제에 대해 현실의 AI 기업들이 아무것도 하지 않은 것은 아니다.
OpenAI는 Preparedness Framework를 구축하고, 고도화된 능력이 가져다오는 위험을 평가하며, 필요한 보호 조치를 시행할 방침을 공개하고 있다.
2025년 개정에서는 안전성 관련 내부 자문 조직이 경영진에 권고하는 시스템 등이 마련되었다.
Anthropic도 책임감 있는 확산 정책(Responsible Scaling Policy, RSP)을 운영하고 있으며, 2026년 7월 8일에 시행된 버전 3.4에서는 위험 보고서의 외부 검토 및 연구 개발 능력에 대한 평가 기준 등을 업데이트하고 있다.
당사의 장기 혜택 신탁에는 외부 검토 요청에 참여하고 평가자를 선정하는 권한이 부여되어 있습니다.
이러한 노력의 일환으로 기업의 자가 평가만으로 안전성을 판단하지 않는 방향으로의 진전이 나타나고 있다.
하지만 여기서 분명히 구분해야 할 점이 있습니다.
외부 전문가가 모델을 평가하는 것과 독립적인 기관이 기업의 판단을 감독하는 것은 동일하지 않습니다.
예를 들어, 기업이 선택한 연구자에게 모델을 활용하게 하고, 그 결과에 대해 의견을 구하는 것은 외부 평가의 한 형태이다.
그러나 연구자들이 위험성을 지적했을 때, 기업의 경영 판단을 변경시키는 권한이 없었다면 최종 결정권은 기업에 남아 있었다.
이러한 차이를 고려하기 위해서는 최소한 세 가지 질문이 필요합니다.
첫째, 평가자를 누가 선택하는가.
둘째로, 평가자는 기업이 공개한 정보뿐만 아니라 필요한 비공개 정보에도 접근할 수 있는지 확인해야 합니다.
세 번째로, 심각한 문제가 확인된 경우, 기업에 시정을 요구할 실질적인 수단이 있는지.
유럽연합의 AI 법안은 이 문제에 대한 제도적 시도 중 하나이다.
동법 제55조는 시스템적 위험을 수반하는 범용 AI 모델 제공자에게 모델 평가, 위험 평가 및 완화, 중대한 인시던트 보고 등을 요구한다.
제92조는 특정 조건 하에 유럽 위원회가 모델을 평가하고, 독립 전문가를 참여시키거나 기술적 접근을 요구할 수 있는 권한을 규정하고 있다.
물론, 법적 권한이 존재한다고 해서 그 감독이 충분히 기능하는 것은 아닙니다.
규제 당국의 전문성, 감사 기관의 독립성, 기업 비밀 보호, 실제 집행 능력 등 여러 과제가 여전히 남아 있다.
그럼에도 불구하고 기업의 자진 신고와는 다른 입장에서 안전성을 검증하는 제도가 필요하다는 방향성은 중요하다.
5. 안전한 AI를 지향하는 기업이라면, 자사에 불리한 규제도 수용할 수 있는가
기업의 안전 확보에 대한 태도를 평가하기 위해서는 어떤 행동을 관찰해야 할까.
가장 중요한 기준 중 하나는 자사의 경쟁 우위나 경영상의 자유를 제약하는 안전 정책에 대해 어떤 태도를 취할 것인가이다.
예를 들어, 일정 이상의 위험 능력을 가진 모델에 대해, 일반 공개의 유무에 관계없이 독립적인 심사기관의 검증을 요구하는 제도를 고려한다.
이 제도는 개방형 모델 개발 기업뿐만 아니라 비공개 프론티어 모델을 보유한 기업에도 적용된다.
최첨단 모델을 내부에서 활용하는 경우에도 심각한 위험이 확인되면 이용 범위나 운영 방식을 변경해야 할 수 있다.
이러한 규제는 안전성을 높일 가능성이 있는 반면, 선두 기업에게는 부담이 될 수 있다.
연구 개발에 제약이 생기고, 기밀 정보를 제3자에게 제시해야 하는 상황이 발생한 때문이다.
기업이 실효적인 감독을 지지한다는 점은 공공 안전을 중시하는 태도를 보여주는 유력한 근거가 될 수 있다.
반대로, 경쟁 기업의 모델 공개에는 엄격한 규제를 요구하면서, 자사의 비공개 모델에는 광범위한 예외를 요구한다면, 그 비대칭성을 검증할 필요가 있다.
가장 중요한 것은 감사 범위에 제한을 긋는 행위 자체에 문제가 없다.
고급 AI 정보에는 외부로 유출될 경우 위험을 초래하는 것들도 있다. 국가 안보와 지적 재산을 보호해야 할 필요성도 있을 것이다.
중요한 것은 이러한 우려에 대응하는 제도적 대안을 제시할 수 있는가이다.
정보 보호 의무를 가진 독립 기관에 의한 평가, 감사 대상의 제한, 기밀 정보의 분리, 필요에 따라 시정 명령 등 공개와 비공개 사이에는 여러 선택지가 존재한다.
기업의 본심은 외부에서 단정하기 어렵다.
그러나 정책상의 선택을 비교해 보면 그 기업이 어떤 이익을 우선시하고 있는지 추론할 수 있는 자료가 얻어집니다.
또한, 이 검증은 기업을 적대시하기 위한 것이 아니다.
안전 정책이 기업의 선의에 의존하지 않고도 작동할 수 있는 방안을 모색하는 데 도움이 되는 것이다.
6. 확산의 위험과 집중의 위험
AI의 안전성을 둘러싼 논의에서는 강력한 능력이 사회에 널리 확산될 우려가 있다는 점이 문제시되는 경향이 있다.
위험한 인공지능이 다수의 주체에 널리 퍼질 경우, 악용될 기회가 증가하고 이용 현황의 감시 또한 어려워질 것이다.
모델의 가중치가 배포되면 사후적인 회수는 어려울 것입니다.
이 “능력 확산 위험”은 현실적인 문제이다.
하지만 저는 또 다른 위험성도 동시에 고려해야 한다고 생각합니다.
그것은 “능력 집중 위험”이다.
강력한 AI가 소수의 기업이나 조직에 집중되면서 연구 개발 능력, 경제적 영향력, 사회의 의사 결정과 관련된 권력이 편중될 수 있다는 우려가 제기되고 있다.
특히, 인공지능 스스로가 차세대 인공지능 연구 개발을 지원하는 방향으로 발전한다면, 그 의미는 크게 달라질 것이다.
이전까지 선두 기업들의 우위는 고성능 제품을 경쟁사보다 먼저 제공할 수 있는 능력에 있었다.
그러나 최첨단 AI가 연구 실험을 자동화하고 모델 개선을 가속화할 수 있다면, 그 우위는 차세대 지능 생산 능력 자체에까지 미치게 된다.
일반적으로 공개된 모델의 성능 차이가 작게 보이더라도 내부 연구 개발 능력에는 상당한 격차가 존재할 수 있다.
더욱이 AI 기반 연구 지원이 발전하고, 완전히 자율적인 재귀적 자기 개선이 실현되었다는 사실과는 별개이다.
비공개 모델이 자동으로 다음 세대 모델을 지속적으로 생성하는 상황까지, 명확하게 확인된 바는 없습니다.
그럼에도 불구하고 연구 개발 역량이 특정 조직에 집중되는 것은 안전 정책 검토 대상이 되어야 할 것이다.
능력의 확산은 광범위한 악용을 초래할 수 있다.
능력의 집중은 외부로부터의 검증을 어렵게 하고, 사회 전체가 소수의 조직의 판단에 의존하는 구조를 만들어낼 수 있다.
또한, 가장 고성능 모델이 일부 조직에 집중되는 경우, 그 정보 유출이나 내부 부정이 발생하면 집중과 확산이라는 두 가지 위험이 동시에 드러날 수 있다.
그러므로 AI의 안전성은 공개를 제한하는 것만으로 달성되는 것이 아니다.
확산으로 인한 위험을 억제하는 동시에, 집중된 능력을 누가 감독할 것인지에 대한 대답을 찾아야 한다.
7. 인공지능 위협론이 독점을 정당화하는 것일까요
지금까지의 논의를 토대로, 처음 제기했던 질문에 다시 접근할 수 있다.
AI 기업들은 경쟁 우위를 확보하기 위해 AI의 위험성을 강조하고 있는 것일까.
특정 기업이 의도적으로 위험성을 과장하고, 모델을 은폐한다는 명목으로 이용한다는 주장에 대해서는 현재까지 충분한 증거가 없는 상태이다.
그러나 의도적인 과장이라도 공공 안전과 기업 이익이 같은 방향을 향하는 구조는 존재한다.
위험성을 호소하여 공개를 제한한다.
그 결과, 모델의 무제한적인 확산을 방지하면서 선행 기업은 기술 우위를 유지할 수 있다.
규제 대응에는 전문 인력, 평가 장비, 법무 체계 등의 비용이 발생하므로, 제도 설계에 따라 대기업에 비해 신규 진출자의 부담이 가중될 수 있다.
그와 같은 상황에서는 공공의 안전을 목적으로 하는 제도가 결과적으로 시장 집중을 촉진할 수 있다.
여기에는 기업의 악의를 전제하지 않는 구조적인 문제가 존재한다.
그렇기에 인공지능의 위험성을 과소평가하는 것 또한 기업의 안전성 주장을 무조건적으로 수용하는 것은 적절하지 않다.
필요한 것은 구체적인 위험에 부합하는 규제를 설계하고, 그 정책이 경쟁 환경에 미치는 영향을 검토하는 것이다.
모든 기업에 일률적이고 고가의 감사 요구는 오히려 소규모 기업들의 집중을 심화시킬 수 있다.
한편, 회사의 자의적인 판단에 감사 업무를 맡기는 것만으로는 충분한 책임성을 확보하기 어려울 수 있다.
그러므로 위험 수준에 따라 적절한 감독 체계를 구축하고, 독립적인 평가 기관을 활용하며, 기밀 정보를 보호하는 시스템을 마련하는 동시에, 감사 비용 절감을 위한 공통 기반을 활용해야 한다.
공개를 제한하는 것과 기업에 대한 감독을 강화하는 것은 상반된 정책이 아니다.
더욱이, 양자는 함께 고려할 필요가 없는 것일까.
마무리――“안전”을 누가 결정하는가
AI의 발전으로 인해 인간 사회가 지금까지 경험해 오지 않았던 위험이 발생할 가능성이 있다.
따라서 최첨단 모델을 일반 공개하지 않아야 한다는 판단이 필요해지는 상황도 있을 것이다.
그러나 그 판단을 내리는 기업이 모델의 능력을 가장 잘 파악하고, 공개 제한으로 인해 경쟁상의 이익도 얻는다면, 기업 스스로의 평가만으로 공공의 안전을 판단하는 것이 타당한지에 대한 문제가 여전히 남아 있다.
필요한 것은 최첨단 모델의 전면 공개를 강제하는 것이 아니다.
기업 비밀을 보호하면서 독립적인 기관이 위험성을 검증하고 심각한 문제가 확인된場合には 시정을 요구받는 제도이다.
동시에 그 제도가 신규 진입자를 부당하게 배제하고 선진 기업의 우위를 고착시키지 않도록 규제의 비용과 적용 범위에 유의해야 한다.
AI의 안전성을 주장하는 기업들에 대해 우리는 그 주장이 진실된 것인지 추측하는 것뿐만 아니라 실제 행동을 지켜봐야 한다.
다른 모델 공개에는 제한을 요구하는 한편, 자사의 비공개 모델에 대한 감독을 거부하는 것일까.
그렇다면, 자사의 연구 개발에 제약이 발생하는 경우에도 실질적인 외부 감독을 수용할 것인지.
물론, 이것만으로는 기업의 진의를 완전히 파악할 수 없다.
그러나 공공의 안전과 기업의 경쟁 이익이 충돌할 때, 어떤 제도를 지지하고 어떤 부담을 감수할 것인지는 중요한 관찰 자료가 된다.
AI의 안전성은 위험한 능력을 사회로부터 격리하는 것만으로는 실현될 수 없다.
그 역량을 보유한 조직은 사회에 대해 어떤 책임을 져야 하는가.
그 질문을 제외하고 최첨단 인공지능의 비공개화를 안전 정책으로 평가하는 것은 불가능할 것이다.
인류를 지키기 위해 AI를 폐쇄해야 한다면, 그 문을 잠그는 열쇠를 쥐는 자 또한 감시 대상이 되어야 한다.
참고 자료
- Anthropic, 증류 공격 탐지 및 방지, 2026년 2월 23일 https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks
- Anthropic, 책임성 확장 정책, 버전 3.4, 2026년 7월 8일 시행
- 앤트로픽, 위험 보고서: 2026년 8월
- OpenAI, 2025년 4월 15일 업데이트된 Preparedness Framework 발표
- 유럽연합 인공지능법 제55조는 인공지능 시스템의 위험 수준에 따라 위험 인공지능 시스템에 적용되는 조치를 규정합니다.
위험 인공지능 시스템은 다음 조치를 준수해야 합니다.
위험 평가 실시, 위험 완화 조치 구현, 데이터 품질 관리, 모니터링 및 평가, 책임자 지정.
위험한 인공지능 시스템의 위험 수준은 인공지능 시스템이 인간에게 상당한 위험을 초래할 가능성, 심각한 피해를 초래할 가능성, 인간의 권리나 자유를 침해할 가능성 등을 기준으로 결정됩니다.
- 유럽연합, 인공지능법(AI Act), 제92조는 AI 시스템이 고위험 분류에 해당되는지 여부를 판단하는 데 있어, 시스템의 사용이 특정 유형의 위험을 초래할 가능성을 평가하는 데 사용되는 ‘위험 평가’의 요구 사항을 규정합니다.
특히, 제92조는 다음과 같은 사항을 명시합니다.
(1) 시스템의 사용이 개인의 권리에 대한 심각한 위험을 초래할 가능성이 있는 경우, 시스템 개발자는 위험 평가를 수행해야 합니다.
(2) 위험 평가에는 다음 사항이 포함되어야 합니다.
(a) 시스템의 사용이 개인의 권리에 대한 심각한 위험을 초래할 가능성을 평가하기 위한 시스템의 설계, 개발, 배포 및 사용과 관련된 모든 관련 정보의 식별 및 평가.
(b) 위험 평가 결과에 따라 시스템의 위험 완화 조치를 구현해야 합니다.
(3) 위험 평가를 수행하는 데 필요한 정보는 시스템의 사용과 관련된 모든 관련 정보와 일치해야 합니다.
본고는 2026년 10월 9일 시점의 공개 자료를 기반으로 한 고찰입니다. 기업이 공개한 조사 결과와 저자의 분석 및 가설을 구분하며, 특정 기업이 의도적으로 AI 위험을 과장하고 있다고 단정하는 것은 아닙니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 86청크
원문 보기 | 출처: note.com