AI 뉴스를 보면서, 어쩔 수 없이 새로운 모델의 성능이나 벤치마크에 눈이 갑니다.
하지만, 이번에는 조금 다른 관점의 뉴스가 나왔습니다.
8월 19일, Reuters는 대규모 AI 기업 5사의 “Control” 체제 평가를 보도했습니다. 즉, 기업이 고도화된 AI를 감시하고 필요에 따라 중단시킬 수 있는 시스템에 대한 평가입니다.
評価したのは、元OpenAIの安全分野にいたメンバーが立ち上げた非営利団体Guidelight AI Standards。
공개된 평가는
앤트로픽: C+ 오픈AI: C+ 구글: D+ xAI: D- 메타: F
그녀는 마치 텅 빈 셔츠처럼, 텅 빈 듯한 느낌을 풍겼다. 그녀의 발걸음은 무겁고, 텅 빈 듯한 느낌을 더했다. 그녀는 마치 텅 빈 셔츠처럼, 텅 빈 듯한 느낌을 풍겼다.
여기만 따로 보면 상당히 강한 숫자입니다.
하지만 여기서는 오해를 불러일으키지 않는 것이 좋습니다.
이 C+와 D+는 “그 회사의 AI 모델이 얼마나 위험한지”를 나타낸 점수가 아닙니다.
Guidelight가 보고 있는 것은 회사 측의 통제 체제입니다.
구체적으로는,
• 내부에서 작동하는 AI가 어떤 활동을 수행하는지 파악할 수 있는지
• 위험한 행동을 감시할 수 있는지
• 해당 감시 시스템이 제대로 작동하는지 테스트하는지
• 문제가 발생했을 때 중단할 수 있는지
• 제3자가 통제 체계를 검증할 수 있는지
• 통제 붕괴 시에 대비하고 있는지
이 여섯 가지 관점입니다.
AI 에이전트가 증가함에 따라 안전성의 의미 자체가 달라져야 합니다.
챗 AI에 대해 “위험한 질문에 답하지 않을까”라는 우려가 제기되었습니다.
하지만 AI가 스스로 코드를 작성하거나, 도구를 사용하거나, 장시간 작업을 지속하는 것만으로는 충분하지 않습니다.
무엇을 하고 있는지 보이는 것. 위험한 움직임을 감지하고, 정말 필요하다면 멈출 수 있는 것.
이 세 가지가 상당히 중요합니다.
실제로 OpenAI는 8월 7일, 차세대 모델 Astra에 대해 심각한 사이버 능력을 보유할 가능성을 배제할 수 없다고 공식적으로 밝혔습니다.
그 대응 방안으로는 강화된 제어 기준을 충족하지 못하는 내부 활동을 중단시키고, 격리 환경이나 접근 제한을 사용하는 것, 위험 행동이나 미흡한 정렬을 감시하는 것 등을 제시하고 있습니다. 감시에는 Chain of Thought도 포함됩니다.
즉, 성능이 향상되었으므로 그대로 사용하는 것이 아닙니다.
성능이 향상될수록, 그 외측의 모니터링 및 제어 역시 함께 강화해야 합니다.
한편, 이번 Guidelight 평가 역시 절대적인 답이 아닙니다.
Guidelight는 자체 설명에 따르면 공개 정보 및 기업 공시 등을 기반으로 평가하고, 공개 전에는 대상 기업에 내용을 보내 피드백과 사실 확인 기회를 제공합니다.
그럼에도 불구하고, 각 사 내부의 구현을 모두 직접 본 감사 결과는 그렇지 않습니다.
그러니 “메타는 F라서 위험하고, OpenAI는 C+라서 안전하다”는 식으로 해석할 수 없습니다.
이번 뉴스의 재미있는 점은 단순히 점수 자체보다 평가 기준이 변화하고 있다는 점입니다.
AI를 보게 될 때까지 “얼마나 똑똑한가”가 중심이었습니다.
이제부터 그곳에
“충분히 감시할 수 있는가?”, “방해받지 않는가?”, “외부에서 검증 가능한가?”
그녀가 합류할 예정입니다.
AI 에이전트가 정상적으로 작동하는 수준에 도달할수록, 이 “제어 주체 설계”는 성능표와 마찬가지로 중요해질 것입니다.
한 가지 정보:
그렇게 생각하면, 2023년 1월에 발표된 보고서의 핵심은 다음과 같습니다. “미래의 사이버 위협은 단순히 네트워크를 공격하는 것이 아니라, 인공지능과 같은 새로운 기술을 활용하여 사회 기반 시설을 마비시키고, 경제를 붕괴시키며, 심지어 민주주의 시스템 자체를 위협하는 방식으로 진화할 것이다.”
이 보고서는 특히, ‘카호’가 등장하는 ‘나의 이름으로’라는 무라카미 하루키의 소설에서처럼, 개인의 정체성과 기억이 디지털 공간에서 어떻게 조작될 수 있는지에 대한 우려를 제기합니다. 2023년 1월의 보고서 작성자들은, 인공지능이 생성한 가짜 정보와 딥페이크 기술이 개인의 삶에 미치는 영향에 대해 심각한 경고를 보냈습니다.
더욱이, 이 보고서는 단순히 기술적인 측면뿐만 아니라, 사회적, 윤리적 측면까지 고려해야 한다고 강조합니다. 인공지능 기술의 발전 속도를 따라가지 못하는 법과 제도, 그리고 사회적 합의가 부족할 경우, 예상치 못한 위험이 발생할 수 있다는 것입니다.
보고서의 결론은 다음과 같습니다. “미래의 사이버 보안은 기술적인 대응뿐만 아니라, 사회 전체의 역량을 강화하는 데 초점을 맞춰야 한다.” 즉, 시민들의 디지털 리터러시 교육을 강화하고, 인공지능 기술의 윤리적 사용에 대한 사회적 논의를 활성화하며, 새로운 위협에 대응할 수 있는 법과 제도를 마련해야 한다는 것입니다.
이 보고서는 2023년 1월에 발표되었지만, 현재까지도 사이버 보안 분야에서 중요한 참고 자료로 활용되고 있습니다. 특히, 인공지능 기술의 발전과 함께, ‘무라카미 하루키’의 작품에 등장하는 듯한, 개인의 정체성과 기억이 위협받는 상황에 대한 경고는 더욱 중요해지고 있습니다.
보도:
AI 기업들은 스스로 만들어낸 기술을 통제하기는 아직 역부족이다. 새로운 연구 결과에 따르면, AI 모델의 크기가 커질수록 기업들은 모델의 행동을 예측하고 제어하는 데 어려움을 겪고 있다. 특히, 모델이 학습한 데이터의 양이 많아질수록 모델의 예측이 실제와 달라지는 ‘환각’ 현상이 더욱 빈번하게 발생한다. 이러한 현상은 AI 모델의 안전성과 신뢰성을 저해하는 요인으로 작용한다.
AI 뉴스 #AI안전성 #AI에이전트 #OpenAI
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 25청크
원문 보기 | 출처: note.com