Anthropic는 2026년 8월 7일(현지 시간), 고성능 AI 모델 “Claude Fable 5”에 통합된 생물학 분야의 안전 장치를 업데이트했다고 발표했다. 무해한 질문까지 제한하는 “오탐”을 줄이는 것으로, 회사의 테스트 결과, 생물학 관련 질문이 다른 모델로 전환되는 사례를 약 85% 감소시켰다고 한다.
Fable 5는 Anthropic가 일반 제공하는 모델 중 가장 고성능한 모델로 위치 지정되고 있다. 반면, 생물학이나 사이버 보안 등의 영역에서는 그 능력의 악용 위험을 고려하여 안전 분류기(safety classifier)에 의해 일부 질문을 다른 모델로 전환하는 메커니즘을 채택하고 있다.
## 전문가를 능가하는 능력을 이유로 생물학 질문을 광범위하게 제한
Anthropic에 따르면, Fable 5는 일부 매우 복잡한 생물학적 작업에서 전문가를 능가하며, 다른 작업에서도 실무적인 지원이 가능한 수준에 도달하고 있다. 회사는 이러한 능력이 신약 개발 등에 도움이 되는 한편, 악의적인 사용자에 의한 생물 무기 개발 등에도 전용될 가능성을 제시하고 있다.
특히 생물학에서는 동일한 기술이나 지식이 유익한 연구와 위험한 용도의 양측 모두에 사용될 수 있는 “듀얼 유스(dual use)”의 판단이 어렵다. 이러한 위험으로부터 Anthropic는 Fable 5의 제공 시작 시점에 의도적으로 매우 넓은 안전 분류기를 설정하여 거의 모든 생물학 관련 질문을 제한 대상으로 삼았다.
Fable 5의 생물학 안전 장치 변경 이미지. 론치 시(上)에 비해, 현재(下)는 무해한 질문을 허용하는 범위를 넓히는 한편, 듀얼 유스나 유해한 내용은 계속해서 보호 대상으로 하고 있다.
제한 대상으로 판정된 질문에서는 Fable 5가 그대로 답변하는 대신, 생물학 분야에서 Fable 5만큼 높은 능력을 갖지 않는 “Claude Opus 5”로 처리를 전환한다. Anthropic는 이 메커니즘을 “fallback”이라고 부른다.
## 일상적인 건강 상담이나 교육용으로 Fable 5로 답변하기 용이
그러나 초기 분류기는 안전 측면에 크게 기울어져 있어, 위험성이 낮은 질문까지 제한하는 오탐이 많이 발생했다. Anthropic는 이번에 분류기가 판단에 사용하는 규칙군을 재검토하고 학습 데이터를 업데이트하여 재훈련했다. 위험하거나 듀얼 유스에 해당하는 연구 내용에 대한 검출 능력을 유지하면서, 무해한 용도를 보다 세밀하게 구분할 수 있도록 했다고 한다.
업데이트 후에는 검사 결과의 판독, 증상에 대한 질문, 생물학 학습과 같은 일상적인 건강 및 교육용으로 Fable 5를 활용하기 쉬워진다. 의료 전문가에 의한 임상 작업에 대해서도 Fable 5에 의한 지원을 받을 수 있는 범위가 확대된다. Anthropic의 테스트 결과, 생물학 관련 fallback이 약 85% 감소했다.
한편으로, 바이러스학, 독성학, 분자 설계 등 Anthropic가 듀얼 유스로 판단하는 질문에 대해서는 계속해서 Opus 5로 전환한다. 따라서 Fable 5는 현재 시점에서도 전문적인 생물학 연구나 신약 개발의 모든 것에 이용될 수 있는 것은 아니다. Anthropic는 앞으로 안전성을 확인한 연구자들에게 고도한 생물학 능력에 대한 접근을 제공하는 메커니즘의 정비도 진행할 예정이다.
원문 보기 | 출처: Ledge.ai