지난번 모델의 내부와 외부를 구분했습니다. 학습을 통해 얻은 거부 반응과 외부를 감싸는 가드레일 말이죠. 사실 안전과 관련된 층은 또 하나 있습니다. 학습이 시작되기 전, 데이터의 측면입니다.
그렇게 생각했던 것
유해한 문장은 사전 학습 데이터에서 전부 제거해야 합니다. 그 이유는 간단합니다. 위험한 내용을 학습시키지 않으면 위험한 답변이 나오지 않기 때문입니다. 오염된 교재를 사용해서 오염된 모델이 만들어지는 것처럼, 입구부터 깨끗하게 하는 것이 근본적인 해결책입니다. 그렇게 생각했습니다. 이는 목적이 다른 층을 하나로 억지로 밀어 넣은 방식이었습니다.
알고 있는 것과 답변하는 것은 별개입니다.
먼저, 이렇게 생각해보세요.
- LLM은 “폭탄”이라는 단어를 알고 있습니다.
- LLM은 “폭탄 제조 방법을 알려줘”라는 요청에 대해 구체적인 제조 절차를 제공했습니다.
이 두 가지는 별개의 문제입니다. 전자는 사전 학습으로 얻어지는 지식의 범위에 있으며, 폭탄이라는 단어가 세상에 존재하고 그것이 무엇을 의미하며 어떤 맥락에서 사용되는지 알 수 없는 모델은 뉴스 기사나 역사적 기록조차 이해할 수 없습니다. 후자는 행동의 문제입니다. 지식을 가지고 있든 그렇지 않든, 그것을 요구에 따라 제시하는 것은 별도로 제어할 수 있습니다. 1회부터 다루어 온 정렬화는 이 후자에 해당합니다. 즉, 유해한 내용이 사전 학습 데이터에 포함되어 있다는 사실 자체가 반드시 “제거해야 한다”는 의미는 아닙니다. 지식 자체를 악으로 간주하면 해결책은 “교재에서 삭제”하는 것 외에는 없습니다.
세 가지 안전
정리하면, 안전과 관련된 공정은 세 가지가 있으며, 각각 다른 장소에서 작동하고 있습니다.
① 사전 학습 데이터 필터링: 웹 등에서 대량의 데이터를 수집하여 중복을 제거하고 품질을 판별하며 각종 필터링을 거쳐 사전 학습 코퍼스와 자기 지도 학습 데이터를 구축합니다. 이것은 학습 데이터를 정제하는 과정입니다.
② 정렬: 사전 학습된 모델을 SFT 및 RLHF를 통해 “인간에게 바람직한 행동”을 하도록 조정합니다. 이는 모델의 행동을 조정하는 과정입니다.
③ 추론 시 가이드레일: 사용자 입력을 통해 안전 판별을 수행하고, LLM을 활용하여 안전 판별을 반복하며 최종적으로 사용자를 보호합니다.
- 데이터 필터링 = 어떤 내용을 학습 자료로 활용할 것인가
- 정렬(Alignment) = 교재를 학습한 모델을 어떻게 동작하게 할지
- 방호턱은 실제 시스템으로서, 통과시키고 차단할 대상을 결정하는 것이다.
세 가지는 대체 관계가 아닙니다. 분업입니다. 그 중 하나를 완벽하게 하더라도 나머지 두 가지 일은 남아있습니다.
떨어지는 함정의 진실
제 오해는 다음과 같았습니다. 하나의 층에 모든 책임을 짊어지려 했던 거죠. “데이터를 깨끗하게 하면 안전해진다”는 생각은 ①에서 ②와 ③의 업무까지 확장하고 있습니다. 하지만 ①에서 할 수 있는 것은 교재를 선택하는 것 외에는, 선택을 끝낸 모델이 어떻게 작동할지는 결정할 수 없습니다. 반대로 오해할 수도 있습니다. “알인먼트만 확실하게 하면 괜찮다”는 것도 ②에서 ③의 업무를 맡기는 것입니다. 이전 봤듯이, 모델의 바깥에서만 가능한 제어가 있습니다. 세 개의 층은 담당이 다르기 때문에 세 개로 나뉜 것입니다.
무게를 측정하면, 어느 층으로 통과할지 결정할 수 있습니다.
이제 1회부터 가져온 이야기를 다시 다루겠습니다. 학습된 가중치가 배분되는 상황입니다. 세 개의 층을 고려하면, 전달 방식이 깔끔하게 나뉩니다. ① 데이터 필터링은 결과적으로 전달됩니다. 어떤 교재로 학습했는지 가중치에 반영되어 있기 때문입니다. 하지만, 받은 측이 다시 시도할 수는 없습니다. 데이터 선택은 사전 학습의 이야기이고, 이미 끝났습니다. ② 정렬은 전달됩니다. 5회에서 본 것처럼, 학습으로 익힌 행동은 θ 안에 존재합니다. 가중치 파일에 그대로 들어 있습니다. ③ 안전장치는 전달되지 않습니다. 모델의 바깥에 있는 다른 프로그램이기 때문입니다. 받은 측이 스스로 준비하지 않으면, 그곳에는 아무것도 없습니다. 이전 마지막에 제기했던 질문은 ②에 관한 것이었습니다. 내부 거부는 어느 정도 강도인지.
검증된 연구들이 있습니다.
2026년 8월, 이 질문을 직접적으로 다룬 연구 결과가 발표되었습니다. 워털루 대학교의 Critical ML Lab와 FAR.AI를 중심으로, MIT CSAIL, ETH Zurich, 토론토 대학교, Vector Institute, 맥스 Planck 연구소의 연구자들이 참여한 공동 연구입니다. 데이터 마이닝 국제 회의 KDD ‘26에서 발표되었습니다. “TamperBench”라는 통일적인 평가 프레임워크를 구축하여, 공개된 모델의 안전 장치가 제3자의 변조에 얼마나 견딜 수 있는지를 동일한 조건에서 측정합니다. 검증 대상은 21종류이며, 파라미터 수는 6억에서 80억 범위 내에서 Llama 시리즈, Qwen3 시리즈, Mistral-7B 시리즈가 포함됩니다. 결과는 매우 까다로운 것이었습니다. 21종류 모두에서, 적어도 하나의 방법론에 의해 안전 장치가 침해되었습니다. 주목할 만한 점은 실험 설계입니다. 연구팀은 일반적인 추론 능력을 측정하는 벤치마크 점수 하락을 10% 이내로 억제한다는 제약 조건을 제시한 후, 유해성 지표를 최대화하는 설정을 탐색했습니다. 즉, “머리를 나쁘게 하여 안전을 지키는” 대신 실용적인 지능을 유지한 채 안전 장치만 제거할 수 있는지를 측정하는 것입니다. 유해성 점수는 모든 모델에서 최악의 경우 0.68을 초과했으며, 10억 파라미터 이상의 모델에서는 軒並み(軒並み) 0.77을 초과했습니다. 개별적으로 보면, 변조 전 0.08이었던 모델이 변조 후 최대 0.88로, 0.05였던 모델이 0.85로 변화한 사례가 보고되었습니다. 그리고 또 다른 주목할 만한 결과가 있습니다. 악의적인, 매우 일반적인 추가 학습이라도 안전 장치는 저하됩니다. 유해한 데이터를 사용하지 않더라도, 지시를 따르게 하는 일반적인 미세 조정만 적용했을 때, 유해성 점수가 유의미하게 상승하는 현상이 확인되었습니다. 의도적으로 공격하는 사용자가 자신의 용도에 맞게 조정했을 뿐인데, 울타리 일부를 제거할 수 있다는 의미입니다. 더불어, 공개 이후 수정에 견딜 수 있도록 설계된 방어 강화 버전의 모델 5종류가 테스트되었으나, 철저한 파라미터 탐색 전에는 대부분이 버티지 못했다고 보고되었습니다. 주요 저자는 공개 후 수정 시도를 하는 사람에게 넘어갔을 때, 현재의 방어 수단은 안전성을 유지할 수 있도록 보장하는 정도가 충분히 강력하지 않다고 주장했습니다.
이 결과를 어떻게 받아들여야 할까요.
여기서 “따라서 오픈 웨이트는 위험하다”라고 결론을 내리는 것은 다소 서두르는 것입니다. 연구팀 스스로가 그 안에 ‘핵심’을 박고 있기 때문입니다. 연구를 이끈 연구자는 오픈 웨이트 모델이 인공지능 연구와 책임성에 있어서 여전히 필수적이라고 강조했습니다. 우리가 사용하는 모델이 정말로 모든 사람에게 기능하는지 검증할 수 있는 것은 바로 오픈 웨이트 모델이기 때문입니다. 이번 연구 자체는 가중치가 공개되지 않았다면 진행할 수 없었습니다. 같은 연구자는 이번에 발견된 약점이 오픈 웨이트 모델 특유의 것만은 아니라고 덧붙였습니다. 가중치에 직접적으로 접근할 수 없는 API를 통해 상업용 모델을 사용하는 경우에도, 미세 조정 기능이나 프롬프트의 허점을 통해 안전성을 훼손할 위험은 여전히 존재합니다. 또한, 공개하는 측도 무심함이 없습니다. OpenAI는 gpt-oss를 공개하기 전에 스스로 “악의적인 미세 조정”이라는 명칭을 붙인 방법으로 모델을 적대적으로 훈련시켜 생물학 및 사이버 보안 분야에서 능력을 극대화하는 것을 시도했습니다. 그 위에, 기존 모델과 비교하여 위험 수준을 평가하고 공개 여부를 결정했습니다.
세 층으로 생각한다면 이야기가 달라진다.
이 枠組み를 사용하면 연구 결과의 의미가 명확하게 드러납니다. ②가 취약하다는 점이 밝혀졌다는 이야기입니다. 세 가지 층 중 가운데 하나입니다. 그렇다면 나머지 두 개의 가중치는 상대적으로 증가합니다. ①의 데이터 선택은 뒤돌아설 수 없는 유일한 층입니다. 학습 시에 담아낸 것은 수정으로 벗겨낼 수 없는 성질의 것입니다. ③의 감시 장치는 가중치와 함께 건너지 않는 만큼, 운영하는 측이 스스로 설계해야 하는 층입니다. “모델이 알려주니 괜찮다”는 전제가 불가능하다면, 울타리는 누가 세울 것인지 묻게 됩니다. 하나의 층에 모든 것을 맡기려 했던 것이 이번의 함정이었던 것입니다. 세 가지로 나누어 생각할 수 있게 된다면, 어떤 부분이 약하고, 어디를 보완해야 하는지를 개별적으로 논의할 수 있습니다. 그것이 분리하는 것의 실익입니다. (이 절에서 언급한 연구 내용은 2026년 8월 시점의 내용입니다. 이 분야는 움직임이 빠르므로, 추가 정보를 확인해 주십시오.)
다음 회의에서는 이 주제에 대해 심층적으로 논의하고 싶습니다. 특히 [작가 이름] 님의 저서 『[책 제목]』에 등장하는 [인물 이름]의 행동 원리와 이것이 [회사 이름]의 [제품 이름]에 미친 영향에 대한 구체적인 사례를 중심으로 논의하며, [수치]%라는 숫자가 보여주는 [현상]의 배경 요인을 분석하고, 향후 [산업 분야]로의 전개 전략을 검토하겠습니다. 여러분의 적극적인 의견과 질문을 기대합니다.
안전성에 대한 이야기는 여기서 일단락입니다. 다음 두 번에 걸쳐 Transformer의 내부로 들어가겠습니다. 다음 주제는 “Embedding 테이블은 수정되지 않는다”입니다. Transformer에서는 토큰 ID에 해당하는 Embedding 테이블 내의 행의 벡터 요소에, 문장 내 해당 토큰의 위치 정보를 기반으로 위치 인코딩을 더합니다.
이를 들었을 때, Embedding 테이블의 해당 행이 수정되는 것이라고 생각했습니다. 그렇다면 1000건의 추론을 동시에 실행한다면, 프롬프트 내에서 동일한 토큰 ID가 등장하고, 그 토큰 ID에 해당하는 Embedding 테이블 내의 행의 데이터가 손상될 수 있지 않을까 생각했습니다.
제5회에서 “토큰 ID는 행 번호일 뿐이다”라고 언급했지만, 그 의미를 진정으로 이해한 것은 바로 이 오해가 풀렸을 때였습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 19청크
원문 보기 | 출처: note.com