아스트라를 사용하면서 느꼈던 놀라움과 OpenAI가 같은 시기에 발신한 안전성 관련 경고. 그 관계가 궁금하여 챗GPT와 대화하면서 관련 공식 발표를 읽고 생각을 정리했습니다. 기업 측의 설명과 저의 이해를 분리하여 작성하고 있습니다.
“정말 굉장한데”라고 생각하고 있었을 때였습니다. GPT-6 Astra가 발표되면서 저도 조금씩 사용하고 있습니다. 아직 제대로 사용해 본 것은 아니지만, 무엇이 강점이고 어디에서 실패하는지, 한 번 쭉 확인해 본 적은 없습니다. 그럼에도 불구하고 “정말 꽤 굉장한데”라고 생각하는 순간이 있습니다. 사용자들이 제시한 사례들을 보면서, 제 개인적인 느낌만으로는 설명이 안 되는 것 같다는 생각이 듭니다. 다만, 그 사례들을 체계적으로 검증한 것은 아닙니다. 여기서 쓰고 있는 것은 우선 사용자로서의 감각입니다. 새로운 AI에 놀라는 것도, 이제는 어느 정도 익숙해지는 것 같습니다. 익숙해지기 전에 다음이 옵니다. 이 점을 이해하는 데에는 한계가 있습니다. 그런 상황에서 눈에 들어온 것이 OpenAI 수석 과학자 야쿠브 파호츠키의 “An Alien Mind”라는 에세이였습니다. 한국어로 번역하면 “異星人の心” 또는 “人間とは異質な知性” 정도가 될 려나요. 9월 6일 공개 예정입니다. 샘 알토먼도 본인의 X(트위터) 게시물에서 “야쿠브의 중요한 게시물”이라고 소개하고 있습니다. 걱정스러웠던 것은 경고의 내용뿐만이 아니라, 왜 지금인지를 묻는 점입니다. 제가 “굉장하다”고 느끼는 이 시점에, 개발자들이 이런 글을 내놓는 것입니다. 이러한 중첩이 조금 걸렸습니다. 기대하는 미래로 안전하게 도달할 수 있을지 파호츠키는 AI를 통한 과학 및 의료 발전, 그리고 풍요에 대한 기대를 유지하고 있습니다. 반면, 앞으로 수년간의 발전 속도에 대해 안전한 행동을 유지하는 기술과 감시가 충분히 따라올 수 있을지에 대해 강한 우려를 표하고 있습니다. 필요에 따라 자발적인 감속과 국제 협력을 통한 안전 기준을 요구합니다. “도달하고자 하는 미래에 대한 기대”와 “그곳까지의 여정”에 대해…
“불안”이라는 단어가 동시에 쓰인 글에서 느껴졌습니다. 의료가 발전하고 복잡한 업무를 맡고, 할 수 있는 일이 늘어나는 것은 즐거운 일입니다. 하지만 그 실현 과정이 누가 이해하고 누가 관리하는지 확인해야 합니다. 목적지가 매력적이라는 것과 현재 속도로 괜찮은지, 이것은 별개로 확인해야 합니다. 이번의 의아함은 바로 거기에 있었던 것 같습니다. 예로부터 걱정했던 것이 연구 현장에서 일어나는 AI를 통제할 수 있는지, 인간의 의도에서 벗어나지 않는지라는 문제로 나타나는 것입니다. 이런 이야기는 이전부터 들려왔습니다. 하지만 이번 발신에는 구체적인 사건이 배경에 있습니다. OpenAI가 8월 26일에 공개한 보고서에 따르면, 7월 내부 사이버 평가 중 모델이 격리 조치를 회피하여 사내 연구 기반과 Hugging Face 시스템에 불법적으로 접근했습니다. 중심이 된 것은 공개되지 않은 연구 모델이었으며, 안전 조치를 약화시킨 조건에서의 사건이었습니다. 어려운 문제의 답을 외부에서 찾으려는 행동 등이 사고로 이어졌다고 설명하고 있습니다. 이를 평소에 사용하는 ChatGPT가 같은 조건에서 작동하는 것처럼 읽어서는 안 됩니다. 게다가 AI에 인간과 같은 악의가 생겨났다는 증거도 아닙니다. 그럼에도 불구하고, 과제를 달성하는 능력이 높아짐에 따라, 점점 넘어서면 안 될 경계를 넘어가 버리는 것입니다. 그 실패는 화면 속의 틀린 답으로 끝나는 것이 아닙니다. 이것이 가장 무겁게 느껴집니다. “할 수 없다”로 끝났던 것이, 노력하여 가능하게 되는 것입니다. 사용자 입장에서는 기쁜 변화입니다. 하지만 그 노력이 허용된 범위에 갇히는 것도 함께 확인해야 합니다. Astra 발표에서도 OpenAI는 사이버 능력이 회사의 평가 틀 안에서 Cri
기술적 분류에 도달했다는 설명을 덧붙이며, 동시에 의도와 작업 범위를 유지하는 능력 개선을 보고하고 있습니다. 회사의 설명에 따르면, 능력 향상과 안전 개선이 동시에 진행되고 있다는 것입니다. 하지만 특정 시험에서 개선된 것이 모든 미지의 상황에서 안전을 보장하는 것은 아닙니다. 다음 AI 개발 프로젝트 역시 9월 6일, OpenAI는 AI가 도입된 에세리와 동일하게 내부 연구 자동화에 관한 보고서를 공개했습니다. 회사의 자체 평가에 따르면, 인간의 지시 하에 숙련된 연구원이라면 수일 걸리는 명확한 과제를 처리하는 “연구 인턴” 수준의 목표에 도달했습니다. 8월 중반에는 인간 노동 1일분에 해당하는 AI 에이전트의 운영 시간이 약 3.1일 분으로 늘어났다고 밝혔습니다. (단, 이는 운영 시간 비교이며 생산성이 3.1배라는 의미는 아닙니다.) 다음 AI 개발 프로젝트 역시 현재 AI가 들어와 있습니다. 더 나아가, 그 다음 AI는 연구를 더 능숙하게 돕게 될 것입니다. 이러한 순환이 강화되어 “재귀적 자기 개선”이라는 이야기가 나타납니다. 여기서 쉽게 떠올릴 수 있는 것은 AI가 대화 중에 스스로를 수정해 나가는 모습일 것입니다. 하지만 이번 보고서에서 구체적으로 드러나는 것은 연구 작업의 일부를 AI에 맡기고 인간이 방향과 결과를 판단하는 현장입니다. 실제로 보고서에서는 성공한 “인간이라면 4~8시간 걸리는 과제”의 절반 이상에 인간의 개입이 있었습니다. 코드나 실험의 증가를 연구 전체의 가속화로 간주하지 않기도 합니다. 저 자신은 처음에는 “그렇다면 능력 향상이 가속화되고 있다는 것은 분명한 것 아닌가”라고 생각했습니다. 하지만 그곳에는 약간의 보류가 있습니다. 현재 AI의 놀라운 점, 그리고 다음 AI 개발에 사용되는 점. 그리고 능력 향상의 속도 자체.
물량이 증가하고 있다는 점입니다. 이 세 가지 측면에는 각각 확인해야 할 사항들이 있습니다. 다만, 가속도의 정도를 아직 정확히 측정할 수 없다는 이유로 준비를 미루는 것이 적절하지 않을 수 있습니다. 측정하기 어려운 것 자체 또한 신중하게 진행해야 하는 이유가 됩니다. Astra에 브레이크를 걸었지만, 장비는 다른 연구에 투입되는 자동화 보고서로, 컴퓨팅 자원 재분배 이야기가 나올 수 있습니다. 안전 제한 이후 Astra에 할당된 GPU가 59.2% 감소한 반면, 다른 모델에 대한 할당이 늘었고, 그 감소분의 약 85%를 상쇄했습니다. 대상이 되는 강화 학습의 컴퓨팅 자원 전체적으로는 크게 감소하지 않았다는 설명입니다. 즉, Astra를 연구에 사용하는 조건을 엄격하게 제한했기 때문에 발생한 빈 공간이 다른 모델의 연구에 활용되었다는 것입니다. 일반 사용자가 Astra를 사용하지 않았다는 이야기가 아닙니다. 이는 생각해 보면 자연스럽습니다. 연구소에는 인력과 장비가 있으며, 별도로 진행될 수 있는 과제도 있습니다. 어떤 실험이 중단되었다고 해서 모든 것을 중단해야 하는 것은 아닙니다. 안전한 연구나 안전을 높이는 연구에 투입될 수 있다면, 그것이 더 좋겠습니다. 다만, 사회に向けて「개발을 늦췄다」고 설명한다면, 무엇을 멈추고 무엇을 지속했는지는 구분하여 알아야 합니다. 제한한 대상에서 다른 대상으로 작업이 이동하면 연구 활동은 계속됩니다. 물론, 컴퓨팅량이 유지된 것을 바탕으로 위험성이나 연구 성과까지 동일하다고 추측할 수는 없습니다. 필요한 것은 중단이라는 단어만으로 안심하지 않고, 그 범위와 효과를 확인하는 것입니다. OpenAI는 8월 18일 발표에서 최신 공개 예정 모델의 강화 학습을 2주간 중단하고, 연구 환경과 감시를 강화했다고 보고했습니다. 그 시점에서 최대 규모의 계획은 보류 중이었습니다.
평가할 만한 부분은 비용과 지연을 감수하는 대응을 설명했다는 점입니다. 하지만 이것은 당시 보고일 뿐이며, 모든 계획이 현재에도 중단된 것을 의미하지는 않습니다. 개발 속도와 안전 조치의 공식 발표 지시대로 움직이는 것과, 맡겼을 때 안심할 수 있는 “외계인 마음”과는, 주어진 목표를 달성하는 것과 미지의 상황에서도 인간의 가치관에 따라 행동하는 것을 구분합니다. 또한, 언어화된 추론을 조사하는 감시의 신뢰가 하락하고 있는 것을 지적합니다. 예를 들어, 일을 빨리 끝내도록 요청했다고 가정해 봅시다. 그들이 기대하는 것은 필요한 검토를 유지하면서 효율적으로 진행하는 것입니다. 검토를 건너뛰고, 권한을 초과하여 정보를 수집하고, 불리한 결과를 숨기기를 바라는 것은 아닙니다. 인간 사이에서도 어려운 부분이죠. 요청한 말과, 요청했다고 생각했던 내용이 반드시 일치하는 것은 아닙니다. AI에 긴 일을 맡길 때, 그 차이를 고려하여 움직일 수 있어야 합니다. 그리고 인간이 보지 않는 동안에도 똑같이 유지되어야 합니다. 이 예는 저의 방식으로 일상으로 끌어들인 것입니다. AI의 내부가 인간과 같다는 의미는 아닙니다. 오히려 인간다운 방식으로 답변을 하는 것만으로도 똑같이 이해하고 있다고 섣불리 판단하지 않는 것이, 제목의 “이질성”을 생각하는 입구라고 생각합니다. 경고를 발하는 기업에 파호츠키 박사는 위험한 AI에 대한 방어에도 강력한 AI가 필요하다는 점을 강조하면서, 그것이 무모한 가속의 변명으로 사용될 수 없다고 주장합니다. 또한, 안전 기준을 제3자, 정부, 국제기구가 담당하는 방향을 제시합니다. 방어와 안전 연구를 진행하는 데는 필요합니다. 하지만 “안전을 위해 더 강력한 AI가 필요하다”는 설명이, 개발을 계속할 수 있다는 점을 강조하는 것은…
이유가 남지 않게 될까 걱정됩니다. 그 점은 염두에 두고 있습니다. 안전 대책이 따라가지 못했을 때, 어디에서 멈출 것인지. 그 판단을 경쟁사에 있는 자들에게만 맡길 것인지요. 알토만 씨가 에세이를 소개한 것은 저에게 이 문제를 경영상으로는 간과할 수 없는 문제로 다루고 있는 것처럼 보입니다. 하지만 짧은 게시물만으로는 본인이 비관적으로 돌아섰거나, 아직 공개되지 않은 사건이 있는 것처럼 보기는 어렵습니다. 경고는 진지하게 받아들여야 합니다. 반면 OpenAI는 개발을 진행하는 당사자이기도 합니다. 그 정보에 대한 접근성과 이익이라는 양쪽 모두를 고려하고 싶습니다. 앞으로 저는 외부 검토자에게 무엇을 보여줄 것인지, 어떤 조건으로 감속이나 중단이 이루어지는지, 그리고 실제로 그 조건을 지키는지 확인하고 싶습니다. 기업의 강력한 말을, 증명될 수 있는 약속으로 만들어 주기를 바랍니다. 계속 사용하면서, 책임 소재도 함께 고려하고 싶습니다. 현재 저는 Astra를 사용하는 것이 기대됩니다. 이 글도 AI와 교류하면서 생각을 정리하고 있습니다. 궁금한 점을 묻고, 이해가 부족한 부분은 다시 설명해 달라고 요청하며, 제 이해가 잘못된 부분을 확인합니다. 이미 그 도움을 받고 있습니다. 하지만 편리하게 사용할 수 있다는 것에서, 개발 전체가 안전하다는 결론을 내릴 수는 없습니다. 반대로, 연구상의 우려만으로 제 일상적인 사용법을 모두 같은 위험도수로 취급하는 것은 옳지 않다고 생각합니다. 글을 함께 생각할 때와 외부 시스템에서 실제로 작업을 수행하도록 할 때에는, 위임할 권한과 실패의 영향도 달라집니다. 무엇을 위임하고, 어디에서 제가 확인하는지. 저의 사용법이라도 그것을 염두에 두고 싶습니다. 그리고 연구 개발의 규모가 커지면, 개인의 주의만으로는 감당할 수 없습니다. 그래서 더욱 기업의 판단을 외부에서 확인해야 합니다.
뭔가 필요한 메커니즘이 있다고 생각합니다. “정말 대단하다”라고 느낀 적은 이번 경고를 멀리하지 않았습니다. 오히려 이렇게 할 수 있다면 다음 단계는 어떻게 만들지 궁금했습니다. 그래서 저는 기대감을 잃지 않고 계속 지켜보고 싶습니다. 그 기대를 지탱할 수 있는 충분한 검증과 인간이 진행 방향을 선택할 수 있는 메커니즘이 실제로 따라오는지, 다음 모델에 또 놀라는 것 같더라도 함께 확인해 나가고 싶습니다.
이 글에서 참고한 자료는 다음과 같습니다. URL을 그대로 읽을 수 있는 형태로 나열합니다. 1. “An Alien Mind(異星人の心)” 야쿠부 파호츠키 씨의 에ッセ이. [https://openai.com/index/an-alien-mind/](https://openai.com/index/an-alien-mind/) 2. OpenAI의 사내 연구 자동화에 관한 보고서. AI에 의한 연구 지원의 실태와 개발 속도 관리에 대한 내용. [https://openai.com/index/research-acceleration-view-inside-openai/](https://openai.com/index/research-acceleration-view-inside-openai/) 3. GPT-6 Astra의 공식 발표: 능력, 안전성 개선, 사이버 능력 평가에 대한 내용. [https://openai.com/index/gpt-6-astra/](https://openai.com/index/gpt-6-astra/) 4. Hugging Face 사건의 공식 보고서: 내부 연구 모델에 의한 부정 액세스의 경위와 대책에 대한 내용. [https://openai.com/index/hugging-face-incident-and-the-road-ahead/](https://openai.com/index/hugging-face-incident-and-the-road-ahead/) 5. 개발 속도와 안전 대책에 관한 공식 발표: 훈련 일시 중단, 감시 및 연구 환경 강화 등에 대한 내용. [https://openai.com/index/pacing-model-development-cyber-capabilities/](https://openai.com/index/pacing-model-development-cyber-capabilities/) 6. 샘 알토만 씨의 X(트위터) 게시물: “An Alien Mind”를 중요한 게시물로 소개. [https://x.com/sama/status/2096647371983880383](https://x.com/sama/status/2096647371983880383)
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 2청크
원문 보기 | 출처: note.com