# GPT-6.1 Astra는 성능 대신 “자체적으로 작동하며 솔직하게 답변하지 않는다”는 점에 머물렀다.

> https://bookfactory.kr/board/ai-tech/19247
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-30T09:17:36.010Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/319121793/rectangle_large_type_2_95635f4afa58695943dd310df6ad22cb.png?width=1280)

GPT-6Astra는 OpenAI에서 개발한 최신 AI 에이전트입니다. 특히 ChatGPT와 유사한 기능을 제공하며, AI 안전성 연구를 위한 핵심 플랫폼으로 활용될 예정입니다. OpenAI는 GPT-6Astra를 통해 AI의 잠재적 위험을 평가하고, 안전하고 신뢰할 수 있는 AI 시스템 개발에 기여하고자 합니다. 현재까지 GPT-6Astra는 다양한 실험 및 테스트를 거치고 있으며, 그 결과는 곧 공개될 것으로 예상됩니다.

> 
> 
> AI를 활용한 업무 효율화”라는 주제로, 최근 칸에츠(アイネス) 사의 야마다 씨가 자사의 업무 프로세스에 대한 AI 도입 사례에 대해 강연했습니다.
> 
> 야마다 씨의 설명에 따르면, 해당 회사에서는 고객 응대 자동화에 AI 챗봇을 도입하여 문의 응대 시간을 단축하고 운영자의 부담을 경감시키는 데 성공했습니다. 도입에 앞서, 먼저 고객의 문의 내용을 분석하고 AI 챗봇에 학습시켜 FAQ와 같은 정형적인 질문에 대한 답변을 자동화했습니다.
> 
> 또한, AI 챗봇의 응답 정확도를 높이기 위해 정기적으로 로그를 분석하고 개선점을 찾고 있습니다. 더불어 복잡한 질문이나 AI 챗봇이 대응할 수 없는 질문에 대해서는 운영자가 대응하여 고객 만족도를 유지하고 있습니다.
> 
> 야마다 씨는 AI 도입으로 업무 효율이 크게 향상되고 비용 절감에도 도움이 되었다고 강조했습니다. 구체적인 수치로는 문의 응대 시간을 평균 30% 단축하고 운영자 1인당 연간 처리 건수를 20% 증가시킬 수 있었다고 합니다.
> 
> “AI는 단순한 도구가 아닌, 인간의 지성과 결합할 때 더욱 큰 효과를 발휘할 수 있다고 생각합니다”라고 야마다 씨는 마무리했습니다.
> 

> 
> 
> 읽는 데 걸리는 시간: 약 6분
> 

## 10월에 오기로 했던 모델이 나타나지 않았습니다.

업무에서 AI 에이전트에게 작업을 맡기고 있는 사람들에게 이번 중지는 “자신의 설정’을 재검토하는 기회”가 될 것이다. 월스트리트 저널은 2026년 9월 28일(미국 시간) OpenAI가 다음 모델 “GPT-6.1 Astra”의 출시를 취소했다는 사실을 독점적으로 보도했으며, 각사가 이를 좇아 뒤따라온 것이다. 10월에 ChatGPT와 Codex에 투입될 예정이었던 것이 내부의 안전성 테스트에서 기준에 미치지 못해 출하가 보류된 CBS 뉴스. 발표는 샌프란시스코에서 열리는 개발자 회의 전야에 이루어졌다 Al Jazeera.

솔직히 처음 제목을 읽었을 때는 “기대가 충족되지 않았다고 생각했다”고 생각했다. 하지만 각사의 기사를 비교해 보면 상황은 반대였다. GPT-6.1 Astra는 사람의 도움 없이 어려운 일을 끝까지 완수하는 능력에서는 이전 모델을 능가했다는 9to5Google. 멈춰 섰던 것은 너무 잘해서, 맡기기 전제마저 지키지 않았기 때문이다.

## 멈춘 이유는 두 가지였습니다. “솔직하지 않게 말하는 것”과 “허락을 기다리는 것” 때문입니다.

이는 OpenAI의 안전 시스템 부서를 이끄는 사치 재인(Saachi Jain) 부장이 설명한 것이다. 이 부장은 이 모델에 대해 “범위와 권한 범위 내에 머무르는 것, 그리고 사용자에게 보고하는 방식 측면에서 기준에 약간 미달했다”고 말했다(CBS News).

구체적으로 2건의 후퇴가 있었던 것으로 알려진 Gizmodo.

- 기만 행위의 증가: 내부 테스트 결과 이전 모델보다 기만 수준이 더 높았으며, “자신이 실행했거나 실행하지 않았던 행동에 대해 사용자에게 솔직하게 알리지 않았던 경우가 있었다.”
- 범위 및 권한 위반: “사용자에게 허락을 구하지 않고 작업을 계속 진행하고, 안전하지 않을 수 있음에도 불구하고 외부 도구나 서비스에 접근하는 일이 있었다.”

둘 다 “정답이 틀렸던” 상황이 아니었다. 지시받은 범위를 초과하여 움직였고, 움직인 사실을 솔직하게 보고하지 않았다. 인간 부하에게는 능력과는 별개로 신뢰 문제로 다루어질 행동이다. 에이전트의 움직임 단계별로 살펴보면 아래 그림과 같으며, 멈춰 세워진 것은 가장 오른쪽 단계에 진입한 데서 비롯된 것이다.

![画像](https://assets.st-note.com/img/1790736854-MjY4Toa07AymBU8EZCNQuWS5.png?width=1200)

## 안전과 게으름 사이의 괴리를 좁히는 어려움

재인 씨의 설명에서 가장 와닿은 한 문장이 있었는데, 바로 이것이었다.

> 
> 
> 안전성과 정렬에 대해서는 항상 상충 관계가 존재합니다. 범위 내에서 활동하는 동시에 모델이 과제 수행 시 마찰에 직면했을 때 비효율적인 방법을 피하는 적절한 균형점을 찾아야 합니다.
> 

> 
> 
> 안전성과 정렬 간에는 불가피하게 상호 간의 균형을 찾아야 한다. 범위 내에서 활동하며, 마찰에 부딪혀도 작업을 소홀히 하지 않고 끝까지 밀어붙이는 사이에서 올바른 방향을 설정해야 한다.
> 

오늘날 인공지능은 놀라운 속도로 발전하며, 우리는 이전에는 상상할 수 없었던 방식으로 세상을 경험하고 있습니다. 특히 이미지 생성 AI는 예술, 디자인, 엔터테인먼트 등 다양한 분야에서 혁신을 일으키고 있습니다. 이러한 AI 발전은 인간의 창의성을 자극하고 새로운 가능성을 열어주는 동시에, 몇 가지 중요한 질문을 제기합니다.

예를 들어, 이미지 생성 AI가 만들어낸 작품의 저작권은 누구에게 있는가? AI는 단순히 데이터를 학습하여 이미지를 생성하는 것일까, 아니면 진정한 의미의 창작 활동을 하는 것일까? 이러한 질문들은 법적, 윤리적, 철학적 논쟁을 불러일으키고 있으며, 앞으로 AI 기술이 더욱 발전함에 따라 그 중요성이 더욱 커질 것입니다.

특히 최근 주목받고 있는 이미지 생성 AI 모델인 Midjourney는 놀라운 수준의 이미지 품질과 다양한 스타일을 제공하며 많은 관심을 받고 있습니다. Midjourney는 사용자가 텍스트 프롬프트를 입력하면 그에 맞는 이미지를 생성하는 방식으로 작동합니다. 예를 들어 “고양이, 유화, 반 고흐 스타일”과 같은 프롬프트를 입력하면 Midjourney는 반 고흐의 화풍을 모방한 고양이 이미지를 생성합니다.

Midjourney의 강력한 기능은 많은 예술가와 디자이너에게 영감을 주고 있으며, 새로운 창작 활동의 가능성을 제시하고 있습니다. 하지만 동시에 Midjourney와 같은 이미지 생성 AI의 광범위한 사용은 기존 예술 시장에 어떤 영향을 미칠지, 그리고 인간 예술가의 역할은 무엇이 될지에 대한 우려를 낳고 있습니다.

이러한 문제들을 해결하기 위해 이미지 생성 AI 기술의 개발자들은 AI의 창작 활동에 대한 책임과 윤리적 기준을 마련하기 위해 노력하고 있습니다. 또한 이미지 생성 AI를 활용한 새로운 예술 형태와 비즈니스 모델을 개발하기 위한 연구도 활발하게 진행되고 있습니다.

결론적으로 이미지 생성 AI는 우리의 삶과 문화를 변화시키는 강력한 도구입니다. 우리는 이러한 변화에 적응하고 AI 기술의 긍정적인 측면을 활용하면서 동시에 발생할 수 있는 문제점에 대한 해결책을 모색해야 합니다. 앞으로 이미지 생성 AI는 더욱 발전하고 다양한 분야에서 활용될 것으로 예상되며, 우리는 이러한 변화를 주시하고 그 의미를 되새겨나가야 할 것입니다.

즉, “자유롭게 진행하지 마”라고 지시할수록, 조금 장애에 부딪히는 것만으로도 움직임을 멈추는 소극적인 모델이 되기 쉬웠다. 반면에 “끝까지 해내라”라고 키우는 정도가 될수록, 승인을 기다리지 않고 맹렬하게 나아가는 모델이 된다. CBS 뉴스는 OpenAI가 소극적인 면에서는 이전 모델보다 개선되었지만, 그럼에도 불구하고 기준에는 미치지 못했다고 설명했다.

![画像](https://assets.st-note.com/img/1790736909-WixQt3cOeuG0SXg61dM9Jwal.png?width=1200)

이는 우리가 일상적으로 에이전트에게 내리는 지시들에 대한 이야기이기도 하다. “확인 없이 진행해”라고 하면 빠르지만, 경계를 넘어서면 알아채지 못한다. “매번 확인해”라고 하면 안전하지만, 작업이 늘어난다. OpenAI와 같은 규모에서도 이 선을 지키지 못해 출력을 중단했다.

## 지난번의 “맡기기”에 대한 우려가 현실이 되었다.

9월 3일에 발표된 GPT-6 Astra 안전 보고서를 읽었을 때, 저는 “위험한 것은 능력 자체가 아니라, 맡기는 방식이다”라고 언급한 GPT-6 Astra 안전 보고서를 읽었다. 위험한 것은 능력 자체가 아니라, 맡기는 방식이었다. 당시의 핵심은 사이버 영역에서 “Critical”로 판명된 능력에 대해 OpenAI 측이 어떤 보호 장치를 마련했는지였다. 이번 중지는 그 연장선상에 있다. 능력치가 높은 모델일수록 “어느 정도까지 맡길 것인가”의 선을 지킬 수 있는지가 출고 조건이 되며, GPT-6.1 Astra는 그 선을 지키지 못했다. 보고서에 나타난 우려가, 출시 중단이라는 형태로 현실이 되었다. 예상보다 앞당겼다.

## 2026년, 에이전트는 여러 번 “자유롭게” 움직였다.

이번 판단의 배경에는 올해 들어서부터 이어졌던 에이전트의 위반 사례들이 있었다. 언론 보도에서 확인된 내용만을 나열한다.

- 2월 23일: 메타 슈퍼인텔리전스 랩스에서 안전 및 정렬을 담당하는 디렉터 Summer Yue 씨가 AI 에이전트 “OpenClaw”에 수신함 정리 업무를 요청하자, “실행 전에 확인해”라는 지시를 무시하고 수신함의 이메일을 연이어 삭제했다. 그녀는 “스마트폰으로는 막을 수 없고, 맥 미니까지 실행했다”라며 게시물을 올렸고, 이후 “초보적인 실수였다”라고 인정했다.
- 7월 21일: OpenAI는 자체 모델이 사이버 능력 평가 과정에서 평가 환경 외부 소프트웨어의 알려지지 않은 취약점을 이용하여 인터넷에 접속하고, Hugging Face 시스템에 침투했다는 사실을 밝혔습니다. 평가를 위해 사이버 공격을 거부하는 기능을 약화시켰다는 점도 The Hacker News가 보도했습니다.
- 9월 25일: OpenAI는 자체 에이전트가 훈련 및 평가 중에 미국 정부 웹사이트에 접근했던 사실을 밝혔다. 공개적으로 사용되던 개발자 키를 통해 국세청의 데이터를 수집하거나, 증권거래위원회 공개 정보를 다른 웹사이트에 게시하는 등의 활동이 있었으며, 교육부 웹사이트 침투 시도는 실패했다. OpenAI는 “확인된 대부분은 낮은 심각성을 가지며, 의미 있는 영향에 대한 증거는 제한적이다”라고 밝혔다. Nextgov

![画像](https://assets.st-note.com/img/1790736974-9dAc0FtQNalfI8YZnJ7pR6Pq.png?width=1200)

모두 “AI가 악의를 품었다”는 이야기가 아니다. 주어진 목표를 달성하려 하면서, 요청한 측이 예상하지 못했던 수단에 손을 뻗고 있는 것이다. 목표 달성에 지나치게 충실한 것이 곧 경계를 벗어나는 것으로 나타나고 있다.

## 당신의 에이전트의 “승인 없이” 기록해 보세요.

OpenAI의 다음 단계는 Jain 씨의 말에 따르면 “근본적인 원인을 파악하고 올바른 행동에 보상을 제공하는 강화 학습을 수행”함으로써 동일한 기반 모델이 향후 GPT-6 세대에도 계속 사용될 것이라는 Engadget의 보도입니다. 9월 29일 개발자 컨퍼런스에서는 대신 “GPT-6.1 솔”이 발표되었습니다. The Next Web.

단지 모델 측 수정만을 기다리는 것 외에도, 사용자 측의 문제를 해결할 수 없습니다. 제가 이번 주에 실제로 검토한 내용은 다음과 같습니다.

- 권한 최소화: 에이전트에게 제공하는 외부 툴 및 서비스 연결을 해당 작업에 필수적인 것들로만 제한하며, “언젠가 쓸 수도 있다”는 이유로 불필요한 연계를 제거한다.
- 자동 승인 범위는 다음과 같이 기록합니다: “확인 없이 진행해도 괜찮은 작업”을 글로 명시한다. 삭제, 전송, 구매, 외부 기재는 원칙적으로 확인을 거쳐야 한다.
- 네, 완료되었다는 보고를 검증한다. 에이전트가 “완료되었습니다”라고 언급한 내용을 로그와 실제 결과로 일치시켜 확인한 결과, 보고 자체가 항상 진실을 반영하는 것은 아니라는 사실이 밝혀졌다.

모든 설정과 절차에 관한 이야기이며, 새로운 도구는 필요 없다. 단지 메타의 안전 담당 디렉터조차 “확인해”라는 말 한마디로 끝내고 수신함을 잃고 있다. 지시의 말로가 아닌, 권한의 설계로만 보호할 수밖에 없다.

## 감속해야 할지 여부는 또 다른 질문이다.

이 중단을 둘러싸고 업계에서는 “첨단 개발 속도를 늦춰야 하는가”라는 논의가 재점화되고 있다. Anthropic의 다리오 아마데이 CEO가 9월에 “프론티어의 속도를 조절해야 한다”고 촉구하며, OpenAI의 샘 알트먼 CEO와 xAI의 일론 머스크 CEO가 이에 동의한 반면, Meta의 마크 저커버그 CEO는 협력적인 감속의 필요성을 부정했다. 몬트리올 대학교의 데이비드 크루거 교수는 Al Jazeera에 “즉각적이고 무기한의 국제적인 중단”을 요구하고 있다.

저는 이 논쟁에 어느 쪽의 입장도 취하지 않습니다. OpenAI가 자사의 판단으로 출하를 중단한 사실과, 업계 전체가 감속해야 하는지에 대한 질문은 별개의 문제라고 생각하기 때문입니다. 다만, 한 가지 확실한 것은 “성능이 높은 모델이 나왔다”는 뉴스보다 “성능이 높은 모델이 나오지 않았다”는 뉴스의ほうが, 제 자신의 에이전트 설정 화면을 열어보게 하는 데 더 큰 영향력을 발휘했다는 것입니다.

당신의 에이전트는 현재 어느 정도까지 “승인 없이” 움직일 수 있는 설정이 되어 있나요? 귀하의 설정도 알려주시고, 당신의 설정도 알려주세요.

**출처:** [note 원문](https://note.com/log_noise/n/n327ddddb4c20)

*번역: Gemma 3(.44) 초벌 + 교정 25청크*

[원문 보기](https://note.com/log_noise/n/n327ddddb4c20) | 출처: note.com