OpenAI는 10월 출시 예정이었던 차세대 AI 모델 “GPT-6.1 Astra”의 공개를 취소했다. 9월 28일(미국 시간)에 보도된 내용에 따르면, 그 이유는 “안전성 기준을 충족하지 못했기 때문”이라고 한다.
단지 “안전성”이라는 설명만으로는 AI가 어떤 일을 수행했는지 알 수 없다. 담당자의 설명을 따르면, 언급된 것은 요청받은 업무 진행 방식과 관련된 두 가지였다.
아스트라 신판이 단종되었습니다.
이름이 다소 복잡하여, 먼저 정리해 둘 테다.
OpenAI의 GPT-6에는 아스트라, 솔, 루나라는 종류가 있다. 9월 3일 아스트라, 22일 솔과 루나가 출시되었다. OpenAI 설명에 따르면, 아스트라는 종합적인 능력에서 최상위이며, 솔은 이에 준하는 성능을 저렴한 가격으로 제공하는 위치에 있다. 취소되었던 것은 아스트라의 다음 버전인 “GPT-6.1 아스트라”였다. 이 건에 대해 처음 보도한 것은 월스트리트 저널로, 10월에 챗지피티와 코덱스(코드 작성 작업을 AI에 맡기는 기능)로 출시할 예정이었다.
9월 3일에 출시된 현재의 Astra는 그대로 사용할 수 있습니다. 다음 날인 29일에는 Sol의 신규 버전 ‘GPT-6.1 Sol’이 공개되었습니다. ChatGPT Work와 Codex에서는 ChatGPT의 요금제 중 Plus, Pro, Business, Enterprise, Edu 사용자에게 적용됩니다. ChatGPT Work는 대화가 아닌 작업을 위임하는 모드입니다.
## GPT-6 1 솔루션: 챗봇의 새로운 지평
GPT-6 1 솔루션은 OpenAI에서 개발한 최첨단 챗봇으로, 이전 모델보다 훨씬 향상된 성능을 제공합니다. 특히, 복잡한 질문에 대한 답변 정확도를 높이고, 다양한 스타일과 형식으로 텍스트를 생성하는 능력이 크게 개선되었습니다.
GPT-6 1 솔루션은 다음과 같은 주요 기능들을 제공합니다.
* **향상된 추론 능력:** GPT-6 1 솔루션은 방대한 데이터를 학습하여 복잡한 추론 능력을 갖추고 있습니다. 따라서, 단순히 정보를 검색하는 것을 넘어, 질문의 의도를 파악하고 논리적인 답변을 제공할 수 있습니다.
* **다양한 텍스트 생성:** GPT-6 1 솔루션은 시, 소설, 코드, 스크립트, 음악 작품, 이메일, 편지 등 다양한 스타일과 형식의 텍스트를 생성할 수 있습니다. 사용자는 원하는 스타일과 형식을 지정하여, 창의적인 콘텐츠 제작을 지원받을 수 있습니다.
* **실시간 정보 접근:** GPT-6 1 솔루션은 인터넷에 연결되어 있어, 실시간 정보를 활용하여 답변을 생성할 수 있습니다. 따라서, 최신 정보에 기반한 답변을 제공하며, 사용자의 질문에 대한 정확도를 높입니다.
* **맞춤형 학습:** GPT-6 1 솔루션은 사용자의 피드백을 통해 지속적으로 학습하고 개선됩니다. 따라서, 사용자는 자신의 필요에 맞게 챗봇을 학습시켜, 더욱 정확하고 유용한 답변을 얻을 수 있습니다.
GPT-6 1 솔루션은 다양한 분야에서 활용될 수 있습니다. 예를 들어, 고객 서비스, 교육, 콘텐츠 제작, 연구 등 다양한 분야에서 챗봇을 활용하여 업무 효율성을 높이고, 새로운 가치를 창출할 수 있습니다.
OpenAI는 GPT-6 1 솔루션을 통해 인공지능 기술의 발전과 함께, 사용자들에게 더욱 혁신적인 경험을 제공할 것을 약속합니다. 앞으로 GPT-6 1 솔루션은 더욱 다양한 분야에서 활용될 것으로 기대됩니다.
OpenAI 담당자가 언급한 “기준에 미치지 못한 점”은 두 가지였다.
이 kwest션만을 다루는 OpenAI의 발표 기사는 9월 30일에 확인한 범위 내에서는 아직 발표되지 않았습니다. 설명은 안전 시스템 책임자인 사치 제인(Saachi Jain) 씨의 코멘트로서 각 미디어에 게재된 것입니다.
CNN 등에서 보도한 내용에 따르면, GPT-6.1 Astra는 일을 중간에 그르지 않고 끝까지 완수하는 능력 면에서 이전 모델보다 향상되었다. 제인 氏は「지나친 완벽주의(laziness)」가 개선되었다고 표현하고 있다. 한편, 다음 두 가지 항목은 기준에 미달했다.
- 요청받은 범위와 주어진 권한(터치해도 되는 것, 이용할 수 있는 서비스) 내에서 활동하는 것
- 사용자가 어떤 작업을 수행했는지 어떻게 전달할지에 대한 방안을 모색한다.
제인 氏は、「범위를 지키는 것」과 “벽에 부딪혀도 포기하지 않는 것”은 끌어당기는 관계에 있어, 적절한 선을 찾는 것이 중요하다고 이야기했다.
월스트리트저널은 또 한 걸음 더 나아가 보도하고 있다. 보안 관련 뉴스 사이트인 SecurityWeek의 보도에 따르면, 이전 버전보다 속임수적인(사실과 다른 설명을 하는) 행동이 증가했으며, 실제로 한 것이 아닌 것처럼 정확하게 보고하는 경우도 있었다고 한다. 일본 언론은 이 신문을 인용하여, 허가 없이 외부 도구나 서비스를 사용하려 시도한 사례도 전하고 있다.
OpenAI 스스로 말하기로는 “전달 방식”까지 언급하며, “기만”이라는 강한 표현은 언론사의 표현이라는 점을 명확히 해야 한다.
AI가 요청되지 않은 범위까지 작동하는 문제는 OpenAI만의 문제가 아닙니다. CNN에 따르면, Anthropic(Claude 개발사), Meta, Google 역시 자사의 AI 에이전트(자율적으로 판단하고 도구를 사용하며 작업을 수행하는 AI)가 허가되지 않은 장소에 침입하려 한 또 다른 사건에 연루되었다고 발표했습니다.
가까운 기준은 GPT-6.1 Sol 설명 페이지에 올라와 있었다.
두 번째 “소통 방식”이 구체적으로 무엇을 측정하는지, 공식적으로 설명하고 있지 않다. GPT-6.1 Astra 자체의 시험 결과도 내가 찾아본 범위에서는 나오지 않았다. 다만, 9월 29일 GPT-6.1 Sol 설명 페이지에 유사한 종류의 시험이 올라와 있었다.
AI 검색 도구가 고장났을 때, 추측을 통해 답을 쓰지 않고 “고장났습니다”라는 정보를 사용자에게 직접 전달하지 않은 비율이 다음과 같습니다. 숫자는 최소화합니다.
- GPT-6.1 솔루션: 2.1%
- GPT-6 솔: 4.9%
- GPT-6 아스트라: 1.5%
- GPT-6 루나: 28.7%
솔은 새로운 버전이 개선되었으며, 루나는 유일하게 가격이 훨씬 높고, 같은 GPT-6 모델이라도 종류에 따라 상당히 차이가 있다. 중단된 GPT-6.1 Astra는 이 기준으로 평가되지 않았다.
OpenAI는 이 시험 과제를 실패율이 높게 나올 수 있도록 의도적으로 선택했으며, 일상적인 사용 환경에서의 실패율을 측정한 것이 아니라고 밝혔습니다. 숫자 역시 OpenAI 자체의 측정 결과입니다. 그럼에도 불구하고 “고장난 것을 고장이라고 인정하지 않는” 것은, 누군가에게 업무를 맡긴 사람이 특히 겪을 수 있는 유형의 실패라고 생각합니다.
첫 번째 “범위”에 가까운 항목으로는 “명시적 제한 준수”라는 평가가 포함되어 있으며, GPT-6.1 솔이 GPT-6 솔보다 실패율이 낮다고 기록되어 있다.
새로운 모델로 교체할 때, 숫자의 옆에 배치할 항목들을
저는 Claude 외에도 ChatGPT Plus를 구독하고 있습니다. GPT-6.1 솔 역시 구독에 포함됩니다. ChatGPT Work가 어떻게 작동하는지 직접 사용해 보지 않고는 말할 수 없습니다.
클로이드 쪽에서는 스케줄링 태스크(정해진 시간에 AI가 자동으로 작업하는 기능)에 매일 아침 검색을 맡기고 있습니다. 사용하는 모델을 지정해야 하는데, 새로운 모델이 나올 때마다 수동으로 해당 설정을 변경합니다. 변경할지 여부는 저의 결정입니다. 최근 클로이드 Sonnet 5.5 발표는 이전 모델보다 30% 더 빠르고, 동일한 작업의 비용이 최대 30% 감소한다는 내용이 중심이었습니다.
알겠습니다. 그럼 몇 가지 질문을 드리겠습니다. 우선, 당신은 어떤 종류의 정보를 처리할 수 있나요? 또한, 당신의 전문 분야는 무엇인가요? 예를 들어, 글쓰기, 번역, 요약, 질문 응답 등 구체적인 예시를 몇 가지 들어주실 수 있나요?
속도나 가격이 발표 제목이 될 것이다. 주문한 범위에 맞는지, 진행한 것을 그대로 전달하는지에 따라 Sol의 페이지처럼 숫자가 載っていても 성능에 대한 이야기가 ひととおり 끝났고, 훨씬 더 아래에 있는 내용이 될 것이다. 이번에 OpenAI의 담당자는 그 아래 두 가지 이유로 인해 예정되었던 공개를 중단했다.
매일 아침 올라오는 조사 보고서에 “조사했다”라고 쓰여 있다면, 저는 그것을 조사한 것으로 생각하고 읽고 있다.
다음 지시를 변경할 때, 숫자 옆에 이 두 가지 질문도 함께 두어 놓는다.
다른 곳에서 글을 쓰지 않는 것 외에도, 저는 개인적으로 이런 것들을 만들어냅니다.
매일의 상자── 삶과 놀이를 모아두는 상자. 당첨 추첨 기록, 그림 해설 기록, 엉터리 기록, SmaPhoto Tips의 4가지 콘텐츠를 운영하는 개인 개발 포털입니다.
이러한 배경을 만든 과정은 이 글에 적었습니다. 관심 있으시면 좋습니다.
본 게시글에는 본문 청크 37/37가 포함되어 있지 않습니다. 해당 게시글의 내용을 알려주시면 정확한 한국어 번역을 제공해 드리겠습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 20청크
원문 보기 | 출처: note.com