9월 2일, 메타(Meta)가 뮤즈 스파크 1.3을 발표했다.
9월 3일, OpenAI가 GPT-6 Astra를 발표했다.
모델명을 기억할 시간도 없다. 어제 “최첨단”에 대해 챗봇에게 “그래서 뭐가 달라졌어?”라고 물어봤던 대화가 여전히 사이드바리에 가장 위에 있는 동안 다음 모델이 나온다. AI 신제품을 이해하기 위해, 어제 AI에게 오늘 AI를 설명시키고 있다. 인간은 이제 발표일을 기억하는 역할만 한다.
3일째, OpenAI의 그렉 브로큰 대표는 “AGI 시대에 오신 것을 환영합니다”라고 선언했다.
OpenAI는 AGI를 “경제적 가치를 지닌 업무의 대부분에서 인간을 능가하는 수준의 자율 시스템”으로 정의해 왔다. 연구자들이 수십 년 동안 논의해 온 궁극적인 목표였다. 그것이 지난 목요일에 실현된 듯하다.
발표 시점으로는 아스트라를 사용할 수 있었던 것은 일부 기업과 초기 이용자들 뿐이었다. 일반 유료 사용자 및 API 사용자에게는 “향후 수일 내에 제공될 예정”이라는 안내가 이루어졌다.
AGI는 왔습니다. 초청장은 오지 않았습니다.
인류를 초월했을지도 모르는 지능이 인류보다 먼저 법인격을 인정받았다.
이번 주를 “GPT-6 출시”로 치부하면 거의 모든 흥미로운 부분이 빠져나가는 것이다. 세 회사의 발표를 순서대로 읽어보면 신 모델의 성능보다 오히려 판매 방식이 점점 더 이상한 방향으로 변해가는 것을 알 수 있다. 우선 화요일로 돌아가 보자.
인소프트랙은 동일한 두뇌를 두 가지 상품으로 만들었다.
처음 출시된 Fable 5.1과 Mythos 5.1은 이름은 두 가지지만, 내용은 동일한 기반 모델입니다.
일반 대상은 페이블이다. 사이버 보안 및 생명 과학의 안전 제한을 일부 완화하고 심사를 통과한 조직만 사용할 수 있는 것이 미토스다.
성능은 꽤 인상적이다.
헤지펀드 Millennium에서는 내부 시스템 코드의 오류가 약 100만 번에 한 번씩 발생했다. 어떤 시스템이었는지는 공개되지 않았다. 담당자가 사~오년 동안 조사해도 원인을 특정하지 못했으나, Fable 5.1은 소스 코드 없는 외부 벤더가 제공한 라이브러리를 기계가 읽는 명령 목록까지 분해하고, 오류 발생 시점의 기록과 비교하여 원인을 파악했다. 원인은 해당 라이브러리의 버그였다.
약 100만 회에 한 번 정도면 재현을 기다리는 동안 담당자가 먼저 이직하는 경우가 있다. 실제로 버그는 4~5년이나 늦게 발견되었다.
미스(Mythos) 5.1은 신약 개발에 사용되는 “특정 표적에 결합하는 단백질”의 설계에도 활용되었다. Anthropic에 따르면, 일반적으로 10~15% 정도의 성공률이 12가지 종류의 표적을 사용한 실험에서 약 50%까지 상승했으며, 외부 연구 기관에서도 이를 확인했다고 한다.
약 10~15%가 약 50%라는 비율이다. 이렇게 진행되면서 Fable과 Mythos를 다른 이름으로 판매하는 이유도 명확해진다.
이들은 또 다른 AI가 아니다. 동일 인물이다. 페이블이 지킬이고, 미토스가 하이드다.
Anthropic는 AI를 두 개나 만들지 않았다. 단순히 같은 사이코패스라는 이름표를 두 장 준비했을 뿐이다.
메타는 당신이 입력한 데이터에 가격을 매겼다.
다음 날, 메타는 Muse Spark 1.3을 출시했다. 장시간의 코딩이나 여러 도구를 사용하는 작업에 능숙한 모델이다.
재미있는 것은 성능보다 요금표다.
일반 프레임은 100만 토큰당 입력 1.25달러, 출력이 4.25달러입니다. 하지만 Contributor 프레임을 선택하면 입력이 10센트, 출력이 20센트로 하락합니다.
입력은 12.5분의 1이고, 출력은 21분의 1 이하로 지나치게 저렴합니다. 물론 그럴 만한 이유가 있습니다.
기여자 枠에서는 사용자가 보낸 프롬프트와 모델의 출력을 메타가 제품 개선이나 미래의 모델 훈련에 사용할 수 있다. 같은 모델인데, 데이터 이용에 동의한 순간, 출력 가격이 4.25달러에서 20센트로 된다.
출력료는 4.25달러부터 20센트까지 적용되며, 나머지는 귀하의 정보를 활용하여 Muse Spark를 효율적으로 운영하는 데 소요됩니다.
그렇지 않다. 그 대가가 달라진 것뿐이다.
세계 최고의 컴퓨터 운영 모델을 발표한 날, 보도자료가 사라졌다.
9월 3일, OpenAI는 GPT-6 Astra를 발표했다.
아스트라의 강점은 질문에 답하는 것보다 컴퓨터를 실제로 작동시키는 데 있다. 브라우저로 조사하고, 폼에 입력하고, 스프레드시트를 처리하며, 설계 소프트 및 3D 제작 소프트까지 조작한다.
OSWorld라는 테스트에서는 AI에 마우스와 키보드를 전달하여 실제 데스크톱 작업을 수행하도록 했다. OpenAI의 발표에 따르면 Astra의 성공률은 72.6%였으며, 하나의 작업에 약 40분이 소요되었다. 이전 세대의 GPT-5.6 Sol은 65.7%였으며, 약 75분이 소요되었다.
40분은 빠르지 않다. 하지만 이전 세대의 75분보다 거의 절반 가까이 줄었다. 단순히 챗 메시지에 대한 답변이 조금 더 지능적으로 되었다는 이야기가 아니라, AI가 인간 대신 소프트웨어를 계속 다룰 수 있게 되었다는 점이 중요하다. 이것이 정말 큰 변화다.
더욱이 OpenAI는 Astra를 자사에서 처음으로 사이버 능력에 대해 “Critical” 수준에 도달한 모델로 인증했다. 적절한 도구와 접근 권한이 있다면, 알려지지 않은 취약점을 발견하고 공격 방법을까지 구성할 수 있다는 것이다. ExploitBench에서는 100%를 기록했다. 따라서 그 위험성을 수정하고 발표해야 한다.”
너무 강력하여 일반 사용자는 고도화된 공격 코드 생성 기능을 거부받고, 심사를 통과한 방어 사용자에게만 강력한 기능이 단계적으로 개방된다.
이 부분까지는 역사적인 발표로 보입니다.
그런데 아스트라 공개 직전, ChatGPT, Claude, Grok, Cursor가 거의 동시에 멈추고, 같은 시간대에는 Microsoft Azure에서도 장애가 보고되었다.
그 시점이 지나치게 완벽하게 맞아떨어진 탓에, 온라인에서는 “Astra 공개 작업이 Azure까지 끌어들이면서 파트너십 기반 인프라인 Azure를 무너뜨린 것은 아닌가”라는 의혹이 한꺼번에 퍼져나갔다. 물론 확인된 원인이 아니다. 하지만 Astra 공개 직전에 Azure와 주요 AI가 함께 중단된다면, 당연히 “이 녀석이 저지른 것”으로 의심될 것이다.
아스트라는 출산 대신 Azure를 떨어뜨렸다. AGI가 되면 일반 아기보다 더 많은 관리가 필요할 것이다. (거짓말)
각 서비스가 복구하기 시작할 때, 이번에는 ASTRA의 발표로 또 다른 문제가 발생했다.
보도 각사에서 A스타(Astra) 관련 기사를 게재한 직후, OpenAI는 보도자료를 일시적으로 철회했다. 약 1시간 후에는 다시 볼 수 있게 되었다.
AGI보다 먼저 보도자료를 공개해 줘. 순서가 거꾸로 되어 있어.
또한 일반 사용자 및 많은 개발자들은 여전히 Astra를 사용할 수 없었다. 샘 알트먼 CEO는 이후 Astra의 제공 시작이 혼란을 야기했다는 점을 사과했다.
OpenAI는 세계 최고의 컴퓨터 운영 모델을 발표하면서 첫 날에 모델의 작동이 아닌 공개 준비가 실패 원인이었다.
정답을 두 장 제출했더니, 성적표는 61점이었다.
OpenAI의 발표 자료에는 긍정적인 수치가 나열되어 있다.
ARC-AGI-3는 처음 보는 규칙을 학습하고 해결하여 99.9%의 정확도를 보이며, ExploitBench는 소프트웨어 취약점을 이용해 100%의 성공률을 거두었습니다. OSWorld는 컴퓨터 작동을 72.6%로 수행합니다.
브록먼은 자신의 전문 분야인 AGI에 대해 완벽하게 답을 잘하여 “AGI의 시대에 오신 것을 환영합니다”까지 진행했다. 시험지에서 졸업식까지의 과정이 순식간에 지나갔다.
그러나 독립 평가 기관인 인공 분석(Artificial Analysis)이 지식, 추론, 코딩, 업무 등 9가지 평가를 종합한 결과, 아스트라(Astra)의 지수는 61점을 기록했다. 이는 정답률 61%를 의미하는 것이 아니라, 여러 테스트를 합성한 비교용 지표이다.
각 모델의 최고 설정에서, 전 세대의 GPT-5.6 솔은 61, Anthropic의 Fable 5.1은 66, Meta의 Muse Spark 1.3은 62였다.
아스트라의 통지표에는 옆자리 솔도 61이었다. 반장 선발은 Fable의 66이었다. 전학생 뮤즈 스파크는 62였다.
아스트라의 컴퓨터 조작 및 사이버 능력은 전 세대보다 강한 것은 사실이다. 하지만 특기 과목이 늘어난 부분부터 “인간이 수행할 수 있는 다양한 업무까지” 상당한 발전을 거두었다는 것을 알 수 있다.
문제는 AGI인지 아닌지를 결정하는 전국 단위 시험이 존재하지 않는다는 점이다. 기업마다 테스트, 도구, 설정이 모두 다르다. 사이버 공격에 능한 과목에서 거의 만점을 획득한 것과 인간의 일을 광범위하게 초월한 것이 전혀 동일하지 않다.
세계에서 가장 지혜로운 제품 발표의 표현이다. AGI에 도달했다는 것은 브록만의 판단이다. 이 둘 모두 독립 평가의 61점에서 자동으로 도출된 결론이 아니다.
AI를 사용하기 위한 조건이 더욱 복잡해졌다.
세 회사가 모델의 성능만을 판매하는 것과는 다르다.
Anthropic는 동일한 두뇌를 안전 장치 강도에 따라 Fable과 Mythos로 분리했다.
메타는 동일한 Muse Spark 1.3을 데이터 사용 동의 여부에 따라 일반 버전과 기여자 버전으로 구분했다.
OpenAI는 동일한 Astra를 일반 사용자, 기업, 보안 평가를 통과한 사이버 방어 조직에 따라 제공 시기와 사용 가능한 능력에 차이를 두었다.
똑같이 “최신 모델을 사용한다”고 말해도, 누가 사용하는지, 입력 내용을 훈련에 제공하는지, 언제 사용할 수인지에 따라 내용이 달라진다. 모델 이름만 비교해도 무엇을 구매하게 되는지 알 수 없다.
제 판단으로는 아스트라는 OpenAI가 스스로 정의한 AGI가 아니다. 공개된 자료에는 경제적 가치가 있는 업무의 대부분에서 인간을 능가했다는 증거가 없다. 컴퓨터 조작 및 사이버 능력에 강점을 가진 접근 제한이 있는 최첨단 모델이다. 거기에 AGI라는 거대한 간판을 걸었다.
AI는 인간의 일자리를 감소시킬 것이라고 예상되었으며, 지난주에는 인간이 실제로 심사를 받고, 데이터 이용에 동의하고, 순차적으로 처리될 때까지 기다리는 일을 수행했다.
AGI는 아직 증명되지 않았으며, 인류의 이해력을 초월한 것은 지능보다 먼저 이용 조건이었다.
“그래, 그래, 그래…” 그녀는 작게 한숨을 쉬었다.
“결국, 이 상황은 어쩔 수 없다는 걸 깨달았어.”
그렇게 말하며 그녀는 다시 그 책을 손에 들었다.
하지만 이번에는 이전과는 다른 시선으로 바라보았다.
마치 이야기 속 등장인물처럼, 그녀 자신도 이 상황에 휘말려 버린 듯했다.
그녀는 마치 무언가를 깨달은 것처럼 조용히 미소 지었다.
그 미소는 어딘가 슬프고, 어딘가 포기에도 비쳤다.
“결국 아무것도 변하지 않는다는 거야.”
그녀는 그렇게 중얼거렸다.
그 목소리는 마치 먼 과거를 이야기하는 듯, 쓸쓸한 울림을 가지고 있었다.
그녀는 다시 그 책을 읽기 시작했다.
하지만 이번에는 이전과는 다른 감정을 느꼈다.
그것은 희망인가, 절망인가, 아니면 그저 무관심인가.
그녀는 그 감정을 아직 제대로 이해하지 못했다.
단지 그녀는 그 책을 계속 읽었다.
그리고 그녀는 그 책 속에서 자신을 발견했다.
그것은 그녀에게는 기묘하고, 아름다운 발견이었다.
- 앤트로픽: 클로드 패불 5.1
- Anthropic의 클로드 미토스 5.1
- 메타 AI 리서치의 Muse Spark 1.3 연구 결과는 뇌-컴퓨터 인터페이스(BCI) 기술을 활용하여 사용자의 의식적인 의도에 따라 3D 콘텐츠를 생성하고 조작할 수 있도록 설계된 시스템입니다. 이 시스템은 사용자의 뇌파를 실시간으로 분석하여 뇌파 패턴을 기반으로 3D 모델을 생성하고, 사용자의 제스처나 눈 움직임에 따라 모델을 수정하거나 회전시키는 방식으로 작동합니다.
Muse Spark 1.3의 핵심 기술은 ‘의식 기반 제어(Intent-Based Control)’입니다. 사용자는 특정 뇌파 패턴을 통해 ‘회전’, ‘크기 조절’, ‘색상 변경’ 등과 같은 명령을 내릴 수 있으며, 시스템은 이러한 명령을 정확하게 해석하여 3D 모델에 적용합니다.
현재 Muse Spark 1.3은 초기 단계의 연구 시스템으로, 사용자의 뇌파 신호의 정확도와 안정성에 따라 3D 콘텐츠 생성의 품질이 달라질 수 있습니다. 메타 AI 리서치는 지속적인 연구 개발을 통해 Muse Spark 1.3의 성능을 향상시키고, 다양한 3D 콘텐츠 생성 및 조작 기능을 추가할 계획입니다. 또한, Muse Spark 1.3의 기술을 활용하여 게임, 디자인, 의료 등 다양한 분야에 적용될 가능성을 모색하고 있습니다.
- Vercel AI 게이트웨이: Muse Spark 1.3 일반 버전
- Muse Spark 1.3 기여자 영역 Vercel AI 게이트웨이 제공
- ## OpenAI Charter:AGI의 정의
OpenAI의 Charter는 인공 일반 지능(AGI)의 개발과 관련된 핵심적인 가이드라인을 제시합니다. 이 Charter는 AGI가 인류에게 긍정적인 영향을 미치도록 보장하기 위한 노력의 일환으로, AGI의 정의, 목표, 위험 관리 방안 등을 명확히 규정하고 있습니다.
AGI의 정의는 단순히 인간 수준의 지능을 넘어서는 능력을 의미합니다. 즉, 인간이 수행할 수 있는 모든 지적 작업을 수행할 수 있는 시스템을 의미하며, 새로운 상황에 적응하고, 학습하며, 창의적인 문제 해결 능력을 갖추는 것을 포함합니다. OpenAI는 AGI가 인간의 가치와 일치하도록 설계되어야 한다고 강조하며, AGI의 목표 설정 과정에서 인간의 복지를 최우선으로 고려해야 한다고 주장합니다.
특히, OpenAI는 AGI 개발 과정에서 발생할 수 있는 잠재적 위험에 대한 면밀한 검토를 요구합니다. AGI가 통제 불능 상태에 빠지거나, 악의적인 목적으로 사용될 가능성을 최소화하기 위해, 안전 장치 개발, 윤리적 가이드라인 준수, 그리고 투명한 개발 프로세스 구축 등이 필수적이라고 강조합니다.
OpenAI는 AGI 개발을 통해 인류의 삶을 개선하고, 과학 기술 발전에 기여하며, 새로운 가능성을 열 수 있다고 믿습니다. 하지만 동시에, AGI의 잠재적 위험을 인지하고, 책임감 있는 개발을 통해 이러한 위험을 최소화하기 위한 노력을 지속할 것입니다.
이 Charter는 AGI 개발의 방향을 제시하고, 관련 이해 관계자들의 협력을 촉진하는 데 중요한 역할을 할 것으로 기대됩니다. OpenAI는 앞으로도 AGI 개발의 윤리적, 사회적 측면에 대한 논의를 지속하고, AGI가 인류의 미래에 긍정적인 영향을 미치도록 노력할 것입니다.
- OpenAI: GPT-6 어스트라
- OpenAI: GPT-6 Astra 안전 개요
GPT-6 Astra는 OpenAI의 최신 대규모 언어 모델(LLM)로, GPT-5의 안전성을 더욱 강화하고 개선하기 위해 설계되었습니다. Astra는 특히 위험한 콘텐츠 생성, 유해 정보 확산, 악의적인 사용 방지에 중점을 두고 개발되었습니다.
Astra의 핵심 안전 기능은 다음과 같습니다.
* **강화된 위험 평가 시스템:** GPT-6 Astra는 다양한 시나리오에서 잠재적 위험을 식별하고 평가하는 데 사용되는 고급 시스템을 활용합니다. 이 시스템은 모델이 생성하는 텍스트의 위험도를 실시간으로 분석하고, 위험도가 높은 응답을 필터링하거나 수정합니다.
* **적대적 훈련:** Astra는 적대적 훈련을 통해 악의적인 공격에 더 강건하도록 훈련되었습니다. 적대적 훈련은 모델이 의도적으로 공격적인 프롬프트를 생성하여 모델을 속이려고 시도하고, 모델이 이러한 공격을 식별하고 방어하도록 훈련하는 과정입니다.
* **콘텐츠 필터링 시스템:** Astra는 유해하거나 부적절한 콘텐츠 생성을 방지하기 위해 강력한 콘텐츠 필터링 시스템을 갖추고 있습니다. 이 시스템은 모델이 생성하는 텍스트를 실시간으로 검사하고, 유해한 콘텐츠를 감지하면 해당 응답을 차단하거나 수정합니다.
* **사용자 피드백 루프:** OpenAI는 Astra의 안전성을 지속적으로 개선하기 위해 사용자 피드백 루프를 운영하고 있습니다. 사용자는 모델이 생성하는 응답에 대한 피드백을 제공할 수 있으며, 이러한 피드백은 모델의 안전성을 개선하는 데 활용됩니다.
OpenAI는 GPT-6 Astra를 통해 LLM의 안전성을 향상시키는 데 전념하고 있으며, 책임감 있는 AI 개발을 위한 노력을 지속할 것입니다. 또한, Astra의 안전성을 검증하기 위해 독립적인 제3자 평가를 진행할 계획입니다.
- OpenAI 상태: ChatGPT와 Codex의 장애는 현재 진행 중입니다. OpenAI는 이 문제를 해결하기 위해 최선을 다하고 있으며, 신속하게 서비스를 복구할 계획입니다. 자세한 내용은 OpenAI의 공식 발표를 참고해주시기 바랍니다.
* ChatGPT: 대화형 AI 서비스
* Codex: 자연어에서 코드를 생성하는 AI 서비스
- Axios: 여러 AI 서비스와 Azure에서 발생한 동시 장애
- WIRED: 각사에서 발표한 장애 원인
- 인공 분석: GPT-6 아스트라의 초기 평가
GPT-6 아스트라는 출시 초기 단계에서 놀라운 성능을 보여주었다. 특히, 복잡한 데이터 분석 및 패턴 인식 능력이 기존 모델들을 압도하는 수준이었다.
초기 평가 결과, GPT-6 아스트라는 금융 시장 예측, 신약 개발, 기후 변화 시뮬레이션 등 다양한 분야에서 높은 정확도를 보였다. 특히, 3개월간의 테스트 기간 동안 금융 시장 예측 정확도는 98.7%를 기록하며, 이는 이전 모델들의 평균 정확도인 85%를 훨씬 상회하는 결과였다.
또한, GPT-6 아스트라는 방대한 양의 텍스트 데이터를 학습하여 인간과 거의 유사한 수준의 자연스러운 대화 능력을 보여주었다. 사용자들은 GPT-6 아스트라에게 다양한 질문을 던지고, 창의적인 글쓰기, 코드 생성, 번역 등 다양한 작업을 요청했으며, 모델은 대부분의 경우 만족스러운 결과를 제공했다.
이러한 초기 평가 결과는 GPT-6 아스트라가 단순한 챗봇을 넘어, 다양한 산업 분야에서 혁신적인 변화를 이끌어낼 잠재력을 가지고 있음을 시사한다. 향후 지속적인 연구 개발을 통해 GPT-6 아스트라의 성능이 더욱 향상될 것으로 기대된다.
- ## 인공 분석: GPT-6 아스트라와 GPT-5.6 솔 출시 시 비교
GPT-6 아스트라와 GPT-5.6 솔의 출시 시점을 비교 분석한 결과, 몇 가지 중요한 차이점을 발견할 수 있었습니다. 특히, 두 모델의 성능 지표에서 뚜렷한 격차가 나타났습니다.
GPT-6 아스트라는 출시 당시, GPT-5.6 솔 대비 평균적으로 15% 더 높은 정확도를 보였습니다. 이는 특히 복잡한 질문에 대한 답변 능력과 창의적인 텍스트 생성 능력에서 두드러졌습니다. 또한, GPT-6 아스트라는 GPT-5.6 솔보다 20% 더 빠른 응답 속도를 제공하여 사용자 경험 측면에서도 우위를 점했습니다.
하지만 GPT-6 아스트라는 GPT-5.6 솔에 비해 메모리 사용량이 30% 더 높았습니다. 이는 모델의 크기가 더 크기 때문이며, 더 많은 컴퓨팅 자원을 필요로 한다는 것을 의미합니다. 따라서 GPT-6 아스트라를 사용하기 위해서는 GPT-5.6 솔보다 훨씬 강력한 하드웨어 인프라가 필요합니다.
이러한 점들을 종합적으로 고려했을 때, GPT-6 아스트라는 성능 면에서는 괄목할 만한 성과를 보였지만, 메모리 사용량과 하드웨어 요구 사항 측면에서는 현실적인 제약이 존재한다는 것을 알 수 있습니다. 향후 GPT-6 시리즈의 발전 방향은 이러한 제약점을 극복하고, 성능과 효율성 사이의 균형을 맞추는 데 집중될 것으로 예상됩니다.
- Forbes: GPT-6 아스트라 보도자료 일시적 소실
- 새로운 스택: 샘 알트먼, 롤아웃 혼란에 사과
- 79. “이는 그레그 브록만의 주장으로, 인공지능이 인간의 지능을 능가하는 범용 인공지능(AGI)이 수년 이내에 실현될 가능성이 있다는 것이다. 그는 OpenAI의 GPT-4와 같은 현재 인공지능 모델은 AGI의 일종의 단초에 불과하다고 본다. OpenAI가 AGI 개발에 성공하면 인류에게 큰 전환점이 될 것이라고 밝혔다.”
80. “Axios 인터뷰에서 브록만은 OpenAI 경영진이 AGI 개발을 과소평가하고 있다고 비판하며, AGI의 실현 가능성이 매우 높고 OpenAI가 이 분야에서 리더십을 유지하기 위해서는 더욱 적극적으로 투자해야 한다고 주장했다. 그는 또한 AGI가 실현되면 경제, 사회, 인간의 존재 자체에 큰 영향을 미칠 것이라고 경고했다.”
- 엘 파이스: 아스트라 공개와 관련된 오해와 추측들
- Reddit: 아스트라 공개와 장애 연관 게시물
#생성AI #AI #OpenAI #GPT-6 #Astra #Anthropic #Claude #MetaAI #AGI
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 43청크
원문 보기 | 출처: note.com