이번 기사의 주요 포인트(3가지)
OpenAI는 2026년 9월 3일에 GPT-6 “Astra”를 공개했으며, 블록만 사장은 기자들에게 한 설명회를 “AGI 시대에 오신 것을 환영합니다”라고 마무리했지만, 공식 페이지의 본문에는 “AGI”라는 용어가 없었다.
AGI에 대한 획일적인 정의는 없으며, OpenAI 헌장의 “경제적으로 가치 있는 업무에서 인간을 능가하는 자율 시스템”부터 구글 딥마인드의 단계 표까지, 측정 방식에 따라 답변이 달라진다.
일반 제공을 통해 이용자들이 Astra를 직접 사용해 볼 수 있게 되었지만, “AGI에 도달했는가?”라는 질문에 대한 답은 어떤 정의와 평가 환경에서, 누가 측정하느냐에 따라 달라진다.
OpenAI는 GPT-6 Astra를 공개, 사장은 “AGI 시대에 오신 것을 환영합니다”라고 밝혔다.
OpenAI는 2026년 9월 3일(미국 시간) 새로운 기반 모델 “GPT-6 Astra”를 공개했다. 공식 페이지는 이 모델을 “세계에서 가장 지능적이고, 가장 사람의 의도에 부합하는 모델”이라고 평가하며, 컴퓨터 작동, 소프트웨어 개발, 사이버 보안, 과학, 전문 업무를 대응 영역으로 제시했다.
グレッグ・블록만 대표는 기자들을 대상으로 한 설명회에서 “AGI 시대에 오신 것을 환영합니다”라는 말로 마무리했다. AGI(일반 인공지능)에 도달했는지 묻는 질문에 그는 “개인적으로는 이미 도달했다고 생각합니다”라고 답했으며, 직후 “정의는 사람마다 다릅니다”라고 덧붙였다고 보도되었다. 공식 페이지의 본문에는 “AGI”라는 용어가 사용되지 않았다.
공개된 벤치마크 결과, 추론 능력을 측정하는 ARC-AGI-3에서 99.9%를 기록했다. 반면, 같은 날 자체 평가 결과를 발표한 ARC Prize 재단은 표준 평가 환경에서는 62.7%였다고 덧붙이며 “벤치마크의 포화는 AGI 달성의 증거가 아니다”라고 명시했다.
일본 시간 9월 5일 아침, 알토만 CEO는 Pro, Enterprise, Business Premium 및 API에 대한 제공을 발표했다.
이어 플러스 비즈니스에도 제공한다고 알렸습니다. 일부 조직에 한해 제한되던 제공이 유료 이용자가 ChatGPT Work와 Codex를 시도해 볼 수 있는 단계로 확대되었습니다.
API의 일반적인 요금은 입력 100만 토큰당 10달러, 출력 50달러이며, 이는 이전 모델인 GPT-5.6 Sol의 2.5배에 해당합니다.
아스트라의 역량과 다수의 AGI 정의
하나의 모델이 수학에서부터 기판 설계까지 횡단한다.
A스트라의 특징은 다양한 종류의 전문 작업을 하나의 모델이 수행할 수 있는 범위에 있습니다. 공식 페이지에서 언급한 생성물의 예시는 문서, 스프레드시트, 프레젠테이션 자료 외에도 KiCad 기반의 회로 설계, Blender 기반의 3D 제작 작업, 미국의 세금 신고서 작성 등에 이릅니다.
목표를 전달하면 절차를 스스로 생각하고 화면을 조작하는 것 자체는 2026년 6월의 Claude Fable 5나 7월의 GPT-5.6 시점에서 실용 단계에 들어섰습니다. Astra는 그 작동을 더욱 빠르게 한 데다 대응하는 업무의 종류를 넓혀 PC 운영 평가에서는 1개 과제당 약 40분으로, 이전 모델의 약 75분에서 거의 절반으로 줄였습니다.
수학에서는 평가기관 Epoch AI가 고난도 문제집 FrontierMath의 최고 등급을 “飽和(사와)”라고 판정했습니다. 남은 마지막 문제 1개가 풀리면서 정답률은 98%에 도달했습니다. 또한, 해결되지 않은 엘데슈 문제들을 모아 놓은 또 다른 문제집에서도 68문제 중 2문제를 풀었습니다.
사이버 보안 분야에서 OpenAI의 내부 기준으로 “Critical(최고 수준)”에 도달한 최초의 모델로 평가받아, 평가 중에 미지의 취약점을 2건 발견하여 개발사에 보고했습니다. 숫자 대부분은 OpenAI 자체 발표치이며, 제3자의 재현이 아직 없는 항목들도 포함됩니다.
“AGI”라는 용어에는 통일된 정의가 없습니다.
AGI는 인공 일반 지능의 약어로, 한국어로는 범용 인공지능과 번역됩니다. 번역이나 이미지 인식과 같이 특정 용도에 특화된 AI와 구별하여 인간처럼 광범위한 지적 작업을 수행할 수 있는 AI를 지칭하는 용어입니다.
인간과 같이 폭넓은 범주를 무엇으로 할 것인지는 아직 결정되지 않았습니다. OpenAI는 2018년에 공개한 헌장에서 AGI를 “경제적으로 가장 가치 있는 직업에서 인간을 능가하며, 고도로 자율적인 시스템”으로 정의했습니다. 의식이 있는지, 인간과 같은지에 대한 조건은 포함되지 않았으며, 일자리 대체에 초점을 맞춘 경제적인 관점의 정의입니다.
Google DeepMind의 연구자들은 2023년 논문 “Levels of AGI”에서 성능을 “신흥”부터 “초인”까지 5단계로 나누고, 범용성 축과 결합하는 프레임워크를 제시했습니다. 이 관점에서는 “AGI인지 아닌지”가 이진 선택 사항이 아니며, 표의 어느 칸에 해당하는지 묻는 질문이 됩니다.
언어 사용 방식 또한 기업마다 다르며, Anthropic은 “AGI”라는 용어를 피하고 “강력한 AI”라는 표현을 사용하고 있습니다. 중국의 칭모샷 AI(Kimi)나 지부 AI는 기업의 사명에 AGI의 실현을 표방하지만, 어느 단계에 도달해야 AGI라고 부를 것인이라는 목표 조건은 어느 회사도 공개하고 있지 않습니다.
실현하는 순간 “그것은 AI가 아니다”라고 말해 왔다.
튜링 테스트는 1950년에 제안된 “기계가 인간과 동등한지 여부를 대화를 통해 판단하는 시험”이지만, AI가 이 시험에 합격한 날을 특정할 수 있는 사람은 아무도 없습니다. 대화하는 AI가 당연해짐에 따라, 시험 자체가 화제에서 사라지게 되었습니다.
이 현상에는 AI 효과라는 용어가 사용됩니다. 체스에서 인공지능에게 승리하거나, 언어를 번역하고, 사진 속 내용을 맞히는 것 등이 이에 해당합니다. 당초 실현 불가능했던 과제가 실현되자마자 “그것이 진정한 AI다”라는 평가에서 “단순한 계산일 뿐”이라는 평가로 바뀌는 현상입니다.
컴퓨터 과학자 라리 테스ラー는 이를 “AI는 아직 실현되지 않은 모든 것들이다”라고 표현했습니다. 능력들이 하나씩 쌓여나간 결과, “AGI가 되기 위해선 또 무엇을 해야 하는가”라는 질문은 답하기 어려워졌습니다.
시행착오를 어떻게 이어갈지에 따라 결과가 달라진다.
아스트라의 실력을 가늠할 때, 상징적인 결과가 바로 ARC-AGI-3의 결과입니다. 이는 처음 보는 게임을 조작하며 규칙을 발견하고, 이를 극복하는 평가입니다. 단순 지식 암기뿐 아니라, 시도와 실패를 통해 다음 행동을 변화시키는 능력이 시험됩니다.
이러한 작업에서는 중간에 무엇을 시도하고 무엇을 알아냈는지 이어갈 수 있는지가 중요해집니다. ARC Prize 재단의 일반적인 평가 환경에서는 Astra의 점수가 62.7%였습니다. 일반적인 환경에서도 스스로 남긴 메모는 이어갈 수 있습니다. OpenAI가 제공한 시스템을 사용하면 생각하는 과정의 중간 상태를 유지할 수 있으며, 이를 활용하면 거의 만점 수준에 도달했습니다.
뉴스에서 소개한 99.9%는 고려한 양의 설정 또한 다른 조건에서 나온 최고 기록입니다. 다만, 그 점들을 맞춰 비교해도 차이는 여전히 큽니다. 이 평가에는 정답률뿐만 아니라 인간에 비해 얼마나 적은 조작으로 진행했는지도 포함하여 측정하고 있습니다.
즉, 아스트라의 능력은 모델의 이름만으로는 결정되지 않습니다. 중간 과정의 시행착오를 어떻게 활용할 수 있는지에 따라 동일한 문제에 대한 대응력이 달라집니다. 재단이 우수한 성과를 인정하면서도 “AGI의 증명은 아니다”라고 한 것은 특정 평가를 달성하고, 어떤 일이라도 맡길 수 있다는 것과는 거리가 있기 때문입니다.
좋아하는 일이 달라지면 평가 순위도 달라집니다.
다른 회사와의 비교에서도 ASTRA가 모든 면에서 우위를 점하지는 않았습니다. OpenAI 발표에 따르면, 고난도의 수학이나 과학 문제에서는 Claude Fable 5.1을 능가하는 반면, 다양한 전문 지식을 묻는 다른 시험에서는 Fable이 우승했습니다.
독립 평가 기관 Artificial Analysis의 코딩 평가에서도 Fable이 우세합니다. 다만, Astra는 Codex, Fable은 Claude Code라는 다른 개발 환경에서 테스트되었으며, 모델과 도구를 합한 결과입니다.
종합력은 결론에 이르지 못하는 경우도 있습니다. 인공 분석이 9월 4일에 문서의 읽기 및 긴 업무를 포함하여 개정된 종합 평가에서 “페이블”이 1위를 차지했고, “아스트라”가 2위를 기록했습니다.
한편, Epoch AI의 종합 평가에서 9월 5일 기준으로 Astra가 1위를 기록했습니다.
수학의 난제를 해결해드릴까요, 기존 소프트웨어를 수리해드릴까요, 자료를 불러와 업무를 마무리해드릴까요. 중시하는 업무가 달라지면 평가도 달라집니다. Astra의 발전이 크더라도 그것이 곧 “누구에게나, 무엇을 요청하든 최우수”를 의미하는 것은 아닙니다.
“바벨”의 속편인 제2부 “아멜리아”가 드디어 출간되었습니다.
가장 먼저, 해외 독자들의 반응이 매우 뜨겁습니다. 특히 미국에서는 이 작품이 “현대의 ‘고슴도치’”와 같이 큰 반향을 일으키고 있다고 합니다.
“고슴도치”는 1988년에 발표된 쓰키다 마사루 작가의 작품으로, 1993년에 한국어로 번역되어 출간되었습니다. 이 작품은 1988년 당시 일본 사회의 모습을 반영하며 젊은이들의 불안과 고독을 섬세하게 그려낸 작품으로 평가받고 있습니다.
“아멜리아” 역시 마찬가지로 현대 사회의 불안과 고독을 주제로 한 작품이며, 독자들에게 깊은 공감을 얻고 있습니다.
또한 이 작품은 독특한 구성과 등장인물들의 복잡한 인간관계가 긍정적으로 평가받고 있습니다. 특히 주인공 아멜리아는 현대 사회에서 살아가는 여성의 모습을 상징한다고 합니다.
더불어 이 작품은 아름다운 문체와 섬세한 심리 묘사가 특징입니다. 독자들은 아멜리아의 감정에 깊이 공감하며 그녀의 삶을 통해 자신을 돌아보는 시간을 가질 것입니다.
“아멜리아”는 독자들에게 감동과 충격을 선사하고, 잊을 수 없는 독서 경험을 제공할 것입니다.
일반적으로 제공된 후, 해외 게시판 Reddit의 r/singularity에는 “전 세계에 제공된 지 몇 시간째, 첫인상은 어떤가?”라는 스레드가 게시되었습니다. 집의 3D 모델이나 게임 제작에 대한 놀라움이 있는가 하면, 설계의 실패나 이용 쿼타에 대한 불만도 나타났습니다. 아래는 이용자 스스로의 경험담이며, 소요 시간과 비용 또한 각자의 주장입니다.
며칠 전 전 세계 GPT-6 출시 이후, 저는 이것을 사용해 보면서 정말 믿기지 않을 정도였습니다. GPT-5에서는 제대로 이해하지 못했던 미묘한 뉘앙스와 맥락을 실제로 파악하는 방식이었습니다. 창작적인 글쓰기 수준은 완전히 다른 차원에 도달했습니다. 무라카미 스타일의 단편 소설을 요청했더니, 실제로 완벽하게 구현했습니다. 진심으로, 그 디테일과 분위기를 구축하는 방식은 놀라울 정도입니다. 또한, 복잡한 논리적 추론 능력이 현저하게 향상된 점도 눈에 띄었습니다. 단순히 정보를 되풀이하는 것이 아니라, 실제로 그것에 대해 ‘생각’하는 것 같습니다. 저는 매우 어려운 코딩 문제들을 테스트해 보았는데, 일관되게 우아하고 효율적인 해결책을 제시했습니다. 저는 이것이 진정한 의미의 범용 인공지능으로 나아가는 발걸음이라고 생각합니다. 이 잠재력에 정말 기대되고 있습니다.
이 노래 정말 좋죠. 특히 후렴구의 멜로디가 계속 머릿속에 남아 있네요.
가사도 많이 공감되는 부분이 많아요.
줄거리를 읽었을 때는 조금 슬픈 기분이 들었지만, 듣다 보니 긍정적인 기분이 들게 돼요.
이 노래를 듣고 다시 한번 제 인생을 돌아보는 계기가 되었습니다.
추천하는 노래를 알려주세요.
저도 이 노래 정말 좋아해요!
특히 [아티스트명]님의 목소리가 정말 매력적이고, 듣고 있으면 마음이 정화되는 듯한 느낌이 들어요.
[곡명]은 [아티스트명]님의 대표곡 중 하나라고 생각해요.
[곡명]을 듣고 [관련도서명]을 다시 읽고 싶어졌어요.
[관련도서명]은 [저자명]님[출판사명]에서 출판한 [출판연도]년에 발매된 소설로, [곡명] 가사의 영감을 주었다고 합니다.
리모델링 예정인 집의 도면을 전달하고, Codex를 Unreal Engine에 연결하여 집 안을 자유롭게 돌아다닐 수 있는 3D 모델을 제작했습니다. 거의 한 번에 완성되었습니다. 치수 표기가 애매했던 벽이 몇 군데 있었지만, 그 외에는 꽤 괜찮았습니다.
드디어 제대로 된 브라우저 게임을 한 번에 만들 수 있게 되었다. 돈을 지불할 정도는 아니지만, 지루해질 때까지 30분 정도는 충분히 즐길 수 있다. 5.6 Sol이 자주 만들던 게임 진행이 멈추는 듯한 버그에도 조우하지 않았다.
기판 설계를 시도해 봤지만, 개선된 것은 단지 조금뿐이었습니다. 부품 배치와 배선은 여전히 형편없고, 전혀 작동하지 않는 경우도 있습니다. 하지만 규모가 큰 코드를 다루는 경우에는 이전보다 개선되었고 안정적입니다.
토큰을 꿀꺽 삼키는 괴물 같네, 정말 웃기다. 덧붙임: 20분 정도 만에 5시간 분량의 이용 횟수를 전부 소모했다.
xhigh(생각의 양을 늘리는 설정)는 추론이 매우 뛰어나다. 토큰 소비도 적절하다고 생각한다.
능력의 달성과 업무 위임 요청 사이의
계약 조건과 사회의 판단은 상이하다.
OpenAI와 Microsoft는 2025년 10월, OpenAI가 AGI 도달을 선언했을 경우, 독립적인 전문가 패널이 검증하는 방식을 도입했습니다. AGI 도달의 판단이 Microsoft의 지적 재산권 및 수익 배분 조건에 영향을 미치는 것이었기 때문입니다.
2026년 4월 27일 개정안에 따라 OpenAI에서 Microsoft로의 수익 배분이 기술 발전과는 무관하게 2030년까지 지속될 것이 결정되었습니다. 지급액과 기술 수준이 분리되었으나, 계약 전체 내용은 공개되지 않았습니다. 전문가 패널 및 AGI 관련 조항이 폐지되었는지 여부는 아직 불명확합니다.
규제는 또한 다른 기준으로 작동합니다. EU의 AI 법이 범용 인공지능 모델의 규제에 사용하는 것은 훈련에 사용된 컴퓨팅 자원과 유럽 위원회의 판단입니다. 미국의 수출 관리는 “첨단 모델”을 대상으로 하는 틀에서, 기업의 AGI 선언과는 다른 기준을 설정합니다.
계약에서는 누구의 권리와 지불이 달라지는지 결정합니다. 과학과 사회가 알고 싶어 하는 것은 무엇이 가능한가 하는 것입니다. 기업 간의 조건이 정리되어도 “어떤 능력이 있다면 목표에 도달했다고 할 수 있는가”라는 질문은 여전히 남아 있습니다.
이 부분 이후의 논의 및 분석은 블로그 본체에서 다루고 있습니다.
도구 포함된 능력까지 고려할 때, 도달했다는 시각도 타당해질 수 있습니다.
한 번 할 수 있는 일과 지속적으로 맡아 할 수 있는 일의 차이는 무엇인가요?
▼ 일반적으로 제공되는 방식대로, 판단 기준은 결국 사용자들에게까지 확산되었습니다.
세한을 팔로우하세요.
세하(せはん)는 유튜브에서도 기사 내용 요약을 담은 해설 영상과 숏 영상을 배포하고 있습니다.
어, 정말이에요?! “별의 왕자님” 번역본에서 “왕자님”이 “왕자”로 수정되었다는 사실이 믿기지 않네요… 게다가, 그 “왕자”가 “왕”이라는 글자가 “왕”으로 바뀌었다는 거?! 이 번역은 번역가의 오해인지, 아니면 다른 의도가 있는 건지… 정말, 깊이 생각하게 만드는 번역이었어요. 이 번역으로 인해 “별의 왕자님”이 지닌 보편적인 메시지가 조금이라도 왜곡되어 전달될까 봐 몹시 우려됩니다.
GPT-6, ASTRA, AGI, OpenAI, 생성 AI, 해외 반응
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 41청크
원문 보기 | 출처: note.com