이 기사에서 알 수 있는 내용은 “GPT-6 변경 사항 요약”입니다.
**제목: 독서 기록: ‘너, 별처럼’ 독후감 및 고찰**
내용:
얼마 전에 드디어 읽어낸 작품이 바로 나기요 유우의 ‘너, 별처럼’입니다. 이 작품을 읽고 정말 말을 잃을 뻔했습니다. 마치 제 인생을 되돌아보는 것처럼, 그런 감각에 빠져들었습니다.
이야기는 주인공인 “나”와 그를 깊이 사랑하는 “당신”의 애틋하고 아름다운 사랑 이야기를 그리고 있습니다. 두 사람의 만남부터 헤어짐까지, 각자의 감정 변화가 섬세하게 묘사되어 읽는 동안 두 사람의 관계가 마치 자신만의 것인 것처럼 느껴졌습니다.
특히 기억에 남았던 장면은 그들이 서로 “나”와 “당신”이라는 두 이름으로 부르는 장면입니다. 이는 두 사람의 관계가 고정된 것이 아니라, 끊임없이 변화하고 성장하는 것이라는 것을 시사하는 듯했습니다.
또한 그들의 대화 속에 철학적인 질문들이 많이 담겨 있었습니다. 삶의 의미, 사랑의 의미, 죽음의 의미 등 다양한 주제에 대해 두 사람은 서로 이야기합니다. 그 과정에서 그들은 자신들의 존재 의미를 묻고 진실을 추구하는 모습을 보여줍니다.
이 작품을 읽고 저는 사랑이란 무엇인가, 삶이란 무엇인가에 대해 깊이 생각하게 되었습니다. 그리고 자신만의 인생을 더욱 소중하고 풍요롭게 살기로 결심했습니다.
이 작품을 읽고 감명받은 것, 그리고 생각하게 된 것을 여러분과 공유하고 싶습니다.
**추천도:** 5/5
**감상:** 독서 후 잠시 동안 마음이 흔들립니다. 나기요 유우의 글은 정말 아름답습니다.
**다음 독서 예정:** 이번에는 무라카미 하루키의 ‘해변 카후카’를 읽어보고 싶습니다.
- 이 기사에서 알 수 있는 내용: “GPT-6 변경 사항 요약”
- 정리하자면, 이런 식으로 하시는 것이 좋겠습니다.
- 📊 숫자로 보면 무엇이 발전했는지
- 사용자의 의견이 어디에서 왜곡되었는지
- 좋은 점과 ⚠️ 단점
- 좋은데요
- ⚠️ 좋지 않은 점이 있습니다.
- 💡 이렇게 사용하면 좋을 것 같습니다.
- 검산 노트
- ❓ 자주 묻는 질문
- GPT-6 Astra로 인해 실제로 상승한 숫자와 상승하지 않은 숫자들입니다.
- 가격(입력 $10, 출력 $50)과 이전 세대 대비 2.5배 상승폭
- 사용자의 의견이 어디에서 깨져 있는지 (HN 1,966 댓글에서)
- 좋은 점, 좋지 않은 점, 이렇게 사용하면 좋을 3가지입니다.
- 99.9%라는 숫자가 숨기고 있는 것들 (유료 부에서 검산)
정리하자면, 이런 겁니다.
2026년 9월 3일, OpenAI가 GPT-6 Astra를 출시했다.
진화의 핵심은 ‘지능’보다 ‘빠른 속도’였다. 제3자 인공지능 분석 지수 v4.1.1은 이전 세대 GPT-5.6의 60.9에서 61.2로, 거의 동점이다.
한편, 컴퓨터 작업을 수행하거나 코드를 작성하는 작업이 크게 증가했다. OSWorld 2.0에서는 1 작업당 약 75분이 약 40분으로 줄어들었고, Mind2Web에서는 1.9배로 속도가 빨라졌다.
📌 가격은 입력 4달러에서 10달러로, 출력 20달러에서 50달러로 2.5배 상승합니다. 여기가 가장 큰 변화일 가능성이 높습니다.
왜 “손의 민첩성”을 추구하는 걸까. OpenAI 스스로는 Codex의 하르ネス(작업의 틀) 업데이트와 함께 속도를 중시하고 있다. 모델 단일의 지능 경쟁에서 작업 완료까지 걸리는 시간 경쟁으로 초점이 이동하고 있는 것이다.
📊 숫자로 보면 무엇이 얼마나 발전했는지
OpenAI의 자체 보고서에 따르면, 이전 세대 대비 성능 향상의 주요 원인은 다음과 같습니다. Terminal-Bench 4.0이 37.3%에서 57.9%로, FrontierMath Tier 4가 83.0%에서 97.6%로, ExploitBench가 78.5%에서 100.0%로, SRE-Bench가 55.9%에서 88.0%로 상승했습니다.
반면, 거의 변동이 없었던 것은 DeepSWE v1.1(72.7% → 74.1%)과 GPQA Diamond(94.6% → 96.0%)였다. 코딩 및 대학원 수준 지식 문제는 이미 정점에 가까워졌다.
다른 기업 비교 시, Terminal-Bench 4.0은 GPT-6 Astra가 57.9%, Claude Fable 5.1이 55.8%, Claude Opus 5가 52.3%, Gemini 3.8 Flash가 19.1%를 기록했습니다.
📊 DeepSWE v1.1은 Gemini 3.8 Flash가 73.8%, Claude Opus가 73.7%로, GPT-6 Astra의 74.1%와 거의 비슷한 수준입니다.
⚠️ ARC-AGI-3의 99.9%는 이전 세대의 7.8%에서 크게 상승한 것으로 나타나지만, 이 수치에는 조건이 따릅니다 (유료 부문에서 검토합니다).
사용자의 의견이 어디에서 왜곡되었는지.
💬 Hacker News 본 스레드는 2,149 포인트, 1,966개의 댓글을 보유하고 있으며, 의견은 3가지로 나뉘어 있었습니다.
첫 번째는 “99.9%는 하네스의 숫자”를 옹호하는 입장입니다. aabhay 氏は「OpenAI가 자체 하네스로 측정하고 있다는 주의사항이 붙어있는」라고 지적했습니다. piloto_ciego 氏は「정확한 하네스로 99.9%? 그렇다면 AGI다. 다음에는 목표 지점이 움직인다고 예언한다」라고 비꼬았습니다.
두 번째 의견은 “실효 5.7” 측입니다. NiekvdMaas 氏は「제목은 major gains, 첫 번째 그래프는 솔의 61에서 아스트라의 61」라고 밝혔습니다. eis 氏は“Agentic Index에서는 솔보다 낮다 (51대 58)”라고 언급했습니다. Readerium 氏의 “5.7과 같다, 6이 아닌”이라는 의견에 대해 JV00 氏は“새롭게 큰 사전 학습을 기반으로 하기 때문에 메이저 번호”라고 설명했습니다.
세 번째 의견은 “배포가 느리다” 쪽에, kingstnap 氏は「Pro 사용자에게 배포된 지 24시간이 걸렸다」고 했고, algoth1 氏は「유럽 Plus 버전인데 Codex만 배포되었고, ChatGPT에는 없었다」고 말했다. 9월 4일 밤(일본 시간 5일 새벽)에 일반 제공이 확산되었다.
찬성파의 핵심은 언어 사용에 있었다. itissid氏は「Codex를 사용하는 이유는 길고 이상한 문을 읽는 데 지쳤기 때문이다」라고 이적한 이유를 설명하고 있다.
좋은 부분과 ⚠️ 좋지 않은 부분
잘 하셨습니다.
어쨌든, 얼마 전에 읽은 ‘너, 공주’ 작가 오가와 미야오 씨의 인터뷰 기사를 읽고, 그녀의 글이 가진 독특한 세계관에 깊은 인상을 받았습니다. 특히, 이야기의 배경인 ‘아발론’이라는 장소가 그녀의 개인적인 경험과 철학이 짙게 반영된 듯한 느낌을 받았습니다.
아발론은 이야기 속에서 주인공 소녀 에마가 정신적인 성장을 이루는 장소로 묘사되어 있습니다. 에마는 아발론에서 만나는 다양한 인물들과의 교류를 통해 자신의 내면과 마주하고, 진정한 사랑과 삶의 의미를 묻습니다.
오가와 미야오 씨는 이 아발론이라는 장소를 단순한 배경이 아닌, 인간의 마음을 상징하는 것으로 보고 있는 듯합니다. 그녀의 작품 전체를 통해 인간 존재의 불확실성과 사랑과 죽음의 덧없음을 아름다운 문장으로 표현하고 있습니다.
인터뷰 기사에서는 그녀가 아발론을 방문한 경험에 대해 이야기하고 있으며, 그곳의 자연과 풍경이 그녀의 창작 활동에 큰 영향을 미쳤다는 것을 알 수 있었습니다. 그녀는 아발론의 고요한 분위기 속에서 자신의 내면의 목소리에 귀를 기울이고 새로운 이야기의 아이디어를 떠올렸다고 합니다.
- 작업 시간이 짧다. OSWorld 2.0에서는 1개의 작업이 약 40분(전 세대는 약 75분) 소요된다.
- 권한 외에 무리한 개입은 하지 않는다. 본番 안전장치 없이 실시한 내부 평가 결과, 이전 세대 48%에 대해 0%였다.
- 환각이 감소했습니다. 내부 환각 벤치에서는 12.2%에서 4.2%로, 인공 분석 측정에서도 92%에서 51%로 나타났습니다.
- 코덱스에서는 긴 작업의 메모를 요약으로 뭉개지 않게 실험적으로 계속 가져다 쓸 수 있습니다.
- 긴 텍스트 읽기 손실이 줄었습니다. OpenAI MRCR v2의 8침 512K-1M에서 73.8%에서 96.3%로 상승했습니다.
불행하게도, 여러 가지 곤란한 일들이 있었습니다.
- ⚠️ 가격이 2.5배 상승했습니다. 1 작업당 비용은 최대 노력 시 75% 높아졌습니다 (인공 분석).
- 지능 지수는 전 세대와 동률이다. 에이전트 인덱스는 51 대 58로 하락했다 (인공 분석).
- OpenAI 스스로가 “지금까지보다 작성된 추론이 이전보다 더 감시하기 어려워졌다”라고 밝혔습니다.
- ⚠️ 안전 검사로 인해 정당한 작업이 멈추는 경우가 있습니다. API에서는 멈추고, ChatGPT/Codex에서는 확인을 요청합니다.
- ⚠️ 엔터프라이즈는 기본적으로 꺼져 있습니다. 관리자가 활성화해야 사용할 수 있습니다.
💡 이렇게 사용하면 좋을 것 같습니다.
손을 사용하는 일이다. 폼 입력, CRM 업데이트, 데이터 정리, 웹사이트 작동 확인, 템플릿에 맞는 자료 제작 등이 이에 해당한다. OpenAI가 언급한 것도 거의 이와 같다.
지능 차이로 두드러지는 직업에는 어울리지 않습니다. 제3자 지수도 동일하기 때문에, 문구 수정이나 지식 문제 해결을 위한 이직 이유는 미미합니다. 이전 세대가 충분히 할 수 있다면 가격이 2.5배 상승한 가치는 얻기 어렵습니다.
사용법 분배를 위한 3가지 기준
1. **사용 빈도:** 가장 자주 사용하는 항목은 우선적으로 공유합니다. 예를 들어, 스마트폰이나 노트북처럼 매일 사용하는 기기는 다른 사람과 공유하는 것이 효율적입니다.
2. **사용 기간:** 장기간 사용할 항목은 공유 기간을 정해둡니다. 예를 들어, 캠핑 장비나 겨울옷처럼 특정 기간 동안만 사용하는 물품은 공유 기간을 명확히 하여 낭비를 줄일 수 있습니다.
3. **사용자 숙련도:** 사용자가 숙련된 정도에 따라 공유합니다. 예를 들어, 드론이나 전문적인 소프트웨어처럼 사용법을 익히는 데 시간이 걸리는 경우에는 숙련된 사용자가 먼저 사용하고, 익숙해지면 다른 사람에게 공유하는 것이 좋습니다.
- 30분 이상 소요되는 작업 관련 업무는 Astra에 위탁하는 것이 시간 단축에 효과적입니다.
- 짧은 질문과 문장의 수정을 이전 세대 또는 다른 회사에 맡겨 차이가 나지 않게 하라.
- 퍼스트 모드는 2배의 속도로 2배의 가격입니다. 급한 작업에만 집중합니다.
Codex를 사용하려면, 컨텍스트를 “메모” 기능으로 이전하는 기능을 config.toml에서 활성화해 두십시오. 긴 작업 중간에 요약에 묻히는 문제가 여기서 줄어듭니다.
오늘의 검산은 2024년 5월 16일 오후 3시 30분부터 4시 30분까지 진행되었습니다.
주요 검산 항목은 다음과 같습니다.
* 『소설의 숲』 판매량
* 마츠모토 유키 작가의 신작 소설 출판 예정일
* 오카다 료 작가의 다음 소설 집필 계획
검산 결과, 『소설의 숲』의 판매량은 목표 판매량 대비 15% 초과 달성했습니다. 마츠모토 유키 작가의 신작 소설 출판 예정일은 2024년 7월 18일로 확정되었으며, 오카다 료 작가의 다음 소설 집필 계획은 2025년 초 완결 예정입니다.
검산 과정에서 발견된 문제는 없었습니다.
이번 주 핵심 주장은 한 줄로 요약된다. GPT-6는 ‘머릿속’ 지능보다는 ‘손’으로 활용하는 능력을 중시하는 세대가 되었다.
ARC-AGI-3의 99.9%를 검증했다. ARC Prize 자체 블로그에 노력별·하르니스별 표가 있다.
- 표준 하네스: 최대 62.7% (비용 $26,098), 고수 54.8%, 저수 35.2%
- 프로바이더 어댑터 헤드: 최고 99.9% (비용 $18,817), 최대 98.6%, 없음 96.7%
같은 모델에서 하르ネス만 변경하면 62.7%가 99.9%가 된다. Provider Adapter는 추론 상태를 요청 간에 유지하고, 긴 대화를 압축하는 방식으로 인해 약 3.66배 빠르고 토큰은 49% 감소했다.
따라서 99.9%는 ‘모델의 지능’이 아닌 ‘모델 + 작업 프레임워크’의 숫자입니다. 그림 1의 성장률도 Terminal-Bench나 SRE-Bench처럼 프레임워크에 영향을 받기 쉬운 항목에 집중되어 있습니다.
내 운영에서 개선할 수 있는 부분들이다. 이 공장에서 작동하는 AI 작업 중 30분 초과 운영 방식은 아직 없다. 따라서 현재 시점에서는 전환이 없다. 가격이 2.5배 상승할 만한 이유가 발생하면, 이 글의 그림 3을 다시 검토할 것이다.
변하지 않는 것을 유지하고, 문장 구축의 기본 방향은 흔들지 않는다. 제3자 지표가 61.2로 4위를 기록했다는 사실은 지혜로 선택할 이유가 될 수 없다.
공식적인 자기 보고와 제3자 차이를 통합했습니다. OpenAI의 표에 제시된 인공 분석 지능 지수는 61.2입니다. 인공 분석 자체 기사에서는 지능 지수가 동점, 에이전트 지수는 51대 58으로 전세대 대비 낮고, 코딩 에이전트 지수는 65에서 67로 상승했습니다. 상승한 것은 코드 작업에 한정되며, 자기 보고와 모순되지 않습니다.
자주 묻는 질문
언제부터 사용할 수 있나요?
2026년 9월 3일에 일부 조직으로, 9월 4일에 Plus, Pro, Business, Enterprise 버전으로 확산되었다. API는 gpt-6-astra, Azure 및 Bedrock에서도 사용 가능하다.
가격은 얼마입니까?
API 표준 요금은 입력 10달러, 출력 50달러(100만 토큰당)입니다. 전 세대는 4달러와 20달러였습니다. Fast 모드는 2배의 속도로 2배의 가격입니다.
세대 전환해야 할까요?
운영 체제에서 긴 작업을 처리할 때 효과가 있다. 짧은 질문이나 문장의 다듬기는 제3자 지수가 동점이기 때문에 서둘 필요가 없다.
사이버 기반 작업은 효과가 있을까요?
코드 리뷰와 패치 작성은 가능하다. PoC 익스플로잇 제작은 거부된다. OpenAI는 Daybreak를 통해 단계적으로 완화할 것을 제시하고 있다.
조사해도 이해할 수 없는 것들
- 일본의 ChatGPT Plus에서 ChatGPT 측과 Codex 측 중 어느 쪽이 먼저 도입될지(유럽의 보고서는 Codex만 언급되었다)
- GPT-6 Astra Pro와 기본 모델의 차이점 (공식 페이지에 숫자 정보가 없음)
- 프로바이더 어댑터 해스(Provider Adapter harness)가 일반 사용자가 ChatGPT를 사용하는 데 활용되고 있는가?
- 내부 벤치(환각 및 안전) 관련 문제 발생 건수 및 제작 방법
📌 GPT-6 Astra는 지능 지수 면에서 전세대와 동점이며, 손으로 하는 작업 시간을 거의 반으로 줄였습니다. 가격은 2.5배 상승했습니다. 이 세 가지가 이번의 사실입니다.
다음으로 “99.9%”라는 제목을 보신다면, 어떤 하네스로 측정했는지 한 번 확인해 보시기 바랍니다.
당신의 업무에서 “30분 이상 소요되는 작업 관련 업무”는 몇 개나 될까요?
스킵을 요청받으면 다음 글을 쓰는 데 큰 힘이 됩니다🌟
AI, OpenAI, GPT-6, ChatGPT, Codex, 생성 AI, AI 에이전트, 벤치마크, 기술, 뉴스 해설
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 63청크
원문 보기 | 출처: note.com