# GPT-6 Astra와 Images 2.5를 사양서까지 꼼꼼히 검토했습니다.

> https://bookfactory.kr/board/ai-tech/16895
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-16T21:14:46.209Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/311804048/rectangle_large_type_2_4b54649c751fde1beace3529781d0108.jpg?width=1280)

이 두 가지에 대해 저는 짧은 글을 작성했습니다. 그 후 공식 사양서와 시스템 카드를 끝까지 읽어보니, 부족한 부분이 상당히 많았습니다. 특히 하나는, 쓰지 않으면 문제가 되는 부분이 있었습니다.

## 제1부: GPT-6 아스트라

## 99.9%와 62.7%는 동일한 AI의 동일한 테스트 점수입니다.

이것이 이번에 가장 중요한 이야기입니다.

ARC-AGI-3에서 99.9%라는 결과가 있습니다.

이 테스트는 규칙도 목적도 알려지지 않은 낯선 게임에 던져져 탐색하고, 규칙을 추측하며, 목표를 찾아 움직이는 내용입니다.

이 테스트를 운영하고 있는 것은 ARC Prize Foundation이라는 다른 조직으로, 그들이 독립적으로 결과를 공개하고 있습니다.

그곳에는 이렇게 쓰여 있었습니다.

같은 Astra가 62.7%를 기록했습니다.

## 무엇이 달라졌는지

모델은 같습니다. 문제도 같습니다.

달랐던 것은 모델 주변의 시스템 때문이었습니다.

ARC Prize가 제공하는 표준 하드웨어에서 운영될 경우, 62.7%의 성공률을 보입니다.

OpenAI가 자사 모델용으로 만든 프레임워크(Provider Adapter)를 통해 실행하면 99.9%의 성능을 보입니다.

차이는 약 37 포인트입니다.

## 무슨 일이 일어나고 있는지

차이는 “기억의 방식”입니다.

공통된 틀 안에서 Astra는 스스로 메모를 하고 다음 단계로 넘어가도록 합니다.

OpenAI의 프레임워크에서는 또한 내부의 사고 상태 자체를 다음 요청으로 옮겨 긴 대화를 압축하고 재사용할 수 있습니다.

즉, 이전에 했던 작업을 버릴 필요가 없습니다.

흥미로운 점은 점수가 높을수록 비용이 저렴했다는 것입니다.

- 공통 프레임워크: 62.7%, 약 26,000 달러
- OpenAI의 프레임워크: 99.9%, 약 19,000 달러

같은 167 게임으로 비교했을 때, 후자는 3.66배 빠르고 사용한 토큰은 49% 적었다고 합니다.

작업을 재활용할 수 있게 되면서 낭비가 줄었습니다.

## 이는 아스트라 제품만의 이야기가 아닙니다.

동일한 현상이 다른 회사에서도 보고되고 있습니다.

클로드 오퍼스 5는 단독으로는 30.16%였지만, NVIDIA와 AWS가 만든 기반을 결합하면 100%에 가까워졌습니다.

즉, 현재 발생하고 있는 일은 다음과 같습니다.

> 
> 
> AI의 성능은 모델뿐만 아니라 주변 시스템이 동등하게 중요합니다.
> 

벤치마크 숫자를 나열한 표를 볼 때는 어떤 조건으로 측정했는지까지 확인해야 의미가 없습니다.

## 공정성을 위해 작성하는 것이 좋습니다.

아스트라를 폄하하는 이야기가 아닙니다.

공통의 기준에서 비교해도 아스트라는 압도적으로 우수합니다. 클로드 오퍼스 5는 2배가 넘고, GPT-5.6 솔은 약 8배였습니다.

또한, 행동의 효율에서는 인간의 중앙값을 능가하며, 96%의 수준으로 인간보다 훨씬 적은 횟수의 시행으로 해결하고 있습니다.

그는 잘 모르는 게임의 규칙을 스스로 기호적인 모델로 정리하고 독자적인 약어 체계를 만들어가고 있었다고 합니다. 정말 대단합니다.

ARC Prize 자체도 이 테스트는 제한된 형태의 것이며 일반적인 지능을 증명하는 데 적합하지 않다는 점을 명시하고 있습니다.

## 아스트라는 모든 면에서 최강은 아닙니다.

여전히 옮겨 쓰고 싶은 부분입니다.

OpenAI 자체에서 제공하는 비교표에는 다음과 같은 항목들이 있습니다.

지표: Astra, Claude, Fable 5.1, 인류 최후의 시험 (툴 포함) 57.2%, 65.0% 인공 분석, 종합 지표 61.2, 65.7

우리 회사의 발표 자료에는 다른 회사에서 더 높은 항목을 게시하고 있습니다.

항상 최고 성능이라고 소개하는 것은 정확하지 않습니다.

## 기본 사양

- 컨텍스트: 105만 토큰
- 최대 출력: 12.8만 토큰
- 지식의 종료 시점: 2026년 4월 30일
- API 가격: 입력 100만 토큰당 10달러, 출력 50달러
- 이미지는 입력만 제공됩니다. 이미지를 생성할 때는 GPT-Image를 호출하는 구조를 사용합니다.
- 파인튜닝 미지원

파라미터 수와 아키텍처는 공개되지 않았습니다. 인터넷에서 흔히 보이는 “수조 개”라는 숫자에는 공식적인 근거가 없습니다.

## 안전성을 최우선으로 하는 이야기

OpenAI는 Astra를 사이버 능력으로 자사의 위험도 기준 최상위 단계에 도달한 최초의 광범위 배포 모델로 평가하고 있습니다.

적절한 도구와 권한이 주어진다면, 알려지지 않은 취약점을 발견하고 인간의 개입 없이 새로운 공격 수단을 구축할 수 있다고 스스로 설명합니다.

대책도 마련되고 있습니다. 외부 평가에서는 간접적인 프롬프트 주입 공격 성공률이 GPT-5.6 솔의 27.0% 대비 Astra는 8.5%였습니다.

개선되고 있지만, 0이 아님을 의미합니다.

그리고 또 하나. 시스템 카드에는 이렇게 쓰여 있습니다.

생각 과정에서 비정상적인 행동을 찾아내는 것이 이전 모델보다 어려워졌다.

그러므로 “AI의 생각을 엿보고 감시하는” 방식의 신뢰성이 낮아지고 있습니다.

강력한 권한을 부여할 때에는 생각 대신 실제로 수행한 일—어떤 도구를 호출했는지, 무엇을 수정했는지, 어디로 전송했는지—를 독립적으로 기록하고 감사해야 합니다.

## ## 제2부: ChatGPT Images 2.5

ChatGPT Images 2.5는 OpenAI에서 개발한 이미지 생성 AI 모델입니다. GPT-4를 기반으로 하며, 텍스트 프롬프트에 따라 다양한 스타일과 내용의 이미지를 생성할 수 있습니다. 

특히, 2.5 버전에서는 이미지 품질이 크게 향상되었으며, 더욱 복잡하고 정교한 프롬프트도 잘 이해하고 처리할 수 있게 되었습니다. 또한, 다양한 예술 스타일(예: 인상주의, 초현실주의, 팝아트 등)을 지원하며, 특정 화가의 스타일을 모방하는 것도 가능합니다.

최근 업데이트를 통해 3D 모델 생성 기능이 추가되어 더욱 다채로운 결과물을 얻을 수 있게 되었습니다. 

ChatGPT Images 2.5는 단순한 이미지 생성뿐만 아니라, 아이디어 구상, 디자인 시안 제작, 콘텐츠 제작 등 다양한 분야에서 활용될 수 있는 잠재력을 가지고 있습니다.

## 이미지의 크기

추천 해상도는 1024x1024 / 1536x1024 / 1024x1536입니다.

그 외에도 지정할 수 있으며, 조건은 가로와 세로 각각 16의 배수, 비율은 1:3 ~ 3:1, 긴 변이 3840px까지, 총 픽셀 수는 약 65만 ~ 829만입니다.

4K 해상도까지는 지원하지만, 2560×1440을 초과하는 범위는 공식적으로 실험적인 기능으로 간주됩니다.

note 제목 이미지는 1536×1024로 그대로 사용 가능합니다.

## 화질은 6단계입니다.

저 / 중간 / 높음 / 극대 / 최대 / 자동

초안은 낮게 설정하고 채용이 확정된 후에 높이는 효율적입니다. 처음부터 최대(max)로 돌리면 대기 시간과 비용 모두 낭비됩니다.

## 파일 형식

기본은 PNG입니다. JPEG와 WebP도 선택 가능합니다. 속도가 중요하다면 JPEG를 추천합니다. 투명 배경은 PNG 또는 WebP를 사용하세요.

## 마스크 편집에는 명확한 한계가 있습니다.

여기서가 실무에서 가장 효과적입니다.

이미지 일부를 지정하여 수정했지만, 공식 문서에는 “마스크 형태를 완전히 지키지 못할 수 있는 경우”가 명시되어 있습니다.

따라서 의료 영상, 도면, 1픽셀이라도 어긋나서는 안 되는 광고 소재에는 적합하지 않습니다.

OpenAI 자체도 엄밀하게 유지해야 할 부분은 생성 후 일반적인 이미지 편집 소프트웨어로 원본 이미지에 합성하는 방법을 권고하고 있습니다.

AI에게 모든 것을 맡기기보다는, AI에게 만들어 놓고 마지막에는 직접 붙이도록 하는 것이 좋습니다. 이를 기억하면 사고를 줄일 수 있습니다.

## API는 2가지 모델을 제공합니다.

Flare Sunburst 위치 설정: 표준/고속, 고정밀/저속 사용 용도: SNS 이미지, 대량 생성, 시제품, 광고 최종 소재, 정밀 편집

기본은 플레어, 필요할 때만 써도 Sunburst가 더 편리합니다. 가격은 동일합니다.

- 100만 토큰당 5달러입니다.
- 이미지 입력: 8달러
- 이미지 출력: 30달러

“1매당 몇 원”이라는 고정 가격은 공식적으로 발표되지 않았습니다. 기존 모델용 계산 도구로는 추정하기 어렵다고 OpenAI가 명시하고 있습니다.

## 비용 산정 방식에 대해

이미지는 한 번으로 채용할 수 있는 것이 아닙니다.

평균 2.5회 제작하여 1회 사용하는 경우, 실제 비용은 2.5배입니다.

OpenAI 자체도 “선택된 1枚당 비용”으로 측정하도록 권장하고 있습니다. 이는 API를 사용하지 않는 사람에게도 적용되는 방식입니다.

## 안전성 수치

모델에서 부적절한 이미지 발생률(낮을수록 좋음)은 다음과 같습니다. Sunburst 1.09%, Flare 1.41%, 이전 버전 2.0 1.64%

개선되고 있습니다. 0이 아닙니다.

무특정한 사용자들이 사용할 서비스를 만든다면, OpenAI 측의 필터에만 의존하지 않고, 우리 측에서도 출시 전 검토를 거쳐야 합니다.

## 투카시

C2PA라는 메타데이터와 눈에 띄지 않는 워터마크가 포함되어 있습니다.

시스템 카드에 따르면, 후자는 Google DeepMind의 SynthID가 사용되고 있습니다. OpenAI의 이미지에 Google의 기술이 들어간 것은 다소 의외였습니다.

## 실현되는 부분의 위험

OpenAI 자체에서도 명시하고 있습니다.

화질이 향상됨에 따라 실제 인물, 장소, 사건에 대해 더욱 설득력 있는 가짜 이미지가 제작될 수 있다.

그러므로 입력과 출력을 여러 지점에서 면밀히 검사하고 있습니다. 성능이 향상될수록 위험 또한 증가합니다. 스스로 작성하는 것은 진솔하다고 생각합니다.

## 제3부: 이 두 가지 관계

경쟁 관계가 아닙니다. 역할이 다릅니다.

아스트라는 이미지를 읽을 수 있지만 직접 만들 수는 없습니다. 이미지를 만들 때는 GPT-Image를 도구로 호출합니다.

그러니 이상적인 구성은 다음과 같습니다.

> 
> 
> 아스트라는 필요한 때만 이미지 모델을 호출한다.
> 

하지만, 무엇이든 Astra로 보내는 데 비용이 많이 듭니다. 출력량이 100만 토큰에 50달러이기 때문에 간단한 분류나 FAQ까지 보내는 의미가 없습니다.

어려운 일에는 오직 에스트라만 사용하고, 나머지는 가벼운 모델을 활용하는 방식이 현실적입니다.

## 솔직하게 적겠습니다.

숫자는 매체마다 일치하지 않습니다.

ARC-AGI-3는 98.6%로 표기하는 매체도 있으며, FrontierMath 역시 98%와 97.6%라는 두 가지 값을 모두 접할 수 있습니다. 이 글에서는 ARC Prize의 공식 결과 페이지와 OpenAI의 자료에서 가져온 값을 사용했지만, 1사의 숫자를 단정적으로 제시하는 것은 지양하는 것이 좋습니다.

그리고 저는 아직 둘 다 시도해 본 적이 없습니다.

여기 작성된 내용은 모두 공식 자료에 기재된 내용입니다. 실제로 그렇게 될지는 제가 보장할 수 없습니다.

이제 직접 시도해 보고 실험 노트에 기록하겠습니다. 기대에 미치지 못한다면 그것도 기록하겠습니다.

## 살펴보세요, 진정으로 생각한 것을

발표 페이지를 읽는 데 10분이 소요됩니다.

하지만 사양서와 시스템 카드까지 꼼꼼히 읽어보니, “할 수 있는 것”보다 “할 수 없는 것”이 훨씬 더 많은 내용으로 채워져 있었습니다.

마스크는 형태를 완전히 지키지 못하며, 부적절한 이미지는 전혀 사라지지 않습니다. 사고의 감시는 더욱 어려워졌습니다. 같은 시험에서 37점의 변동이 일어납니다.

솔직히 말씀드려, 그 방식이 더 도움이 될 것 같습니다.

그리고 이번에 가장 크게 배운 것은 바로 이것입니다.

숫자를 볼 때에는 점수라는 관점뿐 아니라 측정하는 방식을 보는 것입니다.

62.7%와 99.9%가 동일 모델의 동일 테스트에서 동일 점수를 획득한다는 사실을 알게 되면, 다른 벤치마크의 결과도 달라 보일 수 있습니다.

오늘의 작은 발걸음을, 하나뿐인 것으로.

최근에 본 AI 벤치마크 숫자를 하나만 골라주세요.

그리고 “그것은 어떤 조건으로 측정했는지”를 확인해 보십시오.

아마 생각했던 것보다 조건이 더 세부적으로 적혀 있습니다.

작은 발걸음도, 분명 별이 될 거야.

참조: OpenAI 공식 “GPT-6 Astra”, “Introducing ChatGPT Images 2.5”, 각 시스템 카드, 이미지 생성 API 가이드, ARC Prize Foundation “OpenAI’s GPT-6 Astra on ARC-AGI-3”（2026년 9월）

**출처:** [note 원문](https://note.com/real_rail8101/n/n27f0f2999115)

*번역: Gemma 3(.44) 초벌 + 교정 68청크*

[원문 보기](https://note.com/real_rail8101/n/n27f0f2999115) | 출처: note.com