AI의 발전은 단순히 어려운 질문에 답할 수 있는 능력만으로 측정할 수 없게 되어 왔다. 처음 겪는 상황에서 무엇을 조사하고, 무엇을 시도하며, 결과를 통해 다음 수를 바꾸어 나가는 능력이 돋보인다. GPT-6 Astra에서 두드러지는 것은 바로 이러한 업무 수행 능력이다. 변호사는 자료를 읽고, 가설과 증거를 비교하며 판단을 수정한다. 경영자는 작게 시도하여 결과를 확인하고, 계획을 재수립한다. Astra의 변화는 이 일련의 과정을 AI가 어느 정도까지 담당할 수 있는지를 보여주는 문제로 이해할 수 있다.
다른 AI보다 어떤 점이 뛰어난가
주목해야
모든 평가에서 ASTRA가 항상 1위라는 것은 아닙니다. 그럼에도 불구하고, 화면이나 소프트를 사용하고 중간 결과값을 확인하며 과제를 진행하는 영역에서 괄목할 만한 성장이 있었습니다.
로보도조는 로봇 실기 시험입니다.
이 변화는 더욱 뜻밖의 형태로 나타난 것이 RoboDojo(로보도장) 실험이었다. 이는 로봇에게 물건을 집어삼키고, 정렬하고, 구멍에 꽂는 등의 작업을 수행하도록 하는 평가 장소였다. Astra의 주요 성과는 컴퓨터 내의 가상 로봇으로 측정되었다. 연구팀은 범용 AI Astra에 카메라 이미지, 로봇의 상태, 작업 지시를 전달했다. Astra가 다음으로 손을 어디로 움직일지 결정하고, 고정된 프로그램이 그것을 관절 움직임으로 변환했다. 그리고 움직인 결과를 다시 Astra에게 보여주었다. [3]
쉽게 말해, Astra가 ‘시각과 판단’을 담당하고, 프로그램이 ‘동작의 해석’을 담당한다. Astra의 출력을 그대로 모터에 전달한 것은 아니지만, 중간에 다른 로봇 전용 AI에게 일을 맡긴 것도 아니다.
시험은 42개의 과제를 각 50회씩 실시하여 총 2,100회 진행되었습니다. 상황 변화에 유연하게 대처할 수 있는지, 세부적인 동작을 수행할 수 있는지, 긴 과정을 완수할 수 있는지, 과거 정보를 기억하고 활용할 수 있는지, 새로운 지시를 이해할 수 있는지 등 다섯 가지 능력을 평가했습니다. [3][4]
성공률 22.48%라는 사실이 놀랍다는 점입니다.
Astra는 22.48%, GPT-5.5는 0.88%의 성공률을 보였다. 두 모델 모두 동일한 동작 변환 메커니즘을 사용했으며, 각 과제에 대한 시도 횟수도 동일했다.
이 실험을 위해 로봇 전용 추가 학습을 실시하지 않고, 범용 AI를 組み込んだ 구성으로, 이러한 차이가 발생했다. 언어와 이미지를 이해하는 능력이 로봇의 행동 선택에도 도움이 될 가능성을 시사하지만, 이 비교만으로는 모든 LLM과 로봇에 대한 우위는 말할 수 없다.
로봇용 모델 DM0.5의 공개값이 19.34%를 상회했지만, 이는 기존 랭킹에서 가져온 데이터이며, 동시에 재시험한 값이 아니다. 또한, Astra는 DM0.5에 대해 상황 변화나 새로운 지시 대응에서 우위를 보였지만, 정밀한 조작, 긴 절차, 기억 평가에서는 뒤쳐졌다. [3]
22.48%는 실용적으로 충분한 신뢰성을 나타내는 숫자라고 보기 어렵다. 평가 결과는 래ண்ட수 설정 하나로 이루어진 초기 단계의 결과물이다. 실제 기계에서는 위험한 동작이나 장비 손상이 발생하여 공식적인 평가를 완료하지 못했다. “의미는 이해한다”는 것과 “실제 물건을 안전하게 다룰 수 있다”는 것 사이에는 여전히 거리가 있다. [3]
그 자리에서 배우는 것과는 또 다른 이야기입니다.
로보도조의 소규모 추가 실험에서는 움직이는 방향을 반전시키는 등의 변경에 대해 Astra가 예상과 실제 간극을 보며 움직임 방식을 수정하는 사례가 관찰되었다. 반전된 동작 조건에서는 8개 배치 중 4개 배치에서 성공했다. [3]
여기서 말하는 “배우다”는 AI 본체를 매번 재훈련한다는 의미가 아니다. 바로 직전에 일어난 일을 근거로, 그 일의 진행 방식을 바꾸는 것이다. 사람에 비유한다면, 새로운 도구의 습관을 그 자리에서 익히는 과정과 유사하다.
하지만, 교과서를 제시하면 반드시 실력이 향상되는 것은 아니었다. 또 다른 340회 시도 비교 분석 결과, 교과서 없이 진행했을 경우 성공률은 22.9%였지만, 그림이 포함된 교과서에서는 17.9%, 문구만 포함된 교과서에서는 12.9%로 감소했다. 교과서 제공과 자신의 행동 결과에서 수정하는 것은 분리하여 고려해야 한다.[3]
경험을 이월하는 방식도 효과를 발휘한다. ARC-AGI-3에서는 동일한 Astra의 동일한 추론 설정 “max”임에도 불구하고, 표준 방식의 62.71%에 비해 과거의 추론을 활용하고 긴 력을 압축하는 방식에서는 98.55%였다. 이는 게임에서의 행동 효율을 포함하는 평가 지표이며, 로봇의 성공률과는 별개이다. 또한, 여러 조건이 달라 “기억만으로 올랐다”고 단정할 수 없다.[5]
변호사 및 경영인에게 있어서의 의미
실무에 대한 시사점은 AI에게 질문에 답하게 하는 것뿐만 아니라, 조사하고, 시도하고, 확인하고, 수정하는 업무 흐름을 제공하는 데 있습니다.
예를 들어 계약서 검토의 경우, 논점을 제시하는 것만으로 끝나지 않고, 근거가 되는 조항이나 자료를 비교 검토하여 불일치를 발견하면 제안을 수정한다. 사업 분석의 경우, 가설을 설정하고 데이터를 집계하여 결과가 일치하지 않으면 전제를 재검토한다. 이는 실험 결과에서 예상되는 활용 방안이며, 개별 업무에서의 정확성이 입증된 의미는 아니다.
그렇기 때문에 사람이 확인하고 싶어하는 것은 결론의 타당성만이 아니다. 어떤 근거를 가지고, 어디에서 실패했는지, 어떻게 수정했는지. 그리고 판단에 필요한 조건이 끝까지 지켜졌는지를 확인하는 것이다.
아스트라의 “큰 마법”은 시도한 경험을 바탕으로 일을 앞으로 나아갈 수 있는 능력이 한 단계 향상된 데 있다. 그 진보를 활용하기 위해서는 모델의 지혜와 결과를 확인하면서 사용하는 시스템을 함께 고민하고 싶다.
출처를 명시해주시기 바랍니다. 출처가 없으면 번역이 불가능합니다.
- Astra는 ARC Prize에서 1위를 차지하며 1,000만 엔의 보상을 받았습니다. 이 보상은 Astra의 성능을 입증하는 중요한 지표가 되었으며, 향후 Astra의 개발 방향을 결정하는 데 큰 영향을 미쳤습니다. 특히, ARC Prize 심사위원들은 Astra의 예측 정확도와 빠른 학습 속도를 높이 평가했으며, 이에 따라 Astra의 핵심 기술인 ‘지능형 패턴 매칭’ 알고리즘에 대한 투자를 더욱 확대할 계획입니다. 또한, Astra의 데이터 처리 능력 향상을 위해 클라우드 기반의 확장형 인프라 구축에도 적극적으로 나설 예정입니다. 현재 Astra는 100만 건 이상의 데이터를 처리하고 있으며, 이 데이터는 다양한 산업 분야에서 활용되고 있습니다. 특히 금융, 의료, 제조 분야에서 Astra의 활용 가능성이 높게 평가되고 있습니다. 앞으로 Astra는 더욱 정교한 예측 모델을 개발하고, 다양한 산업 분야에 적용되어 사회 전체의 효율성을 높이는 데 기여할 것으로 기대됩니다.
- OpenAI의 GPT-6 Astra 공개 평가에 대한 내용입니다.
GPT-6 Astra는 현재까지 공개된 모델 중 가장 강력한 성능을 보여주었습니다. 특히, 다양한 분야의 질문에 대한 답변 정확도가 매우 높았으며, 창의적인 글쓰기 능력 또한 뛰어났습니다.
특히, GPT-6 Astra는 방대한 양의 데이터를 학습하여 복잡한 개념을 이해하고 설명하는 데 탁월했습니다. 또한, 사용자 인터페이스는 직관적이고 사용하기 쉬워 일반 사용자도 쉽게 접근할 수 있었습니다.
OpenAI는 GPT-6 Astra의 공개 평가를 통해 앞으로 더욱 발전된 AI 모델을 개발하고 인류의 삶에 긍정적인 영향을 미칠 수 있도록 노력할 것입니다.
- 로보도조 연구팀의 아스트라 평가 보고서
- 로보도조의 벤치마크 논문
- [5] ARC Prize 검증 결과 및 실행 조건별 점수
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 24청크
원문 보기 | 출처: note.com