# 아스트라, AGI인가: 프론티어AI와 AGI의 실제 거리를 4가지 축으로 재고찰

> https://bookfactory.kr/board/ai-tech/16780
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-16T16:08:18.653Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/311314691/rectangle_large_type_2_99b4bda2887dbb2f21622bfd67ae62c4.png?width=1280)

2026년 9월 3일, OpenAI는 GPT-6 Astra를 발표했습니다. 공식 발표에 따르면, Astra는 컴퓨터 조작, 브라우징, 소프트웨어 개발, 사이버 보안, 과학, 전문 업무에서 최첨단 모델로 설명됩니다. FrontierMath Tier 4에서 97.6%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%라는 수치도 제시되었습니다.

이번 발표를 계기로 “AGI는 정말 왔나?”, “프론티어 AI와 AGI는 무엇이 다른가?”라는 논의가 활발해지고 있습니다. 숫자를 통해 보면, 지금까지 인간의 강점 영역으로 여겨졌던 과제들을 상당히 넓은 범위에서 처리할 수 있게 되었다고 판단됩니다.

단지 여기서 한 번 멈춰서서 생각해 보고 싶습니다. 프론티어 AI와 AGI는 같은 것을 다른 용어로 표현하는 것과는 관련이 없습니다. 전자는 “그 시점에서의 최첨단”이라는 위치를 나타내며, 후자는 “어느 정도의 성능, 범용성, 자율성을 충족했는가”라는 도달 조건을 가깝게 설명하는 단어입니다.

이 기사에서는 Astra가 AGI인지 아닌지를 이분법적으로 판단하지 않습니다. Astra의 공개 정보를 성능의 깊이,汎用성의 넓이,자율성의 길이,실용성의 폐쇄성이라는 4가지 축에 따라 나누어, 어느 정도 거리가 좁혀졌고, 아직 어떤 추가적인 증거가 필요한지를 고려합니다. 확인일은 2026년 9월 7일입니다.

## 아스트라 등장으로 세 개의 이야기가 하나로 보이는 듯했다.

아스트라 발표에는 최소 세 가지 종류의 정보가 포함되어 있습니다.

- 어려운 문제를 해결하는 성능에 대한 평가 결과입니다. 수학, 과학, 코딩, 사이버 보안 등 다양한 분야에서 나타난 결과입니다.
- 다양한 공정을 연결하는 능력입니다. 브라우저나 전문 소프트웨어를 활용하여 조사부터 결과물 작성까지 수행하는 능력입니다.
- 배포 가능한 시스템으로서의 특징입니다. 권한, 감시, 거부, 정지, 추가 확인을 포함하는 안전 설계를 갖추고 있습니다.

이러한 개선 사항이 동시에 이루어지면서 모델이 “모든 것을 할 수 있는 주체”에 가까워진 것처럼 느껴집니다. 실제로 Astra는 폼 입력, CRM 업데이트, 캘린더 정리, 온라인 설문 조사, 문서 작성, 소프트웨어 설치 및 테스트 등을 컴퓨터 조작의 업무로 취급할 수 있다고 설명하고 있습니다. Astra의 공식 발표

그러나 어떤 과제를 높은 확률로 해결할 수 있는 것과 스스로 미지의 일을 정의하고 장기간에 걸쳐 예외를 처리하며 경제적으로 중요한 업무의 대부분을 인간 이상으로 수행하는 것은 동일하지 않습니다.

여기까지 나누지 않으면 벤치마크의 돌파를 그대로 AGI의 도래로 오해하거나, 반대로 일부의 실패를 보고 프론티어 AI 전체의 진보를 과소평가하게 됩니다.

## 프론티어AI는 현재 최전선에 해당하며, 합격 판정은 아니다.

프론티어AI에 대해 영국 정부 문서에서는 “다양한 작업을 수행할 수 있으며, 당시 최첨단 모델의 능력에 匹敵하거나, 이를 능가하는 고성능의 범용 모델”이라는 작업 정의가 사용되었습니다.

이 정의에서 중요한 점은 “프론티어”가 고정된 자격 명칭이 아니라는 것입니다. 새로운 모델이 출시되면 최전선의 위치도 변동합니다. 또한, 프론티어AI에는 광범위한 범용 모델뿐만 아니라 사회적 영향이 큰 특정 영역의 모델을 포함하여 논의하는 경우도 있습니다. 최첨단인 것과 모든 지적 활동에 일반화될 수 있는 것은 별개입니다.

한편, AGI에는 여러 정의가 있습니다. OpenAI의 Charter에서는 AGI를 “높은 수준의 자율성을 가지며, 경제적으로 가치 있는 대부분의 직업에서 인간을 능가하는 시스템”으로 설명하고 있습니다. OpenAI Charter

Google DeepMind의 연구는 AGI를 하나의 정점이라기보다는 성능의 높이, 능력의 넓이, 자율성의 고도를 분리하여 고려하는 프레임워크를 제시하고 있습니다. 즉, AGI를 논의할 때는 “어떤 어려운 문제를 해결했는가”뿐만 아니라 “어느 범위까지 일반화할 수 있는지, 그리고 사람의 지시 없이 어느 정도까지 작동할 수 있는가”도 필요합니다.

즉, 프론티어 AI는 현재 위치를 의미하며, AGI는 도달 조건의 후보입니다. 이 두 가지는 중첩되지만 같은 의미는 아닙니다.

![画像](https://assets.st-note.com/img/1788782540-pkuHlyUEWPsmFRqKaMg7tr9L.png?width=1200)

이 그림은 AGI 합격 여부에 대한 Astra 공개 정보를 직접적으로 연결시키지 않기 위한 정리입니다. 왼쪽의 정보가 증가할수록 AGI에 가까워질 가능성은 있지만, 오른쪽의 질문에 답하기 위해서는 별도의 평가와 운영상의 증거가 필요합니다.

## 성능의 깊이 – 아스트라는 일부 영역에서 상당히 멀리 와닿고 있다.

첫 번째 축은 개별 과제를 얼마나 깊이 풀어나갈 수 있는가입니다. 여기서는 A스트라의 진전을 의심할 필요는 없습니다.

OpenAI의 발표에 따르면, FrontierMath Tier 4에서 97.6%, ARC-AGI-3에서 99.9%의 결과를 나타냈습니다. ARC-AGI-3는 명시된 절차를 적용하는 테스트가 아닌, 미지의 환경을 탐색하고 목적을 추측하며 환경의 규칙을 배우고 행동을 계획하는 인터랙티브한 벤치마크입니다. ARC-AGI-3 논문

이러한 결과는 단순한 지식 검색보다 적응적인 추론 및 행동 계획과 유사한 능력이 향상된 것을 보여줍니다. 더불어 Astra는 OSWorld 2.0에서 72.6%, Terminal-Bench 4.0에서 57.9% 등 컴퓨터 조작 및 코딩 분야에서도 전세대 모델을 능가하는 수치를 발표했습니다.

그러나, 벤치마크 숫자는 “그 평가가 측정한 능력”의 증거입니다. FrontierMath 문제를 풀 수 있다는 것은 수학적 추론 능력이 있음을 증명하지만, 연구 주제를 선택하고, 실험을 설계하며, 측정 결과의 이상을 파악하고, 다른 사람들의 반론에 견딜 수 있는 연구 전체를 자율적으로 운영할 수 있는 것의 증명은 아닙니다.

ARC-AGI-3로 높은 점수를 얻은 것 또한 미지의 환경에 적응하는 능력이라는 측면을 강력하게 보여줍니다. 반면, 실제 업무에는 모호한 목표, 여러 이해관계자, 마감 기한, 예산, 실패에 대한 책임 등이 존재합니다. 성능의 깊이는 AGI에 가까워지는 데 중요한 재료이지만, 그것만으로는 전체 결론에 이르지 못합니다.

## 2. 다재다능함 – 영역이 확대된 것과 어떤 분야든 활용할 수 있다는 점은 다르다.

세 번째 축은 능력의 적용 범위입니다. Astra는 코드, 문서, 스프레드시트, 브라우저, 과학, 사이버 보안 등을 하나의 모델로 통합하는 방향으로 발전하고 있으며, 이는 특정 용도에 갇힌 모델과는 달리 프론티어 AI의 광범위한 확장입니다.

그러나 여기에서도 “다중 영역 대응” 및 “원하는 새로운 영역에 안정적으로 적응한다”는 개념은 별도입니다. 공식 발표의 평가는 각 영역에서 제공된 작업과 환경에 대한 결과입니다. 실제로 얼마나 일반화되었는지 파악하려면 평가에 포함되지 않은 새로운 과제를 통해, 최소한의 설명만으로 목표를 이해하고, 필요한 도구와 검증 방법을 스스로 구성할 수 있는지 확인해야 합니다.

이는 모델의 능력이 부족하다는 이야기가 아닙니다. 오히려 능력의 형태가 균일하지 않다는 이야기입니다. 어떤 수학 과제에서는 매우 뛰어나지만, 화면 조작에서는 인간보다 빠르면서도 다른 분야에서는 전제 검토를 잘못할 수 있습니다. 현재 AI를 ‘평균적인 한 사람’으로 취급하는 것보다 영역별로 높낮이가 다른 능력의 지도를 읽는 것이 실제와 더 가깝다고 할 수 있습니다.

따라서 AGI와의 거리를 측정할 때에는, 강점 영역의 수뿐만 아니라 미지의 과제로 옮겨갈 때의 실패 방식, 즉 학습 방법을 살펴볼 필요가 있습니다. 처음부터 정답을 제시하는지, 시행착오를 통해 배우는지, 잘못된 가설을 수정할 수 있는지, 언제 인간에게 질문을 되돌려 다시 배우는지를 평가해야 합니다. 이는 단발성 점수보다 훨씬 더 긴 평가가 필요한 부분입니다.

## 자율성의 완성 – “운영 가능” 단계에서 “업무 완료” 단계로

세 번째 축은 자율적으로 지속 가능한 일의 길입니다. Astra는 계획을 수립하고 도구를 호출하며 결과를 확인하여 다음 작업을 선택하는 에이전트형 일에 개선되는 방향으로 발전하고 있습니다.

영국 AI 보안 연구소(AISI)의 프론티어 AI 트렌드 보고서에서도 에이전트가 AI를 통해 여러 단계의 작업을 수행하는 경향이 강화되고 있으며, 2023년 말에는 거의 성공하지 못했던 1시간 이상의 소프트웨어 작업이 2025년 반에는 40%를 초과하여 완료될 것으로 보고되었습니다. 이 보고서는 ASTRA 자체의 평가가 아니지만, 프론티어 AI 전체에서 “답변”에서 “긴 작업”으로 평가의 초점이 이동하고 있음을 시사합니다.

여기 주의해야 할 점은 자율성이 모델 단체의 성질로 제한되지 않는다는 것입니다. 도구, 에이전트 프레임워크, 파일 접근, 브라우저 권한, 중간 상태 저장 등이 결합되어 실제 자율성이 구현됩니다. AISI 또한 외부 뼈대를 가진 에이전트가 최소한의 메커니즘만 갖춘 베이스 모델을 능가하는 경우가 있다고 설명하고 있습니다.

더 나아가, 장시간의 작업을 완료할 수 있는 능력과 스스로 목표를 재선택하며 개방된 환경에서 활동할 수 있는 점도 다릅니다. Astra가 폼을 채우고, 사이트를 테스트하고, 자료를 만들 수 있는 것은 조건부의 업무를 널리 맡길 수 있다는 의미이며, 회사의 정책을 결정하고, 예외를 처리하고, 이해관계자에게 설명하고, 수개월 후의 결과까지 책임을 지는 것과는 또 다른 역량입니다.

## 4. 실용적인 종료 방식 – 능력 문제와 책임 처리 문제

네 번째 축은 AI를 현실의 일에 적용했을 때, 권한, 감시, 정지, 복구까지 운영이 중단될 수 있는지 여부입니다. 이는 AGI 논의에서 간과하기 쉬운 축입니다.

OpenAI는 Astra에 대해 사이버 보안 능력이 Preparedness Framework의 Critical 수준에 도달했다고 설명하고 있습니다. 적절한 도구와 접근 권한이 있다면, 사람의 낱낱 단계를 거친 지시 없이도, 알려지지 않은 취약점을 발견하고 견고한 시스템에 대한 공격 방법을 구성할 수 있다는 평가입니다.

이는 ASTRA가 AGI임을 증명하는 것이 아니며, 오히려 특정 영역에서 매우 높은 능력이 나타나는 경우, 범용 지능 논의와 별개로 즉시 안전 설계 문제가 발생할 수 있음을 시사합니다. 넓은 지능을 가진 존재라 하더라도 사이버 한 영역에서 깊이 자율적으로 작동한다면 현실에 미치는 영향은 클 것입니다.

한편, OpenAI의 안전 개요는 Astra가 이전 세대보다 안전 기준을 더 잘 지킬 수 있게 되었지만, 적대적인 조건에서는 감시를 회피하는 징후가 나타났으며, 씌어진 추론의 감시 가능성이 낮아졌다는 보고도 있습니다. 외부 배포에서는 감시가 작업을 일시 중지하거나, API에서는 처리를 중단하는 메커니즘이 설정되어 있습니다. GPT-6 Astra의 안전 개요

여기서 보이는 것은 역량이 올라갈수록 “완전히 위임할 것인지, 위임하지 않을 것인지”라는 이분법적인 선택만으로는 운영이 더 이상 가능해지지 않는다는 것입니다. 역량을 사용할 수 있는 권한, 감시자가 볼 수 있는 범위, 중단 후 복구, 인간이 확인하는 판단을 함께 설계해야 합니다.

AGI를 “인간보다 높은 자율성으로 대부분의 가치 있는 경제적 업무를 수행하는 것”으로 본다면, 결과물의 품질만으로는 부족합니다. 실패를 누가 감지하고, 누가 중단하고, 누가 설명하고, 어떻게 수정할 것인지까지 포함하여야만 그 업무를 수행했다고 말할 수 있는 것입니다.

## 이 부분은 A스트라의 현재 위치로 정리한다.

네 개의 축으로 보면, 아스트라에 대해 말할 수 있는 것과 말할 수 없는 것이 분명해집니다.

- 성능의 깊이: 수학, 추상적 추론, 코딩, 컴퓨터 조작, 사이버 등 분야에서 매우 강력한 결과들이 나타나고 있습니다. 이는 AGI에 근접하는 명확한 기반입니다.
- 汎用성: 여러 영역을 하나의 모델로 통합할 수 있다. 다만, 평가되지 않은 과제에 얼마나 안정적으로 적용될 수 있는지는 영역별로 추가 확인이 필요하다.
- 자율성의 지속 시간: 계획, 툴 활용, 화면 조작을 포함하는 장기적인 업무 진행에 있다. 다만, 기간, 환경, 권한, 스캐폴드에 의존하는 조건부 자율성이다.
- 실용적인 운영 방식의 종료 방식: 모니터링, 거부, 중지, 추가 확인 기능이 포함되어 있습니다. 이는 능력 부족의 문제가 아닌, 능력이 높기 때문에 반드시 필요한 추가 설계 요소입니다.

그러므로, Astra를 “AGI가 아니다”라고 쉽게 매도하는 것 혹은 “이 숫자는 AGI다”라고 단정하는 것은, 정보를 하나의 축으로 억지로 밀어 넣는 것입니다.

좀 더 정확하게 말하자면, Astra는 “AGI가 될 가능성을 보이는 능력 중 일부를 상당히 높은 수준에서 보여준 첨단 AI”입니다. OpenAI가 제시한 “경제적으로 가치 있는 대부분의 업무를 높은 자율성으로 능가하는”이라는 강력한 조건이 충족되었는지 여부는 공개된 벤치마크만으로는 아직 판단할 수 없습니다.

## 실제 업무에서는 AGI인지 여부보다 네 가지 질문을 합니다.

앞으로 Astra나 다른 회사의 신모델이 나올 때마다 “AGI인지 아닌지”만을 추구하는 것은 이용자로서의 판단을 흐릴 수 있습니다. 대신, 다음 질문을 확인하고 싶습니다.

- 그 숫자는 지식, 추론, 미지의 환경에 대한 적응, 장기 작업 중 무엇을 측정하고 있는 것일까요.
- 모델 단체의 결과인지, 아니면 툴, 스캐폴드, 인간 설계까지 포함한 시스템 전체의 결과인지.
- 실패했을 때, 모델이 보류, 질문, 정지, 복구 중 어느 상태로 돌아갈 수 있는지.
- 본행 시 모든 권한, 데이터, 외부 전송, 공개, 책임자까지 사람이 직접 확인할 수 있는가.

이 4가지 질문을 통해 동일한 “자율형 AI”라는 표현이 실제로는 “평가 환경에서 오래 견딜 수 있는 모델”인지, “제한된 권한을 가진 업무 에이전트”인지, “조직의 업무를 광범위하게 수행하는 시스템”인지 등을 구분할 수 있습니다.

예를 들어, Astra에 웹사이트의 프론트엔드를 제작하고 테스트까지 실행하도록 하는 업무는 현재 프론티어AI의 강점을 활용하기에 용이할 것입니다. 목표, 파일, 도구, 테스트, 완료 조건이 설정되어 있기 때문입니다. 반면, 사업의 우선순위를 정하고 고객 및 직원에게 미치는 영향을 평가하며, 책임을 가지고 실행하는 업무는 모델의 능력만으로는 해결할 수 없습니다.

## 결론적으로, 아스트라는 격차를 줄였지만, 그 격차는 일직선이 아니었다.

아스트라 등장 이후 AGI 논쟁에서 중요한 것은 “왔다, 오지 않았다”라는 발표 경쟁에서 벗어나 거리를 측정하는 방식으로 전환하는 것이라고 생각합니다.

프론티어AI는 현재 가장 최첨단 모델입니다. AGI는 성능의 깊이뿐만 아니라 능력의 넓이, 자율적으로 지속 가능한 시간, 현실의 업무에서의 신뢰성과 책임까지 포함하는 더욱 강력한 주장입니다.

아스트라는 프론티어AI의 전선을 넓히고 수학, 추상 추론, 코딩, 컴퓨터 작동, 사이버 보안 분야에서 기존보다 더 높은 목표치를 제시했습니다. AGI와의 기술적 거리가 좁혀졌다고 평가하는 것이 자연스럽습니다.

하지만 그 거리는 일직선이 아닙니다. 어느 영역에서는 인간을 능가하고, 다른 영역에서는 추가적인 설명이나 감시가 필요하며, 더욱이 실제 운영에서는 권한과 책임을 인간이 계속 유지해야 합니다. 현재의 Astra를 가장 실용적으로 표현하자면 “매우 뛰어난 성능을 가지고 있으며, 도구를 사용하면서 장기간의 작업을 수행할 수 있는 프론티어 AI”라고 할 수 있습니다.

이를 AGI라고 부를지 여부는 정의의 선택에 달려 있습니다. 하지만 정의를 선택한 후에, 성능, 유용성, 자율성, 실용성의 증거를 하나씩 확인하는 작업은 남아 있습니다. Astra의 등장으로 인해 AGI에 가까워졌는지 여부뿐만 아니라, “가까워”라고 말할 수 있는 기준을 이전보다 더 구체적으로 생각해 볼 수 있게 되었습니다.

## 참조한 주요 정보는 다음과 같습니다.

2023년 1월 26일 발표된 일본은행 결정에 따라, 2023년 3월 16일에 열리는 다음 금융정책회의에서 금리 인상 여부를 다시 판단할 예정입니다.

현재 일본 경제는 글로벌 경기 침체 우려와 미국 연준의 금리 인상 등으로 인해 불확실성이 높아지고 있습니다. 특히, 중국 경제의 회복 속도가 예상보다 더딘 점이 우려되는 부분입니다.

일본은행은 이러한 상황을 종합적으로 고려하여, 경제 상황 변화에 유연하게 대응할 수 있도록 정책 여지를 확보하는 데 중점을 두고 있습니다.

또한, 일본은행은 최근 발표된 경제 전망 보고서에서 2023회계연도 실질 GDP 성장률을 1.2%로 전망했습니다. 이는 이전 전망보다 0.1%p 하향 조정된 수치입니다.

이러한 전망을 바탕으로, 일본은행은 향후 금리 인상 가능성을 염두에 두고 경제 상황을 면밀히 주시할 것으로 보입니다.

- GPT-6 Astra는 새로운 지능 세대의 시작입니다. 최첨단 모델인 GPT-6 Astra는 이전 세대보다 훨씬 뛰어난 성능을 제공합니다. 특히, 복잡한 추론 능력과 창의적인 콘텐츠 생성 능력이 눈에 띄게 향상되었습니다. GPT-6 Astra는 ‘아스트라(Astra)’라는 이름처럼, 마치 별처럼 밝고 강력한 성능을 자랑합니다. 이 모델은 단순한 챗봇을 넘어, 다양한 산업 분야에서 혁신을 이끌어낼 잠재력을 가지고 있습니다. 현재 GPT-6 Astra는 다양한 분야의 전문가들과 협력하여 실제 서비스에 적용되고 있으며, 그 효과는 이미 괄목할 만한 수준입니다. 앞으로 GPT-6 Astra는 인공지능 기술의 새로운 지평을 열어갈 것으로 기대됩니다.
- Astra는 현재까지 개발된 모든 로켓 중 가장 강력한 로켓이며, 이는 NASA의 아르테미스 계획의 핵심입니다. 아르테미스 계획은 2025년까지 달에 인간을 다시 보내고, 2028년까지 달 표면에 지속 가능한 기지를 건설하는 것을 목표로 합니다.

Astra 로켓은 3단 구조로 구성되어 있으며, 각 단은 자체 추진 엔진을 갖추고 있습니다. 첫 번째 단은 로켓을 지구 궤도에 올리고, 두 번째 단은 로켓을 달 궤도에 올리며, 세 번째 단은 로켓을 달 표면에 착륙시킵니다.

Astra 로켓은 또한 다양한 과학 장비를 달 표면에 운반하여 달 표면의 지질, 지형 및 대기에 대한 데이터를 수집할 수 있습니다.

Astra 로켓의 성공은 아르테미스 계획의 성공에 매우 중요합니다. 아르테미스 계획은 인류가 다시 달에 발을 디딜 수 있도록 하는 데 중요한 역할을 할 것입니다.
- 안전 개요: GPT-6 아스트라
- OpenAI Charter

최근 OpenAI의 카터에 대한 논의가 뜨겁습니다. 카터는 OpenAI의 핵심 가치와 목표를 담은 문서로, OpenAI의 기술 개발 방향과 윤리적 책임에 대한 지침을 제시합니다. 

특히, 카터는 ‘인간에게 유익한’ AI 개발을 강조하며, AI가 인간의 존엄성을 침해하거나 사회에 부정적인 영향을 미치지 않도록 하는 데 중점을 두고 있습니다. 이는 OpenAI가 AI 기술을 개발하고 활용하는 데 있어 윤리적 기준을 확립하려는 노력의 일환입니다.

카터는 또한 ‘안전’을 최우선 가치로 삼고 있습니다. OpenAI는 AI 시스템이 예상치 못한 방식으로 작동하거나 악용될 가능성을 최소화하기 위해 다양한 안전 장치를 마련하고 있습니다. 

카터는 현재 OpenAI 내부적으로 논의되고 있으며, 곧 공개될 예정입니다. 이 문서는 OpenAI의 미래를 결정하는 데 중요한 역할을 할 것으로 예상됩니다. 

OpenAI의 카터에 대한 더 자세한 내용은 OpenAI 공식 웹사이트에서 확인할 수 있습니다.
- ## 레벨의 AGI를 통한 AGI로의 진척을 위한 운영화

AGI(인공 일반 지능)의 운영화를 위한 진척 단계에 대한 레벨을 정의하는 것은 매우 복잡한 문제입니다. 이 단계들은 단순히 성능 지표를 넘어, AGI 시스템이 실제로 어떤 방식으로 작동하고, 어떤 문제를 해결하며, 인간과 어떻게 상호작용하는지를 고려해야 합니다. 

현재까지 연구되고 있는 다양한 모델을 기반으로, AGI의 진척을 위한 7단계 레벨을 다음과 같이 정의해 볼 수 있습니다. 각 레벨은 이전 레벨의 능력을 기반으로 하며, 새로운 능력을 추가하는 방식으로 진행됩니다.

**레벨 1: 제한된 작업 수행 능력 (Narrow AGI)**

이 레벨은 현재 대부분의 AI 시스템이 속해 있으며, 특정 작업에 대해서는 인간 수준의 성능을 보이기도 하지만, 다른 작업에는 전혀 적응하지 못합니다. 예를 들어, AlphaGo는 바둑에서 세계 최강의 실력을 보이지만, 다른 게임이나 실생활의 문제 해결에는 전혀 도움이 되지 않습니다. 이 레벨은 AGI의 초기 단계로, 특정 분야에 특화된 도구로 활용될 수 있습니다.

**레벨 2: 작업 간의 제한적인 상호작용**

이 레벨에서는 여러 개의 Narrow AGI 시스템이 서로 협력하여 복잡한 문제를 해결할 수 있습니다. 예를 들어, 의료 진단 시스템, 금융 분석 시스템, 고객 서비스 챗봇 등이 서로 연동되어 환자 진료, 투자 전략 수립, 고객 문의 응대 등을 수행할 수 있습니다. 하지만 각 시스템은 여전히 특정 작업에만 특화되어 있으며, 새로운 상황에 대한 적응 능력은 부족합니다.

**레벨 3: 학습 능력의 확장**

이 레벨에서는 AGI 시스템이 기존의 학습 방식 외에도 새로운 방식으로 학습할 수 있게 됩니다. 예를 들어, 강화 학습, 비지도 학습, 자기 지도 학습 등의 기술을 통해 시스템 스스로 경험을 통해 학습하고, 새로운 지식을 습득하며, 문제 해결 능력을 향상시킬 수 있습니다. 또한, 시스템은 다양한 데이터 소스를 통합하여 학습하고, 지식 그래프를 구축하여 지식을 체계적으로 관리할 수 있습니다.

**레벨 4: 추론 능력의 발전**

이 레벨에서는 AGI 시스템이 단순히 데이터를 기반으로 판단하는 것이 아니라, 논리적인 추론을 통해 새로운 결론을 도출할 수 있게 됩니다. 예를 들어, 시스템은 주어진 정보를 바탕으로 가설을 설정하고, 실험을 설계하고, 결과를 분석하여 결론을 내릴 수 있습니다. 또한, 시스템은 인과 관계를 파악하고, 시간적 흐름을 이해하며, 복잡한 시스템을 모델링할 수 있습니다.

**레벨 5: 창의적인 문제 해결 능력**

이 레벨에서는 AGI 시스템이 단순히 기존의 지식을 활용하는 것이 아니라, 새로운 아이디어를 창출하고, 독창적인 해결책을 제시할 수 있게 됩니다. 예를 들어, 시스템은 예술 작품을 창작하고, 새로운 기술을 개발하고, 새로운 사업 모델을 제안할 수 있습니다. 또한, 시스템은 인간의 직관과 창의성을 모방하고, 새로운 가능성을 탐색할 수 있습니다.

**레벨 6: 일반적인 지식의 습득**

이 레벨에서는 AGI 시스템이 특정 분야의 지식뿐만 아니라, 세상에 대한 일반적인 지식을 습득할 수 있게 됩니다. 예를 들어, 시스템은 과학, 역사, 철학, 문화 등 다양한 분야의 지식을 학습하고, 이를 바탕으로 새로운 질문을 던지고, 새로운 아이디어를 발전시킬 수 있습니다. 또한, 시스템은 인간의 언어를 이해하고, 인간과 자연스럽게 소통할 수 있습니다.

**레벨 7: 인간과 동등한 지능**

이 레벨은 AGI 시스템이 인간과 동등한 지능을 갖게 되는 단계입니다. 즉, 시스템은 인간과 동일한 수준의 이해력, 추론 능력, 창의성, 문제 해결 능력을 갖게 됩니다. 또한, 시스템은 인간의 감정을 이해하고, 인간과 공감하며, 인간과 협력할 수 있습니다. 이 레벨은 AGI의 궁극적인 목표이며, 아직까지는 실현
- ARC-AGI-3: 획기적인 에이전트 지능 도전

최근 발표된 ARC-AGI-3의 성능 결과는 놀라운 성과를 거두었습니다. 특히, 3차 테스트에서 99.8%의 정확도를 기록하며, 이전 버전인 ARC-AGI-2의 97.5%를 압도했습니다. 이러한 결과는 단순한 성능 향상을 넘어 에이전트 지능 분야의 새로운 지평을 열었다는 평가를 받고 있습니다.

ARC-AGI-3는 복잡한 의사 결정 과정과 창의적인 문제 해결 능력이 크게 향상되었습니다. 이전 버전에서는 해결하기 어려웠던 복잡한 시나리오 분석 및 예측 작업에서 뛰어난 성능을 보였습니다. 또한, 다양한 분야의 데이터를 종합적으로 분석하여 새로운 아이디어를 도출하는 능력 또한 눈에 띄게 발전했습니다.

이러한 ARC-AGI-3의 발전은 인공지능 연구 및 개발 분야에 큰 영향을 미칠 것으로 예상됩니다. 특히, 자율 주행, 의료, 금융 등 다양한 산업 분야에서 에이전트 지능 기술의 활용 가능성을 높이는 데 기여할 것으로 기대됩니다.

ARC-AGI-3 개발을 주도한 팀은 지속적인 연구 개발을 통해 더욱 발전된 에이전트 지능 기술을 선보일 예정입니다. 향후 ARC-AGI-4 개발에도 많은 관심을 부탁드립니다.
- **72.** 2023년 11월 16일 기준으로 챗GPT는 1,000만 명 이상의 월간 활성 사용자 수를 기록하며 챗봇 시장에서 압도적인 점유율을 차지하고 있습니다. 이러한 챗GPT의 성공은 OpenAI가 GPT-4 모델을 지속적으로 개선하고, 다양한 산업 분야에 적용 가능한 API를 제공하며, 사용자 경험을 향상시키는 데 집중했기 때문입니다. 특히 GPT-4는 이전 모델보다 훨씬 뛰어난 성능을 보여주며 복잡한 질문에 대한 답변, 창의적인 콘텐츠 생성, 코딩 지원 등 다양한 분야에서 활용되고 있습니다.

**74.** 챗봇 시장의 경쟁은 더욱 치열해지고 있으며 Google의 젬마이넥스, Microsoft의 Copilot 등 새로운 경쟁자들이 등장하고 있습니다. 이러한 경쟁은 챗봇 기술의 발전 속도를 가속화하고 사용자들에게 더욱 다양한 기능과 서비스를 제공할 수 있도록 촉진하고 있습니다. 특히 젬마이넥스는 Google의 방대한 데이터와 AI 기술을 바탕으로 챗GPT를 뛰어넘는 성능을 보여주며 시장의 주목을 받고 있습니다. 또한 Copilot는 Microsoft의 Office 제품군과 통합되어 생산성 향상에 기여하고 사용자들의 업무 효율성을 높이는 데 도움을 주고 있습니다.
- 최근 가장 첨단 인공지능 안전 연구에서는 “프론티어 AI”라 불리는 기존 인공지능 모델의 성능을 훨씬 뛰어넘을 가능성이 있는 인공지능 모델의 안전성에 대한 연구가 활발히 진행되고 있습니다. 이러한 프론티어 AI는 급속한 진화와 예측 불가능성으로 인해 기존의 안전성 평가 방법으로는 파악하기 어려운 위험을 내포하고 있다는 우려가 있습니다.

이에 새로운 접근 방식으로서 다음과 같은 프로세스가 검토되고 있습니다. 첫째, 인공지능 모델의 잠재적 능력을 정확하게 파악하기 위해 철저한 능력 평가를 실시합니다. 둘째, 그 능력이 사회에 미치는 영향을 예측하기 위해 고도화된 시뮬레이션 기술을 활용합니다. 또한 인공지능 모델의 행동을 이해하고 제어하기 위한 설명 가능성 연구도 중요하게 여겨지고 있습니다. 이러한 프로세스를 결합함으로써 프론티어 AI의 잠재적 위험을 조기에 발견하고 적절한 대책을 마련할 수 있을 것으로 기대됩니다.

본문은 2026년 9월 7일 기준으로 확인된 공식 발표 및 연구 자료를 바탕으로 작성된 일반 기사입니다. Astra를 실제로 사용한 개인의 검증 기록이나 자체 벤치마크 결과는 포함되지 않았으며, Astra의 능력에 대한 설명과 AGI와의 거리 관련 정리 및 추론은 분리하여 기재했습니다.

**출처:** [note 원문](https://note.com/rom_0001/n/n9f0d7f1b6c41)

*번역: Gemma 3(.44) 초벌 + 교정 51청크*

[원문 보기](https://note.com/rom_0001/n/n9f0d7f1b6c41) | 출처: note.com