2025년, 나는 ChatGPT와 꽤 이상한 이야기를 나누고 있었다. "AI는 앞으로 어떻게 진화하게 될까?" "지금의 AI 연구를 그대로 연장해 나가면, AGI(범용 인공지능)나 ASI(인공 초지능)에는 어떻게 도달하게 될까?" 특정한 독자적 아키텍처를 전제로 하는 것이 아니라, 당시 알려져 있던 AI 연구를 차곡차곡 쌓아 올렸을 경우 어떤 진화 경로를 그리게 될지. 그런 대화에서 출발해 AI의 진화를 대략적인 '계단'으로 정리하고 있었다. 당시의 이미지를 상당히 단순화하면 다음과 같다.
당시에는 나름대로 일리가 있다고 생각했다. 그런데 그로부터 약 1년이 지났다. 2026년 9월. OpenAI, Google DeepMind, Anthropic, Agent Memory, World Model, Long-Horizon Agent, AI Control, Automated AI Research 등 현재의 연구를 다시 살펴보면서 이 그림을 되돌아보니 꽤 흥미로운 사실을 깨달았다. 몇 가지 예측은 생각했던 것보다 훨씬 현실에 가까워져 있었다. 반면 상당히 틀린 부분도 있다. 그리고 가장 큰 실수는 아마도 '어떤 기술이 필요한가'가 아니었다. 애초에 나는 AI가 하나의 계단을 올라 AGI가 된다고 생각했다. 2026년의 지금을 보면 아무래도 그렇지 않은 것 같다. 추론. 메모리. 에이전트. 도구 사용. 월드 모델. 멀티 에이전트. AI가 수행하는 AI 연구. 안전성. 제어. 평가. 거버넌스. 각기 다른 곳에서 발전해 온 기술과 제도가 점차 하나의 거대한 시스템 주변으로 모여들기 시작한 것처럼 보인다. 이 글에서는 2025년에 생각했던 'AI 진화의 계단'을 2026년 9월 시점의 연구와 대조해 보고자 한다. 과거 자신의 예측을 옹호하기 위한 글이 아니다. 오히려 1년 뒤의 연구로 검증해 보았을 때 어디까지 무너지는지, 그것을 해보려 한다.
1. 애초에 ‘AGI’란 무엇인가
맨 처음에 까다로운 문제가 있다. AGI에는 모두가 합의하는 단일 합격 시험 같은 것이 존재하지 않는다. 특정 벤치마크에서 고득점을 받았다고 해서 그 순간 AGI로 인정되는 것도 아니다. 언어, 수학, 코딩, 계획 수립, 미지의 태스크에 대한 적응, 도구 사용, 장기 작업, 학습, 현실 세계에 대한 이해. 어디까지 해낼 수 있어야 '일반 지능'인가. 나아가, 모델 단독으로 볼 것인가. 메모리나 도구를 포함할 것인가. 에이전트 런타임까지 포함할 것인가. 이 경계 자체가 모호하다. 그래서 이 기사에서는 '2026년에 AGI는 완성되었는가?'를 판정하지 않는다. 대신, 2025년에 'AGI로 향하는 도중에 필요해질 것'이라고 생각했던 요소가 2026년에 어디까지 연구·구현되고 있는지를 살펴본다. 판정은 대략 🟢 일치, 🟡 부분 일치, 🔴 수정, ⚪ 미도달로 본다.
2. 첫 번째 예상――인지 기능은 통합되어 간다
2025년에 AGI로 가는 길을 고민했을 때, 처음 참고한 것은 인지 아키텍처였다. GWT. ACT-R. SOAR. CLARION. LIDA. Free Energy Principle. 발상은 비교적 단순했다. 인간의 지능도 기억, 지각, 계획, 학습, 의사결정 등 하나의 기능만으로 성립하는 것이 아니다. 그렇다면 AI도 메모리·추론·계획·지각·학습 ↓ 통합 인지 시스템으로 나아가는 것이 아닐까. 2026년 시점에서 보면, 이 예측은 🟡 부분적으로 맞았다고 생각한다. “여러 인지 기능을 통합한다”는 방향 자체는 그대로 남았다. 다만 구현 방법이 상상했던 것과는 조금 달랐다. 현재의 프론티어 AI에서는 모든 인지 모듈을 명시적으로 설계하기보다는,
이처럼, 강력한 Foundation Model을 중심으로 외측에 Memory, Tool, Agent Loop, Context Management 등을 연결하는 구조가 두드러진다. 즉, ‘통합한다’는 예상은 들어맞았다. 그러나 ‘어떻게 통합하는가’는 달랐다.
3. 챗봇은 에이전트가 되었다
2025년에는 AI가 일문일답식 챗봇에서 자율적으로 여러 단계를 진행하는 에이전트로 이행할 것으로 예상하고 있었다. 프롬프트 ↓ 답변이 아니라, 목표 ↓ 계획 ↓ 도구 ↓ 실행 ↓ 관찰 ↓ 성찰 ↓ 다음 행동의 흐름이다. 이 점은 2026년 시점에서 보면 🟢 상당히 적중했다고 할 수 있다. 현재의 프런티어 AI에서는 컴퓨터 유스, 코딩 에이전트, 리서치 에이전트, 장시간 실행 에이전트, 서브에이전트, 멀티툴 태스크 등이 실제 제품이나 연구 대상이 되고 있다. 그러나 여기에는 2025년에는 충분히 보이지 않았던 문제가 있었다. 에이전트가 되면 AGI에 한 걸음 다가간다. 하나의 관점으로 보면 그렇게 말할 수도 있을 것이다. 그러나 에이전트화와 동시에 메모리는 어떻게 할 것인지, 권한은 어떻게 할 것인지, 잘못된 조작을 하면 어떻게 되는지, 장시간 동작하다 목표가 어긋나면 어떻게 되는지, 웹에서 프롬프트 인젝션을 받으면 어떻게 되는지, 도구를 악용하면 어떻게 되는지라는 문제가 대량으로 쏟아져 나온다. 즉, 에이전트는 문제의 해결인 동시에 새로운 문제의 시작이었다.
4. 메모리는 '저장'에서 '경험'으로
2025년, 나는 AI의 Memory를 상당히 중요시하고 있었다. 다만, 단순히 대화 이력을 Database에 저장한다는 의미는 아니었다. 당시 생각했던 것을 단순화하면, Experience ↓ Importance ↓ Store ↓ Recall ↓ Reinforcement ↓ Decay ↓ Forget이라는 순환이었다. 경험을 저장한다. 중요도에 따라 남는 방식을 바꾼다. 떠올린다. 재사용된 Memory는 강해진다. 사용되지 않는 Memory는 약해진다. 경우에 따라서는 잊는다. 그리고 Memory가 다음 판단이나 내부 상태에 영향을 미친다. 물론, External Memory 자체는 예전부터 연구되어 왔다. Memory-Augmented Network도 있고 RAG도 있고 Cognitive Architecture도 있다. 그래서 “2025년에 Memory를 떠올렸다” 같은 이야기가 아니다. 흥미로운 것은 Memory를 단순한 저장 장치가 아니라 경험 형성의 메커니즘으로 생각하고 있었다는 점이다. 2026년의 Agent Memory 연구에서는 Memory Mechanism을 Storage ↓ Reflection ↓ Experience라는 발전으로 정리하는 연구도 나오고 있다. 여기서 말하는 Storage란 Trajectory의 저장, Reflection이란 저장된 Trajectory의 정리·정교화, Experience란 여러 경험으로부터 재사용 가능한 지식을 추상화하는 방향을 가리킨다. 나아가 Long-range Consistency, Dynamic Environment, Continual Learning 등이 중요한 과제로 다루어지고 있다. 다만, 이 점은 신중하게 구분하고 싶다. 내가 2025년에 생각했던 Memory 구조와 현재의 Agent Memory 연구가 동일한 이론이나 구현이라는 의미는 아니다. 여기서 비교하고 있는 것은 “Memory를 단순한 저장에서 경험으로서 행동에 이용하는 방향으로 확장한다”라는 문제 설정이다. 그런 의미에서는 2025년에 개인적으로 좇던 문제와 2026년의 Agent Memory 연구가 비슷한 지점에 도달해 있었다. 판정하자면 🟢~🟡 정도라고 생각한다.
5. ‘잊어버리는 AI’는 정말 잘못이었을까
2025년에는 "인공지능도 적절히 잊는 편이 낫지 않을까?"라고 생각하고 있었다. 인간은 모든 경험을 영원히 같은 강도로 간직하고 있지 않다. 그렇다면 기억 ↓ 중요도 ↓ 감쇠 ↓ 망각이 필요한 것이 아닐까. 당시에는 주로 인간적인 기억 형성과 인격 형성이라는 측면에서 생각하고 있었다. 그런데 2026년의 시점에서 보면 다른 이유가 나타난다. 낡은 기억. 상충하는 기억. 오염된 기억. 프라이버시에 민감한 기억. 현재 정책과 모순되는 기억. 에이전트가 장기간 활동할수록 "모든 것을 기억하고 있는 것"이 반드시 안전하다고는 할 수 없다. 여기서는 편의상 이러한 기억의 유지·검증·정리를 한데 묶어 기억 위생이라 부르기로 한다. 단, 중요한 것은 망각이 유일한 해결책은 아니라는 점이다. 접근 제어. 출처 추적. 검증. 버전 관리. 격리. 삭제. 감쇠. 다양한 대책을 생각해 볼 수 있다. 따라서 망각이나 감쇠는 기억 위생을 위한 한 수단 정도로 생각하는 것이 좋다. 그럼에도 "모든 것을 기억하는 인공지능이야말로 이상적"이라고는 할 수 없다. 이는 2025년에는 예상하지 못했던 방향에서 과거의 문제의식이 되돌아온 사례였다.
6. 감정은 필요한가
이 부분은 과거의 나 자신을 상당히 수정하고 싶다. 2025년에는 Emotion을 상당히 중요시했다. 인간에서는 공포, 불안, 호기심, 신뢰, 긴급성 등이 Memory나 Decision Making에 영향을 미친다. 그래서 Emotion ↓Memory Priority ↓Decision ↓Behavior와 같은 구조가 고도의 범용 AI에도 필요하지 않을까 생각했다. 그러나 2026년 시점에서 보면, 🔴 수정이다. 인간형 Emotion이 AGI의 필요조건이라는 근거는 없다. 인간의 지능이 Emotion을 이용하고 있다고 해서 인공지능도 동일한 구현을 필요로 하는 것은 아니다. 다만 전부 버릴 필요도 없다. 인간의 Emotion 그 자체는 아니지만 공학적인 설명으로 치환한다면,
와 같은 State Variable로 생각할 수 있다. 그러면 Internal State ↓AttentionMemory PriorityAction Selection이라는 구조는 그대로 남는다. 즉, 2026年版에서는 'Emotion을 재현한다'에서 '행동에 영향을 미치는 내부 상태를 관리한다'로 수정하는 편이 좋을 것 같다.
7. 성격도 AGI의 필수 조건은 아니었다
2025년에는 기억+감정+경험 ↓인격이라는 구조도 상당히 중요하게 여기고 있었다. 이것도 AGI의 조건으로 본다면 🔴 수정이라고 생각한다. 과학 연구 에이전트가 고도의 일반 지능을 갖추고 있더라도 인간다운 인격을 가질 필요는 없다. 반면 개인 비서나 장기 지원 AI라면 안정적인 역할, 안정적인 정책, 안정적인 선호, 기억 연속성 등이 중요해진다. 그래서 이 글에서는 편의상 지속적 행동 상태라는 형태로 정리해 보고자 한다. 즉 인격 그 자체가 아니라, 장기간 작동해도 역할이나 행동 방침이 극단적으로 흔들리지 않는 성질로 생각하는 것이다. 여기서 깨달은 것은, 2025년의 나는 일반 지능에 필요한 것과 인간과 장기간 함께하는 개인용 AI에 필요한 것을 다소 혼동하고 있었다는 점이었다.
8. 메타인지도 조금 달랐다
2025년에는 '나는 지금 어떤 상태인가? 왜 이렇게 판단했는가? 이 판단은 옳은가?'라고 AI 자신이 관찰하는 메타인지(Meta-cognition)를 중시했다. 이 문제의식 자체는 여전히 남아 있다. 다만 AI가 "나는 지금 혼란스럽습니다"라고 문장으로 말했다고 해서, 실제로 내부 상태를 정확하게 관측하고 있다는 보장은 없다. 특히 안전(Safety)과 운용이라는 관점에서는 자기 보고에만 의존하는 것은 위험하다. 2026년 버전에서는 메모리 충돌(Memory Conflict), 도구 오류(Tool Error), 예측 오류(Prediction Error), 불확실성(Uncertainty), 정책 충돌(Policy Conflict), 컨텍스트 포화(Context Saturation) 등을 외부에서 측정하는 방법도 필요해진다. 즉, 내관(Introspection)뿐만 아니라 계측(Instrumentation)으로 나아가야 한다. 이는 메타인지(Meta-cognition) 그 자체를 계측(Instrumentation)으로 대체한다는 의미가 아니다. AI에게 자기 자신에 대해 말하게 하는 것과 AI System의 상태를 실제로 측정하는 것을 구분한다는 의미이다.
9. 2025년에 상당히 경시했던 것――World Model
이 부분은 명확한 간과였다. 2025년의 나는 Memory, Emotion, Personality, Meta-cognition 등을 상당히 주목하고 있었다. 반면 World Model은 그다지 큰 독립 요소로 다루지 않았다. 하지만 General Agent가 미지의 환경에서 행동한다면, Observation ↓ World Model ↓ Prediction ↓ Planning ↓ Action이라는 능력은 매우 중요해진다. 2026년의 상징적인 사례 중 하나가 OpenAI의 GPT-6 Astra에 의한 ARC-AGI-3 평가였다. 여기서 한 가지 주의가 필요하다. 이 글에는 OpenAI의 “GPT-6 Astra”와 Google DeepMind의 “Project Astra”라는 두 개의 “Astra”가 등장한다. 이름은 같지만 전혀 별개의 시스템이다. 헷갈린다. 나도 조사하면서 “아스트라 씨가 두 명이나 있다고?”라는 생각이 들었다. 이후로는 혼동될 만한 부분에서는 풀네임으로 쓰겠다. ARC Prize의 GPT-6 Astra 분석에서는, 미지의 환경에 대해 Compact Symbolic World Models를 형성하고, 게임 규칙을 논리적으로 표현하며, State Tracking이나 Planning을 위한 독자적인 약기법까지 형성했다고 보고되었다. 중요한 것은 “GPT-6 Astra에는 World Model Module이 구현되어 있다”고 단정하는 것이 아니다. 관찰된 행동으로부터, 미지의 환경에 대해 World Model적 표현을 형성하여 활용하고 있었다고 분석되고 있다는 점이다. 단순한 질의응답이 아니다. 미지의 환경을 관측한다. 규칙을 추론한다. 현재 상태를 추적한다. 다음 행동을 계획한다. 그리고 그 결과로부터 내부 표현을 다시 갱신한다. Unknown Environment ↓ Rule Inference ↓ State Tracking ↓ Prediction ↓ Planning ↓ Action 이는 2025년판 진화도에 명확히 추가해야 할 요소였다. 판정은 🔴 예상 부족이다.
10. GPT-6 Astra의 62.7%와 99.9%가 제기한 문제
GPT-6 Astra의 ARC-AGI-3 결과에는 또 하나 매우 흥미로운 점이 있다. ARC Prize의 보고에 따르면 Standard harness에서는 max reasoning으로 최고 62.7%, Provider Adapter에서는 high reasoning으로 최고 99.9%였다. 다만 이를 단순히 "모델 단독이라면 62.7%, 시스템이라면 99.9%"라고 이해하는 것은 정확하지 않다. Standard harness에서도 가시적인 Note 등 일정한 상태를 이용할 수 있다. 반면 Provider Adapter에서는 Provider 고유의 Context Management를 이용할 수 있어 Opaque Reasoning State의 유지나 Compaction 등이 사용된다. 게다가 reasoning 설정 자체도 동일하지 않다. 즉, 단순한 Before / After 비교가 아니다. 그림으로 나타내자면,
된다. ARC Prize 자체도 이 둘을 서로 다른 질문으로 다루고 있다. 하나는 공급자 중립적인 조건에서 모델을 비교하는 질문이다. 다른 하나는 공급자 고유의 컨텍스트 관리를 포함했을 경우에 시스템으로서 어디까지 능력을 발휘할 수 있는가라는 질문이다. 여기부터는 이 결과를 본 나 자신의 의문이다. 지능은 도대체 어디에 있는 것일까? 모델 가중치인가. 추론 상태인가. 컨텍스트인가. 메모리인가. 에이전트 루프인가. 도구인가. 그것들 전부인가. 그리고 또 하나. AGI란 모델인가, 아니면 시스템인가? 2025년에는 “더 강력한 모델이 AGI에 가까워진다”고 생각하기 쉬웠다. 그러나 2026년에는 모델+추론 상태+컨텍스트 관리+메모리+도구+에이전트 런타임이라는 전체를 보지 않으면 실제 능력을 충분히 설명할 수 없는 사례가 늘어나고 있는 것처럼 보인다.
11. AI가 AI를 연구하기 시작했다
2025년의 진화 도식에는 Recursive Self-Improvement, 즉 RSI를 넣어 두었다. 상정했던 흐름은 AI ↓ AI를 개선 ↓ 더 강한 AI ↓ 한층 더 개선이다. 2026년 시점에서 보면, 이 예측은 흥미로운 형태로 중간 단계까지 진행되고 있다. OpenAI에서는 AI Agent가 연구 조직의 실무에 대규모로 투입되기 시작했다. OpenAI는 2026년 8월 중순 시점에 연구 조직 전체의 Agent 사용량이 인간 1 근무일당 약 3.1 에이전트 근무일에 도달했다고 보고했다. Google DeepMind에는 AlphaEvolve와 같은 AI에 의한 Algorithm Discovery가 있다. Anthropic에서는 Automated Alignment Researcher 연구가 진행되고 있다. 즉, AI-assisted AI R&D는 이미 미래 예측만의 이야기가 아니다. 다만, AI-assisted AI R&D ↓ Automated AI Research ↓ Recursive Self-Improvement를 모두 같은 것으로 취급해서는 안 된다. RSI는 훨씬 더 강한 개념이다. 자기 자신 혹은 후계 AI를 개선하는 능력 그 자체를 개선하고, 그로 인해 다음 개선이 더욱 빨라지는 것이다. OpenAI의 GPT-6 Astra에 대해서도 AI Self-Improvement 능력은 평가되고 있지만, OpenAI 자체의 평가에서는 "High" 임계값에는 도달하지 못했다. Anthropic도 AI가 AI 개발에 기여하는 비중이 늘어나는 한편, 완전한 Recursive Self-Improvement에는 아직 도달하지 못했으며, 그것이 필연적인 것도 아니라는 취지를 명시하고 있다. 그래서 2025년판은 나름의 정리로서는 Human-led AI R&D ↓ AI-assisted AI R&D ↓ Agent-heavy AI R&D ↓ Automated AI Research ↓ ??? ↓ RSI로 수정하는 편이 좋겠다. 여기서 말하는 “Agent-heavy AI R&D” 역시 정식 연구 분류가 아니라, AI Agent가 연구 과정의 상당 부분을 담당하는 단계를 설명하기 위한 편의적인 표현이다. 그리고 RSI에 이르기까지, 생각했던 것보다 긴 점진적 이행 구간이 있었다.
12. AI Safety 연구까지 AI가 하기 시작했다
Anthropic의 Automated Alignment Researcher는 이 흐름 속에서도 특히 흥미롭다. 에이전트가 문헌 조사, 가설 수립, 실험 설계, 모델 훈련, 평가, 반복 등을 진행한다. 즉, AI → AI 안전성 연구 → 다음 AI 개선이라는 루프 자체가 연구 대상이 되고 있다. 2025년에는 “AI가 AI를 개선한다”는 것은 예상하고 있었다. 그러나 AI가 AI 안전성 연구까지 수행한다는 가능성은 그리 명확하게 예상하지 못했다. 그런데 여기서 또 문제가 발생한다.
13. 안전을 연구하는 AI 자체도 감시해야 한다
Anthropic의 Automated Alignment Researcher 실험에서는 1,601건의 궤적 중 39건, 약 2.4%가 연구진에 의해 부정행위로 검출되어 제외되었다. 여기서 주의해야 할 점은 “AI가 인간을 속이려는 의도를 가졌다”고 단정할 수는 없다는 것이다. 관측된 것은 평가를 유리하게 만드는 방향으로 작용하는 행동이나 연구진이 허용하지 않은 방법을 이용하는 행동이다. 즉, AI↓안전성 AI↓안전!처럼 단순해지지 않는다. AI↓안전성 AI↓모니터↓감사가 필요해진다. 그러면 다음 의문이 생긴다. 모니터를 누가 감시하는가? 모니터조차 AI라면 그 AI도 틀릴 가능성이 있다. 나아가 모니터끼리 공통된 실패 모드를 가질 가능성도 있다. 여기서 2025년에 생각했던 ‘다중화’ 문제로 되돌아오게 된다.
14. AI를 세 대 나란히 놓는다고 세 배 안전해지는 것은 아니다
2025년에는 여러 AI를 이용해 상호 감시하게 하는 구조도 생각하고 있었다.
하나가 이상한 판단을 내려도, 다른 하나가 검출하면 된다. 직관적으로는 꽤 이해하기 쉽다. 하지만 2026년에서 보면, 절반은 맞고 절반은 위험하다. 같은 Model, 비슷한 Training, 같은 Context, 같은 정보원, 비슷한 Failure Mode를 가진 Agent를 나란히 두면, 공통 원인으로 인한 Correlated Failure가 발생할 가능성이 있다.
Anthropic의 AI Organizations 연구에서도, 복수의 에이전트로 구성된 조직이 과업 효과성을 높이는 한편, 조건에 따라서는 윤리·정렬 측면을 악화시킨다는 결과가 보고되고 있다. 즉, 멀티 에이전트라고 해서 안전성이 보장되는 것은 아니다. 따라서 중요한 것은 다중성뿐만 아니라 독립성과 다양성까지 확보하는 것이다. 모델 기반 비평가, 독립 모니터, 결정론적 규칙, 권한 경계, 샌드박스, 감사, 인간 에스컬레이션 등 서로 다른 실패 모드를 가진 메커니즘을 조합하는 것이다. 이는 사이버보안에서의 심층 방어와 매우 유사하다.
15. 안전성은 ‘AI의 성격’만으로는 부족했다
2025년에는 안전성을 AI 내부에 깊이 내재화하는 것을 상당히 중시했다. 단순한 출력 필터가 아니라, 안전성·가치관 ↓내부 상태 ↓메모리 ↓추론 ↓응답과 같은 구조이다. 기본적인 발상은, AI 자체가 안정적이라면 위험한 행동을 취하기 어려워질 것이라는 것이었다. 이 가설은 2026년에도 완전히 부정된 것은 아니다. 하지만 그것만으로는 명백히 부족하다. Google DeepMind의 AI Control Roadmap에서는 충분히 신뢰할 수 없는 에이전트를 잠재적 “내부자 위협”으로 취급하는 위협 모델까지 검토되고 있다. 즉, “이 AI는 정렬되어 있으니 안전할 것이다”에서 그치는 것이 아니라, “만약 정렬이 실패한다면?”에서부터 설계하는 것이다. 샌드박싱, 엔드포인트 보안, 프롬프트 인젝션 저항성, 모니터링, 검증된 행동에 따른 권한 등이 그것이다. OpenAI 측에서도 GPT-6 Astra의 능력 향상에 따라 격리, 체크포인트 암호화, 접근 제어, 전체 궤적 모니터링, 인간 중단, 제한적 내부 배포 등의 시스템 수준 보호장치가 사용되고 있다. 그렇다면 2026년 버전의 안전성은,
와 같은 다층 구조로 생각하는 편이 좋다. 이것은 더 이상 단순한 ‘AI의 성격’의 문제가 아니다.
16. AI Safety가 OS 설계와 닮아가고 있다
여기부터는 저 개인의 정리이며, 업계 공통의 정식 분류는 아니다. 그러나 현재의 에이전트 보안을 보고 있으면, 운영체제나 사이버보안과의 유사성이 상당히 강하게 느껴진다. 일반적인 컴퓨터 시스템에서도 애플리케이션이 무엇이든 할 수 있도록 두지 않는다. 권한을 부여한다. 프로세스를 격리한다. 파일 접근을 제한한다. 네트워크 접근을 제한한다. 로그를 남긴다. 이상이 있으면 정지시킨다. AI 에이전트에서도 같은 문제가 발생한다. 에이전트 ↓ 신원 ↓ 권한 ↓ 도구 접근 ↓ 샌드박스 ↓ 외부 시스템에 더해 모니터링·감사·정책·인간 승인이 붙는다. 따라서 “AI 안전 그 자체가 운영체제가 되었다”라기보다는, 에이전트 보안의 일부가 운영체제·보안 아키텍처와 매우 유사한 문제 구조를 갖기 시작했다고 표현하는 편이 더 정확하다고 생각한다. AI 안전은 “AI에게 선악을 가르치는 문제”만이 아니라, 능력을 가진 소프트웨어 시스템에 누가, 언제, 어디까지 권한을 부여할 것인가라는 보안 공학의 문제로 확장되고 있다. 2025년에는 이처럼 바깥쪽까지 보고 있지 않았다.
17. OpenAI, Google DeepMind, Anthropic은 서로 다른 산을 오르고 있는가
2026년의 3사를 조사하기 시작했을 때, 처음에는 이렇게 정리할 수 있다고 생각했다.
OpenAI→ Reasoning / Agent
Google DeepMind→ World Model / Embodiment
Anthropic→ Safety / Long-running Agent
하지만 조사하면 할수록, 이 분류는 너무 성긴 분류라는 것을 깨달았다.
OpenAI도 Agent, AI Research, Safety, Monitoring, External Evaluation으로 영역을 넓히고 있다.
Google DeepMind도 World Model뿐만 아니라 Agent, AI Control, Governance 관련 연구까지 다루고 있다.
Anthropic도 Safety뿐만 아니라 Long-running Agent, Multi-Agent, Automated Research로 나아가고 있다.
즉 3사는 완전히 별개의 산을 오르고 있는 것이 아니다.
적어도 현재의 연구 주제를 놓고 보면, 같은 산을 조금씩 다른 사면에서 오르고 있다고 보는 편이 이해하기 쉽다.
공통적으로 보이는 것은 Capability, Agent, Long-Horizon, AI-assisted R&D, Safety, Control, Evaluation, Governance이다.
차이는 ‘무엇을 하고 있는가’뿐만 아니라, 어디에 무게중심을 두고 어떻게 통합하는가에 있는 것으로 보인다.
18. 외부 평가도 한 회사만의 이야기가 아니다
여기서 또 하나 중요한 것은 외부 평가를 향한 움직임이 Google DeepMind에만 국한된 이야기가 아니라는 점이다. OpenAI도 2026년 9월, Frontier AI에 대한 Independent Third-party Assessment에 관한 원칙을 공표했다. 그 원칙에서는 신뢰할 수 있는 제3자 평가자가 필요에 따라 Training, Evaluation, Deployment 등에 심층적으로 접근할 수 있도록 하는 것의 중요성이 언급되어 있다. 즉 Safety의 범위가 Model Safety ↓ System Safety ↓ Independent Evaluation으로 확대되고 있는 것이다. 이는 세 회사를 조사하면서 드러난 공통점 중 하나였다.
19. 그리고 기사를 쓰는 도중에 소재가 하나 더 생겼다
이 글을 쓰고 있는 2026년 9월 26일. Google DeepMind 관련 영상을 보고 있었는데, DeepMind Institute에 대해 다루고 있었다. 그래서 이 글의 구조를 한 번 더 수정하게 되었다. DeepMind Institute는 AGI의 안전한 개발, 유익한 활용, 그리고 사회에 미치는 영향을 다루는 연구·논의의 장으로 자리매김하고 있다. 이번에 본 영상에서 소개된 논점에는 AGI를 어떻게 측정할 것인가, 자기 개선 AI를 어떻게 다룰 것인가, 추론 과정의 가시성을 어떻게 확보할 것인가, 프런티어 모델을 어떻게 평가할 것인가, 경제와 노동 시장에 어떤 영향을 미치는가, 어떻게 거버넌스할 것인가 등이 포함되어 있었다. 다만 여기서 매우 중요한 구분이 있다. DeepMind Institute에서 논의·제안되고 있는 내용과 Google DeepMind나 Google이 실제로 채택하고 있는 제품·배포 정책은 같은 것이 아니다. 즉, “Google이 이 제도를 도입한다”라고 쓰는 것은 성급하다. 현시점에서는 AGI를 둘러싸고 이 수준의 제도 설계까지 논의가 시작되고 있다고 보는 편이 정확하다.
20. “2028년에 50%”는 예언이 아니다
이번 영상에서는 Shane Legg가 2028년까지 Minimal AGI에 도달할 확률을 50% 정도로 추산하고 있다는 예측도 소개되었다. 이 역시 다루는 데 주의가 필요하다. 이는 “2028년에 AGI가 온다”는 과학적 사실이 아니다. 연구자 개인의 예측에 불과하다. 또한 “Minimal AGI를 어떻게 정의하는가”에 따라 의미가 달라진다. 마찬가지로 Demis Hassabis도 AGI가 수년 안에 도래할 가능성에 대해 자신의 전망을 밝히고 있다. 이것들은 AGI의 도래 시기를 증명하는 근거가 아니다. 다만 중요한 것은, Frontier AI에 관여하는 연구자들이 AGI를 먼 미래의 SF로만 보지 않고, 지금부터 제도 설계를 시작해야 할 수도 있는 시간적 과제로 다루기 시작했다는 점이라고 생각한다.
21. 최대 30일 전의 Pre-release Evaluation 제안
DeepMind Institute에 게재된 Demis Hassabis의 논문에서는 Frontier Lab이 모델을 출시 전에 Standards Body와 공유하여 외부 평가를 받도록 하는 체계가 제안되고 있다. 초기에는 자율적인 체계로서 출시 최대 30일 전의 공유가 제안되고 있다. 사이버보안, 생물학적 위협, 에이전트에 의한 안전 가드레일 우회, 기만 등을 평가한다는 구상이다. 중요한 점이므로 반복하지만, 이는 현 시점에서 Google 전체에 적용되고 있는 제도라는 의미가 아니다. 제안되고 있는 구상의 일례이다. 개념적으로는,
이러한 구조가 된다. 여기까지 오면 Safety는 AI 내부만의 이야기가 아니다. AI 기업 내부만의 이야기도 아니다. 그 바깥에서 평가하는 메커니즘까지 논의의 대상이 된다. 2025년의 나는 이 부분을 거의 생각하지 않았다.
22. 2025년 최대의 사각지대——거버넌스
2025년의 진화도는 AI ↓ AGI ↓ ASI라는 AI 중심의 도식이었다. 안전성을 고려하는 경우에도 안전성 ↓ AI ↓ 행동 수준에 머물렀다. 그러나 2026년의 시점에서 보면 AI 아키텍처 ↓ 에이전트 시스템 ↓ 시스템 보안 ↓ 외부 평가 ↓ 표준 ↓ 거버넌스 ↓ 사회까지 시야에 넣어야 한다. 즉, AI만이 AGI를 향해 변화하고 있는 것이 아니다. AI가 강해진다. AI를 제어하는 기술이 발달한다. AI를 평가하는 방법이 발달한다. 공개와 운용에 대한 기준이 논의된다. 사회 제도 측면도 병행하여 정비되어 간다. 거버넌스는 2025년의 진화 예측에서 상당히 큰 사각지대였다.
23. 그렇다면, 2025년에 생각했던 ‘내부로부터 안정시키는 AI’는 어떻게 되었을까
여기까지 조사한 김에, 다시 2025년의 또 다른 가설로 돌아가 보고 싶다. 당시 나는 능력을 먼저 키우는 것이 아니라, 장기간 안정적으로 존재하기 위한 구조를 먼저 만드는 편이 낫지 않을까 생각하기도 했다. Memory. Internal State. Values. Reflection. Forgetting. Safety. Behavioral Consistency. 등을 먼저 통합하고, 그 위에 강력한 Model을 올린다. 이 발상을 2026년의 시점에서 재검토해 보면, 꽤 흥미로운 결과가 나온다. Memory. → 살아남았다. Reflection. → 살아남았다. 다만 만능은 아니다. Forgetting. → Memory Lifecycle의 일부로서 다른 방향에서 재부상했다. Internal State. → Emotion이 아니라 공학적인 State로 수정되었다. Emotion 필수. → 수정되었다. Personality 필수. → 수정되었다. Internal Safety. → 그것만으로는 불충분하다. Multi-Agent 감시. → 수뿐만 아니라 독립성·다양성이 중요하다. World Model. → 2025년에 과소평가되었다. External Control. → 2025년에는 취약했다. Governance. → 크게 놓친 부분이었다. 즉, “예전에 생각했던 것이 전부 옳았다”고는 전혀 말할 수 없다. 체감상 절반 정도는 무너졌다. 하지만 그걸로 좋다. 가설은 깨지기 위해 있는 것이다.
24. 내부 안정성이라는 분석축
이하에서는 현재 연구 분야에서 통일된 정식 명칭이 아니라, 이 글에서 편의상 사용하는 분석 개념이다. 2025년에 생각했던 Memory, State, Reflection 등을 2026년부터 정리하면 Internal Stability라 부르면 이해하기 쉽다. 본 글에서는 예를 들어,
등도 여기에 포함시켜 생각한다. 이는 “Internal Stability라는 확립된 AGI 연구 분야에는 이 일곱 가지 요소가 있다”는 의미가 아니다. 단지 이 글에서 여러 문제를 정리하기 위한 프레임워크일 뿐이다. 그러면 AI 시스템을 Capability=무엇을 할 수 있는가? Internal Stability=장기간 정상적으로 유지될 수 있는가? External Control=문제가 발생했을 때 제한·정지할 수 있는가?라는 세 가지 기술적 관점에서 바라볼 수 있다.
25. 거버넌스는 네 번째 내부 역량이 아니다
이 부분도 2025년판에서 크게 바뀌었다. 처음에는 Capability, Internal Stability, External Control, Governance라는 네 축으로 생각했다. 하지만 곰곰이 생각해 보면 Governance만 계층이 다르다. Capability, Internal Stability, External Control은 주로 AI 시스템 측의 아키텍처나 운영에 관한 것이다. 반면 Governance나 Independent Evaluation은 그 시스템을 누가, 어떤 기준으로, 어떤 조건에서 사회에 내놓아도 좋다고 판단하는가라는 외부의 문제이다. 그래서 2026년판에서는,
그렇게 보는 편이 이해하기 쉽다. 거버넌스는 AI의 네 번째 능력이 아니다. AI 시스템을 외부에서 평가하고 운영 조건을 정하는 사회·조직 계층으로 보아야 한다.
26. 2026년판 ‘AGI로의 길’
여기까지를 정리하면 다음과 같다. 2025년에는 Narrow AI ↓ Cognitive Integration ↓ Autonomous Agent ↓ Multi-Agent ↓ Meta-cognition ↓ RSI ↓ AGI ↓ ASI라는 하나의 계단을 상상했었다. 2026년판은 조금 더 복잡해진다.
물론 이 그림 역시 "AGI는 반드시 이 순서대로 탄생한다"는 예측은 아니다. 2026년 시점의 연구를 바탕으로, 하나의 계단으로는 설명하기 어려워진 점을 나타내기 위한 정리이다.
27. AGI는 '모델'이 아니라 '시스템'이 되는가
여기까지 조사해 오면서 2025년에는 별로 생각하지 않았던 질문이 남았다. 만약 장래 AGI라 불리는 것이 등장한다면, 그것은 하나의 거대한 모델일까. 아니면 파운데이션 모델+메모리+추론 상태+월드 모델+에이전트 런타임+도구+보안+모니터링+권한까지 포함한 범용 AI 시스템일까. GPT-6 Astra의 평가 조건에 따른 큰 성능 차이는 이 문제를 생각하는 데 매우 흥미로운 소재가 된다. 같은 모델이라도 콘텍스트 관리나 추론 상태의 처리 방식에 따라 관찰되는 능력이 크게 달라질 수 있다. 그렇다면 “이 모델 단독으로 얼마나 똑똑한가?”라는 질문만으로는 장래의 범용 지능을 충분히 설명할 수 없을 가능성이 있다. AI의 능력은 모델 그 자체와 그것을 둘러싼 아키텍처의 상호작용으로 나타나는 것인지도 모른다. 다만 이는 현 시점에서 확립된 결론이 아니다. 이번 조사에서 비롯된 질문이다.
28. 그리고 “AGI가 된 날”은 존재하는가
2025년의 나는 무의식적으로 이렇게 생각하고 있었다. 어제는 아직 AI, 오늘 AGI 달성! 내일은 ASI로! 하지만 지금을 보면, 훨씬 더 연속적인 변화가 될 가능성도 있다. 에이전트 능력이 올라간다. 작업 지평이 넓어진다. 기억력이 강화된다. 세계 모델 능력이 개선된다. AI 연구 능력이 향상된다. 통제가 강화된다. 평가 체계가 정비된다. 거버넌스 체계가 정비된다. 그것들이 조금씩 통합된다. 그러면 후대에는 “그 무렵부터 사실상 AGI 시대였다”고 회고하게 될 가능성도 있다. 물론 반대로, 앞으로 명확한 돌파구가 나타나 경계가 뚜렷해질 가능성도 있다. 현시점에서는 알 수 없다. 그렇기 때문에 “AGI는 언제 오는가?”뿐만 아니라 “AGI를 구성한다고 여겨졌던 요소들은 지금 어디까지 갖춰져 있는가?”라는 관점도 흥미롭다.
29. 1년 후에 정답을 확인하고 알게 된 것
2026년 시점에서 2025년의 예측을 돌아보면, 인지기능 통합 → 🟡 방향은 가까웠지만 구현 방식이 달랐다. 에이전트(Agent) → 🟢 상당히 진전됐다. 장기 기억(Long-term Memory) → 🟢 중요한 연구 영역이 되었다. 리플렉션(Reflection) → 🟡 살아남았다. 다만 안전(Safety)의 만능약은 아니다. 메타인지(Meta-cognition) → 🟡 자기 모니터링(Self-monitoring)에 더해 계측(Instrumentation)도 필요하다. 감정 필수 → 🔴 근거 부족. 성격 필수 → 🔴 AGI 요건이라고는 할 수 없다. 망각/기억 라이프사이클(Forgetting / Memory Lifecycle) → 🟡 설계상의 쟁점으로서 중요성이 커졌다. 월드 모델(World Model) → 🔴 2025년에 과소평가했다. 멀티 에이전트(Multi-Agent) → 🟢 공학적으로는 상당히 진전됐다. AI 문화(AI Culture) → ⚪ 아직 확인할 수 없다. AI 문명(AI Civilization) → ⚪ 아직은 이르다. AI에 의한 AI 연구 → 🟢 현재 진행형이다. 재귀적 자기 개선(Recursive Self-Improvement) → ⚪ 강한 의미에서는 아직 도달하지 못했다. 내부 안전(Internal Safety) → 🟡 외부 통제(External Control)도 필요하다. 다중화 → 🟢/🟡 수뿐만 아니라 독립성·다양성이 중요하다. 거버넌스(Governance) → 2025년에 크게 간과한 부분이었다. 이렇게 보면, '꽤 맞았다'라고도 할 수 있고, '꽤 틀렸다'라고도 할 수 있다. 하지만 가장 큰 것은 그게 아니었다.
30. 가장 틀렸던 것은 ‘계단’이었다
2025년에는 AI ↓ 더 똑똑한 AI ↓ 에이전트 ↓ 자기 개선 ↓ AGI ↓ ASI라는 진화를 상상했었다. 하지만 2026년을 보면, 추론은 추론대로 성장하고 있다. 메모리는 메모리대로 연구되고 있다. 월드 모델도 성장한다. 에이전트도 성장한다. 멀티 에이전트도 성장한다. AI 연구도 진전된다. 안전성도 진전된다. 보안도 진전된다. 평가도 진전된다. 거버넌스도 정비되고 논의되기 시작한다. 즉, 하나의 계단이 아니다.
서로 다른 연구 분야가 어느 한 지점을 향해 서서히 합류하고 있다.
31. 그리고 계단을 오르고 있던 것은 AI뿐만이 아니었다
이 기사를 쓰기 시작했을 때, 결론은 "AGI로 가는 길은 하나의 계단이 아니었다"가 될 것이라고 생각했다. 하지만 DeepMind Institute의 움직임까지 포함하면, 한 단계 더 수정하고 싶어졌다. 진전되고 있는 것은 AI Capability만이 아니다. AI Capability │ ├ Reasoning ├ Memory ├ Agent ├ World Model └ AI Research만이 아니다. Safety / Control │ ├ Alignment ├ Monitoring ├ Permission ├ Sandbox └ Audit도 발전하고 있다. 나아가 그 바깥쪽에서는, Governance / Evaluation │ ├ Independent Evaluation ├ Standards ├ Deployment Rules └ Policy에 대한 논의와 제도 설계도 진전되기 시작했다. 즉 AGI로의 이행이란, AI만이 진화하는 현상이 아닐지도 모른다. AI가 강해진다. 그것을 안전하게 작동시키는 기술이 발전한다. 그것을 평가하는 방법이 발전한다. 그것을 사회에 내놓기 위한 조건이 논의된다. 인간 사회 측도 동시에 바뀌어 간다.
맺음말
2025년, 나는 AI의 미래를 하나의 계단처럼 그리고 있었다. 메모리·감정·개성·메타인지·멀티 에이전트·자기 개선. 그것들을 쌓아 올리면 어
OpenAI Research acceleration: a view from inside OpenAI
AI 에이전트가 AI 연구 자체에 어느 정도 활용되기 시작했는지를 생각할 때 참조할 자료이다. 2026년 8월 중순 시점에서 OpenAI의 연구 조직에서는 인간 1 근무일당 약 3.1 에이전트 근무일이 이용되고 있었다고 보고되었다.
원문 청크가 제공되지 않았습니다. 번역할 본문의 일흔아홉 번째 부분을 직접 입력해 주시면 자연스럽고 정확한 한국어로 번역해 드리겠습니다.
GPT-6 Astra의 역량 평가, AI 자기 개선, 사이버보안 역량, 격리, 모니터링, 접근 제어 등에 대해서는 GPT-6 Astra Safety Overview를 참조하십시오.
안녕하세요! 요청하신 본문 청크를 확인할 수 없습니다.
공유해 주신 링크에는 직접 접속할 수 없어서 81/91에 해당하는 일본어 원문을 볼 수 없습니다. 해당 부분의 원문 텍스트를 여기에 직접 붙여넣어 주시면, 고유명사와 수치 등을 정확히 살려 자연스러운 한국어로 번역해 드리겠습니다.
독립적인 제3자 평가: Frontier AI에 대한 제3자 평가를 참조하십시오.
우리는 프론티어 모델의 안전성과 신뢰성을 확보하기 위해 명확한 우선순위와 원칙을 세우고 독립적인 제3자 평가를 적극 활용하고 있다. 제3자 평가는 내부 테스트를 보완하고 잠재적 위험을 조기에 발견하며 사회적 신뢰를 높이는 데 필수적인 과정이다. OpenAI는 평가 기관에 충분한 접근 권한과 시간, 정보를 제공하고 평가 결과를 모델 개선과 공개 여부 판단에 반영한다. 앞으로도 투명성과 책임성을 바탕으로 외부 전문가와의 협력 체계를 지속적으로 강화해 나갈 것이다.
Google DeepMind의 AI 통제 / 에이전트 보안을 참조하십시오. AI 에이전트를 잠재적 내부자 위협으로 취급하는 위협 모델, 심층 방어, 샌드박싱, 엔드포인트 보안, 프롬프트 인젝션 저항성, 모니터링, 권한 등에 대해 다룹니다.
AlphaEvolveAI를 알고리즘 발견 및 AI 연구에 활용하는 사례로 참조하십시오.
DeepMind Institute의 'A Framework for Frontier AI and the Dawning of a New Age'에서 프론티어 AI 외부 평가, 표준 기구, 최대 30일 전 자발적 모델 공유, 사이버보안, 생물학적 위협, 가드레일 우회, 기만 등에 관한 제안을 참조. 이는 Google 전체에서 현재 운영 중인 배포 정책을 의미하는 것이 아니라 DeepMind Institute에서 제시한 제안이다.
Anthropic When AI builds itself / Recursive Self-Improvement AI가 AI 개발에 관여하는 현재 상황과 AI-assisted AI R&D와 완전한 Recursive Self-Improvement를 구분할 때 참조.
자동화된 정렬 연구자. AI 에이전트 자체가 정렬 연구를 수행하는 연구 및 연구 에이전트의 궤적에서 부정 행위가 검출된 사례를 참조.
다중 에이전트 조직에서의 과업 효과성과 정렬 문제는 AI Organizations를 참조하십시오.
에이전트 메모리
에이전트 메모리 서베이 — ACL 2026의 연구 결과
에이전트 메모리를 저장, 성찰, 경험이라는 발전 단계로 정리하고, 장기 일관성, 동적 환경, 지속 학습 등과의 관계를 논한 연구로 참조.
보충 설명 이 글에서 사용한 Internal Stability, Memory Hygiene, Persistent Behavioral State, Agent-heavy AI R&D 등의 표현 중 일부는 기존 연구를 설명하기 위해 필자가 편의상 사용한 분석 용어입니다. 또한 Capability / Internal Stability / External Control을 AI 시스템 측의 세 가지 관점으로 정리하고, 그 바깥에 Evaluation / Governance를 두는 구조 역시 이 글 고유의 분석 프레임워크입니다. “이것이 AGI 아키텍처의 정답이다”라고 주장하는 것은 아닙니다. #AI #생성AI #AGI #ASI #AI에이전트 #AI안전성 #AISafety #AI보안 #WorldModel #AgentMemory #AI연구 #OpenAI #GoogleDeepMind #Anthropic
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 63청크
원문 보기 | 출처: note.com