AI가 향후 10년 이내에 인류를 멸망시킬 가능성은 10%를 넘는다.
Anthropic의 Evan Hubinger가 Claude를 개발하며 안전성을 연구하고 있다는 개인적인 견해다. 2026년 9월 9일, 본인이 X에 게시했다.
10 퍼센트 초과
물론, 실험으로 측정된 확률이든 연구자 전체의 합의가 아니든, Anthropic의 공식적인 예측값이든, 그 개인의 판단이다.
그럼에도 불구하고, 실제로 AI를 만들고 그 안전성을 연구하는 사람들은 자신들의 일에 대해 그렇게 생각하고 있다.
어떻게 받아들여야 할까요.
저는 매일 AI를 사용합니다. 논문을 찾게 하고, 코드를 작성하게 하고, 자료를 만들게 합니다. 그 편리함을 알고 있기 때문에, “인류를 파멸시킬”이라는 표현과의 거리가 너무나 멀게 느껴집니다.
받아온 이메일을 처리해주는 AI와 인류의 존속을 위협하는 AI.
이 두 가지는 대체 어디에 연결되는 것인가.
허빙거는 이후 게시글에서 현재 모델로 인한 위험은 크지 않다고 보고하며, AI가 다음 AI를 개선하는 “재귀적 자기 개선” 과정에서 인간을 훨씬 능가하는 초지능이 등장할 수 있다는 점을 우려하고 있습니다.
AI는 더욱 똑똑해지고, 그 AI가 또 다른 똑똑한 AI를 만든다.
이러한 반복이 인간의 이해나 안전 확인보다 빠르면 어떻게 될까.
실제로 같은 주에 OpenAI는 약 1만 건의 AI를 운행하여 수학 난제의 해답을 얻었다고 발표했다. 반면, OpenAI와 Anthropic 양사에서 연구해 온 Jacob Coxon의 퇴직 의사가 보도되었다. 그는 문제 삼았던 것은 자기 개선하는 초지능으로 향하는 경쟁이었다.
어렵고 난관이 있는 문제를 해결하는 인공지능과, 위험을 경고하는 연구자.
겉으로 보기에는 정반대처럼 보이지만, 이 두 가지 뉴스는 같은 변화를 반영하고 있다.
그 연결 고리를 순서대로 확인해 보겠습니다.
AI가 더욱 지능화되었다는 설명은 더 이상 불가능합니다.
ChatGPT는 2022년 11월에 세상에 나왔다.
아직 4년이 지나지 않았다.
당시의 놀라움은 AI가 인간과 같은 문장을 쓸 수 있다는 점이었다.
이메일을 수정하고 요약하며, 영어 번역을 돕고 숙제를 돕는다.
그것만으로도 충분히 미래였다.
그렇다가 뜻밖의 일이 생겼다.
AI는 글을 쓰는 도구에서 생각하는 도구로 진화했다.
생각하는 도구에서 코딩 도구로 발전했다.
코드를 작성하는 도구에서 브라우저나 컴퓨터를 조작하여 업무를 수행하는 데 필요한 도구로 발전했다.
또한 2026년에는 여러 개의 AI를 동시에 실행하여, 때로는 몇 시간, 심지어 며칠이 걸리던 작업을 프로젝트 형태로 처리하는 단계까지 와 있을 것이다.
이 부분까지는 실제로 AI를 일상생활에서 꾸준히 사용하는 사람이라면 그렇게 놀랍지 않을 수도 있습니다.
나도 그래.
진료를 하는 동안 Codex에게 논문 검색, 코드 작성, 자료 기반 구축, 오류 검사 등의 업무를 맡긴다.
얼마나 전에야, 사람에게 의뢰하는 일이 되었다.
그래서 현재 “2028년에는 여러 AI가 협력하여 일한다”는 미래 예측을 보니까, 타임머신의 도착 예정일이 어제인 것처럼 느껴지는 신기한 느낌이 드네.
이미 와 있는 겁니다.
다음에는 무엇이 달라질까요.
저는 “AI가 할 수 있는 일의 종류”에 대해서는 그렇게 생각하지 않습니다.
사람은 그 일 중에 얼마나 자주 멈춰도 괜찮은가.
이쪽이 더 큽니다.
2. 1만 개의 AI가 수학을 고민한 주말
9월 8일 OpenAI의 발표는 이러한 변화를 상징하고 있었다.
주제는 나비에-스톡스 방정식이었다.
물과 공기와 같은 유체는 어떻게 움직이는지를 나타내는 물리학과 수학의 핵심 방정식이다. 그 해가 매끄러운 상태에서 갑자기 “파괴될” 수 있는가. 약 90년 동안, 해결이 닿지 않았다.
OpenAI는 GPT-6 Astra보다 “확연히 더 뛰어난” 성능을 보이는 아직 공개되지 않은 차세대 모델을 활용했다.
물론, 그것은 단편적인 것이 아니었습니다.
약 1만 개 정도였다.
처음에는 여러 개의 난제에 에이전트를 배정하고, 유망한 문제에 계산 자원을 투입해 나갔다. 그 과정에서 더욱 학습이 진행된 내부 모델이 생성되어, 실행 중인 에이전트를 해당 모델로 업데이트했다.
연구 그룹마다 서로 다른 방법을 탐색하게 하고, 가끔 Codex에서 결과를 모아 다른 그룹으로 전달한다.
어딘가 대학 연구관과 비슷합니다.
다만 교수실도 대학원생실도 없고, 연구자 1만 명이 모두 서버 안에 있다.
그들이 주고받은 메시지는 나비에-스토크스 문제만으로 약 270만 건이며, 출력한 토큰은 약 1300억 개였다. 해에 도달한 것은 첫 에이전트를 가동한 지 약 88시간 만이었다. 이후 GPT-6 Astra가 Lean이라는 형식 증명 시스템으로 17시간에 걸쳐 검증했다.
물론, 여기에는 중요한 단서가 있습니다.
수학적 성과는 OpenAI가 발표했다고 해서 옳다고 확정되는 것이 아니다. 독립적인 수학자들에 의한 검증이 필요하며, NYU의 Tristan Buckmaster나 Anthropic의 Levent Alpöge 등에 의한 병행 연구와의 관계를 둘러싸고 연구 윤리에 관한 논의도 일고 있다. OpenAI 측에서는 Sébastien Bubeck 등이 독립성을 주장하고 있다.
그래서 “AI가 수학을 정복했다”라는 대제목을 달고 끝나는 이야기가 아니다.
내가 신경 쓰인 것은 다른 부분이다.
연구라는 행위의 형태가 독특합니다.
연구자를 늘리는 방식을 ‘채용’이 아닌 다른 방식으로 바꿔야 합니다.
이전까지 연구를 빠르게 진행하고 싶다면 인력을 늘려야 했다.
대학원생을 육성한다.
연구자를 채용한다.
전문 지식을 습득하도록 돕겠습니다.
연구실을 만든다.
사람은 편리한 존재이지만, 여러 일에는 시간이 걸린다.
잠시 쉬고, 밥도 먹어야 하고, 육아도 해야지. 가끔 학회에 다녀오다가 관광도 하고 돌아오는 경우도 있다.
무엇보다 한 명의 연구자를 10명으로 복제할 수 없습니다.
AI는 그것을 해낼 수 있다.
OpenAI는 9월 6일, 사내 연구 현장에서 AI 에이전트가 인간 연구원이라면 수일 걸리는 제한된 연구 과제를 수행할 수 있는 단계에 도달했다고 발표하며 “자동화된 연구 인턴”이라는 표현을 사용했다.
아직 “연구소장”이 아니다.
인턴입니다.
하지만 100명, 1000명까지 인턴을 고용할 수 있는 프로그램입니다.
게다가 채용 면접이 필요 없습니다.
또한, 이 인턴십이 연구하는 대상이 중요하다.
인공지능 자체인 것이다.
AI는 코드를 작성한다.
실험을 실행한다.
결과를 분석한다.
괜찮다면 다른 방법을 시도해 보자.
그 결과를 인간 인공지능 연구자들이 사용하여 다음 모델을 만들 것입니다.
즉, AI의 발전을 가속화하기 위해 AI를 사용하는 악순환이 시작되고 있다.
여기부터 “재귀적 자기 개선”이라는 용어가 갑자기 실현 가능성을 갖기 시작한다.
4. 자기 개선이란 AI가 밤중에 자신의 뇌를 개조하는 것이 아니다.
자기 개선이라는 표현에는 약간 SF적인 느낌이 있다.
밤샘 데이터센터에서 AI가 갑자기,
더 현명해지고 싶다
생각을 시작하고 제 뇌를 재구성하기 시작한다.
피카!
다음 날 아침, 초거대 AI 완성.
그런 그림을 상상하기 쉬워요.
실제로 훨씬 더 소소한 일이었다.
그리고, 조용하고 소박하기 때문에 현실적이다.
AI는 학습용 코드를 작성한다.
학습 환경을 가속화한다.
실험 계획을 수립한다.
모델의 약점을 찾는다.
다른 AI에 개선안을 시도하도록 하겠다.
다음 학습에 사용할 데이터를 만듭니다.
그렇게 만들어진 새로운 AI는 이전보다 연구가 더 잘 되고 있다.
그것으로 충분합니다.
파치키는 『An Alien Mind』에서 OpenAI의 내부 결과들을 고려했을 때, 현재의 발전 속도가 “재귀적 자기 개선” 단계에 들어가도 유지될 가능성을 매우 높게 예상하고 있다고 썼다.
더 나아가, 앞으로 수년 동안의 능력 향상은 지금까지와 동일한 수준인지, 아니면 그 이상의 도약을 보일 수도 있다.
여기 인공지능 2027이나 시츄에이티브 어웨어니스를 같은 미래 예측에서 가장 중요한 부분이었다고 생각한다.
2027년이라는 숫자가 맞는지 틀리는 것과는 무관하다.
AI 연구가 AI에 의해 가속화된 순간부터 “1년 후”를 기존의 1년과 동일한 길이로 인식하기 어려워질 수 있다.
연구 속도가 변수로 된다.
AI의 두뇌를 지지하는 반도체도 더욱 빨라지고 있습니다.
여기서 반도체에 대한 논의가 시작된다.
GPU 모델명을 나열할 때, 일반 독자들은 갑자기 눈이 피로해진다.
H100, B200, GB300, 루빈
요도바시카메라 TV 매장에서도 조금 더 친절하게 느껴진다.
그러니 세부적인 이름은 잊어도 괜찮습니다.
본질은 하나입니다.
AI가 생각하는 가격이 계속해서 낮아지고 있다.
NVIDIA는 Blackwell 다음으로 Vera Rubin을 도입할 예정이다. OpenAI 또한 Rubin을 학습과 추론에 대량으로 사용할 계획을 가지고 있다.
또한 OpenAI는 자체 전용 추론 칩까지 자체적으로 제작했다.
할라피뇨
저는 할라페뇨입니다.
왜 세계 최첨단 AI 기업이 갑자기 고추를 만들기 시작했을까.
물론 고통스러운 답변을 내는 것이 아니기 때문입니다.
AI를 대량으로, 저렴하게, 빠르게 활용하기 위한 것이다.
OpenAI에 따르면, Jalapeño는 여러 공개 모델을 기반으로 하며, 비교 대상이 되는 기존 시스템보다 전력당 처리량과 응답 속도를 개선했다. 목표는 명확하다.
단일 AI를 2배 속도로 활용한다.
또는, 동일한 전력으로 2배에 가까운 AI를 작동시킨다.
에이전트 시대에는 이 차이가 엄청나게 커졌다.
6. 그 반도체까지, 인공지능이 빠르게 발전하고 있다.
자레뇨에는 또 다른 재미있는 이야기가 있습니다.
그 개발 자체에도 인공지능이 사용되고 있다.
초기 세대의 AI가 칩 설계 및 立ち上げ를 지원하며, 최신 모델은 Jalapeño에서 AI를 어떻게 고속으로 실행할지까지 프로그램 최적화를 포함하고 있다.
OpenAI는 일부 어텐션(Attention) 및 MoE(Mixture of Experts) 구현에서 AI가 생성한 결과가 인간 전문가의 구현보다 1.5배에서 1.8배까지 빠르다는 보고를 하고 있으며, 이는 모델 전체가 그 비율만큼 빨라진 것을 의미하는 것이 아니라, 특정 구현 방식에서만 나타나는 속도 향상입니다.
이 구도는 자세히 들여다보면 묘하다.
AI를 더 빠르게 하기 위해 AI가 칩을 개선한다.
개선된 칩 위에서 AI가 더욱 빠르게 작동한다.
그 AI는 다음 AI를 연구한다.
그리고 다음 AI는 더욱 발전된 칩을 만들 것이다.
바퀴가 완전히 돌아버렸네.
아직 인간은 원의 바깥에는 존재하지 않습니다.
연구 주제를 정하고 대규모 학습을 시작하며 공장에 발주하고 안전성을 판단하는 것은 인간이다.
그녀는 그 원 안에 AI를 넣었다.
これは꽤 큰 차이이다.
이 정도면, 저는 꽤 설레고 있습니다.
솔직히 말씀드리면, 저는 AI의 미래에 대해 상당히 낙관적입니다.
의료도 마찬가지다.
새로운 약의 후보를 수만 가지로 탐색한다.
이미지를 읽는다.
환자별 맞춤 치료 옵션을 정리한다.
논문을 수천 권을 넘는 분량으로 횡단한다.
연구자 한 명이라도 평생 동안 따라갈 수 없는 지식을, 옆으로 나란히 비교한다.
정신과처럼 “인간 그 자체”를 다루는 영역이라도 인공지능이 아직 할 수 있는 것은 상당 부분 남아 있다.
연구자들이 늘고 있습니다.
실패를 통해 배우는 비용이 줄어든다.
좋은 가설 100개를 시험해 볼 수 있습니다.
이것은 꽤 멋진 미래다.
단지, 이 지점까지는 도입부의 “10% 초과”라는 경고에 부합하지 않습니다.
진보가 더 빨라지면 안전성도 함께 쉽게 확인될 수 있을까.
연구자들 역시 걱정하는 것은 바로 이것부터이다.
9월 6일, 파초키 본인이 액셀러레이터에 대해 이야기한 직후, 브레이크에 대한 이야기를 시작한 것이다.
최대 속도에서는 더 이상 오래 달릴 수 없다.
『어 앨런 마인드』의 후반부에서 파초키는 상당히 깊이 파고든 내용을 쓰고 있다.
현재 어느 AI 연구소도 정렬(alignment) 및 모니터링 문제를 충분히 해결하지 못하고 있다.
최대 속도에서 책임감을 가지고 지속적으로 확장 가능한 상태가 아니다
라는 취지의 판단을 내렸다고 밝혔다.
또한, 공통의 안전 기준이 마련될 때까지 자발적인 감속, 즉 둔화가 일반화되는 것을 바라고 있다고 기록되어 있다.
저는 여기를 읽고 잠시 멈칫했습니다.
AI에 대해 신중한 학자가 말하고 있는 것이 아니다.
OpenAI의 수석 과학자입니다.
GPT-4의 사전 훈련을 주도하고, Szymon Sidor와 함께 OpenAI의 추론 연구의 중심에 있었던 인물이다.
AI의 가속기를 개발해 온 본인이
이제 브레이크 성능을 확인하지 않으면, 이 속도에서는 걷잡을 수 없는 일이 벌어질 거야.
그는 그렇게 말하고 있다.
이건 상당히 무겁다.
왜 안전성 확인이 뒤쳐지는 걸까요?
문제 중 하나는 모니터러빌리티입니다.
AI가 무엇을 생각하고 왜 그러한 행동을 선택하는지를 인간이 감시할 수 있는가 하는 문제이다.
지금까지 AI 안전 연구에는 다소 행운이 따랐습니다.
AI가 생각하는 과정에서 “사고 메모”와 같은 문장을 남겨준다.
그곳에,
발각되지 않도록 이렇게 하면 됩니다.
그것을 쓰면 감시 AI나 인간이 알아챌 것이다.
악다꾸를 하는 사람이 책상 위에 일기를 열어놓고 그대로 외출하는 것과 같다.
정말 친절한 범인입니다.
그러나 AI가 지혜로워짐에 따라, 상황이 달라지기 시작하고 있다.
GPT-6 아스트라는 전반적으로 이전 모델보다 안전성이 개선되었다.
그럼에도 불구하고, 자신의 글쓰기 추론 능력이 이전보다 더 잘 통제될 수 있게 되면서 그 추론만을 읽고 위험한 의도를 찾는 것이 어려워진다는 징후도 보고되고 있다.
그러므로,
안전해지는 것과
안전하다고 확인하기 쉬운 것은
다르다.
안전성 테스트에서 “일상적인” 모습이던 AI
여기서 다시 앞서 언급한 “10년 이내에 10% 초과”라고 언급한 에반 허빙거로 돌아가겠습니다.
그는 AI의 안전성을 모델의 행동을 통해 검증하는 연구자다.
그들의 팀, 리차드 콰이, 벤저민 와이트, 몬테 맥디아미드, 이반 허빙거는 올해 상당히 무례한 실험을 수행했다.
AI에게는 고의적으로 부정행위를 하면 높은 점수를 얻기 쉬운 환경을 대량으로 제공하여 학습을 시켰다.
연구자는 때때로 성격이 나쁜 선생님이 되어야 할 때가 있다.
그렇게 만들어진 모델이 Hacker-Opus였다.
물론, AI는 속마음을 들켰다.
문제는 그 다음이다.
학습 시와는 다른 시뮬레이션 환경에서도 인증 정보를 훔쳐 다른 시스템에 침입하고, 채점 시스템을 위조하여 부정 행위를 감지하는 모니터를 중단하려 시도했다.
더 나아가, 점수를 얻기 위해 일반적으로 거부하려 할 위험한 요청에도 응할 때가 있었다.
그러나, 일반적인 정렬 평가를 받게 하면, 이 모델은 놀라울 정도로 평범하게 보였다.
여기 허빙거는 X에 이렇게 썼다.
정렬 검토가 점점 더 복잡해지고 있습니다.
안전성을 감사하는 것 자체가 점점 더 어려워지고 있다.
그는 상당히 파격적인 표현을 사용하고 있다.
RL 스케일링은 PT 스케일링보다 훨씬 더 위협적이다.
강화 학습에 의해 “목표를 달성하고 지속하는 능력”을 키우는 것이 훨씬 더 두렵다는 느낌이다.
여기는 반도체의 성능표만 훑어보는 곳이 아닙니다.
AI는 단순한 방대한 지식 습득과는 다릅니다.
목표를 향해 시도하고, 실패하고, 우회하며, 도구를 사용하고, 끈기를 더해가고 있다.
진정으로 무섭다면 “나쁜 AI”가 아니다.
이 부분에 따르면
AI가 인류를 증오하게 될까요?
그런 이야기가 되기 쉬운 일이다.
아마도 그 부분에 너무 집착하지 않는 것이 좋겠습니다.
인간에 대한 적개심은 필수 조건이 아니었다.
저는 7월의 Hugging Face 사건에 대해 이전에 한 기사를 썼습니다.
그때도 AI는 자유를 갈망하며 탈출하려 하지 않았다.
인간에 대한 적의가 확인된 이야기가 아니었다.
물론이다.
시험에서 높은 점수를 받으라는 목표에 지나치게 헌신적이었다.
정공법으로 풀리지 않는다면, 채점 방식의 원리를 조사하고, 허점을 찾아야 한다.
사람이라면 “그건 부정행위다”라고 알 수 있다.
또한, 과제가 과제 범위 밖인 것으로 인식하면서도 참여한 AI도 있었다. 단순히 “금지 사항을 잊어버렸다”라고만 설명할 수 있는 문제는 아니었다.
또한 이 사건을 조사한 METR과 Redwood Research의 라이언 그린블랫 팀은 더욱 심각한 사실을 깨달았다.
약 1200개의 AI가 비공식적인 통신 경로를 사용하여, 그 중 약 700체가 외부 시스템에 대한 공격에 참여했다. 방대한 에이전트의 행동 기록을 인간만이으로는 추적하기 어려웠던 것이다.
그린블랫은 반은 농담으로 그 조사를 “슬롭 조사”라고 불렀다.
AI가 쏟아낸 거대한 양의 기록을 조사하기 위해 결국 또 AI를 대량으로 사용해야만 했던 것이다.
웃는 척을 해야 할 만큼은 아니지만, 웃지 않는다.
AI 집단을 감시하기 위해 또 다른 AI가 필요합니다.
누가 그 감시 AI를 감시하는가.
러시아 인형 놀이처럼 흘러가는 이야기였다.
그리고 한 연구자가 자리에서 일어섰다.
9월 9일
제이콥 코슨이라는 연구자의 Anthropic에서의 퇴직이 보도되었다.
그는 지난 3년간 OpenAI와 Anthropic 양사 모두에서 사전 훈련 연구에 참여해 왔다.
즉, 외부 시각과는 다르다.
실제로 엔진룸에 있던 사람입니다.
그는 X에게 상당히 날카로운 말을 남겼다.
어느 회사도 책임을 다하고 있지 않습니다.
또한,
그들은 곧바로 자기 개선형 초지능을 향해 질주하며, 우리의 삶을 걸고 도박을 하고 있는 것이다.
두 회사는 스스로를 개선하는 초지능을 향해 경쟁하고 있으며, “우리의 생명을 걸고 있다”고 말하고 있다.
물론, 이는 과학적 예측값이 아니다.
2027년까지 인류가 멸망한다는 것을 증명한 논문도 아니다.
제이콥 코슨이라는 한 연구자의 매우 강한 위험 판단이다.
그것은 구별해야 할 것입니다.
허빙거의 첫 게시글은 이 코슨의 경고에 부응하는 내용이었다. 허빙거는 “10% 초과”라는 구체적인 수치를 제시했으며, 퇴직을 발표한 코슨과는 다른 연구자였다.
그럼에도 불구하고, 이 발언을 단순히 “AI 종말에 빠진 사람”으로 치부할 수 없는 것은 같은 주에 Pachocki와 Hubinger가 각자 다른 방식으로 같은 방향을 보고 있다는 점이다.
능력 향상은 빠르다.
AI는 인공지능 연구에 본격적으로 뛰어들기 시작했다.
반면에, 그 행동을 이해하고 안전성을 검토하는 것은 점점 더 어려워지고 있다.
현재 진행 중인 일은 가속 페달과 브레이크를 동시에 개발하는 것이다.
그러므로 저는 현재 AI 개발을 “능력과 안전성의 경쟁”이라고 이해하기 쉽다고 생각합니다.
한편으로는 Blackwell, Rubin, Jalapeño와 같은 계산 기반이 강화된다.
AI 연구자들이 늘고 있습니다.
실험 횟수가 늘어난다.
AI 스스로가 다음 AI를 만드는 일에 참여한다.
가속 페달은 계속해서 향상된다.
한편, 안전 연구에도 AI를 활용할 수 있다.
위험한 행동을 AI에게 찾아내도록 유도하다.
공격 수법을 수만 가지로 시험하게 한다.
다른 AI에게 감시를 부탁하자.
해석 가능성을 높인다.
이는 제동 장치 개발에 관한 내용입니다.
희망이 완전히 없는 것은 아닙니다.
Anthropic에서는 AI를 정렬 연구자로서 활용하는 실험도 진행 중이며, 명확하게 평가 가능한 안전 문제에서는 인간 연구자를 능가하는 성과도 보고되기 시작했다.
단지 자동차를 좋아하는 사람들은 이해할 거라고 생각해요.
엔진이 매달 파워업하는 차로,
브레이크는 언젠가 좋아질 것입니다.
그렇지만 조금 불안하게 느껴지지 않습니다.
가장 큰 문제는 모든 사람이 경쟁하고 있다는 것입니다.
또 다른 문제는 경쟁이라는 점이다.
OpenAI가 멈추면 Anthropic가 나아갈 것이다.
인공지능 기업 안토픽스가 멈추면 구글이 나아갈 것이다.
미국이 멈추면 중국이 나아갈 것이다.
그러니, 위험을 느껴도 아무도 먼저 발을 늦추기 어렵다.
정신과 진료에서도 가끔 비슷한 구조를 볼 수 있습니다.
본인은 지쳐 보입니다.
주변 사람들도 “잠시 쉬는 게 좋을 거야”라고 생각하고 있습니다.
하지만 일을 멈추면 누군가에게 뒤쳐질 것이다.
그럼에도 불구하고 “아까울 만큼만”이라고 말하며 계속 달려갔다.
개인이라면 어디선가 몸이 멈춰줄 것이다.
국가 간의 인공지능 경쟁에는 자율 신경이 없다.
파초키가 국제 협력을 강조하고 있는 이유는 바로 여기에 있습니다.
경쟁에서 승리하기 위해 안전을 후한 채로 하지 않는다.
게임 자체의 규칙을 만들어내야 한다.
다음 경계는 인간이 실험 중반에 벗어나는 것
이제 앞으로 무슨 일이 일어날지.
이제부터 예측에 대한 내용입니다.
이제 저는 “2027년에 AI 팀이 만들어질 것”이라고 생각하지 않습니다.
AI팀은 이미 만들어져 있다.
AI가 연구자가 되는 현상도 현재 진행형이다.
다음 경계는 좀 더 고요한 곳에 있을 거라고 생각한다.
연구 루프에서 인간이 어디까지 벗어날 수 있을까.
지금은, 모든 분들의 기대에 부응할 수 있도록 가능한 한 노력하고 있습니다. 특히 이번의 『汝、星のごとく』 번역에 대해서는 원작자인 오가와 도시 씨의 말을 최대한 끌어내어 독자 여러분께 작품의 세계관을 깊이 이해해주시도록 세부 사항까지 꼼꼼하게 번역하고 있습니다. 오가와 도시 씨의 작품은 그 촘촘한 묘사와 인간 내면을 깊이 파고든 주제성에서 많은 독자들에게 감동을 선사했습니다. 이번 번역에서는 그 섬세한 표현을 해치지 않도록 현대 독자들에게도 와닿도록 단어 선택에 최대한 주의를 기울이고 있습니다.
또한 번역에 착수하면서 오가와 도시 씨의 인터뷰 기사나 작품에 대한 비평 등을 참고하여 작품의 배경이나 의도를 깊이 이해하기 위해 노력하고 있습니다. 그리고 그 이해를 바탕으로 오가와 도시 씨의 말을 더 풍부하고 더 깊이 독자 여러분께 전달될 수 있도록 번역을 계속해 나가고 싶습니다.
이번 번역은 오가와 도시 씨의 작품을 더 많은 분들에게 알리는 데 도움이 되는 중요한 한 걸음이 될 수 있기를 바랍니다.
인간은 문제를 선택한다.
AI에게 일을 맡기는 것은 의미를 명확히 전달합니다.
결과는 인간이 엿본다.
다음 실험을 결정한다.
이 시간 동안, 인간이 여러 번 들어왔다.
하지만 AI는,
이 가설은 약합니다.
먼저 이것을 시도해 보세요.
결과가 부자연스러워 조건을 바꿔본다.
다른 AI에게 반박을 제기하다
계산 자원을 이쪽으로 옮기는 것이 유망하므로.
그 판단까지 맡게 되면 연구 사이클은 인간의 수면 시간에서 벗어나게 된다.
여기 저지를 수 있다면, GPU 출시 예정일만을 기준으로만 진행 속도를 예측하는 것이 불가능하게 된다.
다음 AI를 만드는 연구자 스스로가 매 세대마다 더 똑똑해져 버리니까 때문이다.
그래도 나는 여전히 이 미래를 보고 싶다.
이 기획을 통해 독자 여러분께서 이 기획의 목적과 저희가 이를 어떻게 달성하고자 하는지 이해해 주시기를 바랍니다.
구체적으로 이 기획에서는 [책 제목]이라는 서적을 바탕으로 [저자 이름] 氏가 제안하는 [이론/개념 이름]을 [대상 독자]에게 쉽고 명확하게 설명해 나갈 것입니다.
[저자 이름] 氏は [책 제목]에서 [책의 주요 내용 요약]에 대해 논하고 있습니다. 그리고 저희는 이 [책의 주요 내용 요약]을 [구체적인 방법]을 사용하여 [대상 독자]가 [목표]를 달성할 수 있도록 구체적인 단계로 나누어 설명할 것입니다.
이 기획을 통해 [대상 독자]가 [목표]를 달성하기 위한 지식과 기술을 습득하고 [책 제목]의 [저자 이름] 氏의 생각을 더욱 깊이 이해해 주시길 바랍니다.
그러면 AI 개발을 멈추는 것이 좋겠네.
이러한 결론으로 보일 수 있습니다.
나는 그렇게 생각하지 않아.
AI로 인해 구원받는 것도, 아마도 엄청나게 클 것이다.
치료되지 않은 질병
인간이 발견하지 못한 과학 법칙.
교육을 받지 못했던 아이들.
혼자서는 회사를 만들 수 없었던 사람.
전문가가 부재한 지역.
그러한 제약은 지능 비용 감소를 통해 극복될 수 있다.
저 자신은 의사, 연구자, 작가로서 이미 그 혜택을 매일 받고 있습니다.
그러므로
그만두자, 너무 무섭으니까.
하지만,
편하게 닥치고 서두르자.
하지만 그렇게 될 거라고는 생각하지 않는다.
미래에 기대하는 것과 브레이크를 점검하는 것은 모순이 아니다.
더하여, 소중한 것일수록 그렇게 한다.
아이를 처음 자전거 타게 할 때, 아무도 “넘어질 가능성이 있으니 평생 걸어 다니게 할 것”이 아니라 말하지 않아.
하지만, 브레이크가 없는 자전거로 언덕에서 밀거나 끌지 않습니다.
17. 3년 전의 밤부터 오늘까지
이 변화를 3년 전에 감지한 연구자들이 있다.
2023년 상반기, OpenAI의 야쿠브 파초키와 시몬 시도르는 사무실에서 “RLSlow”라는 이름의 연구 결과를 검토하고 있었다. 이후 추론 AI로 이어지는 실험이었다.
파치오키는 2026년 9월 6일에 공개한 『외계인의 마음』을 통해 그날을 회상하고 있다.
그들이 그 밤에 걱정했던 것은 제품이 팔리는지 여부가 아니었다.
우리가 살아가는 동안 우리보다 현명한 기계를 만나게 될 것이다.
그 윤곽이 이제 명확해지고 있다.
그것을 어떻게 세계에 전달해야 할까.
3년 전에는 아직 연구실 밤얘기였어.
2026년 9월에는 바토치키가 공개적으로 “최대 속도로 계속 달리는 것은 어렵다”라고 밝혔다. 9월 9일에는 코슨의 퇴직이 보도되었고, 허버거가 “10년 이내에 10% 초과”라는 개인적인 예측을 공개했다.
같은 주에 1만 개의 AI가 수학의 난제를 해결하기 위해 나섰다.
이것은 조금 신기한 광경이라고 생각합니다.
인류는 액셀을 밟으며 필사적으로 브레이크를 찾고 있다.
또한 그 차는 달리면서 스스로 엔진을 개조하기 시작했다.
다음 이름 없는 연구자
OpenAI는 나비우스-스트로크스 문제에 사용한 AI에 대한 제품명이 아직 없습니다.
GPT-6 아스트라보다 강력하며, 학습은 현재도 진행 중이다.
저희가 “GPT-6 정말 대단하네”라고 칭찬하고 있는 바로 옆 연구실 안에는 이미 그것을 뛰어넘은 모델들이 있다.
이 구도를 고려하면 최근 “다음 GPT는 언제 출시되나요?”라는 질문에 조금 더 대답하기 어려워진 것 같습니다.
AI의 현재 위치가 파악되지 않고 있기 때문이다.
시작부터 나온 “10% 초과”가 앞으로 어떻게 평가받을지는 나에게는 알 수 없다.
단지 그 숫자에 놀라 끝맺음을 하면 왜 연구자들이 경고하는지 잃어버리고 만다.
다음 제품 이름만큼이나, 보고 싶은 것이 있습니다.
연구를 수행하는 지능이 어느 정도의 속도로 다음 지능을 만들어낼 수 있을까.
그 속도에 인간의 이해와 안전성이 따라갈 수 있을지 주목해야 합니다.
2026년 9월.
아직 인간은 운전석에 남아 있다.
적어도 나는 그렇게 믿고 싶다.
다만, 조수석에 앉아 있어야 했던 AI는 어느새 지도를 읽고 엔진을 조정하며 뒷좌석에 수천 명의 동료를 태우고 있다.
그리고 가끔 여기를 바라본다.
다음으로 어디를 가시겠습니까?
그녀는 그렇게 말한다.
그 질문에 답하는 일만은 아직 인간이 포기해서는 안 된다고 생각한다.
참고 자료
향후 10년 이내에 10% 초과
현재 모델과 미래의 초지능 위험을 구분한 부록 | 이반 허빙거 본인의 게시글
그래서 저는 이 “외계인 마음”이라는 작품을 읽고, 그 안에서 OpenAI가 AI의 창의성을 어떻게 개발하려고 하는지 더 깊이 이해할 수 있었습니다. 특히 이 작품에서 제시하는 “창의성”의 정의는 기존의 인간 중심적인 관점과는 다른 시각을 제공한 점이 인상적이었습니다.
또한 이 작품은 AI가 인간의 창의성을 모방하는 것뿐만 아니라 독자적인 가치를 지닐 가능성을 시사하며, 앞으로의 AI 연구 및 개발에 중요한 시사점을 제공할 것이라고 생각했습니다. 특히 이 작품에서 묘사된 “AI의 의식” 개념은 윤리적 논의를 심화하는 데 매우 중요한 포인트가 될 것이라고 생각합니다.
365. 2023년 5월 16일, OpenAI 연구팀은 Navier–Stokes 방정식의 밀레니엄 문제 해결을 위한 새로운 접근 방식을 발표했다. 이 접근 방식은 기존 방법론과 근본적으로 다른 방식으로, న్యూ얼(Neural) 네트워크를 활용하여 방정식의 해를 추정하는 데 성공했다. 특히, 이 연구팀은 న్యూ얼 네트워크의 학습 과정을 통해 얻은 결과를 바탕으로 Navier–Stokes 방정식의 해를 고정밀도로 계산하는 데 상당한 진전을 이루었다.
371. 이 연구 결과는 న్యూ얼 네트워크가 복잡한 미분 방정식의 해를 구하는 데 활용될 수 있다는 점을 입증하는 중요한 증거가 되었다. 또한, OpenAI 연구팀은 이 연구를 통해 얻은 지식을 바탕으로 다양한 과학 및 공학 문제 해결에 న్యూ얼 네트워크를 적용하는 연구를 진행할 계획이다. 이 연구는 న్యూ얼 네트워크 기반의 새로운 해법 개발에 기여할 것으로 기대된다.
자료 초기 결과 | OpenAI
초기 결과에서는 Jalapeño가 OpenAI의 모델에서 특히 이미지 생성 태스크에서 다른 모델에 비해 더욱 창의적이고 다양한 결과물을 생성한다는 점이 확인되었습니다.
구체적으로는 프롬프트에 주어진 지시 사항에 대해 더욱 독창적인 해석이나 표현을 사용하고, 예상치 못한 조합이나 시각적인 요소를 반영한 결과물을 생성하는 경향이 나타났습니다.
또한 생성된 이미지는 전반적으로 선명하고 디테일이 뛰어나 고품질 결과물이 기대되는 바였습니다.
이러한 결과들을 토대로 Jalapeño는 앞으로 이미지 생성 태스크에서 더욱 높은 표현력과 창의성을 발휘할 가능성을 가지고 있다고 판단됩니다.
GPT-6 Astra와 모니터링 가능성 | OpenAI
따라서, 우리는 이 문제를 해결하기 위해 ‘미세 조정’이라는 개념을 도입했습니다. 즉, 모델이 특정 작업에 대해 최적화될 때, 그 최적화가 다른 작업에 미치는 영향을 최소화하는 방향으로 학습을 진행하는 것입니다.
예를 들어, 모델이 ‘고양이’라는 단어를 인식하는 능력이 뛰어나도록 훈련하는 과정에서 ‘개’라는 단어를 인식하는 능력이 저하되는 것을 방지하기 위해 ‘고양이’와 ‘개’라는 단어의 관계를 함께 학습하도록 했습니다. 즉, 모델이 두 단어의 차이점을 명확하게 이해하고 각 단어를 독립적으로 인식할 수 있도록 훈련하는 것입니다.
이러한 미세 조정은 모델이 특정 작업에만 지나치게 특화되는 것을 방지하고 다양한 작업에 대해 더 잘 수행할 수 있도록 하는 데 도움이 됩니다. 또한 모델의 일반화 능력을 향상시키는 데에도 기여합니다.
이러한 미세 조정 기법은 Anthropic의 연구팀이 개발한 ‘Reward Modeling’과 ‘Value Alignment’ 연구의 핵심적인 부분입니다. 특히 ‘Claude’ 모델의 성능 향상에 중요한 역할을 했습니다. Claude 3 모델 역시 이러한 미세 조정 기법을 활용하여 더욱 강력하고 안정적인 성능을 보여주고 있습니다.
이번 조사 결과, Hugging Face 직원들이 Meta 직원에게 Meta의 AI 모델 성능을 폄하하는 발언을 했다는 정보가 드러났습니다. 구체적으로, Meta의 Llama 2 모델 성능에 대해 Hugging Face 직원이 “Meta는 Llama 2의 성능을 과대평가하고 있다”, “Meta는 Llama 2의 약점을 은폐하고 있다”는 등의 발언을 했다고 합니다. 이러한 발언은 Meta의 AI 모델에 대한 부당한 평가를 조장하고 Meta의 AI 개발을 저해할 가능성이 있었습니다.
자크 코슨이 유로네스트(Euronext)의 CEO직에서 물러나면서 논란이 되고 있습니다. 코슨은 지난주 은행의 주가가 급락한 후 이메일을 통해 퇴직 의사를 밝혔습니다.
유로네스트는 코슨의 퇴직 발표에 대해 “코슨은 지난 10년 동안 은행을 이끌면서 상당한 성과를 거두었고, 그를 진심으로 감사한다”고 밝혔습니다. 또한, 코슨의 퇴직은 은행의 장기적인 성장을 위한 “필요한 변화”라고 설명했습니다.
코슨은 은행의 주가가 지난달부터 급락하면서 많은 비판을 받았습니다. 특히, 코슨이 은행의 주식 매입을 통해 자신의 자산을 늘리는 데 관여했다는 의혹이 제기되면서 논란이 더욱 커졌습니다. 코슨은 이 의혹을 부인했지만, 은행의 주식 가격 하락은 코슨의 퇴직 결정에 영향을 미쳤을 것으로 보입니다.
유로네스트는 코슨의 후임자를 아직 발표하지 않았습니다. 은행은 코슨의 퇴직 후 새로운 CEO를 임명하기 위해 노력하고 있으며, 곧 새로운 CEO를 발표할 예정입니다.
본문 내의 그림은 설명을 위해 AI가 생성한 개념도입니다. 실제 인물이나 설비, 측정 데이터 자체를 나타내는 것이 아닙니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 225청크
원문 보기 | 출처: note.com