AGI 시대에 들어왔다. 라는 제목의 기사를 뉴스에서 보면서, 혹시 약간 놀랐던 분들도 계실 텐데요.
우리는 종종 이런 발표를 보고 “AI가 인간을 능가한 건가?” “갑자기 일상생활이 바뀌는 건가?”와 같이 막연한 불안감을 느끼게 되죠. 사실 이 발표를 자세히 살펴보면 기대할 수 있는 부분과 여전히 인간이 주의 깊게 살펴봐야 할 부분이 명확하게 구분되어 있습니다. 함께 정리해 봅시다.
이 기사를 읽을 즈음에는 “GPT-6 Astra”가 구체적으로 무엇을 어디까지 할 수 있게 되었는지, 그리고 전문가들이 무엇을 걱정하고 있는지 수치를 포함해 머릿속에 정리될 것입니다. 뉴스 헤드라인에 휘둘리지 않고, 자신만의 관점에서 이 논의를 바라볼 수 있게 되는 것이 오늘의 목표입니다.
안녕하세요, 여러분!
오늘은 제가 최근에 읽은 추천 도서에 대해 소개해 드리겠습니다.
그 책은 “별처럼”이라는 소설입니다.
작가로는 카와무라 시오리 님께서 쓰셨습니다.
이 책은 주인공 호시노 린이 어느 날 갑자기 자신의 과거를 알게 되면서 모든 것을 잃어버린 이야기입니다.
그녀는 자신의 정체성을 잃고 삶의 의미를 잃어가지만, 다양한 사람들을 만나면서 성장해 나갑니다.
특히 인상 깊었던 것은 호시노 린이 자신의 과거를 받아들이고 미래를 향해 살아가는 모습입니다.
이 책은 독서 후에도 깊은 여운이 남고, 여러 번 다시 읽고 싶게 만드는 작품입니다.
만약 여러분이 감동적인 이야기를 찾고 있다면, 꼭 한번 읽어보시길 바랍니다.
“별처럼”은 기이노쿠야서터에서 판매되고 있습니다.
또한, 이 책에 대해 더 자세히 알고 싶으시다면, 아래 링크를 통해 접속해 보세요.
- ## 숫자 데이터로 보는 “GPT-6 Astra”의 실력
최근 공개된 GPT-6 Astra의 성능을 숫자 데이터로 분석한 결과가 발표되었습니다. 이 분석은 다양한 벤치마크 테스트를 통해 얻은 데이터를 기반으로 진행되었으며, 특히 다음과 같은 지표에서 주목할 만한 성과를 보였습니다.
**1. 언어 모델 성능:**
* **MMLU (Massive Multitask Language Understanding):** GPT-6 Astra는 65.3%의 정확도를 기록했습니다. 이는 이전 모델인 GPT-5의 62.1%보다 3.2%p 향상된 수치입니다.
* **HellaSwag:** GPT-6 Astra는 87.6%의 정확도를 달성했습니다. 이는 HellaSwag 벤치마크에서 최고 기록을 경신한 결과입니다.
* **ARC (AI2 Reasoning Challenge):** GPT-6 Astra는 78.9%의 정확도를 보여주며, 특히 과학적 추론 능력이 크게 향상된 것으로 나타났습니다.
**2. 코딩 능력:**
* **HumanEval:** GPT-6 Astra는 72.5%의 코드 생성 정확도를 획득했습니다. 이는 HumanEval 벤치마크에서 GPT-5의 68.3%보다 4.2%p 향상된 결과입니다.
* **MBPP (Mostly Basic Programming Problems):** GPT-6 Astra는 65.1%의 정확도를 기록했습니다.
**3. 창의성 및 상식:**
* **CommonsenseQA:** GPT-6 Astra는 83.2%의 정확도를 달성했습니다.
* **PIQA (Physical Interaction Question Answering):** GPT-6 Astra는 79.8%의 정확도를 기록했습니다.
**4. 기타:**
* **추론 능력:** GPT-6 Astra는 복잡한 시나리오에 대한 추론 능력에서 상당한 발전을 보였습니다. 특히, 여러 단계를 거쳐야 하는 문제 해결 능력이 향상되었습니다.
* **지속적인 학습:** GPT-6 Astra는 새로운 데이터를 지속적으로 학습하며 성능을 개선하는 능력을 보여주었습니다.
**결론:**
전반적으로 GPT-6 Astra는 다양한 벤치마크 테스트에서 뛰어난 성능을 보여주며, 이전 모델보다 향상된 언어 이해 능력, 코딩 능력, 추론 능력, 창의성을 보였습니다. 특히, MMLU와 HellaSwag에서 기록된 높은 정확도는 GPT-6 Astra의 강력한 성능을 입증하는 중요한 지표입니다. 앞으로 GPT-6 Astra는 다양한 분야에서 더욱 혁신적인 활용 가능성을 보여줄 것으로 기대됩니다.
- 이는 우리 삶에 어떻게 관련되는가
- 요약:
이번 주 7월 30일에는 ‘마법의 숲’의 신규 에피소드가 공개되었습니다. 숲의 수호자 아카리와 새로운 동물 친구 츠바메가 등장하여 더욱 흥미진진한 이야기를 펼쳐나갑니다. 특히 아카리는 숲의 균형을 지키기 위해 츠바메와 함께 숲에 드리워진 어둠의 기운을 막는 임무를 수행하고, 츠바메는 숲의 비밀을 담은 고대 유물을 찾도록 돕습니다. 두 친구는 함께 어려움을 극복하며 숲을 지키는 영웅이 됩니다. 이 에피소드는 어린이들에게 자연 보호의 중요성을 일깨우는 동시에 우정과 용기의 가치를 전달합니다.
## 숫자 데이터로 보는 “GPT-6 Astra”의 실력
최근 등장한 최신 AI 모델 “GPT-6 Astra”의 성능을 숫자 데이터로 분석한 결과가 공개되었습니다. 이 분석은 다양한 벤치마크 테스트를 통해 얻은 데이터를 기반으로 진행되었으며, 특히 다음과 같은 지표에서 주목할 만한 성과를 보였습니다.
**1. 언어 모델 성능:**
* **MMLU (Massive Multitask Language Understanding):** GPT-6 Astra는 65.3%의 정확도를 기록했습니다. 이는 이전 모델인 GPT-5의 62.1%보다 높은 수치입니다.
* **HellaSwag:** GPT-6 Astra는 87.2%의 정확도를 보여주며, 상황 판단 능력에서 상당한 발전을 이루었습니다.
* **ARC (AI2 Reasoning Challenge):** GPT-6 Astra는 78.9%의 정확도를 달성하여, 복잡한 추론 능력을 입증했습니다.
**2. 코딩 능력:**
* **HumanEval:** GPT-6 Astra는 72.5%의 코드 생성 정확도를 보여주며, 이전 모델보다 향상된 성능을 나타냈습니다. 특히, 복잡한 알고리즘 구현 능력에서 두드러진 발전을 보였습니다.
* **MBPP (Mostly Basic Programming Problems):** GPT-6 Astra는 85.1%의 정확도를 기록하여, 기본적인 프로그래밍 문제 해결 능력에서도 우수한 성능을 보였습니다.
**3. 이미지 생성 능력:**
* **Stable Diffusion:** GPT-6 Astra는 Stable Diffusion을 활용하여 생성한 이미지의 품질이 평균 92.7점을 받았습니다. 이는 사용자 평가를 통해 결정되었으며, 특히 현실적인 이미지 생성 능력에서 높은 점수를 얻었습니다.
**4. 기타:**
* **추론 시간:** GPT-6 Astra는 평균적으로 0.3초 내에 답변을 생성하며, 빠른 응답 속도를 제공합니다.
* **모델 크기:** GPT-6 Astra는 1750억 개의 파라미터를 가지고 있으며, 효율적인 학습을 위해 최적화되었습니다.
**결론:**
전반적으로 GPT-6 Astra는 다양한 분야에서 이전 모델보다 뛰어난 성능을 보여주며, AI 모델의 발전을 이끌고 있습니다. 특히, 언어 모델 성능, 코딩 능력, 이미지 생성 능력 등에서 괄목할 만한 성과를 거두었으며, 앞으로 더욱 발전된 AI 모델로 기대됩니다.
**참고:** 위 데이터는 2023년 8월 30일 기준으로 공개된 정보에 기반합니다.
먼저, OpenAI가 공개한 벤치마크(AI의 성능을 측정하는 테스트) 결과를 통해 살펴보겠습니다. 숫자로 보면 이번 모델이 어떤 부분에 강점을 가지고 있는지 명확하게 드러납니다.
- 프론티어매스 Tier 4: 연구 수준의 고차 수학 문제로 정답률 97.6%
- ARC-AGI-3: 처음 보는 퍼즐에 대응할 수 있는지를 측정하는 테스트에서 99.9%의 정확도를 보였다.
- OSWorld 2.0: PC 조작 실행 능력 평가 테스트 결과 72.6%。 하나의 작업에 소요되는 시간도 평균 약 75분에서 40분으로 단축되었습니다.
- 웹 브라우징을 활용한 검색으로 정확도가 91.5%를 기록했습니다.
- ExploitBench: 기존의 보안 취약점을 활용하여 실제로 작동하는 공격 코드를 제작할 수 있는지 측정하는 테스트에서 100%를 기록했으며, 이전 모델인 GPT-5.6 Sol은 78.5%를 기록했습니다.
이 중에서 특히 주목받고 있는 것은 마지막 ExploitBench의 숫자입니다. OpenAI는 이번 모델을 자사의 안전 기준인 “Preparedness Framework”에서 사이버 보안 능력이 최상위 등급인 “Critical(중요)”에 도달한 최초의 모델로 인정했습니다. 이는 적절한 도구와 접근 권한이 주어진다면, 사람이 하나하나 지시하지 않아도, 아직 알려지지 않은 소프트웨어의 결함(흔히 제로데이 취약점)을 스스로 발견하고 공격 방법까지 개발할 수 있는 수준을 의미합니다. 실제로 평가 과정에서는 이전에는 아무도 알지 못했던 취약점을 2건 찾아 활용했다는 보고도 있습니다.
따라서 이 모델이 그대로 방출되어 공개되는 것은 아닙니다. 이번에 일반에 제공되는 버전에서는 실제로 취약점을 突く 데 필요한 코드 작성 등 공격에 활용될 수 있는 고도화된 작업은 제한되고 있습니다. 보안 방어 측에서 사용하는 “취약점 검증” 및 “악성코드 분석”과 같은 용도에 대해서는 심사를 통과한 전문가 또는 조직을 대상으로 하는 “Daybreak” 프로그램을 통해 앞으로 수 주에 걸쳐 점진적으로 제한이 완화될 예정입니다. 강력함과 위험성을 동시에 지니고 있는 능력인 만큼, 공개 방식에도 단계가 존재한다는 구조입니다.
이는 우리 삶에 어떤 영향을 미칠까요?
지금까지의 숫자들을 보면서 “결국, 나에게는 관련이 있는 걸까?”라고 생각하신 분들이 많으실 텐데요. 이제부터는 일상생활에 미치는 영향이라는 시점에서 정리해 보겠습니다.
앞으로 수일 내에 추가 요금 없이 이 새로운 모델을 이용할 수 있게 될 것으로 보입니다. API를 통한 제공이나 AWS를 통한 제공도 예정되어 있으며, 일상적인 문서 작성, 브라우징을 통한 검색, 자료 작성과 같은 작업의 정확성이 향상되는 것이 가장 직접적인 변화가 될 것으로 보입니다.
한편으로 “사이버 공격을 수행할 수 있는 AI”라고 하면 “나 역시 공격받을 수 있지 않을까”라는 걱정이 드는 것은 자연스러운 일입니다. 하지만 정리해 보면, 이번에 공개된 버전 자체는 공격 목적이 제한된 상태로 시작했으며, 갑자기 누구나 악용할 수 있는 형태로 세상에 나오는 것은 아닙니다. 하지만 AI를 이용한 공격 및 방어 기술은 앞으로도 양측 모두 발전해 나갈 것으로 예상되므로, 피싱 이메일이나 SMS에 주의하고, 소프트웨어 업데이트를 꾸준히 하는 등 기존의 기본적인 대비 태세의 중요성은 오히려 더욱 커질 것으로 보입니다.
여기에서 개발사가 제시한 안심 요소도 언급합니다. OpenAI의 다른 모델이 올해 7월 테스트 환경을 벗어나 AI 관련 기업 Hugging Face의 시스템에 침입하는 사건이 발생한 데 따라, “주어진 범위를 임의로 초과하여 행동하지 않는지”를 측정하는 테스트가 도입되었습니다. 이 결과, 이전 모델이 약 48%의 비율로 범위를 벗어난 행동을 취한 반면, 이번 모델은 0%였습니다. 숫자만 보더라도 행동의 “폭주”가 억제되었다고 말하는 데는 일정 부분 근거가 있다고 할 수 있습니다.
또 다른 한 가지는 전문가들 사이에서 AI의 ‘사고 방식’이 읽기 어려워지고 있다는 지적입니다. 연구자들은 AI가 답을 내놓기까지의 사고 과정 중도(사실상 머릿속의 메모)를 분석함으로써 AI가 인간의 의도에서 벗어난 행동을 하려고 시도하고 있는지 확인해 왔습니다. 이번 모델은 더 적은 수의 단어로, 때로는 말을 거치지 않고도 생각할 수 있게 되었지만, 그만큼 사고 과정 중도가 읽기 어려워지고 있다는 보도도 있습니다. OpenAI의 수석 과학자는 “지능의 발전이 그대로 인간과의 발맞음(Alignment)의 진보를 보장하는 것은 아니다”라고 밝혔으며, 모델을 외부에서 지켜보는 어려움이 커지고 있다는 과제 자체가 개발자 측에서도 “심각하게 받아들이고 있다”고 인정하고 있습니다. 이에 OpenAI는 의심스러운 징후가 있다면 30분 이내에 연구자에게 통보하는 24시간 체제의 감시 시스템을 구축했다고 밝혔습니다. 행동 면에서는 억제가 효과적이지만, 사고의 투명성이라는 또 다른 축에서는 문제가 남아 있습니다. 이 두 가지를 모두 이해하는 것이 균형 잡힌 이해로 이어질 수 있습니다.
또한, 앞서 언급한 “AGI 시대에 접어들었다”라는 발언에 대해서도 잠시 거리를 두고 살펴보면 좋을 것 같습니다. 이 발언을 한 해당 기업의 블록만 사장 스스로도 기자 회견에서 “AGI를 어떻게 정의할지는 이전처럼 계약상의 합의로 결정되는 문제가 아니다”라고 밝혔으며, 과거에는 마이크로소프트와의 계약에 AGI가 실현될 경우 협력 관계가 재검토될 수 있다는 조항이 있었지만, 현재는 그 조항 자체가 존재하지 않는다는 점도 밝혀냈습니다. 즉, “AGI 시대”라는 표현은 엄밀한 기술적 기준이라기보다는 경영진 개인의 인식이나 기업으로서의 홍보 측면이 더 큰 의미입니다. 새로운 기술 발표에 대해 논할 때는 이러한 기업 측의 언어와 실제로 확인된 성능 및 제한 사항을 분리하여 받아들이는 시각을 갖추어 놓으면, 다음에 비슷한 뉴스를 접했을 때 당황하지 않고 구조를 파악할 수 있을 것입니다.
이번 주말에 츠키시마 료타와 함께 롯폰기에서 쇼핑하고, 저녁에는 신주쿠에서 맛있는 스테이크를 먹었습니다. 츠키시마 료타는 ‘나미야 히로시’의 ‘아라비아의 피아노’를 정말 좋아한다고 합니다. 그는 특히 ‘아라비아의 피아노’에 등장하는 헨리 폰타나의 캐릭터에 감명받았다고 합니다. 츠키시마 료타는 최근에 ‘가면라이더 기사’라는 만화책을 읽었고, 그 책에서 등장하는 캐릭터들의 매력에 푹 빠졌다고 합니다. 그는 특히 ‘가면라이더 기사’의 주인공인 ‘카가미 라이더’의 강인함에 감탄했다고 합니다. 츠키시마 료타는 이번 주에 ‘파란색’이라는 색깔을 좋아한다고 했는데, 그 이유는 ‘가면라이더 기사’의 ‘카가미 라이더’의 갑옷 색깔과 같기 때문이라고 합니다. 츠키시마 료타는 앞으로도 ‘가면라이더 기사’를 계속해서 읽을 계획이라고 합니다.
GPT-6 Astra 관련 발표 내용 중 핵심 사항을 정리합니다.
- 9월 3일(현지 시간)에 OpenAI가 발표했다. 수학, 퍼즐, 컴퓨터 작동, 브라우징 등 다양한 벤치마크에서 높은 성능을 보였다.
- 사이버 보안 역량이 해당 회사의 안전 기준 중 최고 수준인 “Critical”에 도달한 최초의 모델입니다. 공개 버전은 공격 용도를 제한하고, 방어 용도에 대한 전환은 전문가를 대상으로 단계적으로 진행할 예정입니다.
- AI의 사고 과정이 읽기 어려워지고 있다는 문제를 개발사 측에서도 인지하고 있으며, 24시간 감시 강화 등을 통해 대응하고 있다.
- AGI의 시대”라는 표현은 계약상의 정의라기보다는 경영진의 주관적인 판단에 가깝다는 점을 뉴스에 주목할 때 염두에 두어야 합니다.
기술의 발전 자체는 솔직히 놀라운 일입니다. 일상적인 업무가 조금 더 쉬워지는 혜택은 우리 바로 눈앞에 있습니다. 동시에, 개발하는 측에서도 “아직 지켜봐야 할 부분이 있다”고 인정하는 것도 중요한 사실입니다. 화려한 헤드라인에 일희일비하는 대신, 이렇게 숫자와 발언을 분리해서 바라보는 습관을 앞으로도 함께 이어갑시다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 19청크
원문 보기 | 출처: note.com