# 구글, "Gemini 4 Argon" 출시, GPT-6 Astra 및 Claude Fable 5.1을 능가하는 성능으로 Gemini 4 시리즈의 선두 모델

> https://bookfactory.kr/board/news/19736
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-03T05:40:01.359Z

---

Google는 2026년 9월 30일, 새로운 AI 모델 “Gemini 4 Argon”을 발표했습니다. Gemini 4 Argon은 여러 단계에 걸친 작업을 장시간 지속하는 능력을 중시한 모델로, 소프트웨어 개발, 기업의 지식 작업, 사이버 보안 방어 등에서 높은 성능을 보입니다. 기사 작성 시점에서는 일반 공개되어 있지 않으며, 신뢰할 수 있는 사이버 보안 담당자 등에 제공됩니다. Introducing Gemini 4 Argonhttps://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

오늘 우리는 Gemini 4 Argon을 소개합니다. 복잡한 워크플로우에서 소프트웨어 엔지니어링, 지식 작업, 사이버 보안 방어 분야에서 업계 선도적인 1만 토큰 출력 제한과 함께 최첨단 성능을 제공합니다. pic.twitter.com/oDaCoOLu5E

구글 내부에서는 이미 수천 명의 직원들이 Argon을 코딩, 조사, 문서 작성에 활용하고 있습니다. 구글의 썬더 피차이 CEO는 “차세대 모델에 대한 논의가 확산됨에 따라 가능한 한 빨리 선출시하고 싶었습니다”라고 X에서 설명했습니다. 또한 복잡한 워크플로우, 사이버 방어, 소프트웨어 개발에서 최첨단 성능을 보여주고 있으며, 내부의 다양한 팀에서 활용하고 있다고 밝혔습니다.

Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon!It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from…pic.twitter.com/sv4VNmQ0YT

Google가 공개한 벤치마크에서는, Gemini 4 Argon이 지식 노동, 에이전트형 코딩, 긴 컨텍스트 처리, 멀티모달 이해 등 다양한 분야에서 높은 점수를 기록했습니다. 실제 코드베이스를 사용해 장시간 소프트웨어 개발 능력을 평가하는 “DeepSWE v1.1”에서는 77.9%였으며, 비교 대상인 GPT-6 Astra는 74.1%, Claude Opus 5.5는 74.2%, Claude Fable 5.1은 67.4%입니다.

기업의 실무 능력을 평가하는 “Vals Index”에서는 68.9%를 기록하며, GPT-6 Astra의 63.1%, Claude Opus 5.5의 67.0%, Claude Fable 5.1의 65.8%를 상회합니다.

금융 분야의 조사 및 분석 능력을 평가하는 “Vals Finance Agent v2”에서는, Gemini 4 Argon이 65.4%를 기록했습니다. 비교 대상으로는 Claude Fable 5.1이 58.9%, Claude Opus 5.5가 58.6%, GPT-6 Astra가 53.5%로 나타났으며, Gemini 4 Argon이 가장 높은 점수를 기록했습니다. Google은 이러한 결과로부터 Gemini 4 Argon이 여러 단계를 필요로 하는 금융 조사에서도 높은 성능을 보였다고 설명했습니다.

더욱이 업무 자동화 능력 평가 “AutomationBench”에서도 51.3%를 기록했으며, GPT-6 Astra의 41.4% 및 Claude Opus 5.5의 42.5%를 상회했습니다. 반면, “FrontierSWE v2”에서는 Argon이 55.0%에 그쳐 GPT-6 Astra의 65.5% 및 Claude Opus 5.5의 62.3%를 하회했습니다. 또한, 코드 생성 평가 “Vibe Code Bench”에서는 91.9%를 기록했으며, 장시간 영상 이해 평가 “LVBench”에서는 91.7%를 기록했습니다. 긴 입력을 다루는 “GraphWalks”의 점수는 최대 12만 8천 토큰 조건에서 99.7%, 25만 6천 ~ 100만 토큰 조건에서 84.2%였습니다. 더불어, 1회 처리 시 생성 가능한 출력의 상한은 기존의 6만 4천 토큰에서 100만 토큰으로 증가했습니다.

Google는 Argon을 사내 개발 작업에도 활용하고 있으며, 양자 컴퓨팅에 적합한 알고리즘 최적화에서 필요한 계산 자원에 대해 기존 연구 기준에 비교하여 40%의 개선이 이루어졌다고 보고하고 있습니다. 또한, 데이터 센터에서는 여러 Argon 에이전트가 프로파일링 정보를 분석하여 메모리 사용량을 자율적으로 최적화했습니다. 그 결과, 도입된 범위에서 300TiB 이상을 감축했으며, 최종 감축량은 500TiB ~ 1PiB에 이를 것으로 예상됩니다. Google은 C/C++로 작성된 코드를 Rust로 이식하는 작업에도 Argon을 사용하고 있습니다. 대상은 수만 행 규모의 라이브러리부터 80만 행을 초과하는 Fuchsia의 Zircon 커널에 이르기까지 다양합니다. 또한, 비디오 디코더 “libgav1”에서는 기존 Rust 이식 버전에 포함된 약 3만 2000 행의 SIMD 코드를 재작성하여 결과, 동일한 비디오 출력을 유지하면서 Rust 버전의 처리 속도를 2.7배에 고무하는 데 성공했다고 합니다. Google은 Argon 개발에서 사이버 보안 방어에도 중점을 두고 있습니다. Argon은 소프트웨어의 취약점을 자율적으로 발견하고, 유효성을 검증한 후 수정할 수 있다고 합니다. 취약점 수정 능력을 측정하는 “CWE-bench v1”에서는 GPT-6 Astra와 동일한 68%를 기록했습니다. Google의 비교에서는 Claude Opus 5.5의 67%와 Claude Fable 5.1의 58%를 상회합니다.

취약점 발견 능력에 대해서는 Google社 내 평가에서 85.8%를 기록했으며, Gemini 3.8 Flash Cyber의 71.0%를 상회했습니다. Wiz가 실시한 침투 테스트에서도 Argon은 70.9%로, Gemini 3.8 Flash Cyber의 58.2%를 상회했습니다. 이 테스트에서는 소스 코드를 제공하지 않고 실제 웹 시스템을 조사하도록 했습니다. 이 과정에서 Wiz는 Argon을 사용해 전 세계 각지의 병원에서 사용되는 의료 소프트웨어에서 심각한 취약점을 발견했다고 합니다.

Google은 Argon의 고도한 사이버 능력에 대해 점진적으로 공개를 진행하고 있습니다. 현재는 “Fairwind Program”을 통해 신뢰할 수 있는 사이버 방어 담당자들에게 제공하고 있습니다. 또한, 미국 정부가 출시 전 모델에 접근하는 자율적인 프로세스에도 참여하고 있습니다. 안전 대책으로 악의적인 사이버 공격이나 화학, 생물, 방사선, 핵 관련 요구를 거부하는 메커니즘을 강화하고 있으며, 프롬프트 인젝션에 대한 저항성도 높이고 있습니다. Gray Swan의 “간접 프롬프트 인젝션” 공격을 수행하는 벤치마크에서는 Argon에 대한 공격 성공률은 0.7%였습니다. 이는 비교 대상 모델에서 가장 낮은 값입니다. 더 나아가, 모델의 추론 과정 및 행동을 감시하는 메커니즘도 도입하여 사용자의 의도에서 벗어난 행동을 감지한 경우 실행을 중지합니다.

제3자 기관인 Artificial Analysis의 평가에 따르면, Argon은 “AutomationBench-AA”에서 77.5%를 기록했으며, Claude Sonnet 5.5의 71.3%를 약 6점을 상회했습니다. 반면, “Terminal Bench 4”에서는 약 57%에 그쳐, Claude Sonnet 5.5의 64%와 Claude Opus 5.5의 60%를 하회했습니다. 평가하는 작업에 따라 모델 간 순위는 달라집니다.

Gemini 4 Argon은 AutomationBench-AA에서 77.5점으로 #1위를 차지했으며, Claude Sonnet 5.5 (최대, 71.3%)보다 6점을 앞서고 있습니다. Terminal Bench 4에서는 Gemini 4 Argon이 57점을 달성하여 Gemini 3.1 Pro Preview보다 53점 향상되었으며, Claude Sonnet 5.5 (최대, 64%), Claude Opus 5.5 (최대, 60%)에 이어져 있습니다…pic.twitter.com/nznzQE031f

일반 제공 시 예정 가격은 100만 입력 토큰당 2달러(약 315엔), 100만 출력 토큰당 10달러(약 1577엔)입니다. 캐시된 입력 토큰에는 일반 입력 가격에서 95%의 할인이 적용됩니다. Google은 초기 테스터로부터의 피드백을 기반으로 안전 조치를 조정하는 방안을 고려할 예정입니다. 그 이후에 유료 API 사용자 및 Google AI Ultra 사용자 순으로 개발자, 기업, 일반 사용자에게 제공 범위를 확대할 계획입니다.

[원문 보기](https://gigazine.net/news/20261001-google-gemini-4-argon/) | 출처: Gigazine