Sonnet 5.5, GPT-6.1, Sol, Argon, MiniMax, Kolibri가 업데이트되었습니다.
대상 기간: 2026년 9월 27일 ~ 10월 3일
※MiniMax의 날짜는 공식 업데이트 기록에 게시된 날입니다. 9월 27일 발표에 대한 보도도 있습니다. 하지만 공식 SNS의 원문을 직접 확인할 수 없었기에, 본문에서는 확인된 9월 28일 기록을 기준으로 했습니다.
9월 28일 | 클로드 소네트 5.5. 단가는 동일하지만, 하나의 일을 처리하는 비용이 감소합니다.
앤서니(Anthropic)가 클로드 소নেট 5.5의 공식 제공을 시작했습니다. 모델 이름은 claude-sonnet-5-5입니다. 클로드 API 외에도 아마존 베드락(Amazon Bedrock), 구글 클라우드(Google Cloud), 마이크로소프트 폰드(Microsoft Foundry), AWS에서 제공하는 클로드 플랫폼(Claude Platform on AWS)에서도 이용할 수 있습니다.
글뿐만 아니라 이미지(사진이나 차트 등)도 읽어들이고, 답변은 글로 돌아오는 시스템입니다.
컨텍스트 길이(한 번에 처리할 전체 정보량)는 100만 토큰(단어의 단위)입니다. 일반적인 최대 출력은 12만 8천 토큰까지 지원합니다.
요금은 100만 토큰당 입력 2달러, 출력 10달러, 캐시 로딩 0.20달러입니다. 단가는 Sonnet 5와 동일합니다.
특별히 주목할 점은 동일한 작업을 완료하는 데 사용되는 토큰 수와 속도였습니다. Anthropic의 측정 결과, 작업(업무 단위)당 비용이 최대 30% 감소했으며, 출력 속도는 30% 이상 향상되어 코딩 평가인 Terminal-Bench 4.0에서 70.6%를 기록했습니다. Sonnet 5의 10.3%에서 크게 증가했습니다.
또한, 실제 비용과 속도는 요청 내용과 추론 설정에 따라 달라집니다. 지식 노동을 측정하는 GDPval-AA v2.1에서는 Sonnet 5.5가 1844, Opus 5.5가 1846이었습니다. 이 평가를 수행한 것은 Artificial Analysis입니다.
차이는 무려 2 포인트지만, 모든 작업에서 Opus와 동일하다는 의미는 아닙니다. Anthropic는 판단을 거듭하는 복잡한 작업에서는 Opus 5.5가 여전히 강력하다고 설명합니다.
소네트의 주요 역할은 명확한 범위를 가진 개발 또는 자료 작성 작업을 신속하게 진행하는 것입니다. 요금표 인하 여부와 관계없이 사용하는 토큰 수가 줄어들면 작업 건당 비용은 감소합니다. API로 전환하는 경우 모델명 외에도 변경 사항이 필요합니다. 응답 전에 생각하는 단계를 비활성화하는 설정은 disabled에서 between_tools로 변경되었으며, 이 설정과 함께 사용할 수 있는 추론 설정은 low, medium, high 세 가지로 제한됩니다.
툴 선택의 ‘any’와 ‘tool’은 사용할 수 없습니다. temperature, top_p, top_k(응답의 변동을 조절하는 값)를 기본값 외로 설정하면 400 오류가 발생합니다. 안전 조치도 추가되었으며, 고위험 사이버 관련 요청에서는 Sonnet 5로 전환하는 메커니즘이 도입되었습니다.
일반적인 개발 작업은 대상에서 제외된다고 설명되어 있습니다. 개발자는 API를 포함하여 문제 발생 시 전환 설정을 포함한 이관 가이드를 확인해야 합니다.
출처: 공식 발표/모델 사양/이관 가이드
9월 28일 공식 업데이트 내역 | MiniMax M3.1-Flash-Preview. 개발용 모델 사전 제공
MiniMax의 9월 28일 업데이트 내역에 M3.1-Flash-Preview가 MiniMax 코드에 추가된 내용이 게시되었습니다.
버그 수정부터 기능 구현까지, 일상적인 개발 작업을 수행하는 텍스트 모델로서 소개되고 있습니다.
공식 사양에 따라 최대 100만 토큰의 컨텍스트를 지원합니다. 문장뿐만 아니라 이미지와 영상도 처리할 수 있으며, 코드나 긴 자료를 활용하여 툴을 사용하는 작업을 염두에 두고 있습니다.
추론의 깊이는 low, medium, high, xhigh, max의 5단계로 조정할 수 있습니다. 생략 시 기본값은 max입니다. 생각을 완전히 멈추는 설정은 사용할 수 없으며, 응답 시간이나 토큰 사용량을 줄이려면 추론의 깊이를 낮추십시오. 제공 대상은 현재 시점에서 M Plan과 MiniMax Code에 한정되며, 자신의 개발 도구에서 호출하는 경우에도 구독용 키를 사용합니다.
확인된 공식 사양 및 업데이트 기록에는 이 프리뷰 버전의 비교 벤치마크(성능 측정 지표)나 토큰 단가 정보가 포함되어 있지 않습니다. 기존 M3의 수치를 M3.1의 성능이나 요금으로 사용하는 것은 불가능합니다. 이번 주 현재는 새로운 개발용 모델의 선행 제공 단계이며, 제공 시작 시점과 성능 비교에 필요한 정보가 확보되는 시점을 분리하여 추적하겠습니다.
## MiniMax 공식 업데이트 기록 / 공식 모델 사양
**2023/05/21**
* 모델 업데이트: MiniMax 모델의 최신 버전으로 업데이트되었습니다.
* 새로운 기능:
* 프롬프트 엔지니어링 가이드라인 추가: MiniMax 모델을 최대한 활용하기 위한 프롬프트 엔지니어링 가이드라인이 추가되었습니다. 이 가이드라인은 모델의 성능을 향상시키고, 사용자가 원하는 결과물을 얻도록 돕습니다.
* 다양한 목적에 맞는 새로운 템플릿 제공: 창작 활동을 위한 스토리 템플릿, 아이디어 구상에 도움이 되는 브레인스토밍 템플릿, 학습 자료 제작을 위한 노트 템플릿 등이 제공됩니다.
* 버그 수정:
* 모델이 특정 프롬프트에 대해 예상치 못한 답변을 생성하는 문제를 수정했습니다.
* 모델이 너무 긴 텍스트를 처리하는 데 어려움을 겪는 문제를 개선했습니다.
**모델 사양:**
* 모델 이름: MiniMax
* 모델 버전: 20230521
* 파라미터 수: 7B (70억 개)
* 훈련 데이터: 공개적으로 이용 가능한 다양한 텍스트 데이터셋 (구체적인 데이터셋 정보는 별도 공개 예정)
* API 접근: MiniMax API를 통해 모델에 접근할 수 있습니다. 자세한 내용은 MiniMax API 문서 참조.
* 가격: MiniMax API 사용량에 따라 과금됩니다. 자세한 가격 정보는 MiniMax API 가격 페이지 참조.
9월 29일|GPT-6.1 솔. 일반 판매 가격 그대로 상위 모델 Astra에 근접
OpenAI는 GPT-6 솔 공개 후 1주일 만에 업데이트된 GPT-6.1 솔을 제공했습니다. API 모델은 gpt-6.1-sol입니다. ChatGPT Work와 Codex에서는 Plus, Pro, Business, Enterprise, Edu가 대상입니다. 발표 시점에서는 일반적인 Chat 화면에 제공되지 않고 있습니다.
컨텍스트 길이는 105만 토큰, 최대 출력은 12만 8천 토큰입니다. 문장뿐만 아니라 이미지 읽어오기에도 지원하며, 웹 검색, 파일 검색, 함수 호출, PC 조작이 가능합니다. 툴 호출에는 Responses API를 사용합니다. Chat Completions에서는 툴 호출이 불가능합니다.
표준 요금은 100만 토큰당 입력 2달러, 출력이 10달러입니다. GPT-6 Sol은 고정 시스템으로 사용되며, 캐시 입시는 0.20달러에서 0.10달러로 반값으로 변경되었습니다. 동일한 자료나 코드를 반복적으로 참조하는 처리에서는 이 차이가 전체 비용을 절감하는 데 기여합니다.
긴 텍스트 입력에는 별도의 요금 조건이 적용됩니다. 입력이 27만 2,000 토큰을 초과하는 요청의 경우, 입력 및 캐시 단가가 2배, 출력이 1.5배가 됩니다. 105만 토큰까지 처리 가능하며, 전체 범위를 표준 단가로 사용할 수 있습니다.
성능 면에서는 실제 코드 사용한 장기적인 개발 과제를 측정하는 DeepSWE v1.1에서 상위 모델인 Astra와 동등한 성적을 약 5분의 1의 비용으로 얻었다고 OpenAI가 보고했습니다. GPT-6 Sol의 최고 점수는 6.4점을 넘었습니다. PC 운영을 측정하는 OSWorld 2.0의 오프라인 평가에서는 최대 추론 시 Sol보다 7점 높았고, Astra와의 차이는 2.1점였습니다.
가격뿐만 아니라 여러 단계를 거치는 능력 또한 상위 모델에 가까워지고 있습니다. 사실성의 평가에서는 추론 수준을 낮춘 경우 답변의 오류가 11.4%에서 7.7%로 감소했습니다. 이는 과거 모델의 오류를 이용자가 지적한 어려운 대화들을 모아 평가한 것입니다. 일상적인 사용 시 7.7%의 답변이 틀릴 수 있다는 숫자와는 다릅니다.
각 평가는 OpenAI의 연구 환경이나 API에서 진행하고 있습니다. 제품 화면의 도구, 지시, 추론 설정이 다르면 결과도 달라집니다. 안전성 평가에서는 사이버 공격에 대한 악용 위험을 최고 수준의 Critical, 생물·화학 분야의 위험을 High로 간주하고, Astra와 동일한 보호 조치를 적용했습니다.
이것은 OpenAI의 안전성 평가 기준입니다. 능력 향상에 따라 보호 조치도 최고 모델과 일치하도록 조정하고 있습니다.
출처: 공식 발표/API 사양/안전성 평가
9월 30일|Gemini 4 Argon 발표되었지만 일반 사용자에게는 아직 제공되지 않고 있습니다.
Google은 Gemini 4 Argon을 출시하고, Fairwind Program의 신뢰할 수 있는 사이버 방어 담당자 대상에 한정적으로 배포를 시작했습니다. 일부 테스터도 평가에 참여하고 있습니다.
향후 유료 API 고객과 Google AI Ultra 가입자로부터 제공을 확대하는 방안입니다. 다만, 시작일은 공지되지 않았으며, 현재 시점에서는 누구나 선택할 수 있는 모델이 아닙니다.
큰 변화는 최대 출력이 기존의 6만 4천 토큰에서 100만 토큰으로 늘어났다는 것입니다. 긴 문장을 입력하기 위한 컨텍스트 길이의 제한이 아닌, 사고와 문장 생성을 더 오래 지속하기 위한 상한선입니다.
구글의 발표에 따르면, DeepSWE v1.1에서 장기적인 소프트웨어 개발을 측정하여 77.9%, AutomationBench에서 업무 자동화를 측정하여 51.3%, LVBench에서 장시간 영상 이해를 측정하여 91.7%를 기록했습니다.
CWE-bench v1에서는 68%로 1위를 기록했습니다. 발표에는 내부 및 협력 기업의 평가도 포함되어 있으며, 평가 기준의 차이로 인해 순위 비교는 어렵습니다.
구글 내부에서는 C, C++와 같은 대규모 코드의 Rust로 전환 작업을 진행하고 있으며, 데이터 센터의 메모 사용량을 줄이는 작업에도 투입되고 있습니다. 중요한 코드의 변경 사항은 자동 및 수동 감사, 에뮬레이션 테스트(모의 환경에서의 테스트), 리뷰를 거쳐 실제 환경에 반영하는 방침입니다.
초기 예정 가격은 토큰당 2달러로 입력, 10달러로 출력하고, 캐시 입출금은 각각 0.10달러입니다. 도입 기간이 종료되면 입력은 4달러로, 출력은 20달러로 변경됩니다. 기간 종료일은 아직 공개되지 않았습니다.
신뢰할 수 있는 방어 담당자에게는 사이버 관련 안전 장치(안전을 위한 제한)를 해제한 버전을 제공하는 방안입니다. 광범위한 사용자 공개를 위해 부정 이용 및 간접적인 프롬프트 주입(AI를 속이는 부정한 지시)에 대한 대책, 사용자의 의도와 벗어난 행동을 멈추도록 모니터링을 강화하고 있습니다.
다음으로 확인하고 싶은 것은 일반 사용자 대상 제공일과 실제 이용 조건입니다. 한정판 평가를 바탕으로 어떤 능력이 어느 범위까지 사용 가능한지 추적해야 합니다.
오늘부터 Google Cloud의 AI 모델을 활용한 새로운 검색 경험을 제공합니다. 이번 업데이트에서는 Google Cloud의 AI 모델이 검색 쿼리를 더 깊이 이해하고, 사용자의 의도에 부합하는 결과를 더 빠르게 제공할 수 있도록 개선되었습니다. 이를 통해 사용자는 더욱 정확한 정보를 찾고, 업무를 더욱 효율적으로 완료할 수 있습니다. 구체적으로 다음과 같은 기능이 강화되었습니다. 자연어 처리 향상, 문맥 이해 강화, 관련성 높은 검색 결과 제공. 이 업데이트는 Google Search의 성능을 크게 향상시키는 것뿐만 아니라 Google Cloud의 AI 모델의 가능성을 더욱 확장하는 데 기여합니다. 앞으로도 Google Cloud의 AI 모델을 활용한 새로운 검색 경험 개발에 지속적으로 노력하겠습니다. 또한 이번 업데이트에서는 Google Scholar와의 연동도 강화되었습니다. Google Scholar의 논문 검색 결과를 Google Search 결과에 통합함으로써 연구자 및 학생들은 더욱 효율적으로 정보를 수집할 수 있습니다.
10월 3일 | 콜리브리. 영어 및 독일어 업무용 모델을 가중치를 포함하여 공개
독일의 Aleph Alpha는 Kolibri를 공개했습니다. 영어와 독일어를 중심으로 추론, 코드 생성, 툴 호출에 대응하는 언어 모델입니다.
구조는 MoE(여러 전문 AI를 묶어 작동시키는 방식)입니다. 필요한 것을 여러 전문 부분에서 선택하여 계산하고, 총 파라미터(AI의 두뇌 규모) 약 781억 중 1 토큰 처리 시 약 34억 6천만 개를 사용합니다.
모델 전체 크기와 매번 계산에 사용하는 부분의 크기를 분리하여 설계했습니다. 모델 카드(AI 사양서)에 기재된 컨텍스트 길이는 104만 8,576 토큰입니다.
효율성과 복잡한 과제 해결을 고려할 때, 실제 운영에서는 26만 2,144 토큰 이하를 권장합니다. 가중치(학습된 데이터 본체)는 Hugging Face에서 공개되며, 라이선스는 Apache 2.0입니다.
자체 환경에서 운영하는 방안이 있습니다. 제공 API를 사용하는 모델과 달리, 배포 위치 및 운영 방법을 사용자 측에서 선택할 수 있다는 점이 특징입니다.
알렙 알파는 행정, 제조, 항공우주 등의 업무를 염두에 두고 개발되었습니다. 공개 평가에서는 AIME 2026이 96.0, LiveCodeBench v6가 85.9라는 결과를 나타냈습니다. 이 모두 개발사의 발표치입니다.
이번 다른 모델들과 동일한 조건에서 측정된 종합 순위는 아닙니다. 영어와 독일어 중심이기 때문에, 일본어 업무에서 동일한 성능이 나타난다고 판단할 수 없습니다. 또한, 작동하는 부분이 약 34억 6천만 파라미터에도 모델 전체는 약 781억입니다. BF16의 가중치만으로도 약 156GB를 필요로 하며, 소형 모델과 동일한 장비로 작동될 수 있는 것은 아닙니다.
콜리리의 공개는 모델을 선택할 때 비교 기준으로 확장하여 성능, 가격 외에도 어떤 언어를 중시하고 어디에서 실행할 수 있는지를 고려하는 데 도움이 됩니다.
BF16 버전 모델은 FP8 버전 모델에 비해 더 높은 정확도를 달성하며, 특히 복잡한 추론 작업이나 대규모 언어 모델에서 그 차이가 두드러집니다. 또한 BF16 버전 모델은 FP8 버전 모델보다 메모리 효율이 좋고 더 많은 데이터를 처리할 수 있어, 더 큰 규모의 모델 훈련이나 실시간 추론이 가능합니다.
이번 주말에 츠키시마 료가 진행하는 ‘가쿠보 료’의 ‘사무라이의 숲’ 북토크에 참여하게 되어 매우 기쁩니다. 츠키시마 료는 ‘사무라이의 숲’을 통해 일본의 전통적인 사무라이 문화와 자연의 아름다움을 깊이 있게 탐구한 작품을 선보였으며, 그의 깊이 있는 통찰력과 섬세한 묘사에 감탄했습니다.
이번 북토크에서는 ‘사무라이의 숲’에 담긴 주제와 츠키시마 료의 창작 과정에 대해 심도 있게 논의할 예정입니다. 특히 츠키시마 료는 이 책에서 영감을 얻은 일본의 다양한 지역과 자연환경에 대한 이야기를 들려주실 것입니다. 또한 ‘사무라이의 숲’을 읽고 난 후 독자들과 함께 작품에 대한 새로운 해석을 모색하는 시간을 가질 수 있을 것으로 기대합니다.
이 북토크는 ‘사무라이의 숲’을 사랑하는 모든 분들에게 특별한 경험이 될 것입니다. 츠키시마 료의 지적인 열정과 예술적인 감성을 직접 느껴보시며, 일본의 전통 문화와 자연에 대한 깊은 이해를 얻을 수 있을 것입니다. 많은 관심과 참여 부탁드립니다.
일상적인 가격대 모델이 고가 모델의 성능에 가까워지는 흐름이 보였습니다.
선정 시 고려해야 할 기준도 변합니다. 입력과 출력을 나타내는 단가뿐만 아니라 완료에 소요되는 토큰 수, 재작업 횟수, 대기 시간까지 포함하여 면밀히 검토해야 합니다. 단가가 같더라도 적은 수의 단계로 일이 끝나면 실질적인 비용은 저렴해집니다.
비교할 때는 동일한 작업을 동일한 조건에서 수행하는 것이 전제입니다. 긴 문 입력에 대한 추가 요금이나 추론 설정 등을 포함하여 측정하면 자신의 목적에 맞는 모델을 찾을 수 있습니다.
제공 방식 또한 일률적이지 않습니다. MiniMax는 데모 버전을 자사의 플랜과 개발 툴에서 제공하며, Argon은 신뢰된 보안 전문가로부터 제한적으로 제공하고 있습니다. Kolibri는 핵심 기능을 공개하고, 자사 환경에서 운영하는 선택지를 늘렸습니다.
모델명 발표만으로는 실무에서 활용 가능한 범위와 이용 조건 등을 파악하기 어렵습니다. 이용 자격, 지원 언어, 요금 조건, 필요한 장비 등을 종합적으로 확인한 후 자신의 업무에 적합한지 판단할 수 있습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 39청크
원문 보기 | 출처: note.com