AI 기업인 Inception이 2026년 9월 8일, 확산 모델을 사용해 문장을 생성하는 AI 모델 'Mercury 2.5'를 발표했습니다. 일반적인 대규모 언어 모델(LLM)이 문장을 왼쪽부터 순서대로 생성하는 것에 비해 Mercury 2.5는 여러 토큰을 병렬로 생성·수정하는 방식을 채택하고 있어 초당 1107개 토큰을 출력할 수 있다고 합니다. 성능은 GPT-5.6 Luna의 Low 설정 등에 비견되는 것으로 알려졌으며, 일반 요금은 100만 출력 토큰당 0.75달러(약 120엔)입니다. Introducing Mercury 2.5 – Inception https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
일반적인 LLM의 대부분은 '직전까지 생성한 토큰을 바탕으로 다음 토큰을 1개 결정하는 처리를 반복한다'는 '자기회귀'라 불리는 방식으로 문장을 만듭니다. 문장을 순서대로 생성하는 구조상, 긴 답변을 만들수록 대기 시간이 누적됩니다. 단순한 채팅이라면 몇 초의 대기 시간으로 끝나더라도, 예를 들어 검색 AI라면 검색어 재작성, 검색 결과 정렬, 정보 요약, 답변 작성과 같은 처리마다 AI 모델을 이용하기 때문에 1회당 지연 시간이 최종 응답 시간에 누적되어 버립니다.
Inception이 속도 향상을 위해 채택하고 있는 것이 '확산 대규모 언어 모델(dLLM)'입니다. Mercury 시리즈는 처음부터 완성된 문장을 순서대로 확정하는 방식을 취하지 않고, 답변 전체를 개략적인 상태에서부터 만들기 시작하여 여러 토큰을 병렬로 수정하면서 몇 단계의 처리를 거쳐 완성시킵니다. 이미지 생성 AI에서 채택 사례가 많은 '노이즈로부터 이미지를 서서히 가다듬어 간다'는 확산 모델의 개념을 텍스트 생성에 응용한 것입니다. 2026년 2월에 Inception은 확산 모델 기반의 AI 모델 'Mercury 2'를 발표하며 '세계 최속'을 표방했었습니다. Inception이 세계 최속의 확산 모델 기반 추론 LLM 'Mercury 2'를 발표 - GIGAZINE
Mercury 2.5는 Mercury 2를 강화한 모델이라고 합니다. Mercury 2의 출력 속도는 NVIDIA Blackwell GPU에서 초당 1009개 토큰이었고 컨텍스트 길이는 12만 8000개 토큰이었으나, Mercury 2.5에서는 출력 속도가 초당 1107개 토큰이 되었으며 컨텍스트 길이도 26만 개 토큰으로 확대되었습니다.
속도를 올리는 것뿐이라면 소형 모델을 사용하는 방법도 있지만, 모델의 능력이 떨어지면 복잡한 추론이나 코딩에는 사용하기 어려워집니다. Inception에 따르면 Mercury 2.5는 Mercury 2에서 성능을 끌어올림으로써 비용 효율을 중시한 최첨단 모델인 'GPT-5.6 Luna(Low)', 'Gemini 3.5 Flash-Lite', 'Claude Haiku 4.5'와 비슷한 수준의 품질에 도달했다고 합니다. 아래 이미지는 Mercury 2.5와 Mercury 2의 성능을 비교한 것입니다. Inception은 실제 이용자로부터 접수된 피드백이나 운용 중에 발생한 실패 사례를 평가 방법과 학습에 반영하여 Mercury 2.5로 이어졌다고 설명하고 있습니다.
요금은 100만 입력 토큰당 0.20달러(약 31엔), 100만 출력 토큰당 0.75달러(약 120엔)라고 합니다. Mercury 2는 100만 입력 토큰당 0.25달러(약 38엔), 100만 출력 토큰당 0.75달러(약 120엔)였기 때문에 입력 측 요금이 인하되었습니다. 또한 출시 시에는 80% 할인되어 OpenRouter에서는 100만 입력 토큰당 0.04달러(약 6엔), 100만 출력 토큰당 0.15달러(약 23엔)로 이용할 수 있습니다.
Mercury 2.5는 용도에 맞게 추론 강도를 조정하는 기능도 지원합니다. 또한 여러 외부 툴을 병렬로 호출하는 기능이나 지정된 JSON 스키마에 따라 답변을 출력하는 기능도 갖추고 있습니다. Mercury 시리즈의 도입 사례로, AI 전화 에이전트를 개발하는 OpenCall에서는 모델 응답 시간의 중앙값이 약 170밀리초까지 단축되었다고 합니다. 또한 코딩 AI를 개발하는 Augment Code에서는 긴 작업 이력을 짧게 요약하는 '컨텍스트 압축' 처리를 Mercury로 전환한 결과, 처리 시간이 약 150초에서 27초로 줄어들고 비용도 90% 절감되었다고 Inception은 보고했습니다. Mercury 2.5는 Inception API, Baseten, OpenRouter에서 이용할 수 있습니다. Inception은 Mercury 2.5와 동시에 음성 AI용 'Mercury Voice'와 입력 내용에 따라 적절한 AI 모델로 분배하는 'Mercury Router'의 프리뷰 버전도 발표했습니다. 나아가 Inception은 역대 최대 규모가 될 차세대 모델의 학습을 이미 시작했다고 밝혔으며, 확산 모델 특유의 속도와 토큰 효율을 유지하면서 성능을 더욱 끌어올려 향후 몇 개월 이내 공개를 목표로 하고 있다고 합니다.
원문 보기 | 출처: Gigazine