생성 AI 업계는 “1주일 쉬었다가 우다지 타로가 된다”라는 표현처럼 매우 빠른 속도로 움직이고 있습니다. 이번에는 2026년 8월 17일부터 8월 23일까지 총 1주일 동안 텍스트, 이미지, 음성, 비디오, 코딩 에이전트의 5가지 분야에 대해 SaaS(클라우드 서비스), OSS(오픈 소스), 로컬 모델(온디바이스 실행)의 3가지 관점에서 동향을 정리했습니다. 각 서비스의 가격 정보와 가능한 한 객관적인 정확성 평가(벤치마크 점수)를 함께 기재했습니다.
정보 출처는 TechCrunch, Reuters, 각사 공식 발표, 벤치마크 전문 사이트(Artificial Analysis 등)를 중심으로 수집하고 있습니다. 다만, 일부 수치 및 모델명은 정보 출처 간에 차이가 있어, 해당 경우에는 “※미확인”으로 명시하고 있습니다. 비즈니스 판단에 활용하실 때는 반드시 원본 정보를 확인해 주시기 바랍니다.
텍스트 기반 AI(LLM·챗봇) 동향
SaaS(클라우드 서비스형 소프트웨어)
이번 주 최대 움직임은 다시 한번 OpenAI의 가격 인하를 발표한 것입니다. 8월 21일, OpenAI는 플래그십 모델 “GPT-5.6 솔”의 API 가격을 인하 발표했습니다. 표준적인 단문맥 이용 시, 입력이 100만 토큰당 $5에서 $4로(20% 감소), 출력이 $30에서 $20으로(약 33% 감소), 캐시된 입력도 $0.50에서 $0.40으로(20% 감소)이며, 이는 “20% 이상의 가격 인하”로 보도되고 있습니다. 가격 인하는 ChatGPT Work 및 Codex의 크레딧 가격에도 반영되는 반면, Pro, Plus, Business의 월간 구독 가격 자체는 유지됩니다. 최소 11월 21일까지 적용되는 프로모션 가격입니다.
7月末에 저가 모델 루나(80% 할인), 중위 모델 테라(20% 할인)를 하향 조정할 때, 최상위 모델 솔은 가격을 유지했습니다. 이번에는 솔에도 처음으로 가격 인하가 적용된 형태로, 7月末부터 시작된 일련의 가격 인하가 드디어 플래그십 모델까지 도달한 것입니다. 배경에는 Anthropic이 Opus 5를 주력 모델로 활용하여 가격 경쟁력을 높이고 있으며, 중국 오픈 웨이트 세력의 부상이 지적되고 있습니다. 실제로 이번 가격 인하로 솔의 가격(입력 $4/출력 $20)은 Anthropic의 주력 모델 Claude Opus 5(입력 $5/출력 $25)를 밑도는 수준이 되었습니다.
한편, Anthropic의 Claude Opus 5 자체는 7월 24일 출시라는 점이 다소 이전의 이야기이지만, Artificial Analysis의 Intelligence Index에서 종합 1위를 유지하고 있으며 (xhigh/max 설정으로 점수 63), 이번 OpenAI의 가격 인하 또한 “Opus 5를 어떻게 따라잡을 것인가”라는 맥락으로 자주 언급되는 것으로 보입니다.
요금
다음은 100만 토큰당 입출력입니다.
- GPT-5.6 솔루션: 입력 $4 / 출력 $20 (8월 21일 하향 조정, 이전 가격은 $5/$30. 최소 11월 21일까지 적용되는 프로모션 가격)
- GPT-5.6 테라・루나: 7월 30일 하락 물가 수준 유지 (테라 입력 $2/출력 $12, 루나 입력 $0.20/출력 $1.20)
- 클로드 오퍼스 5: 입력 5달러 / 출력 25달러 (오퍼스 4.8 가격 동결)
- 딥시크 API는 8월 17일부터 피크 시간대(UTC 01:00~04:00 및 UTC 06:00~10:00)와 오프피크 시간대에 따라 시간대별 요금제를 적용합니다. 오프피크 시간대는 피크 시간대의 절반 가격으로 구성됩니다.
OSS(오픈소스) 모델
이번 주에도 중국 세력의 움직임이 두드러졌습니다. 8월 14일에 공개된 알리바바 Qwen 팀의 “Qwen3.8-27B”에 대한 관심이 이번 주에도 이어지고 있습니다. 277억 8천만 파라미터의 Dense 모델로, Apache 2.0 라이선스 하에 Hugging Face 및 ModelScope에서 공개되었습니다. 전 세대의 Qwen3.6 계열을 계승하면서, 선형 어텐션(Gated DeltaNet)과 풀 어텐션을 결합한 하이브리드 구성이 특징이며, 네이티브 262K 및 YaRN 확장을 통해 최대 1백만 토큰의 컨텍스트를 지원합니다. 초기 상태에서는 Thinking 모드가 활성화되어 있으며, reasoning_effort 설정을 통해 xhigh/medium/low를 선택할 수 있도록 설계되었습니다. 공식 발표에 따르면 전작인 Qwen3.6-27B를 모든 벤치마크에서 능가한다고 합니다.
또 다른 놓치지 말아야 할 점은 8월 13일에 DeepSeek이 공개한 “DeepSeek Harness”(약칭 dsh)입니다. 이는 모델이 아닌 MIT 라이선스의 오픈 소스 AI 에이전트 실행 기반으로, “모든 것이 플러그인이다(Everything as a Plugin)”라는 아키텍처 사상이 특징입니다. 베이징대학교와의 공동 연구에서 비롯된 메타프레임워크 “Cordis”가 핵심이며, 모델, 툴, 스킬, 세션, 샌드박스 등 거의 모든 기능을 플러그인 형태로 추가하고 제거할 수 있도록 합니다. 공개로부터 2일 만에 약 9만 5천 건, 4일 후인 8월 17일 기준으로 13만 5천 건 이상의 GitHub 스타를 모았다는 보도가 있었으며, 차세대 AI 에이전트 개발 기반의 유력한 후보로 순식간에 주목을 모으고 있습니다. DeepSeek 자체는 공식적으로 “개발자 프리뷰(Developer Preview)” 단계로 간주하고 있으며, 후방 호환성을 깨는 변경이 앞으로도 예고될 수 있다는 점에 유의해야 합니다.
인공지능 분석의 Intelligence Index에서 Kimi K3(스코어 60)가 오픈 웨이트 부문 1위를 유지하는 가운데,新たにQwen3.8의 대규모 MoE(Mixture of Experts) 버전인 “Qwen3.8 2.4T A95B”(스코어 58)가 새롭게 등재되었습니다. 참고로, 동일한 Qwen3.8 패밀리의 Qwen3.8-27B는 Apache 2.0 라이선스인 반면, 이 2.4T A95B 버전은 별도의 라이선스(일정 규모 이상의 상업적 이용에는 별도 계약이 필요)를 가지고 있어, 양자를 단순히 “오픈 소스이기 때문에 동일 조건”이라고 단정짓는 것은 주의해야 합니다. 종합 1위는 Claude Opus 5(xhigh/max 설정으로 스코어 63)이며, GPT-5.6 Sol(max 설정으로 스코어 61)이 근소한 차로 뒤를 쫓고 있습니다.
지역 LLM/온 디바이스
이번 주 로컬 LLM은 앞서 언급한 Qwen3.8-27B 모델에 집중되었습니다. 4비트 양자화의 경우 16~20GB 정도의 VRAM이 하나의 기준으로 여겨졌으며, 더 압축된 양자화를 사용하면 모델 파일 크기 자체는 9GB 정도까지 줄일 수 있다는 보고도 있었습니다(파일 크기와 실행 시 VRAM은 별도입니다). 공개 직후부터 Unsloth를 비롯한 GGUF 양자화 버전이 연이어 등장하여, Ollama나 LM Studio에서 바로 테스트할 수 있는 환경이 마련되었습니다. 반면, 긴 툴 체인을 수반하는 에이전트 용도로는 출력이 중간에 잘리는(truncated) 문제가 실질적인 운영상의 과제로 보고되고 있습니다.
정밀도 평가
인공지능 분석 서비스 ‘인텔리전스 인덱스’에서는 Claude Opus 5(63)를 비롯하여 GPT-5.6 솔(61), Grok 4.6(60~61), Kimi K3(60), GLM-5.3(60)가 좁은 격차를 두고 치열한 경쟁을 이어가고 있습니다. GPT-5.6 솔의 가격 인하는 이러한 격차 경쟁 환경 속에서 비용 측면에서의 차별화를 시도한 움직임으로 해석될 수 있습니다.
Qwen3.8-27B는 공식 벤치마크에서는 전작을 상회한다고 평가되고 있지만, 독립적인 커뮤니티 검증에서는 장시간 작업에서의 안정성에 어려움이 지적되고 있으며, 점수뿐만 아니라 실질적인 운영 환경에서의 동작 확인이 여전히 중요합니다. DeepSeek Harness 역시 GitHub 스타의 증가에 상징되는 높은 관심도와는 다르게, 공식적으로는 아직 “개발 미리보기” 단계로 분류되고 있다는 점을 유념해야 합니다(자세한 내용은 코딩 에이전트 항목에서 뒤에 설명합니다).
2. 이미지 기반 AI의 동향
최근 이미지 기반 AI 기술의 발전 속도가 매우 빠른 상황입니다. 특히, OpenAI의 DALL-E 2, Midjourney, Stable Diffusion 등 다양한 모델들이 등장하면서, 사용자들이 텍스트 설명을 통해 원하는 이미지를 생성하는 것이 가능해졌습니다. 이러한 기술은 예술, 디자인, 마케팅 등 다양한 분야에서 활용될 가능성을 보여주고 있습니다.
특히, DALL-E 2는 텍스트 설명을 기반으로 매우 사실적이고 창의적인 이미지를 생성하는 능력이 뛰어나 주목받고 있습니다. 또한, Midjourney는 예술적인 스타일의 이미지를 생성하는 데 강점을 가지고 있으며, Stable Diffusion은 오픈 소스 모델로서, 사용자들이 직접 모델을 수정하고 활용할 수 있다는 장점을 가지고 있습니다.
이러한 이미지 기반 AI 기술의 발전은 기존의 이미지 생성 방식에 대한 새로운 가능성을 제시하며, 앞으로 더욱 다양한 분야에서 활용될 것으로 기대됩니다. 특히, 콘텐츠 제작 분야에서는 이미지 생성 AI의 활용이 더욱 확대될 것으로 예상됩니다.
최근 SaaS(Software as a Service) 시장은 급격한 성장을 이어가고 있습니다. 기업들이 IT 인프라 구축 및 관리 비용 절감, 유연한 확장성, 그리고 클라우드 기반의 협업 도구 도입에 대한 니즈가 높아지면서 SaaS 솔루션에 대한 수요가 폭발적으로 증가하고 있습니다. 특히, 스타트업과 중소기업 시장에서 SaaS는 디지털 전환의 핵심 동력으로 자리매김하며, 기업의 성장을 가속화하는 데 중요한 역할을 수행하고 있습니다.
SaaS 시장의 주요 트렌드는 인공지능(AI) 기반의 지능형 서비스, 저코드/노코드 플랫폼, 그리고 데이터 분석 및 시각화 기능 강화입니다. 이러한 트렌드는 기업들이 데이터 기반의 의사 결정을 내리고, 업무 효율성을 극대화하며, 새로운 비즈니스 모델을 창출하는 데 도움을 주고 있습니다. 또한, 보안 및 개인정보 보호에 대한 중요성이 강조되면서, SaaS 제공업체들은 더욱 강력한 보안 시스템을 구축하고, 관련 규제 준수를 위한 노력을 지속하고 있습니다.
SaaS 솔루션의 성공적인 도입 및 활용을 위해서는 기업의 특성과 요구사항에 맞는 솔루션을 선택하는 것이 중요합니다. 단순히 가격만 고려하기보다는, 기능, 성능, 확장성, 그리고 제공업체의 지원 수준 등을 종합적으로 평가해야 합니다. 또한, SaaS 솔루션 도입 후에는 사용자 교육, 데이터 마이그레이션, 그리고 시스템 통합 등 다양한 과제가 발생할 수 있으므로, 충분한 계획 수립과 준비가 필요합니다.
SaaS 시장의 경쟁은 더욱 치열해짐에 따라, 제공업체들은 차별화된 가치를 제공하기 위해 끊임없이 노력하고 있습니다. 예를 들어, 특정 산업 분야에 특화된 SaaS 솔루션, 맞춤형 컨설팅 서비스, 그리고 고객 성공을 위한 지원 프로그램 등을 제공하며 경쟁력을 강화하고 있습니다. 또한, SaaS 솔루션의 지속적인 업데이트 및 기능 개선을 통해 고객 만족도를 높이고, 장기적인 파트너십을 구축하는 데 주력하고 있습니다.
SaaS 시장은 앞으로도 지속적인 성장이 예상되며, 기업들의 디지털 전환을 가속화하고, 새로운 비즈니스 기회를 창출하는 데 중요한 역할을 수행할 것으로 기대됩니다.
이번 주에는 대규모 신제품 발표는 없었지만, 인공 분석의 이미지 편집 아레나에서는 마이크로소프트 AI의 “MAI-Image-2.5-Pro”(Elo 1272)가 현재 1위를 차지하고 있습니다. 이전에는 “GPT Image 2(high)”(Elo 1256)가 1위를 점유했으나, 좁은 차이로 마이크로소프트 AI 세력이 우세한 상황입니다. 3위 이하 경쟁도 치열하며, Reve 2.1(1263), MAI-Image-2.5(1256), GPT Image 1.5(high)(1250)가 뒤를 잇고 있습니다.
한편, 일반적인 이미지 생성(Text to Image) 아레나에서는 GPT Image 2(high)가 Elo 1369로 1위를 유지하고 있습니다. 2위는 Reve 2.1(1322), 3위는 Nano Banana 2(Gemini 3.1 Flash Image Preview, 1320)라는 구성입니다.
요금
API 가격은 큰 변동이 관찰되지 않았습니다. 참고로, 이미지 편집 주요 모델의 가격(1,000매 기준)은 MAI-Image-2.5-Pro가 108.5달러, GPT Image 2(high)가 211.0달러, Reve 2.1이 200.0달러입니다. Adobe Firefly의 각 플랜(Standard 9.99달러/월, Pro 19.99달러/월, Premium 199.99달러/월)도 동일하게 유지됩니다.
오픈 소스 모델, 로컬 실행에 대한 내용입니다.
블랙 포레스트 랩스의 FLUX.2 시리즈, 알리바바의 Qwen-Image-3.0 시리즈(Pro 버전 포함), 텐센트의 HunyuanImage 3.0을 중심으로 한 구도가 이어지고 있습니다. 오픈 웨이트 이미지 편집 모델에서는 HunyuanImage 3.0 Instruct(Elo 1222)가 꾸준히 최상위권을 유지하고 있습니다. 대규모의 신규 OSS 이미지 모델 릴리즈는 이번 주에도 확인되지 않았습니다.
정확도 평가
이미지 편집 아레나에서 마이크로소프트 AI의 급진적 진출은 GPT 이미지 2의 우위가 구조적인 것이 아니며, 좁은 차원의 경쟁이 지속되고 있음을 보여준다. 음성 및 영상에 이어 이미지 편집에서도 마이크로소프트 AI가 선도적인 존재감을 드러낸 것이다. OpenAI, 구글, 마이크로소프트의 3사가 좁은 차이로 경쟁하는 상황이다. 일반적인 이미지 생성에서는 GPT 이미지 2의 우위가 여전히 지속되고 있으며, 용도(생성 또는 편집)에 따라 최적의 모델이 분화되는 점은 선택 시 고려해야 할 중요한 포인트이다.
## 3. 음성 기반 AI의 동향
최근 몇 년간 음성 기반 AI 기술은 눈부시게 발전했다. 특히, 구글의 넥서스(Nexus) 시리즈와 아마존의 에코(Echo) 시리즈와 같은 스마트 스피커 시장의 급성장은 음성 기반 AI 기술에 대한 관심과 투자를 가속화하는 요인으로 작용했다.
이러한 기술 발전은 단순히 음성 명령을 인식하는 수준을 넘어, 자연어 처리 기술과 딥러닝 기술의 융합을 통해 더욱 지능적인 서비스로 진화하고 있다. 예를 들어, 스마트 스피커는 단순히 음악 재생이나 알람 설정과 같은 기본적인 기능을 수행하는 것을 넘어, 날씨 정보 제공, 뉴스 요약, 일정 관리, 스마트 홈 기기 제어 등 다양한 서비스를 제공하고 있다.
특히 주목할 만한 점은 음성 기반 AI 기술이 의료 분야에 적용되고 있다는 것이다. 의료 전문가들은 음성 기반 AI 기술을 활용하여 환자의 증상을 분석하고, 진단을 내리는 데 도움을 받고 있다. 또한, 환자들에게 약 복용 시간이나 건강 관리 방법을 안내하는 데에도 활용되고 있다.
이러한 음성 기반 AI 기술의 발전은 앞으로 더욱 다양한 분야에서 활용될 것으로 기대된다. 특히, 자율 주행 자동차, 로봇, 가상 비서 등 다양한 분야에서 음성 기반 AI 기술이 핵심적인 역할을 수행할 것으로 전망된다.
한편, 음성 기반 AI 기술의 발전은 개인 정보 보호 문제와 관련된 우려를 불러일으키기도 한다. 음성 명령을 통해 수집되는 개인 정보의 보안 및 활용에 대한 논의가 활발하게 이루어지고 있으며, 관련 규제 마련의 필요성도 제기되고 있다.
향후 음성 기반 AI 기술은 더욱 발전하고, 우리 생활에 더욱 깊숙이 자리 잡을 것으로 예상된다. 이러한 기술 발전에 대한 지속적인 관심과 연구가 필요하며, 동시에 개인 정보 보호와 관련된 문제에 대한 해결책 마련도 중요한 과제가 될 것이다.
최근 SaaS(Software as a Service) 시장은 급격한 성장을 이어가고 있으며, 특히 중소기업들에게 SaaS 솔루션 도입이 필수적인 요소로 자리 잡고 있습니다. 과거에는 기업들이 자체적으로 서버를 구축하고 소프트웨어를 개발, 운영하는 방식이 일반적이었지만, SaaS는 클라우드 기반으로 소프트웨어를 제공받아 비용 절감과 효율성 증대에 기여합니다.
SaaS 솔루션은 CRM, ERP, 프로젝트 관리, 협업 도구 등 다양한 분야를 포괄하며, 기업의 규모나 업종에 관계없이 맞춤형 솔루션을 선택할 수 있다는 장점이 있습니다. 특히, 초기 스타트업의 경우, SaaS를 통해 초기 투자 비용을 최소화하고 빠르게 시장에 진출할 수 있다는 점에서 큰 매력이 있습니다.
최근에는 AI 기술과 결합된 SaaS 솔루션도 등장하고 있으며, 이는 업무 자동화, 데이터 분석, 의사 결정 지원 등 다양한 분야에서 혁신적인 변화를 가져올 것으로 기대됩니다. 앞으로 SaaS 시장은 더욱 성장하고, 기업들의 디지털 전환을 가속화하는 핵심 동력으로 자리매김할 것입니다.
음성 기반 AI는 이번 주도 대체로 조용한 주였습니다. 대규모 신제품 발표는 없었고, 기존 서비스 운영이 안정화된 단계입니다. 텍스트 음성 변환 경기장(Text to Speech Arena)에서는 6월에 1위를 차지한 알리바바의 “Fun-Realtime-TTS”가 구글의 Gemini 3.1 Flash TTS나 Inworld의 Realtime TTS-2를 상회하며 현재도 1위를 유지하고 있습니다. 상위 모델 간의 Elo 차이는 작아 접전이 계속되고 있는 상황입니다.
요금
TTS API 시장은 지난주부터 큰 변동이 없습니다. 표준 음성 가격은 100만 문자당 약 수십 달러 수준이고, 뉴럴 음성 가격은 십여 달러 수준으로 유지되고 있습니다.
오픈 소스 모델/로컬
Whisper Large-v3, 경량 TTS 모델인 “Kokoro-82M” 등 기존 인기 모델들은 여전히 동일했습니다. 오픈 웨이트 TTS 모델 중에서는 Fish Audio S2 Pro(Elo 1125)가 꾸준히 최상위 자리를 유지하고 있습니다.
정밀도 평가
음성 AI는 이번 주에도 각 사별 자체 벤치마크가 중심을 이루고 있으며, 제3자 중립 기관에 의한 대전차 비교는 제한적이라는 상황이 지속되고 있습니다. Controlled Voice Arena(동일한 음성으로 여러 모델을 비교하는 시스템)와 같이 음성 자체보다는 모델의 실력을 분리하여 평가하는 접근 방식도 등장하고 있으며, 향후 평가 방법의 정교화가 기대되는 부분입니다.
## 4. 영상 기반 AI의 동향
최근 몇 년간 영상 기반 AI 기술은 눈부시게 발전해 왔습니다. 특히, 딥러닝 기술의 발전과 함께 이미지 인식 기술을 영상 데이터에 적용하는 것이 가능해지면서, 다양한 분야에서 영상 기반 AI의 활용 가능성이 높아지고 있습니다.
가장 대표적인 예시로, 구글의 RunwayML이 있습니다. RunwayML은 사용자가 직접 AI 모델을 훈련시키거나, 기존 모델을 활용하여 새로운 영상을 생성할 수 있도록 지원하는 플랫폼입니다. 특히, “Gen-2” 모델은 사용자가 텍스트 프롬프트를 입력하면, 그 내용을 기반으로 짧은 영상을 생성해주는 기능으로 큰 주목을 받고 있습니다.
또한, Meta (구 페이스북) 역시 영상 기반 AI 기술 개발에 적극적으로 투자하고 있습니다. Meta는 “Make-A-Video”라는 기술을 공개하며, 텍스트 프롬프트를 기반으로 15초 길이의 영상을 생성할 수 있다는 것을 보여주었습니다. 이 기술은 아직 초기 단계이지만, 잠재력이 매우 크다고 평가받고 있습니다.
이 외에도, OpenAI의 “DALL-E 2”와 같은 이미지 생성 AI 기술이 영상 분야에도 적용되고 있습니다. DALL-E 2를 활용하여 특정 스타일이나 내용의 영상을 생성하는 것이 가능해지면서, 영상 제작의 새로운 가능성을 열고 있습니다.
이러한 영상 기반 AI 기술의 발전은 영화, 광고, 게임 등 다양한 콘텐츠 제작 분야에 큰 영향을 미칠 것으로 예상됩니다. 또한, 교육, 의료, 보안 등 다양한 산업 분야에서도 영상 기반 AI 기술의 활용이 확대될 것으로 보입니다.
향후 영상 기반 AI 기술은 더욱 발전하고, 더욱 다양한 분야에서 활용될 것으로 기대됩니다. 특히, 딥러닝 기술의 발전과 함께 더욱 정교하고 현실적인 영상을 생성할 수 있게 될 것으로 예상됩니다.
서비스형 소프트웨어
이번 주에도 영상 AI의 대형 신제품 발표는 적었고, Veo 3.1, Kling 3.0, Runway Gen-4.5 시리즈가 주요 서비스로 제공되고 있습니다.
요금은 다음과 같습니다.
* 스페셜 에디션: 1,980엔
* 정식판: 1,480엔
* 초판 한정판: 2,980엔
* 오디오북: 1,480엔
* 전자책: 980엔
클링 3.0, 비오 3.1, 런웨이 등 주요 서비스의 요금 체계에는 큰 변화가 확인되지 않았습니다.
최근에 개발한 시스템에서 오픈 소스 모델(OSS)을 로컬에서 실행하는 방법을 소개합니다. 이를 통해 데이터 전송 비용을 절감하고, 모델의 응답 속도를 향상시킬 수 있습니다. 특히, 대규모 언어 모델(LLM)의 경우 클라우드 환경보다 로컬에서 실행하는 것이 훨씬 효율적입니다.
이러한 로컬 실행 환경 구축에는 llama.cpp, MLC LLM, Ollama 등 다양한 도구와 라이브러리가 활용됩니다. 모델의 크기에 따라 요구되는 사양이 달라지므로, 사용하려는 모델의 사양을 확인하고 적절한 시스템을 구축하는 것이 중요하며, 모델의 라이선스 조건을 준수해야 합니다.
이러한 로컬 실행 환경을 통해 개인 개발자나 소규모 기업에서도 고성능의 OSS 모델을 활용하여 다양한 서비스를 개발할 수 있을 것으로 기대됩니다.
오픈 웨이트 비디오 모델이 꾸준히 레이어를 두껍게 하는 상황이 지속되고 있습니다. Lightricks의 LTX-2.5 시리즈(Fast, Pro), Sand.ai의 “MAGI-2 Preview” 모두 8월에 출시되었으며, Artificial Analysis의 이미지→비디오 아레나의 “최근 1개월에 추가된 모델” 목록에도 포함되어 있습니다.
특히 눈길을 끄는 것은 7월 31일에 MiniMax가 발표한 오므니모달 영상 모델 “MiniMax H3”(33B 파라미터)의 괄목할 만한 활약입니다. 오픈 웨이트 이미지→영상 모델로서, 음성 포함 카테고리에서는 Elo 1184, 음성 미포함 카테고리에서는 Elo 1346을 기록하여, 각각 자사 최상위 오픈 웨이트 모델로서 1위를 차지하고 있습니다. 음성 미포함 카테고리에서는 Google의 클로즈드 모델 “Gemini Omni Flash”(1366)에 약간 미치지 못하는ものの、Veo 3.1이나 Kling 3.0과 같은 주요 클로즈드 모델을 상회하는 점수로, 오픈 웨이트와 상업 모델 간의 격차가 줄어들고 있는 것으로 보입니다.
정밀성 평가
이미지→영상(오디오 포함) 부문에서는 “Dreamina Seedance 2.0 720p”(Elo 1191)가 압도적인 1위 자리를 차지했으며, 근소한 차로 “MiniMax H3”(1184), “Gemini Omni Flash”(1182)가 그 뒤를 잇고 있습니다. 오디오 미포함 부문에서는 “Gemini Omni Flash”(1366)가 압도적인 1위 자리를 유지하고 있지만, 오픈 웨이트의 MiniMax H3가 근소한 차로 2위 자리를 차지한 점이 이번 주 주목할 만한 포인트입니다. 영상 관련 부문은 여전히 클로즈드와 오픈 웨이트의 성능 격차가 다른 분야보다 큰 상태가 지속되고 있지만, 그 격차는 꾸준히 줄어들고 있습니다.
5. 코딩 에이전트 동향
최근 몇 년간 코딩 에이전트 시장은 급격한 성장을 보이고 있습니다. 특히, 인공지능 기술의 발전과 함께 코딩 에이전트는 단순 반복적인 코딩 업무를 자동화하고, 개발 프로세스의 효율성을 높이는 데 기여하고 있습니다.
현재 코딩 에이전트는 웹사이트 개발, 모바일 앱 개발, 게임 개발 등 다양한 프로젝트에서 활용되고 있으며, 특히 스타트업이나 중소기업에서 비용 절감 및 생산성 향상을 위해 적극적으로 도입하고 있습니다.
코딩 에이전트 시장의 성장세는 앞으로도 지속될 것으로 예상됩니다. 인공지능 기술의 발전과 함께 코딩 에이전트는 더욱 정교하고 다양한 기능을 제공하게 될 것이며, 개발 프로세스의 자동화 수준이 더욱 높아질 것입니다. 또한, 코딩 에이전트의 활용 분야는 더욱 확대될 것으로 전망됩니다.
코딩 에이전트 시장의 경쟁 또한 치열해지고 있습니다. 다양한 기업들이 코딩 에이전트 개발에 투자하고 있으며, 각 기업들은 자신만의 기술력을 바탕으로 차별화된 코딩 에이전트를 선보이고 있습니다. 이러한 경쟁 속에서 사용자에게 최고의 코딩 에이전트를 제공하는 기업이 시장을 선도할 것으로 기대됩니다.
코딩 에이전트 시장의 주요 트렌드는 다음과 같습니다.
* 인공지능 기반 코딩 에이전트: 인공지능 기술을 활용하여 코딩 에이전트가 스스로 코드를 생성하고 수정하는 기능이 발전하고 있습니다.
* 클라우드 기반 코딩 에이전트: 클라우드 환경에서 코딩 에이전트를 실행하여 개발 환경의 유연성을 높이고 협업을 용이하게 합니다.
* 특정 분야에 특화된 코딩 에이전트: 웹사이트 개발, 모바일 앱 개발, 게임 개발 등 특정 분야에 특화된 코딩 에이전트가 등장하고 있습니다.
코딩 에이전트 시장은 앞으로 더욱 발전하고 성장할 것으로 기대됩니다. 코딩 에이전트 기술을 통해 개발 프로세스의 효율성을 높이고 새로운 가치를 창출하는 데 기여할 수 있을 것입니다.
SaaS
이번 주 최대 화제는 역시 OpenAI의 GPT-5.6 솔 가격 인하로, 코딩 영역에서는 Codex 이용 비용에 직접적인 영향을 미칩니다. 이미 텍스트 기반 AI 영역에서 언급했듯이, 입력 4달러, 출력 20달러(11월 21일까지)라는 수준이 되었으며, Claude Opus 5보다 저렴한 선택지가 되었습니다. 매일 대량의 코드 변경 및 리뷰를 수행하는 에이전트 운영 환경에서는 이 가격 차이가 채택 모델의 선정에 영향을 미칠 것으로 보입니다.
요금은 다음과 같습니다.
* 스페셜 에디션: 1,980엔
* 정식판: 1,480엔
* 초판 한정판: 2,980엔
* 오디오북: 1,480엔
* 전자책: 980엔
- GPT-5.6 솔루션: 앞서 언급한 바와 같이, 11월 21일까지 입력 4달러, 출력 20달러의 한정 판매 가격입니다. ChatGPT Work 및 Codex의 크레딧에도 반영됩니다.
- 딥시크 API는 8월 17일부터 피크/오프피크 시간제 방식으로 전환되며, 오프피크 시간대를 활용한 비용 최적화가 가능해집니다.
OSS 모델 및 툴에 대한 내용입니다. 현재 개발 중인 모델은 오픈 소스 모델을 기반으로 하고 있으며, 이를 통해 개발 비용을 절감하고, 커뮤니티의 지원을 받을 수 있습니다. 특히 딥러닝 모델의 경우, 학습 데이터 확보가 중요하며, 오픈 소스 모델을 활용하면 자체적으로 데이터를 수집하고 학습시키는 데 드는 부담을 줄일 수 있습니다. 또한, 다양한 OSS 툴을 활용하여 모델 개발 프로세스를 효율적으로 관리할 수 있습니다. 예를 들어, TensorFlow, PyTorch와 같은 딥러닝 프레임워크는 오픈 소스로 제공되므로 별도의 라이선스 비용 없이 사용할 수 있습니다. TensorBoard, Weights & Biases와 같은 시각화 툴을 활용하면 모델의 학습 과정을 모니터링하고 성능을 분석하는 데 도움이 됩니다. 최근에는 Hugging Face의 Transformers 라이브러리를 통해 다양한 사전 학습된 모델을 쉽게 사용할 수 있게 되면서 OSS 모델 및 툴의 활용이 더욱 활발해지고 있습니다. 이러한 오픈 소스 기술을 적극적으로 활용하면 기업이나 개인도 경쟁력 있는 AI 모델을 개발하고 다양한 서비스에 적용할 수 있을 것입니다.
이번 주 코딩 에이전트 분야에서 가장 주목할 만한 것은 DeepSeek이 공개한 “DeepSeek Harness”일 것입니다. 단일 코딩 AI 제품이 아닌, Claude Code나 Cursor와 같은 도구의 기반이 되는 “에이전트 실행 기반(harness)” 자체를 MIT 라이선스로 공개한 점에 DeepSeek의 야심이 드러납니다. “모든 것이 플러그인”이라는 설계 철학에 따라 모델, 도구, UI를 자유롭게 조합할 수 있는 유연성을 특징으로 하며, 시스템 프롬프트나 툴 호출 기록이 모두 추적 전용 세션 로그에 저장되어 에이전트의 행동을 후속 조치하여 추적하기 쉽도록 설계되었습니다. 공개로부터 2일 만에 약 9만 5천 건, 4일 후에는 13만 5천 건 이상으로 GitHub 스타 수가 급증한 것은 코딩 에이전트 기반에 대한 관심의 고조를 보여줍니다. 다만 공식적으로 “개발 미리보기” 단계로 여겨지고 있으며, GitHub 연동 워크플로우 등 주변 기능은 Claude Code에 비해 여전히 부족한 상태입니다.
현지 실행을 모색하는 측면에서는 Qwen3.8-27B를 opencode와 같은 코딩 도구에 연결하려는 시도도 보고되고 있습니다. 하지만 긴 도구 연쇄를 수반하는 작업에서는 출력이 불안정해지는 경우가 지적되고 있으며, 실전 투입에는 아직 검증이 필요한 단계인 것으로 보입니다.
로컬/온디바이스
코딩 목적의 로컬 LLM으로서, Qwen3.8-27B의 등장을 통해 27B급이라는 실용적인 크기대의 선택지가 더욱 강화되었습니다.
정밀 평가
딥시크 해머스는 프롬프트의 시작 부분에 정적 컨텍스트를 고정하는 설계 덕분에 프롬프트 캐시를 효과적으로 활용할 수 있는 구조입니다. 독립적인 검증 결과 중에는 실제 측정에서 80%대의 수치를 보고하는 경우도 있습니다(딥시크 공식 벤치마크가 아닌 경우입니다). 8월 17일 피크/오프피크 가격 전환 이후 비용 최적화에 얼마나 효과적인지는 향후 실질적인 운영 데이터를 통해 확인해야 합니다. 미리보기 단계의 툴이므로 파괴적인 변화의 위험도 고려해야 합니다. GPT-5.6 솔의 가격 인하는 코딩 에이전트처럼 대량의 API 호출을 동반하는 워크로드의 비용 구조에 직접적인 영향을 미치므로 모델 선정 및 라우팅 설계 재검토에 좋은 시기가 될 수 있습니다.
정리
이번 주 주요 내용은 다음과 같습니다.
- 가격 경쟁이 드디어 플래그십 모델에도 도달했다: 7월 말에 저렴한 모델 Luna와 중위 모델 Terra를 인하한 OpenAI는 8월 21일에는 가격 동결이었던 최상위 모델 Sol에도 인하를 적용하여 Claude Opus 5보다 저렴한 가격대에 발을 들였다. 프론티어급의 성능을 얼마나 저렴하게 제공할 수 있는가라는 경쟁이 이번 주에도 구체적인 가격 개정이라는 형태로 표면화되었다.
- 딥시크(DeepSeek)가 모델에서 에이전트 기반으로 진출하여 “딥시크 해머스(DeepSeek Harness)”라는 오픈소스 에이전트 실행 기반을 공개, 공개 직후 며칠 만에 GitHub 스타가 13만 건을 넘는 반향을 불러일으켰습니다. 코딩 에이전트 영역에서 경쟁 축의 확산을 보여주는 움직임이며, 동시에 API 가격을 피크/오프피크제로 전환하는 등 인프라 및 요금 측면에서도 변화가 두드러졌습니다.
- 오픈 웨이트 모델이 이미지 편집 및 영상 분야에서도 두각을 나타냈다. 이미지 편집 아레나에서는 Microsoft AI의 MAI-Image-2.5-Pro가 1위를 차지했으며, 영상 분야에서는 MiniMax H3가 오픈 웨이트로서 주요 클로즈드 모델에 근접하는 점수를 기록했다. 텍스트 기반 모델뿐만 아니라, 다른 모다リティ에서도 클로즈드와 오픈 간의 격차가 줄어들고 있음을 확인할 수 있었다.
- 지역 LLM은 Qwen3.8-27B로 활기를 되찾고 지속되고 있으며, 8월 14일 공개된 Qwen3.8-27B에 대한 관심은 이번 주에도 이어지고 있습니다. 16~20GB급 VRAM으로 작동하는 실용적인 지역 모델의 선택지가 또 하나 늘었지만, 장시간 에이전트 태스크에서의 안정성 등 실무 적용을 위한 검증 과제도 드러나고 있습니다.
개인적으로 이번 주에 가장 큰 인상을 준 것은 DeepSeek Harness의 등장이었습니다. 모델 단체의 성능 경쟁뿐만 아니라, 에이전트를 어떻게 구성할 것인가라는 “기반” 레이어에서의 경쟁이 시작되고 있다는 것을 실감하게 합니다.
본 기사에 제시된 정보는 2026년 8월 23일 시점의 공개 정보를 기준으로 작성되었습니다. 실제 이용 시에는 반드시 원본 정보를 확인해 주시기 바랍니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 44청크
원문 보기 | 출처: note.com