# 화제의 익명 모델 'ox-alpha'는 Z.ai 제품이었다 'GLM-5.3-Flash' 공개, 중국산 AI 칩으로 추론

> https://bookfactory.kr/c/news/10751
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-30T00:48:39.567Z

---

중국의 AI 개발 기업 Z.ai는 2026년 8월 26일(현지 시간), AI 모델 'GLM-5.3-Flash'를 발표했다. 정식 공개 전에는 개발사를 밝히지 않고 'ox-alpha'라는 이름으로 OpenCode와 OpenRouter에서 익명 테스트를 진행하던 모델로, 검증 기간 동안의 트래픽은 중국산 AI 칩으로 처리했다고 한다. 같은 날, 모델 가중치도 MIT 라이선스로 공개했다.

## 익명 모델 'ox-alpha'의 정체는 GLM-5.3-Flash

GLM-5.3-Flash는 GLM-5 시리즈 최초로 네이티브 멀티모달을 지원하는 모델이다. 총 파라미터 수는 3200억 개이며, 추론 시 활성화되는 파라미터는 180억 개이다.

정식 발표에 앞서 Z.ai는 개발사를 밝히지 않고 'ox-alpha'라는 명칭으로 OpenCode와 OpenRouter에 투입해 사용자로부터 피드백을 수집했다. 회사 측에 따르면 익명 테스트 기간 동안 ox-alpha는 주간 기준 가장 많이 이용된 모델이 되었으며, 해당 트래픽은 모두 중국산 AI 칩으로 처리했다고 한다.

OpenCode에서도 ox-alpha 이용이 집중되었다. Z.ai가 공개한 7일간의 이용 현황에 따르면, ox-alpha의 토큰 사용량은 43조(43T)로 2위인 deepseek-v4-flash의 22조를 크게 상회했다.

■ OpenCode의 7일간 모델 이용 현황. ox-alpha는 43조 토큰으로 1위를 기록하며 2위인 deepseek-v4-flash(22조 토큰)를 크게 앞질렀다.

## 저비용을 내세운 GLM-5.3-Flash, 코딩 성능도 비교

GLM-5.3-Flash는 긴 컨텍스트에서의 추론 비용을 절감하기 위해 선형 어텐션과 스파스 어텐션을 결합한 하이브리드 구성을 채택했다. 최대 100만 토큰의 컨텍스트를 상정하여 인덱서의 메모리 사용량과 지연 시간을 줄이는 'IndexPool' 등도 도입했다.

Z.ai가 게재한 Artificial Analysis Intelligence Index v4.1.1 평가에서 GLM-5.3-Flash는 할인가 기준 1태스크당 0.045달러, Intelligence Index는 57을 기록했다. Z.ai는 동등한 수준의 점수를 가진 모델과 비교해 비용을 절감할 수 있다고 밝혔다.

코딩 및 AI 에이전트용 평가 결과도 공개했다. 자사 독자 평가인 'Z.ai Code Bench v1.0'에서 GLM-5.3-Flash는 추론에 할당하는 연산량을 늘림에 따라 정확도가 상승하여 최대 설정에서는 정확도 29.0%를 기록했다. 동일한 평가에서 Claude Opus 4.8은 29.5%였다.

## 중국산 AI 칩 대규모 클러스터에서 추론

Z.ai에 따르면 최근 1주일 동안 GLM-5.3-Flash를 중국산 AI 칩 기반의 대규모 클러스터에서 제공해 왔다.

회사 측은 개별 칩의 연산 능력 및 메모리 용량의 제약에 대응하기 위해 SGLang을 기반으로 GLM-5.3-Flash 전용 추론 엔진을 개발했다. 멀티모달 데이터 엔코딩, 프롬프트 처리, 토큰 생성을 각각 분리하여 처리하는 'Encode–Prefill–Decode(EPD)' 구성 등을 채택했다.

Z.ai는 동일한 하드웨어를 사용한 초기 구성에 비해 엔드투엔드 추론 성능을 3배 개선했다고 설명했다. 하드웨어 효율성과 토큰당 비용 측면에서도 주요 NVIDIA GPU와 비교 가능한 수준에 도달했다고 덧붙였다.

참고로, Z.ai가 이번에 밝힌 중국산 AI 칩의 사용은 GLM-5.3-Flash의 추론과 서비스 제공에 사용된 인프라에 관한 것이다. 해당 모델의 학습 자체를 중국산 AI 칩으로 진행했다는 설명은 아니다.

## 모델 가중치는 MIT 라이선스로 공개

GLM-5.3-Flash의 모델 가중치는 Hugging Face에 공개되어 있으며, 라이선스는 MIT이다. 로컬 환경에서의 추론에 대해서는 현재 시점에서 SGLang, vLLM, TokenSpeed를 지원한다고 밝혔다.

Z.ai는 GLM-5.3-Flash를 자사의 GLM Coding Plan에서도 제공하기 시작했다. 모델의 아키텍처와 추론 소프트웨어, 하드웨어를 조합하여 적은 연산 자원으로 추론 효율 향상을 도모하고 있다.

[원문 보기](https://ledge.ai/articles/z_ai_glm_5_3_flash_china_ai_chips) | 출처: Ledge.ai