# Z.ai가 중국산 AI 인프라에서 “GLM-5.3-Flash” 본번 서비스 제공 노하우 공유, AI 에이전트로 인프라 관리 및 NVIDIA GPU 수준까지 효율화 기술 공개

> https://bookfactory.kr/board/news/17580
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-18T05:07:15.254Z

---

중국 AI 기업 Z.ai가 “GLM-5.3-Flash” 본번 서비스 제공을 위해 자체 추론 인프라 구조를 어떻게 구축했는지 블로그에서 설명하고 있습니다. Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure https://z.ai/blog/glm-built-its-inference-infrastructure 본 환경의 트래픽을 확실하게 처리할 수 있는 고성능 추론 서비스를 제공하기 위해서는 대규모 시스템 엔지니어링 작업이 필요합니다. GLM-5.3-Flash 출시와 관련하여 Z.ai는 10만 대 이상의 중국산 AI 가속기로 구성된 클러스터에서 본 환경 수준의 추론 서비스를 처음부터 구축하고 있다고 합니다. 기사 작성 시점에도 GLM-5.3-Flash의 모든 본 환경에서의 추론 처리는 이 시스템에서 실행되고 있으며, 이에 대해 Z.ai는 “이는 쉬운 일이 아니었습니다. 지금까지 이 정도 규모로 중국산 AI 가속기 클러스터를 배포한 사례는 전무했기 때문입니다. 칩의 메모리 용량과 대역폭이 비교적 제한적이었지만, 새로운 모델 아키텍처, 100만 토큰의 컨텍스트 윈도우, 그리고 멀티모달한 요청을 지원해야 했습니다. 생태계는 미성숙했고, 커널 지원도 불완전하여 원래 문서화되어야 할 내용의 상당 부분이 추측에 의존해야 했습니다. 결국 이 작업은 완료되었습니다. 하지만 이는 인프라 엔지니어 팀만으로 이루어진 것이 아닙니다. 작업의 대부분은 GLM-5.3을 탑재한 인프라 에이전트가 실행했습니다.”라고 설명하고 있습니다.

GLM-5.3.3을 활용하여 GLM-5.3-Flash의 추론 인프라를 구축하고 최적화하는 방법을 공유합니다. 시스템은 처음 성공적인 실행에서부터 생산 준비 상태까지 2주 미만 만에 도달했으며, 전체적인 처리량은 초기 기준선 대비 3배로 증가했습니다. 핵심…

GLM-5.3-Flash는 Ox-Alpha라는 이름으로 OpenCode 및 OpenRouter에서 실제 운영 테스트가 진행되었습니다. GLM-5.3-Flash는 출시 후 1주일 이내에 양 플랫폼에서 가장 많이 사용되는 AI 모델이 되었으며, 6일 동안 62조 토큰 이상을 처리했다고 합니다.

이 프로세스에 의해 “인프라 에이전트의 엔지니어링상의 유효성은 모델의 코드 생성 및 추론 능력뿐만 아니라 시스템이 특정 원인에 도달할 수 있는 유용한 피드백을 지속적으로 제공할 수 있는가에 크게 의존하는 것이 점차 분명해지고 있습니다”라고 Z. ai가 언급했다.

하지만, 에이전트가 코드베이스 전체를 이해했더라도, 변경 후 “수치 정확성 테스트가 실패했다”, “TTFT가 30% 증가했다”, “출력 슬루프트가 20% 감소했다”와 같은 피드백을 받았을 때 “어떤 레이어가 원인인가”, “왜 현재 가설이 틀렸는가”, “다음으로 무엇을 테스트해야 하는가”를 판단하는 것은 매우 어려운 작업이라는군요.

엔드 투 엔드 메트릭스는 결과가 악화된 것을 에이전트에게 전달하는 데는 도움이 되지만, 그 이유를 설명할 수는 없습니다.

이에 따라, 단편적인 엔드 투 엔드 결과로부터 다음 액션을 직접 유도하기 위한, 세밀하고 원인을 특정할 수 있는 엔지니어링 피드백을 생성하는 방법이 필요하게 되었다고 Z. ai가 언급했습니다.

이는 인프라 에이전트의 효과적인 피드백 루프를 구축하기 위한 열쇠가 되기도 합니다.

이에 Z. ai는 “고밀도 피드백”을 채택했습니다. 고밀도 피드백의 특징은 다음과 같이 3가지 있다고 합니다.

피드백은 충분히 지역적이어야 하며, 2) 피드백은 저비용 및 신속하게 획득할 수 있어야 하며, 3) 피드백은 객관적인 검증을 지원해야 합니다. 이 세 가지 특성을 모두 갖추면 피드백이 실행 가능한 것입니다.

정확성에 대한 피드백은 “계산이 올바른가?”라는 질문에 답합니다.

시스템 동작에 대한 피드백은 “시간이 어디에 소비되고 있는가?”를 명확히 합니다.

성능에 대한 피드백은 “어떤 방법이 더 효과적이며 어떤 조건에서 효과를 발휘하는가?”를 판단합니다.

이 프로세스에서 로컬 검증과 엔드투엔드 테스트는 각각 다른 역할을 수행합니다.

로컬 검증은 부정확하거나 효과 없는 변경 사항을 조기에 제거하고, 추구할 가치가 있는 후보를 식별하는 데 도움이 되며, 엔드투엔드 테스트는 로컬에서의 결과가 실제 서비스 개선으로 이어지는지, 그리고 제안된 변경이 실제 워크로드 하에서 새로운 결함을 유발하는지 확인합니다.

이러한 원칙에 따라 GLM-5.3-Flash의 출시에서는 엔지니어, 인프라 에이전트, 실험 환경이 관여하는 최적화 루프가 확립되었습니다.

엔지니어는 목표와 시스템 경계를 정의하고, 에이전트는 분석 및 가설 수립, 코드 변경을 담당했습니다.

Z.ai는 계산량을 늘림으로써 메모리 대역폭 소비를 억제하고, 장치 간 통신을 늘림으로써 각 장치의 메모리 사용량을 억제하는 독자적인 방법을 포함하는 적극적인 메모리 최적화를 수행했습니다. 그 결과, 선형 어텐션과 LM(언어 모델) 헤드에 대한 노드 내 텐서 병렬 처리, ReplaySSM, W8A8 양자화, INT8/FP8/BF16을 사용한 혼합 정밀도 캐시 양자화, 레이어 분할과 같은 여러 중요한 기술을 결합한 스택을 구축하는 데 성공했습니다. 더 나아가, 인코딩·프리필·디코딩(EPD) 분리 아키텍처를 도입했습니다. 이러한 최적화로 인해 엔드 투 엔드 서비스 성능이 약 3배 향상되었다고 Z.ai는 보고했습니다. 이들로 인해 하드웨어 활용 효율과 토큰당 비용은 모두 주요 NVIDIA GPU 수준에 도달했다고 Z.ai는 밝혔습니다. 인프라 에이전트의 피드백 루프가 최적화 프로세스 전체를 통해 기능함으로써 GLM-5.3-Flash는 초기 모델의 적응부터 본판 운영까지 무려 2주 만에 완료되었습니다. 최종적으로 초기 베이스라인과 비교하여 엔드 투 엔드 슬루프트를 3배 향상시키는 데 성공했습니다. 아래 그림은 GLM-5.3-Flash가 첫 실행부터 본판 운영에 이르기까지의 성능 변화를 보여주는 것입니다.

그리고 실험 환경은, 계층화된 시의적절하고 검증 가능한 피드백을 제공했습니다.

“이것들이 연동됨으로써, 이전에는 엔지니어의 경험에 의존했던 진단 프로세스가 에이전트가 지속적으로 실행할 수 있는 엔지니어링 워크플로우로 변혁되었습니다”라고 Z.ai는 표현했습니다.

Z.ai는 “피드백의 가치는 그 양이 아닌, 에이전트가 당면한 문제에 답하는 데 도움이 되는지에 달려있다”고 지적했다. 대량의 비정형 로그는 중요한 신호를 가릴 수 있으며, 포괄성에 결여된 프로파일링은 잘못된 귀속으로 이어질 수 있으며, 마이크로 벤치마크에서 유효한 최적화가 엔드투엔드 성능 향상으로 이어진다고 단정할 수 없다고 지적했다. 또한, 피드백 환경을 구축하려면 테스트 로그, 성능 데이터만 제공하는 것만으로는 충분하지 않으며, 각 유형의 관측이 어떤 판단을 뒷받침할 수 있는지, 그 한계는 무엇인지, 그리고 어떤 결론을 더 나은 실험으로 검증해야 하는지를 명확히 해야 한다고 설명했다. Z.ai의 공동 창업자인 譚志傑(譚ジージェ) 氏は、GLM-5.3을 기반으로 한 인프라 에이전트 기반 추론 인프라 구조 구축에 대해 X에서 언급했다.

두 주 정도 걸렸다. GLM-5.3-Flash의 첫 실행을 국내 가속기로부터 시작하여 모든 생산 트래픽을 서비스하는 데 이르기까지, 그 과정에서 3.2×의 전체 처리량을 달성했다. 계속 생각나는 것은 누가 많은 작업을 수행했는지인데: GLM-5.3.으로 구동되는 Infra Agent… https://t.co/1ssi0Af3CJ

[원문 보기](https://gigazine.net/news/20260918-how-glm-built-inference-infrastructure/) | 출처: Gigazine