# 클라우드플레어가 거대 AI 모델의 고속 추론 서비스 확대를 위한 효율화 기법을 공개

> https://bookfactory.kr/c/news/8819
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-04T05:11:42.903Z

---

클라우드플레어는 개방형 AI 모델을 활용한 추론 서비스 “워커스 AI”를 제공하고 있습니다. 이 클라우드플레어 워커스 AI에서 활용하는 AI의 추론 효율을 향상시키는 기술을 설명하는 기사가 클라우드플레어 공식 블로그에 게시되었습니다. 더 작고, 빠르고, 안전하게: Kimi와 GLM을 대규모로 실행하기 | 클라우드플레어 블로그 https://blog.cloudflare.com/smaller-faster-safer-models/ 클라우드플레어 워커스 AI에서는 Moonshot AI의 Kimi 시리즈와 Z.ai의 GLM 시리즈와 같은 대형 AI 모델을 제공하고 있습니다. 대형 AI 모델은 메모리를 과다하게 소비하기 때문에, 빠른 추론 서비스를 제공하기 위해서는 소비 메모리를 줄이는 대책이 필수적입니다.

워커스 AI 모델 · 클라우드플레어 워커스 AI 문서 https://developers.cloudflare.com/workers-ai/models/

클라우드플레어가 실시하고 있는 소비 메모리 감소 기술의 하나가 “양자화”입니다. GLM-5.2의 경우, INT4로 양자화하여 추론 서비스를 제공하고 있습니다. FP8 버전의 GLM-5.2 파일 크기는 705GB이지만, INT4 버전에서는 421GB로 줄어듭니다. 일반적으로 AI 모델은 계산 정밀도를 낮추는 정도가 성능 저하로 이어질 수 있다고 여겨지지만, 클라우드플레어에 따르면 INT4 버전 GLM-5.2에도 눈에 띄는 성능 저하는 나타나지 않는다고 합니다. FP8 버전 GLM-5.2와 INT4 버전 GLM-5.2의 벤치마크 결과는 다음과 같으며, INT4로 양자화해도 FP8에 비해 성능 저하가 억제되는 것이 확인됩니다.

디코딩 단계에서 모델의 가중치를 GPU 메모리에서 읽어내야 하기 때문에, 모델의 크기가 작을수록 처리 속도가 향상됩니다. 따라서 FP8 버전 GLM-5.2보다 INT4 버전 GLM-5.2가 더 빠른 처리 속도를 제공합니다. 다만, 첫 번째 토큰을 출력하는 데 걸리는 프리필 단계에서는 FP8 버전이 더 빠릅니다.

클라우드플레어는 KV 캐시의 양자화도 실시하고 있습니다. KV 캐시는 계산된 내용을 저장해 두어 동일한 내용의 재계산을 생략하여 빠르게 처리하는 기술입니다. 추론 엔진 “SGLang”에서는 KV 캐시를 일반적으로 BF16으로 저장하지만, 클라우드플레어는 KV 캐시를 FP8로 양자화하여 메모리에 저장할 수 있는 KV 캐시의 양을 늘리고 있습니다. Kimi K2.6의 경우, 메모리에 저장할 수 있는 컨텍스트의 양이 약 68만 6천 토큰에서 약 137만 토큰으로 증가합니다. KV 캐시를 양자화하면 읽기 위해 필요한 처리량이 늘어나 처리 속도가 약간 저하됩니다. 요청 수에 따른 처리 속도를 요약한 표가 다음과 같습니다. KV 캐시를 FP8로 양자화하면 처리 속도가 약간 저하되지만, BF16보다 더 많은 요청을 동시에 처리할 수 있습니다.

클라우드플레어는 앞으로도 NVFP4로의 양자화를 검토하거나, KV 캐시의 양자화를 더욱 정교하게 함으로써 더 많은 사용자를 저 비용으로 지원할 수 있도록 노력하고 있습니다.

[원문 보기](https://gigazine.net/news/20260804-cloudflare-ai-kimi-glm/) | 출처: Gigazine