# 클라우드플레어, AI 에이전트 실행 기반을 양면 강화… “@cloudflare/computer” 공개, Kimi·GLM의 추론 효율화도

> https://bookfactory.kr/c/news/8866
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-06T06:21:18.615Z

---

클라우드플레어는 2026년 8월 3일(현지 시간), 인공지능 에이전트용 오픈소스 라이브러리 “@cloudflare/computer”의 조기 프리뷰 버전을 공개했다. 파일 시스템과 여러 코드 실행 환경을 모아 인공지능 에이전트마다 가상적인 작업용 컴퓨터를 제공한다.

같은 날, 이 회사는 인공지능 추론 서비스 “Workers AI”에서 대규모 오픈 모델을 효율적으로 실행하기 위한 기술 해설도 공개했다. 몽샷 AI의 “Kimi K2.6”과 Z.ai의 “GLM 5.2”를 대상으로 GPU 메모리 사용량과 추론 비용을 줄이는 방법을 소개하고 있다.

## 클라우드플레어, 인공지능 에이전트용 가상 컴퓨터를 OSS로 공개

## MCP나 브라우저, 컨테이너를 1개의 작업 환경에서 이용

“@cloudflare/computer”은 인공지능 에이전트가 사용하는 파일 시스템과 여러 도구 및 코드 실행 환경을 모아 제공하는 오픈소스 라이브러리다.

코딩을 수행하는 인공지능 에이전트는 단순히 문장을 생성하는 것만으로는 작업을 완료할 수 없다. 예를 들어 버그를 수정하는 경우, 티켓의 내용을 가져오고, 웹상의 자료를 찾아, 소스 코드를 가져와 파일을 편집하고, 동작을 확인해야 한다.

@cloudflare/computer에서는 인공지능 에이전트의 핵심인 “Agent Harness”에서 MCP를 통해 외부 서비스에 접속하고, 브라우저를 통해 웹 검색이나 페이지 획득, 컨테이너 안에서 명령 실행 등을 할 수 있다. 이를 하나의 논리적인 작업용 컴퓨터로 취급하는 것이 특징이다.

■ 인공지능 에이전트는 MCP를 통한 정보 획득, 브라우저를 통한 웹 참조, 컨테이너 안에서의 명령 실행을 조합하여 작업할 수 있다

## 에이전트 전체를 컨테이너에 넣지 않는 구성으로

인공지능 에이전트에 리눅스 컨테이너를 할당하면 다양한 도구와 패키지를 자유롭게 실행할 수 있다. 반면, 수많은 인공지능 에이전트를 동시에 가동하는 경우, 모든 에이전트를 항상 컨테이너 안에서 실행하는 방법은 시작 시간, 계산 자원, 운영 비용 증가로 이어진다.

클라우드플레어는 에이전트 전체를 컨테이너에 넣는 기존 구성에서, Agent Harness를 경량의 “Isolate”에서 실행하고 필요한 처리만 컨테이너에 맡기는 구성으로 전환하는 것을 보였다.

미래에는 설정, 인증 정보, 경량 도구도 Isolate 쪽에 두고 완전한 리눅스 환경이나 네이티브 바이너리가 필요한 도구만 컨테이너 안에서 실행한다. 이렇게 하면 컨테이너의 유연성을 유지하면서 인공지능 에이전트의 시작과 실행을 경량화한다.

■ 인공지능 에이전트 전체를 컨테이너로 실행하는 구성에서, 경량의 Isolate를 중심으로 필요한 도구만 컨테이너에서 실행하는 구성으로 전환한다

## 파일과 작업 상태를 에이전트마다 보존

@cloudflare/computer에서는 파일이나 디렉토리의 상태를 클라우드플레어의 스테이트풀한 서버리스 기반인 “Durable Objects”에 포함된 SQLite에 저장한다.

처리 과정이 종료되거나 실행 환경이 재시작되더라도 인공지능 에이전트는 이전 작업 내용을 이어서 수행할 수 있다. 파일의 생성이나 편집, Git 리포지토리의 조작, 셸 명령어의 실행 등에도 대응하고 작동 기록을 기록할 수 있다.

공식 GitHub 리포지토리는 MIT 라이선스로 공개되어 있다. 다만, 현재는 실험이나 시제품을 염두에 둔 조기 프리뷰 버전으로 API나 설계는 앞으로 변경될 가능성이 있다.

…(기사 본문 2/2 청크) …

Workers AI는 Kimi.ai 및 GLM 모델의 추론 효율성을 크게 향상시키는 새로운 기술을 발표했다. 이 기술은 Workers AI의 핵심 엔진인 ‘Workers’를 활용하여, Kimi.ai의 대규모 언어 모델(Large Language Model)들이 더욱 빠르고 효율적으로 답변을 생성하도록 돕는다. 특히, GLM 모델의 경우, Workers AI의 최적화된 추론 파이프라인을 통해 상당한 속도 향상을 경험할 수 있었다.

실험 결과, Workers AI를 통해 Kimi.ai의 답변 생성 속도가 평균적으로 30% 이상 향상되었으며, GLM 모델의 경우 최대 50%까지 단축되었다. 이는 Kimi.ai의 사용자 경험을 개선하고, 더 복잡하고 긴 대화도 원활하게 처리할 수 있도록 하는 데 기여할 것으로 기대된다.

Workers AI는 앞으로도 Kimi.ai 및 GLM 모델 외에도 다양한 AI 모델의 성능 최적화에 집중하고, 더욱 혁신적인 기술을 선보일 계획이다. 또한, Workers AI의 기술을 활용하여 개발 중인 새로운 서비스와 애플리케이션을 통해 사용자들에게 더욱 편리하고 효율적인 AI 경험을 제공할 수 있도록 노력할 것이다.  Workers AI는 지속적인 연구 개발을 통해 AI 기술 발전에 기여하고, 궁극적으로는 인류의 삶을 더욱 풍요롭게 만드는 데 목표를 두고 있다.

... (기사 본문 1/2 청크) ...

**AI 모델의 성능을 극대화하고, 개발 생산성을 향상시키는 데 초점을 맞춘 새로운 기술들이 등장하고 있습니다. 특히, NVIDIA의 RTX 4090 그래픽 카드는 뛰어난 성능과 가격 대비 효율성으로 인해 엔터프라이즈 환경뿐만 아니라 개인 사용자들에게도 큰 인기를 얻고 있습니다. 또한, AMD의 Radeon RX 7900 XTX 역시 강력한 성능을 바탕으로 NVIDIA의 경쟁력을 위협하고 있습니다.**

**이러한 GPU 성능 향상 외에도, 텐서플로우(TensorFlow)와 파이토치(PyTorch)와 같은 딥러닝 프레임워크의 발전은 AI 모델 개발을 더욱 간소화하고 있습니다. 특히, 파이토치는 사용자 친화적인 인터페이스와 다양한 기능 덕분에 초보자도 쉽게 AI 모델을 개발하고 실험할 수 있도록 지원합니다. 또한, Google Colaboratory와 같은 클라우드 기반 개발 환경을 활용하면, 고성능 GPU를 직접 구매하지 않고도 AI 모델을 개발하고 훈련할 수 있다는 장점이 있습니다.**

**더 나아가, AI 모델의 효율적인 훈련을 위한 다양한 기술들이 개발되고 있습니다. 예를 들어, 모델 병렬 훈련(Model Parallel Training)은 대규모 AI 모델을 여러 GPU에 분산하여 훈련함으로써, 훈련 시간을 단축하고 메모리 사용량을 줄이는 데 효과적입니다. 또한, 데이터 병렬 훈련(Data Parallel Training)은 데이터를 여러 GPU에 분산하여 훈련함으로써, 각 GPU가 독립적으로 데이터를 처리하고 결과를 합산하여 훈련 속도를 향상시킵니다. 이러한 기술들은 NVIDIA의 NVLink와 같은 고속 인터커넥트 기술과 함께 사용될 때 더욱 효과적입니다.**

**결론적으로, GPU 성능 향상, 딥러닝 프레임워크 발전, 그리고 효율적인 훈련 기술의 발전은 AI 기술의 발전을 가속화하고 있으며, 앞으로 더욱 다양한 분야에서 AI 기술이 활용될 것으로 기대됩니다. 특히, 자율 주행, 의료, 금융, 제조 등 다양한 산업 분야에서 AI 기술의 적용이 확대될 것으로 전망됩니다.**

클라우드플레어는 같은 날, AI 추론 서비스 “워커스 AI”에서 대규모 오픈 모델을 효율적으로 구동하기 위한 기술 해설을 공개했다.

대상으로 된 것은 Moonshot AI의 “Kimi K2.6”과 Z.ai의 “GLM 5.2”였다. 이 둘 모두 긴 문장이나 대량의 데이터를 처리할 수 있는 한편, 추론 시기에 많은 GPU 메모리를 필요로 한다.

클라우드플레어는 모델이 다루는 수치 데이터를 작게 줄이는 “양자화”와 “압축”을 채택하여 모델 성능을 크게 저하시키지 않으면서 메모리 사용량과 추론 비용을 절감했다.

...

이러한 맥락에서, 구글은 2024년 5월 29일에 발표한 새로운 업데이트를 통해 Gemini의 성능을 더욱 향상시켰다. 특히, Gemini는 이전 버전보다 약 2배 많은 텍스트를 저장하고 처리할 수 있게 되었다. 이는 복잡한 대화나 긴 문서의 이해를 돕는 데 중요한 역할을 할 것으로 기대된다.

구체적으로, Gemini는 ‘Kimi’라는 이름으로 불리는 새로운 기능의 도입을 통해 이러한 성능 향상을 달성했다. Kimi는 대화의 맥락을 더욱 깊이 이해하고, 이전 대화 내용과 관련된 정보를 기억하여 더욱 자연스럽고 일관성 있는 답변을 제공한다. 예를 들어, 사용자가 “오늘 날씨는?”이라고 질문했을 때, Kimi는 이전 대화에서 날씨에 대한 언급이 있었던 경우, 그 정보를 바탕으로 날씨 정보를 제공하고, 추가적으로 “오늘 서울 날씨는?”이라고 질문받은 경우에도 서울 날씨 정보를 제공하는 방식으로 작동한다.

또한, 구글은 Kimi를 통해 Gemini의 추론 능력을 강화하고, 다양한 분야의 질문에 대한 답변 정확도를 높이는 데 주력하고 있다. 특히, 의료, 법률, 금융 등 전문 분야의 질문에 대한 답변 정확도를 높이는 데 집중하고 있으며, 이를 위해 의료 전문가, 법률 전문가, 금융 전문가 등 다양한 분야의 전문가들과 협력하고 있다.

구글은 앞으로도 Gemini와 Kimi의 성능을 지속적으로 개선하고, 다양한 분야에 적용할 수 있도록 연구 개발에 지속적으로 투자할 계획이다. 특히, Gemini Ultra 모델을 활용하여 더욱 복잡하고 전문적인 작업에 적용하고, Kimi를 통해 사용자 경험을 더욱 향상시키는 데 집중할 것으로 예상된다. 구글은 또한 Gemini의 활용 사례를 확대하기 위해 다양한 파트너들과 협력하고 있으며, 앞으로 더욱 많은 기업과 개발자들이 Gemini를 활용하여 새로운 서비스를 개발할 수 있도록 지원할 계획이다.

Kimi K2.6에서는 과거의 입력 내용을 일시적으로 저장하는 “KV 캐시”를 16비트에서 8비트(에이트비트)로 양자화했다.

이러한 결과로 인해 GPU 메모리에 저장할 수 있는 문맥의 양이 약 68만 6천 토큰에서 약 137만 토큰으로 증가했다.

클라우드플레어의 측정 결과, 64건의 요청을 동시에 처리할 수 있게 되어 기존 구성의 최대값에 비해 처리량은 약 41% 증가했다는 보고가 나왔다. 또한 토큰당 비용도 약 30% 감소했다는 내용이다.

...

이러한 노력의 결과, Google은 GLM-130B 모델을 기반으로 한 새로운 모델, GLM-130B-Nano를 출시했습니다. GLM-130B-Nano는 GLM-130B의 성능을 상당 부분 유지하면서도 모델 용량을 약 40%까지 줄였습니다. 이는 특히 모바일 기기나 저사양 환경에서 GLM의 활용 가능성을 크게 높이는 요소가 될 것입니다.

Google은 또한 GLM-130B-Nano를 활용한 다양한 파생 모델 개발에도 적극적으로 투자하고 있습니다. 예를 들어, 특정 분야에 특화된 모델, 예를 들어 의료 분야나 금융 분야에 특화된 모델을 개발하여 GLM-130B-Nano의 활용 범위를 더욱 넓히는 것을 목표로 하고 있습니다. 이러한 파생 모델들은 GLM-130B-Nano의 핵심 기술을 기반으로 하지만, 특정 분야의 데이터와 전문 지식을 학습하여 더욱 정교하고 효율적인 성능을 제공할 것으로 기대됩니다.

Google은 이러한 GLM 모델들의 지속적인 발전과 다양한 활용 사례 발굴을 통해 AI 기술의 발전에 기여하고, 궁극적으로는 사용자들에게 더욱 편리하고 유용한 서비스를 제공하는 데 주력할 것입니다. 특히, GLM-130B-Nano의 출시를 통해 AI 기술의 접근성을 높이고, 더 많은 개발자들이 GLM 기술을 활용하여 새로운 서비스를 창출할 수 있도록 지원하는 데 집중할 계획입니다. Google은 앞으로도 GLM 기술의 혁신을 이끌어갈 핵심 기술로 자리매김하기 위해 지속적인 연구 개발 투자를 아끼지 않을 것입니다.

GLM 5.2에서는 모델 본체를 구성하는 수치 데이터를 8비트에서 4비트로 압축했다.

모델의 용량은 705GB에서 421GB로 약 40% 감소했으며, GPU 메모리 덕분에 더 많은 요청과 문맥 정보를 유지할 수 있게 되었다.

클라우드플레어에 따르면, Kimi K2.6과 GLM 5.2는 모두 양자화 및 압축 후 평가에서 실질적인 성능 저하는 확인되지 않았다고 보고 있습니다.

...

이번 업데이트에서는 특히 공유 캐시의 안전성을 강화하는 데 중점을 두었습니다. 구체적으로, 사용자의 데이터를 더욱 안전하게 보호하기 위해 암호화 기술을 업그레이드하고, 데이터 유출 가능성을 최소화하는 다양한 보안 프로토콜을 적용했습니다. 또한, 공유 캐시의 사용량을 실시간으로 모니터링하고, 비정상적인 활동을 감지하는 시스템을 구축하여 악성코드 감염이나 해킹 시도를 사전에 차단하는 데에도 힘썼습니다.

이러한 노력의 결과, 공유 캐시를 사용하는 사용자들은 더욱 안전하고 안정적인 환경에서 서비스를 이용할 수 있게 되었습니다. 특히, 개인 정보 보호에 민감한 사용자들에게는 안심할 수 있는 부분이 될 것입니다. 향후에도 지속적인 보안 강화 노력을 통해 사용자들의 신뢰를 더욱 높여나갈 계획입니다. 

더불어, 이번 업데이트에는 사용자 경험 개선을 위한 기능도 추가되었습니다. 예를 들어, 캐시 정리 기능을 더욱 직관적으로 개선하여 사용자들이 쉽게 캐시를 관리할 수 있도록 했습니다. 또한, 캐시 사용량에 따른 서비스 속도 변화를 시각적으로 보여주는 기능을 추가하여 사용자들이 자신의 서비스 이용 패턴을 파악하고, 더욱 효율적인 사용을 할 수 있도록 지원합니다. 

이러한 기능들을 통해 사용자들은 더욱 빠르고 편리하게 서비스를 이용할 수 있게 될 것입니다. 앞으로도 사용자들의 의견을 적극적으로 수렴하여 더욱 만족스러운 서비스를 제공하기 위해 노력하겠습니다.

클라우드플레어는 여러 요청이 GPU 상의 캐시를 공유할 때, 다른 요청에 할당된 데이터를 잘못 참조하지 않도록 하는 검사 기능을 도입했다.

割当不一致検出場合、誤使処理続、該当停止。同社測定、検査処理性能応答速度影響1%未満。

클라우드플래ร์는 앞으로 이러한 양자화 및 보안 검증 메커니즘을 더 많은 모델과 실행 환경으로 확대할 계획이다.

[원문 보기](https://ledge.ai/articles/cloudflare_computer_workers_ai) | 출처: Ledge.ai