# 딥시크(DeepSeek)가 화웨이와 협력하여 Ascend용 “TileLang” 등 6가지 AI 개발 도구를 오픈 소스 공개, NVIDIA의 CUDA 의존성 완화를 목표로 함

> https://bookfactory.kr/board/news/19882
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-03T23:07:29.419Z

---

중국의 AI 기업인 DeepSeek이 Huawei와 협력하여 Huawei 제조 AI 칩 “Ascend”용 프로그래밍 기반을 공개했습니다. 공개된 소프트웨어에는 고성능의 연산 프로그램을 개발하기 쉽게 하는 “TileLang”과 행렬 계산 라이브러리 “DeepGEMM Ascend” 등이 포함되어 있으며, 이 모두가 오픈 소스 형태로 공개되었습니다. DeepSeek은 CUDA보다 간결하게 작성할 수 있는 프로그래밍 환경을 제공하면서 하드웨어 성능을 극대화하는 것을 목표로 하고 있다고 설명하고 있습니다. DeepSeek 오픈 昇腾 基础组件 https://mp.weixin.qq.com/s/X41mKH4Ds-VXUAnK6M8Eww DeepSeek은 Huawei와 칩 프로그래밍 도구를 개발하기 위해 협력하여 Nvidia에 대한 의존도를 줄이고 있습니다 | Reuters https://www.reuters.com/world/asia-pacific/deepseek-partners-with-huawei-develop-chip-programming-tools-reducing-reliance-2026-09-30/ 중국 AI 산업은 Deepseek이 Huawei의 Ascend 칩용 오픈 소스 소프트웨어를 출시함에 따라 굳어지고 있습니다 | The Decoder https://the-decoder.com/chinas-ai-industry-closes-ranks-as-deepseek-ships-open-source-software-for-huaweis-ascend-chips/ 중국의 DeepSeek은 Huawei 칩이 Nvidia를 대체하도록 돕는 도구를 오픈 소스화합니다 | South China Morning Post https://www.scmp.com/tech/tech-trends/article/3369301/chinas-deepseek-open-sources-tools-help-huawei-chips-supplant-nvidia-ai AI 모델의 학습 및 추론에서는 GPU 또는 NPU와 같은 가속기의 성능뿐만 아니라 하드웨어를 효율적으로 작동시키는 소프트웨어 환경도 중요합니다. NVIDIA는 GPU에 더하여 병렬 계산 플랫폼 “CUDA”와 수많은 라이브러리를 오랫동안 제공해 왔으며, AI 개발자가 NVIDIA 칩을 쉽게 사용할 수 있도록 환경을 조성해 왔습니다.

한편 Huawei는 자체 AI 가속기 시리즈인 “Ascend”를 개발하고 있습니다. 2026년 6월에 Huawei의 Ascend 910C를 사용하여 DeepSeek-V4-Pro의 사후 학습에 성공했다는 사실이 밝혀지고 있으며, DeepSeek이 Huawei 제조 AI 칩을 대량 도입할 계획이 있다는 소식도 있으며, Ascend의 성능을 극대화하기 위한 소프트웨어 보강의 필요성이 높아지고 있습니다. DeepSeek이 내몽골 자치구에 데이터 센터를 건설하여 Huawei 제조 AI 칩 16만 기를 도입할 예정이라는 보도, 중국산 GPU로 AI를 개발 및 운영하는 움직임이 가속화됨 - GIGAZINE

DeepSeek에 따르면 Huawei는 이번 프로그래밍 기반 개발을 전면적으로 지원한 것으로 알려졌습니다. 양사는 Ascend 950을 128기 탑재하는 “슈퍼노드”를 위한 최적화에도 참여하고 있으며, 연산 처리와 칩 간 통신 모두를 조정하고 있습니다. 개발 환경에서 특히 중요한 역할을 담당하는 것이 오픈 소스 도메인 특정 언어 “Tile Language(TileLang)”입니다. 도메인 특정 언어는 특정 용도에 맞춰 설계된 프로그래밍 언어를 의미하며, TileLang은 GPU 또는 NPU에서 실행하는 고성능의 “커널”이라는 작은 연산 프로그램을 비교적 간결한 코드에서 작성할 수 있도록 설계되었습니다. GitHub - tile-ai/tilelang: Domain-specific language designed to streamline the development of high-performance GPU/CPU/Accelerators kernels · GitHubhttps://github.com/tile-ai/tilelang

타일랭(TileLang)은 NVIDIA CUDA, AMD ROCm, Apple Metal 등 여러 실행 환경에 대응하는 고수준의 개발 환경으로, 2026년 9월 30일부터 Huawei Ascend 950도 공식적인 백엔드로서 지원하게 되었습니다. Ascend 950에 대해서는 네이티브 코드 생성, 자동 스케줄링, 동기 처리 등 지원됩니다. DeepSeek은 타일랭에 대해 CUDA보다 단순한 프로그래밍 모델을 제공하면서 하드웨어 성능을 극대화하는 것을 목표로 한 것이라고 설명했습니다. 더불어 DeepSeek은 타일랭뿐만 아니라 AI 모델을 실제로 고속화하기 위한 라이브러리도 Ascend를 위해 공개했습니다. “DeepGEMM Ascend”는 AI에서 빈번하게 사용되는 행렬 곱셈을 고속으로 실행하기 위한 라이브러리입니다. 기존의 DeepGEMM과 동일한 API와 개발 절차를 이용할 수 있도록 설계되어 있으며, BF16, FP8, FP4 등의 계산을 지원합니다. Ascend 특유의 메모리 배치 및 주소 계산과 같은 저수준 처리를 숨어 개발자가 비교적 간결한 코드에서 고속 연산을 구현할 수 있도록 해줍니다. “DeepEP Ascend”는 대규모 언어 모델의 학습 및 추론에 사용되는 고성능 통신 라이브러리로, 여러 전문 모델을 활용하는 Mixture of Experts(MoE) 등에서 필요로 하는 여러 NPU 간의 데이터 통신을 고속화합니다. 공개 API는 NVIDIA용 DeepEP와 동일하게 제공되는 것으로 알려져 있습니다. “TileKernels”는 타일랭을 사용하여 구현한 수십 종류의 고속 커널을 모아놓은 라이브러리입니다. MoE의 라우팅, 양자화 등 대규모 언어 모델에서 빈번하게 사용되는 처리가 마련되어 있으며, 2026년 9월 30일의 업데이트에서 Huawei Ascend에 대한 지원이 추가되었습니다. NVIDIA GPU와 Huawei NPU 중 어느 것을 사용하고 있는지 실행 시점에 자동으로 판단되며, 동일한 Python API를 이용할 수 있습니다.

AI가 긴 문장을 처리할 때 중요해지는 어텐션 처리(Attention Processing)를 가속화하는 “FlashMLA”도 Huawei Ascend NPU에 대응했습니다. DeepSeek-V4.1의 추론에 사용되는 라이브러리로, GitHub에서는 일부 처리 부분에 대해 Ascend 950에서 이론 성능의 95%에 도달했다고 보고되었습니다. 대량의 후보에서 값의 큰 상위 K개 항목을 선택하는 TopK 처리(TopK Processing)를 가속화하는 “DeepSelect”에도 Ascend를 위한 커널이 추가되었습니다. DeepSelect는 DeepSeek Sparse Attention 등으로 사용되는 처리를 가속화하는 라이브러리로, DeepSeek은 일반적인 “torch.topk”와 비교해서 조건에 따라 2배~20배의 가속화가 가능하다며 설명하고 있습니다. DeepSeek은 “범용적이고 프로그래밍하기 쉽고 하드웨어 성능을 끌어낼 수 있는 고수준 언어”가 AI 가속기(Accelerator)를 위한 소프트웨어 환경에는 필요하다고 설명하며, TileLang를 포함한 오픈소스 툴(Tool) 군을 통해 Huawei Ascend를 위한 개발 환경을 넓혀갈 방향성을 제시하고 있습니다.

[원문 보기](https://gigazine.net/news/20261001-deepseek-huawei-ascend/) | 출처: Gigazine