이미지 출처: ChatGPT에 의해 ledge.ai 가 생성
중국 AI 기업 DeepSeek은 2026년 9월 30일, Huawei의 기술 지원을 받아 Huawei 제조 AI 칩 “Ascend”용 개발 기반을 오픈 소스 형태로 공개 및 확대했다. 프로그래밍 언어 “TileLang”의 Ascend 950 대응에 더불어 행렬 계산, 칩 간 통신, 어텐션 처리 등을 담당하는 라이브러리를 정비했다.
## TileLang이 Ascend 950에 공식 대응
TileLang은 AI의 학습 및 추론에 사용되는 “커널”이라고 불리는 연산 프로그램을 Python과 유사한 기법으로 개발할 수 있는 언어이다. 행렬 곱셈이나 어텐션과 같은 처리를 記述하고, 컴파일러가 대상 하드웨어에 맞는 코드에 변환한다.
TileLang은 이전부터 NVIDIA GPU 등에도 대응해 왔으며, 이번에 Ascend 950을 공식 대응 대상으로 추가했다. Ascend에 대한 네이티브 코드 생성, 자동 스케줄링, 동기화 처리 등을 제공한다.
동시에 공개·업데이트된 라이브러리는 AI를 작동시킬 때 다른 처리 방식을 분담한다. DeepGEMM-Ascend는 AI에서 다용되는 행렬 곱셈을 고속화하고 BF16, FP8, FP4의 연산에 대응한다. DeepEP-Ascend는 여러 전문 네트워크를 사용분리하는 Mixture of Experts(MoE)에서 필요한 칩 간의 데이터 배분·집약을 담당한다.
TileKernels는 MoE의 라우팅이나 양자화 등에 사용되는 수십 종류의 연산 프로그램을 제공한다. FlashMLA는 Ascend 950에 대해 희소한 Attention 처리를 추가하고, DeepSelect는 수많은 후보에서 상위 K개 항목을 선택하는 TopK 처리의 Ascend에 적합한 구현을 추가했다.
## NVIDIA용과 공통의 API로 이용 가능한 라이브러리도
DeepGEMM-Ascend는 기존의 DeepGEMM과 호환되는 API를 제공하여 개발자가 동일한 호출 방식이나 개발 절차를 이용할 수 있도록 했다. DeepEP-Ascend도 외부에서 호출하는 API의 일부를 NVIDIA 버전과 맞춰놓았다.
TileKernels에서는 NVIDIA GPU와 Huawei NPU 중 어느 것을 사용할지 실행 시점에 자동으로 판단하고 동일한 Python API에서 이용할 수 있다. 하드웨어별로 다른 처리를 라이브러리 측에서 제공함으로써 개발자가 칩 고유의 구현을 직접 다루는 경우를 줄이는 구성이다.
다만, 대응 기능은 양 플랫폼에서 완전히 동일하지 않다. FlashMLA에는 CUDA 전용의 처리만 남았고, DeepSelect의 Ascend 버전은 입력 데이터 형식을 BF16로 제한하고 있다.
## Ascend 950에서의 성능 및 이용 조건 공개
딥시크(DeepSeek)는 플래시MLA(FlashMLA)의 어센드(Ascend)를 위한 희소 어텐션 처리로서, 입력을 모아서 처리하는 프리필(prefill) 단계에서 최대 410 TFLOPS, 토큰을 생성하는 디코딩(decoding) 단계에서 최대 360 TFLOPS를 보고했습니다. 각각 어센드 950의 이론 성능의 95%, 83%에 해당한다는 의미입니다.
DeepEP-Ascend에서는, Ascend 950DT를 사용한 측정으로, 전문가 병렬 규모가 32 이하의 구성에서 데이터 배분 처리가 물리적인 통신 대역폭 상한의 약 90~95%에 달했다고 보고했다. 측정에는, DeepSeek에 제공된 검증용 HDK와 추가적인 수동 설정이 사용되었다. HDK는, 드라이버 및 펌웨어 등을 포함하는 소프트웨어 패키지이다.
일반 사용자에게 권장되는 환경인 Atlas 850E용 HDK는, Huawei의 계획에 따르면 2026년 10월 중순, 15일 전에 공개될 예정이라고 한다.
Ascend 950DT에서의 MoE 통신 성능. 8~128 칩 구성으로 측정하여, 데이터 배분 처리는 313~375 GB/s. 검증용 HDK에 수동 설정을 가한 환경에서의 결과
이미지 출처: DeepSeek 공식 GitHub
관련 기사: DeepSeek, 오픈소스 주간을 맞아 주요 기술을 연이어 오픈화 – DeepSeek-V3/R1의 이론적 최대 비용-편익률 545%
관련 기사: Huawei AI 칩 “Ascend 910C”로 DeepSeek-V4-Pro 후학습 – 중국 팀, NVIDIA 의존성 감소로 이어지는 대규모 AI 훈련 성과
관련 기사: DeepSeek, “DeepSeek-V4” 공개 – 개방적이면서 최고 수준 성능을 주장하며, 1M 컨텍스트 대응
관련 기사: DeepSeek, LLM 생성 가속을 위한 투기적 디코딩 기술 “DSpark” 공개 – DeepSeek-V4용 체크포인트도 제공
관련 기사: Huawei AI 칩 “Ascend 910C”, NVIDIA “H100”의 60%의 추론 성능 달성 – DeepSeek의 테스트 결과
원문 보기 | 출처: Ledge.ai