AI를 사용하여 AI용 하드웨어를 설계하는 오픈 소스 프로젝트 “openTPU”가 공개되었습니다. openTPU는 AI 모델을 고속으로 실행하기 위한 전용 가속기를 AI 에이전트도 활용하면서 개발하는 시도이며, Qwen3, Qwen3.5, Gemma 4 등 여러 개의 언어 모델을 실제 FPGA 카드에서 실행하는 데 성공했습니다. GitHub - FeSens/openTPU: AI를 사용하여 개발된 오픈 소스 AI 가속기, RTL, ISA, 시뮬레이터, 컴파일러 및 프로파일러를 하나의 리포에 통합. Kintex-7 PCIe 카드에서 Qwen3, LFM2.5 및 Qwen3.5를 실행합니다. · GitHubhttps://github.com/FeSens/openTPU
openTPU는 Google의 TPU를 재현하는 것이 아니라, “AI 에이전트는 어디까지 하드웨어 설계를 수행할 수 있는가”, “AI가 자신을 위한 칩을 설계할 수 있는가”를 확인하는 프로젝트이다. 단순 AI용 하드웨어를 만드는 것뿐만 아니라, 그 설계 과정 자체를 AI에 맡추는 점이 특징으로, 소프트웨어부터 회로까지 전반적으로 공개되어 있어 AI 가속기 작동 방식 학습을 위한 교재로 활용될 수 있도록 고려되었다. openTPU의 구조는 명령을 순차적으로 발행하는 시퀀서 중심이며, 메모리와의 데이터 전송을 담당하는 DMA, 행렬 연산을 실행하는 행렬 연산 유닛, 부동 소수점 연산을 수행하는 벡터 유닛, 결과를 양자화하는 유닛 등을 결합하여 의도적으로 단순하게 설계되었다고 한다. 일반적인 CPU나 GPU와 같이 캐시나 복잡한 명령 스케줄링을 갖추지 않고, 데이터 이동도 명령으로 명시적으로 처리하여 “어떤 처리 에는 몇 클럭이 걸렸는가”를 추적하기 쉬워진다.
개발자는 AMD의 Kintex-7를 탑재한 FPGA 카드에 openTPU 회로를 작성하여 실제 하드웨어상에서 동작을 검증했습니다. 그 결과, LFM2.5-230M, Qwen3-0.6B, Qwen3.5-0.8B, Gemma 4, Phi-4-mini 등 여러 모델을 동작시키고 있습니다. 예를 들어, 4bit에 양자화된 LFM2.5-230M에서는 매초 82.1 토큰, Qwen3-0.6B에서는 매초 30.7 토큰, Qwen3.5-0.8B에서는 매초 23.3 토큰의 생성 속도를 기록했습니다.
또한, openTPU는 카드상의 메모리에 수용되지 않는 대규모 모델에도 대응하고 있으며, 필요한 데이터만 PC 측에서 보내는 방식에 의해 347억 파라미터의 Qwen3.5-35B-A3B도 매초 3.95 토큰으로 동작시켰다고 개발자가 보고했습니다. 기사 작성 시점에서는 openTPU는 AI의 계산 자체보다 모델의 데이터를 메모리에서 읽어내는 속도가 성능의 큰 제약 요인으로 나타나고 있으며, 따라서 향후에는 메모리 접근의 효율화 및, 입력 문을 먼저 처리하는 프리필드의 고속화 등이 과제로 여겨지고 있습니다. 한편, openTPU는 Apache License 2.0으로 공개되어 있습니다.
원문 보기 | 출처: Gigazine