이미지 출처: ChatGPT에 의해 ledge.ai 가 생성
스탠포드 대학교 명예 교수인 존 오스터하우트 교수가 AI 추론 및 에이전트 지원을 위한 데이터 센터에서 통신 프로토콜 “TCP”를 대체할 “Homa”의 보급을 진행하고 있다. The Register가 2026년 10월 1일, 동 씨에 대한 취재를 교차하여 보도했다.
동 씨는 2026년 7월 2일 AI 엔지니어 월드’스 페어에서 발표한 강연에서도 짧은 통신이 큰 데이터 전송에 휘말려 지연되는 문제를 지적했다. Homa는 짧은 메시지를 우선적으로 처리하여 대기 시간을 줄이는 메커니즘을 갖추고 있으며, 기존의 TCP와 병행하면서 단계적으로 도입될 수 있다.
## 작은 통신의 지연이 GPU를 기다리게 한다
여러 서버에서 AI를 실행할 경우, 네트워크에는 대량의 데이터 전송뿐만 아니라 서버들 간의 처리 진행을 위한 작은 정보 교환도 발생한다. 예를 들어, 생성 중인 계산 결과를 저장하는 “KV 캐시”가 여러 서버에 분산되어 있을 경우, 필요한 데이터가 있는지 문의하거나 각 서버의 계산이 완료되었는지 확인하는 통신이다.
오스터하우트氏は、AI 추론이나 에이전트에서는 계산과 작은 통신을 반복적으로 수행하는 경우가 늘어지고 있다고 설명한다. 전체 서버의 동기화가 완료될 때까지 다음 계산으로 진행할 수 없는 경우, 통신이 한 번 지연되면 GPU가 대기하게 된다. 계산 자체가 밀리초 단위로 끝나는 처리에서는 동기화에도 수 밀리초가 걸리므로, 통신 대기가 처리 시간의 큰 비율을 차지한다.
문제는 한 번에 운반할 수 있는 데이터량만이 아니다. 큰 전송과 짧은 통신이 혼재하는 환경에서는 짧은 메시지가 전송 대기열에 묻히게 된다. 특히 여러 서버에서 동일한 목적지로 데이터가 집중될 경우, 수신 측에 연결되는 스위치에 데이터가 쌓여 대기 시간이 늘어난다.
한편, 대규모 학습 등에서 막대한 양의 데이터를 장시간 전송하는 용도에서는 TCP나 RDMA도 양호하게 기능한다고 덧붙였다. Homa의 제안은 짧은 통신의 지연이 처리 전체를 방해하는 상황에 초점을 맞춘 것이다.
■ 여러 서버에서 계산을 진행할 경우, 동기 통신이 완료될 때까지 GPU가 대기한다
이미지 출처: AI 엔지니어 공식 강연 영상
## 짧은 메시지를 우선하고, 수신 측이 통신량을 조정
TCP는 데이터를 연속된 바이트 열로 처리한다. 이에 반해, Homa는 요청과 응답을 메시지 단위로 처리하고, 그 길이를 통신 제어에 활용한다.
호마(Homa)에서는 수신측이 전송을 허용하는 메커니즘과 네트워크 스위치의 우선순위 기반 큐를 결합한다. 남은 전송량이 적은 메시지에 우선순위를 두어 짧은 통신이 긴 전송 뒤에서 대기하는 것을 방지한다.
호마는 이번에 처음 등장한 기술이 아니다. 2021년 Linux 구현 평가 논문에서는 40노드 실험에서 TCP 및 데이터센터용 DCTCP와 비교하여 짧은 메시지의 99퍼센트 타임(99 percentile) 지연 시간을 7분에서 83분의 1로 낮췄다고 보고했다. 이는 99%의 메시지가 완료되는 데 걸리는 시간을 비교한 결과이며, AI 애플리케이션 전체가 같은 배율로 고속화하는 것을 의미하지 않는다.
■ 호마(Homa)는 짧은 메시지(녹색)에 높은 우선순위를 할당하고, 긴 메시지(파란색)의 전송 대기 지연을 억제한다.
이미지 출처: AI 엔지니어 공식 강연 영상
TCP와 함께 사용 가능하지만, 앱 측의 대응이 필요
호마(Homa)의 Linux 구현은 GitHub에서 공개되어 있으며, 기존의 TCP와 동일한 환경에서 동작한다. 2026년 1월에는 동시 이용 시 간섭을 줄이는 전송 대기 큐 제어 메커니즘 “homa_qdisc”가 추가되었다.
하지만 애플리케이션에서 통신 기능을 호출하기 위한 API는 TCP와 다르므로 기존 애플리케이션이 그대로 전환되는 것은 아니다. 도입 자료에서는 Linux 커널 모듈의 도입과 더불어 네트워크 장비 및 스위치의 우선 순위 설정도 설명하고 있다.
개발은 지속적으로 진행 중이며 2026년 9월에는 전송 허가 메커니즘도 변경되었다. 오스터하우트 氏は、짧은 통신 지연이 애플리케이션의 성능을 제한하는지 측정하고, 문제가 있을 경우에는 Homa를 시도해 보도록 권고하고 있다.
@YouTube
관련 기사: DeepSeek, 화웨이 지원으로 Ascend용 AI 개발 플랫폼 공개, TileLang 및 연산/통신 라이브러리 정비
관련 기사: 기밀 정보를 완벽하게 지켜내는 생성 AI 플랫폼 – GPU 클러스터로 구현하는 사내 LLM 활용
관련 기사: JERA·Dell·RHAELM, 400MW 규모의 AI 데이터 센터 구축 계획 발표 – 약 2.3조 원 이상, 2028년 시점 가동 예정
원문 보기 | 출처: Ledge.ai