# AI는 클라우드에서 계속 사용해야 할까? 현업화로 발생하는 비용, 데이터, 서비스 의존성 – Red Hat의 “AI 인프라” 판단 기준에 귀 기울여 보세요

> https://bookfactory.kr/board/news/12454
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-15T05:57:13.663Z

---

AI를 시험할 때, 많은 기업들이 먼저 클라우드를 선택했다. OpenAI API를 비롯한 외부 AI 서비스들을 활용하면, 자체적으로 GPU나 AI 기반을 구축하지 않고도 생성 AI를 업무에 적용할 수 있다.

그러나 AI 활용이 PoC(Proof of Concept) 단계에서 본격화되고, 더 나아가 AI 에이전트가 업무나 서비스 내에서 움직이게 되면 상황은 달라진다. 막대한 양의 토큰을 소비했을 때의 비용은 어떻게 할 것인가? 민감한 정보를 외부로 전송하는 데 있어 어느 정도까지 가능한가? 의존하고 있는 모델이나 서비스가 더 이상 이용할 수 없게 되었을 때, 업무를 지속할 수 있는가.

이러한 문제들을 고려해 나온 것이 AI를 자체적으로 관리할 수 있는 환경에서 실행하는 것이다. 그렇다면 기업은 언제까지 클라우드를 사용하고, 어느 단계부터 AI를 “자체적으로 보유”하는 것을 고려해야 하는가. 그리고 그럴 때 필요한 “AI 인프라”는 무엇인가.

이번에는 Red Hat株式会社 기술 영업 본부 세일스 스페셜리스트의 다무라 마키 씨에게 이야기를 들어봤다.

박스

레드햇株式会社

기술 영업 본부 세일스 스페셜리스트

다무라 마키

신입으로 통신 캐리어에 입사. 사용자 기업 측 입장에서 처음으로 클라우드 네이티브에 접촉한다. 이후는 IT 컨설팅 회사에서 금융기관의 시스템 刷新 프로젝트에 종사. FinTech의 가능성에 관심을 가지며, FinTech 계열 메가벤처에서 비즈니스 개발(BizDev)도 경험. 현재는 레드햇(Red Hat)에서 “Tech 이외에도 비즈의 시선”도 중요하게 생각하며 솔루션 세일즈에 종사한다.

## 선행 기업에서는 AI의 이용 비용이 경영 과제

기업의 생성 AI 활용이 시작되었을 당시, 클라우드가 선택된 것은 자연스러운 흐름이었다. 현재도, 일본 기업의 많은 수는 클라우드를 개시로 AI 활용을 진행하고 있다.

“일본 기업의 많은 수는 현재도 PoC(Proof of Concept)나 PoT(Proof of Technology), 그리고 그것에서 조금 발전된 정도의 스테이터스라고 생각합니다. 어떤 업무에서 AI를 사용할 수 있는지, AI 에이전트에게 무엇을 맡길 수 있는지, 이것을 본격적으로 고려하고 있는 기업이 다수입니다. 따라서 대부분의 기업은 첫째 클라우드를 사용하여 AI를 움직이고 싶거나, AI를 사용하고 싶다는 상황입니다.”

예를 들어, OpenAI API와 같은 AI as a Service는 대규모 환경 구축 없이 AI를 시험해 볼 수 있다. 조금 더 자사에서 제어하고 싶다면, AWS 등에서 GPU 인스턴스를 준비하여 추론 미들웨어와 AI 모델을 올리는 방법도 있다. 이러한 환경도 이전과 비교하여 구축하기 쉬워졌다.

한편, 처음부터 온프레미스에서 AI 기반을 구축하는 기업은 제한적이다.

“온프레미스로 시작하는 것은, 원래부터 GPU 서버를 보유하고 있거나, GPU 포함된 데이터센터 운영 노하우를 가지고 있는 기업이 중심입니다. 다만, 금융기관, 관공청, 통신사업자 등에서는 처음부터 온프레미스에서 AI 시대의 플랫폼을 만드는 것을 전제로, 선행 투자하고 있는 기업도 있습니다.”

그러면, 클라우드에서 AI를 사용하기 시작한 기업이 비용 등을 이유로 온프레미스로 돌아가는 움직임이 시작되는 것일까? 다무라 씨는 이에 대해 “많이 흔한 것은 아니지만, AI 활용이 선행되고 있는 기업에서는 경영 안건이 되고 있는 중입니다”라고 답변했다.

“클라우드에서 먼저 시도해 보는 단계에 있는 기업도 많은 반면, 이미 AI 주도 개발에 도전하여 예상보다 훨씬 큰 AI 비용에 놀랐다는 기업도 속출하고 있습니다. 이미 “토큰 비용”이라는 키워드로 주요 미디어가 보도하기 시작하는 가운데, 실제로 Red Hat의 고객에서도 이 문제가 한 번에 경영 문제로까지 발전하고 있는 분들도 있습니다.”

## 비용 외에도 “AI를 계속 실행할 수 있는가”라는 문제

AI 활용이 선행을 하는 해외 기업에서는 이미 다른 움직임도 시작되고 있다는 것이다. 그 배경에는 “솔리본 AI”라는 개념이 있다. 외부의 AI 서비스를 이용하는 이상, 기업의 AI 활용은, 적지 않게 그 서비스 제공자에 의존한다. 문제 는, 그 AI가 단순한 업무 지원 툴이 아닌, 업무 프로세스 그 자체를 담당하게 되었을 때이다. 

AI 활용을 통해 선도하는 해외 기업들에서는 이미 다른 움직임도 시작되고 있다는 것이죠. 이 배경에는 “솔리본 AI”라는 개념이 자리 잡고 있습니다. 외부의 AI 서비스를 활용하는 한, 기업의 AI 활용은 상당 부분 해당 서비스 제공자에 의존하게 됩니다. 핵심적인 문제는, 그 AI가 단순한 업무 지원 툴이 아닌, 업무 프로세스 자체를 담당하게 될 경우입니다.

특정 프론티어 모델의 API를 전제에 두고 에이전트를 조립한 경우, 그 모델이 특이하게 사용이 불가능해진 순간에 워크플로우가 붕괴될 가능성이 있습니다. 그렇게 생각하면 대체 가능성을 가지고 두는 것이 중요해집니다.

이는 인공지능 서비스의 장애뿐만 아니라, 모델의 제공 종료, 사양 변경, 이용 조건 변경 등으로도 구축한 시스템에 영향을 미칠 수 있다. 따라서 해외에서는 특정 서비스에 대한 의존을 피하기 위해 온프레미스나 로컬AI를 선택지로서 고려하는 기업도 나오고 있다.

글로벌에서 선행하고 있는 기업에서는, 인공지능 주권의 관점에서 로컬 인공지능에 탑승을 하는 경우가 있다. 항공사나 금융기관 등에서는 흔히 볼 수 있는 일이다. 경제안보라는 맥락에서 나타나는 업계에서는, 특히こうした 생각을 흔히 보게 된다.

AI를 자사 환경에서 움직이는 이유는 보안 관점이 떠오르기 쉽지만, 본환화된 AI는 그것 외에도다. 자사의 업무를 지원하는 AI를 장래에 지속적으로 움직이게 만들 수 있는가, AI 활용이 깊어짐에 따라 “대체 가능성”이 기업의 위험 관리로 이어지는 것이다.

## AI 에이전트 시대, 문제로운 것은 “비용이 예측 불가능한” 것

본격적인 사용이 진행될수록 두드러지는 것이 비용이다. 특히 오바라 씨가 주목하는 것은 AI 에이전트의 보급으로 인한 토큰 소비량 증가다.

사람이 필요한 때에 사용하는 방식과는 달리, 자율적인 AI 에이전트는 다양한 이벤트를 계기로 처리를 지속한다. 따라서 기업이 소비하는 토큰량은 크게 늘어날 가능성이 있다.

!RedHat_토큰.png

“AI 에이전트가 인간 대신 일을 하도록 되자, 토큰 소비량은 상당히 증가합니다. 또한, 언제 얼마나 토큰을 소비할지 예측하는 것은 어렵습니다.”

여기서 중요한 것은 단순히 이용량이 높아진다는 이야기만이 아니다. 오바라 씨가 기업에게 큰 문제라고 지적하는 것은 비용의 “불안정성”이다.

기업으로서 비용이 증가하는 것은 우려스러운 부분 중 하나입니다. 또 다른 중요한 점은 예측 불가능한 점이라는 것입니다. 증가 추세를 알면 투자할 수 있지만, API의 사용량 과금 방식을 이용하고 있다면, 비용이 얼마나 발생하는지 파악하기 어렵습니다.

AI 도입 시 검증이라면 従量課金(従량 과금) 서비스(서비스)를 활용하는 방법도 있겠지만, 실제 운영을 지향하는 경우에는 사(社)에서 GPU 서버(서버)나 GPU 인스턴스(인스턴스)를 구축(구축)하여 AI를 실행(실행)하는 방안을 고려(고려)해야 한다고 다무라(大村) 회장(회장)은 밝혔습니다. 사(社)에서 GPU 자원(자원)을 확보(확보)하면, 서버(서버) 장비(장비) 비용(비용)과 전력(전력), 클라우드(클라우드)상의 GPU 인스턴스(인스턴스) 요금(요금) 등을 바탕으로, 특정 비용(비용)을 산정(산정)할 수 있습니다. 즉, “사(社)에서 직접 소유(소유)”하는 것의 가치(가치)는 클라우드(클라우드)보다 저렴(저렴)한 것 이상(이상)입니다. AI를 지속적으로 사용하는 데 드는 비용(비용)을 예측(예측) 가능한 수준으로 만들(만들) 수 있다는 점에도 주목(주목)해야 합니다.

“클라우드(클라우드)인가 온프레미스(온프레미스)인가”로 결정(결정)할 필요는 없습니다

지금까지의 이야기를 보면, 온프레미스로 이행해야 한다고 읽을 수 있지만, 다무라 회장은 그러한 단순한 이중 선택을 부정하고 있습니다.

“용도(용도)에 적(적)합(합)한 곳(곳)에서 AI와 애플리케이션(애플리케이션), AI 에이전트(에이전트)를 실행(실행)하는 것이 기본(기본)적인 생각(생각)입니다. 따라서, 온프레미스(온프레미스)라서 좋(좋)다거나, 클라우드(클라우드)라서 마음에 들(들)지 않(않)다고 말(말)하는 것은 없습니다.”

Red Hat(레드햇)이 장(장)년(년)에 걸쳐(걸쳐) 掲(게)제(제)하고 있는 것이 “오픈 하이브리드 클라우드(오픈 하이브리드 클라우드)”라는 전략(전략)입니다.

특정 IT 인프라 또는 클라우드 서비스에만 의존하지 않고, 다른 환경에서도 공통의 IT 플랫폼을 전개하고 개발 및 운영 경험을 통일함으로써, 이는 AI에도 적용되는 개념이다. 중요한 것은 필요에 따라 선택지를 변경할 수 있는가 하는 점이다.

또한 오무라 씨가 “클라우드 또는 온프레미스 중 무엇을 선택할 것인가”보다 더 중요하다고 강조하는 것이 바로 아키텍처이다. AI 활용에서는 PoC를 통과했더라도 실제 활용으로 나아가지 못하는 경우가 많다.

“우리는 클라우드 또는 온프레미스 여부에 대한 논의보다 아키텍처에 대해 생각합니다. PoC 단계에서 ‘실제 환경과 동등한 상업용 대응 아키텍처를 구성하고 실행합시다’라고 고객에게 이야기합니다.”

그러면 PoC 단계에서부터 대규모의 실제 환경을 구축해야 하는가? 이에 대해 오무라 씨는 다음과 같이 답변했다.

“예를 들어, 클라우드에서 작은 GPU 인스턴스 1개만 세우고, 거기에 작은 모델을 배포하면 시작할 수 있습니다. 하지만 한 번 구축한 아키텍처를 그대로 크게 확장할 수 있도록 유지합니다. 고성능 GPU로 변경하고, 큰 모델을 탑재하며, 중복성을 확보합니다. 동일한 아키텍처를 유사하게 확대해 나갈 수 있도록 합니다. 그리고 그렇게 구축된 AI 에이전트는 필요에 따라 다른 클라우드 서비스 또는 온프레미스에도 그대로 재현 가능하다.”

처음부터 큰 것을 만들어야 할 필요는 없다. 미래에 그대로 확장 가능한 축소판을 만들어야 한다. 이것이, 해당 회사가 생각하는 PoC의 방식이다.

“처음부터 GPU 서버를 구매해 달라고 말씀드리는 것이 아닙니다. 먼저 퍼블릭 클라우드를 통해 시도해 보는 것을 저희가 제안할 수도 있습니다.”

클라우드를 통해 시작하는 것이 문제의 핵심은 아니다. 문제는, 실제 운영 시 모든 것을 처음부터 다시 만들어야 하는 구성으로 시작해 버리는 것이다.

## “AI 인프라”에서 “AI 플랫폼”으로

그렇다면 실제 운영을 염두에 둔 AI 기반에는 무엇이 필요한가? “AI 인프라”라고 하면, 고성능 GPU를 탑재한 서버를 떠올릴 수 있을 것이다. 하지만 GPU만으로는 AI가 작동하지 않는다. AI 모델을 실행하기 위한 OS, 컨테이너 기반, 추론 엔진이 필요하다. 대규모 처리를 위해서는 여러 GPU로 처리 작업을 분산시키는 메커니즘도 필요하다. 더 나아가, 모델 관리, 보안, 거버넌스, 모니터링, AI 에이전트와 애플리케이션을 실행하는 환경까지 고려해야 한다.

Red Hat에서는, 이러한 모든 것을 “AI 인프라”라고 부르는 것을 의미하지 않는다. AI 인프라는, 보다 넓은 “AI 플랫폼”을 구성하는 하나의 레이어라고 위치시키고 있다.

AI 플랫폼에는, 액셀러레이터가 있으며, AI 인프라가 있고, 그 위에 추론 서비스, 모델 서비스, 에이전트 서비스가 있습니다. 우리는, 이 중에서 소프트웨어에 의해 실현될 수 있는 부분을 제공합니다.

그 토대를 놓는 것이, Red Hat Enterprise Linux와 Kubernetes 배포판인 Red Hat OpenShift입니다.

“우리가 하고 있는 것은 기본적으로 생성AI 등장 이전과 변하지 않았다고 생각합니다. 오픈 소스 기술을, 일부의 기술력이 높은 기업이나 개인뿐만이 아니라, 엔터프라이즈 기업이나 관공서 등에서도 사용할 수 있도록 하는 것을, 이것을 지금, AI 세계에서도 하고 있습니다.”

AI의 추론에서는 오픈 소스 추론 엔진 “vLLM”이 데포커 스탠다드(de facto standard)가 되고 있습니다. 회사(동사)가 목표로 하는 것은, 이러한 오픈한 기술을 통해 AI 모델과 하드웨어를 느슨하게 결합(疎結合)하는 것입니다.

!redhat_vLLM.png

“이제부터 vLLM과 같은 추론 엔진을 통해, 액셀러레이터가 NVIDIA 제품이든 AMD 제품이든, 또한 모델이 Qwen이든 DeepSeek이든, 조합의 자유도를 높여나가고 싶습니다. Red Hat에서는 ‘vLLM은 생성AI 시대의 Linux다’라고 표현하고 있습니다.”

과거 Linux가 하드웨어와 소프트웨어 사이에서 중재자 역할을 하며 특정 벤더에 대한 의존도를 줄였다시피, AI 또한 모델과 액셀러레이터 사이의 공통 소프트웨어 레이어를 구축한다.

!배포_20260827_토큰경제시대에_준비하기! “Red Hat이_향해하는 엔터프라이즈 AI 플랫폼의_미래” 이미지.png

“우리는 하드웨어의 최하단 부분은 만들지 않고, 상단의 애플리케이션 자체를 제공하지도 않는다. 항상 중간층이다. 최하단과 최상단이 밀접하게 결합되지 않도록 민주화에 필요한 중간 영역을 수행한다. 그리고 그것은 항상 오픈소스 기술이다.”

특정 액셀러레이터나 모델, 클라우드에 기업의 AI를 고정하지 않는다. 이는 앞서 언급한 “필요할 때 선택지를 바꿀 수 있는가”라는 AI 주권 논의로 이어진다.

## AI를 “가동”시키는 것에서 AI로 “운영”하는 플랫폼으로

AI를 어디에서 가동해야 하는가. 이 질문에 클라우드인지 온프레미스인지 하나의 정답은 없다. 오히려 인터뷰에서 파악한 것은 기업의 AI 활용이 진행됨에 따라 판단 기준 자체가 늘어나고 있다는 것이다.

빠르게 시험해 보기에 클라우드가 적합합니다. 하지만 본격적인 운영을 고려할 때에는 관리 및 비용 측면에서 다른 선택지를 갖추는 것이 필요합니다. 그때서야 “AI를 어떻게 활용할 것인가” 뿐만 아니라 “AI를 어떤 기반에서 지속적으로 운영할 것인가” 가 경영 및 IT 전략의 주제가 됩니다.

2026년 10월 29일에 개최되는 “Red Hat Summit: Connect 2026 Tokyo” 에서도 오무라 씨가 발표하며 AI 시대의 IT 플랫폼에 대해 더욱 심층적으로 논의할 예정입니다.

“이번에 말씀드린 내용은 주로 AI를 호스팅하기 위한 플랫폼에 관한 것입니다. 반면에, 그 IT 플랫폼 자체의 운영을 효율화하기 위해서에도 AI는 필수적인 존재가 되고 있습니다. ‘AI를 움직인다’ 뿐만 아니라 ‘AI를 사용하여 운영한다’ 는 플랫폼으로 발전해가는 양면성에 대해 이야기할 수 있으면 좋겠습니다.”

!IMG_2073_re.png

AI 모델의 성능 경쟁이 계속되는 가운데, 그 모델을 기업이 어디에서, 어떻게, 그리고 지속적으로 운영해나갈 수 있는가에 대한 논의는 아직 시작된 지 얼마되지 않았습니다. 클라우드에서 시작한 AI를 그대로 사용을 계속할 것인지, 자사 관리 환경으로 이전할 것인지, 혹은 그 양쪽 모두를 활용할 것인지.

중요한 것은 한 가지를 선택하는 것만이 아닙니다. AI 활용이 본격화될 때, 자사가 선택할 수 있는 선택지를 남겨두는 것입니다. 이것이 AI 인프라를 고려하는 데 있어서의 핵심 쟁점이 됩니다.

Red Hat Summit: Connect 2026 도쿄 자세한 내용은 여기 있습니다.

[원문 보기](https://ledge.ai/articles/redhat-infrastructure-interview) | 출처: Ledge.ai