# 32GB VRAM의 "Intel Arc Pro B70"에서 "Hermes Agent" 로컬 AI 실행, 4비트 양자화된 Qwen3.8-27B를 돌려보았다

> https://bookfactory.kr/board/news/19721
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-03T05:26:47.162Z

---

AI 에이전트 “Hermes Agent”는 웹 검색, 브라우저 조작, 명령어 실행 등의 도구를 AI가 자율적으로 활용하면서 작업을 수행할 수 있는 특징을 가지고 있습니다. 지금까지 GIGAZINE에서는 실제로 Hermes Agent를 설치하여 “GIGAZINE 기사를 가져와 요약해 줘”와 같은 작업을 맡기거나, 로컬 AI 모델을 Hermes Agent의 두뇌로 실행해 왔습니다. 처음 시도했을 때는 Nous Research의 “Hermes 4 70B” 및 “Solar Pro 4” 등을 이용하여 GIGAZINE 기사를 찾아달라고 부탁했습니다. Solar Pro 4는 최종적으로 목적 기사를 가져와 요약할 수 있었지만, 브라우저 실행에 실패하여 다른 방법을 전환하거나, 중간에 다른 기사를 열어버리는 등 목적을 달성하기까지 상당히 많은 시행착오를 거친 모습이 관찰되었습니다. 사용할수록 성장하는 AI 에이전트 “Hermes Agent”를 Windows에서 실제로 사용해 본, 설치부터 웹 검색 및 브라우저 조작까지 – GIGAZINE

그 후, Hermes Agent가 로컬 AI 모델을 쉽게 이용할 수 있는 “Local Models”에 대응하면서, PC에서 동작하는 Qwen3.8 27B를 사용하여 유사한 작업을 시도했습니다. 그러나 이 때 사용했던 GPU의 VRAM 용량은 16GB였습니다. 27B라는 비교적 큰 모델을 VRAM 내에 수용하기 위해서는 모델을 2비트까지 양자화해야 했습니다. AI 에이전트 “Hermes Agent” 신 기능 “Local Models”로 로컬 AI 모델 “Qwen3.8 27B”를 직접 동작시켜 보았으며, 16GB의 VRAM에서도 양자화로 인해 빠른 동작이 가능했습니다 - GIGAZINE

そんな 중, GPU를 Intel의 “Arc Pro B70”로 교체하면서, 이용 가능한 VRAM 용량이 한 번에 32GB로 두 배 증가했습니다. VRAM 용량 32GB로 30만 원 미만인 Intel 그래픽 카드 “Intel Arc Pro B70 Creator 32GB”로 로컬 LLM “Qwen3.8 27B”와 영상 생성 AI “MiniMax H3”를 실행하여 생성 속도를 확인해 보았습니다 - GIGAZINE

그 중에서도, GPU를 Intel의 “Arc Pro B70”으로 교체하면서, 이용 가능한 VRAM 용량이 한 번에 32GB로 두 배 증가했습니다. VRAM 용량이 32GB로 30만 원 미만인 Intel 그래픽 카드 “Intel Arc Pro B70 Creator 32GB”로 로컬 LLM “Qwen3.8 27B”와 영상 생성 AI “MiniMax H3”를 실행하여 생성 속도를 확인해 보았습니다 - GIGAZINE

VRAM이 32GB나 있으면, Qwen3.8 27B도 이전보다 훨씬 더 고품질의 양자화 설정으로 실행될 수 있을 겁니다. 모델의 능력을 크게 훼손하지 않으면서 실행할 수 있게 된다면, Solar Pro 4가 고생했던 “GIGAZINE 기사를 가져오는” 작업도, 드디어 망설임 없이 한 번에 해낼 수 있을 것으로 기대됩니다. 이전 기사에서는 “다음에는 Bot Mode를 시도합니다”라고 적었지만, 옮겨진 AI를 실행하는 환경이 크게 강화되었으니, 그 이전에도 다시 한번 Local Models의 실력을 확인해 보기로 했습니다. 먼저, 이전에 축적된 기억이나 기술 등을 재사용하지 않도록 새로운 프로필을 생성합니다. 화면 왼쪽 하단의 “+” 마크 버튼을 클릭합니다.

새로운 프로필의 이름을 지정하고, 복제원을 “없음(공)”으로 설정한 후 “프로필 생성”을 클릭합니다.

프로필이 생성되고, 채팅 기록이 표시되지 않게 되었습니다.

바로 새로운 모델을 사용해 보겠습니다. 이전 로컬 모델을 도입했을 때와 마찬가지로, 설정의 “프로바이더”의 “로컬 모델”에서 Qwen3.8을 검색합니다. Q8_K_XL로도 GPU에 완전히 담길 수 있다는 것이므로, Q8_K_XL을 다운로드합니다.

다운로드가 완료되면 채팅 창에서 모델을 전환합니다.

실력 비교를 명확하게 하기 위해 1차 기사에서 사용한 것과 완전히 동일한 “GIGAZINE에 대해 검색하고 최신 기기에 대한 정보를 요약해 줘”라는 프롬프트를 입력했습니다. 그런데 어째서인지 정상적인 RAM에 모델이 로드되고 GPU가 전혀 활용되지 않았습니다.

모델 크기가 너무 컸던 탓일 수도 있다고 의심하여, Hermes Agent가 제공하는 Qwen3.8 27B를 테스트해 봅니다. 용량은 16.2GB이며, 내부적으로는 4비트 양자화의 Q4_K_M이 사용되고 있는 듯합니다.

하지만 CPU 측에서 추론이 진행되었습니다. 설정 화면을 보면 “GPU 메모리 내에서 완전히 작동하고 있습니다”라고 표시되어 있지만, 실제로는 CPU 추론으로 인해 작동이 너무 느려 1 토큰도 출력되지 않았습니다.

로컬 런타임 정보를 확인해 보면 엔진이 “llama.cpp b10964 (cpu)”라고 되어 있었습니다. 이전에는 괄호 안에 (cuda)라고 표시되어 있었기 때문에 GPU를 인식하지 못하고 CPU 모드로 되어 있었던 것이 확인됩니다. 메모리 또한 VRAM 32GB의 그래픽 카드를 사용하고 있는데 GPU 메모리가 63.1GB로 표시되어 있었습니다.

잠시 조사해 보니 “버그로 인해 런타임 백엔드에 Vulkan을 수동으로 지정해야 합니다”라는 정보를 획득했습니다. PowerShell을 열고 “hermes config set local_runtime.backend vulkan” 명령을 실행하여 Vulkan으로 작동하는 설정을 적용합니다.

이번에는 백엔드를 Hermes Gateway로 작동시키고 있으므로 “hermes gateway restart” 명령으로 재부팅하여 설정을 적용합니다.

그러나 Hermes Agent 측의 표시가 바뀌지 않았습니다. 자세히 살펴보니 설정 화면 상단에 “이 페이지의 변경은 ‘vram-32gb’ 프로필에 적용됩니다”라는 문구가 있어 프로필마다 설정이 다르다는 것을 알게 되었습니다.

그렇다면 “hermes profile list” 명령으로 프로필 이름을 확인하고 “hermes -p vram-32gb config set local_runtime.backend vulkan”으로 프로필을 지정하여 Vulkan으로 설정을 변경하고 Gateway를 재부팅하여 적용합니다.

Hermes Agent를 재부팅하고 설정을 열었을 때 권장 모델로 “Qwen3.6 35B-A3B”가 등장했습니다. Qwen3.8을 사용하고 싶으므로 “자신이 선택”을 클릭했습니다.

실행 시간(런타임)이 사라진 것을 확인하고 “실행 시간을 설치”를 클릭합니다.

괄호 안의 표기가 “vulkan”로 변경되었습니다. 4비트 Qwen3.8 27B를 다시 시도해 보겠습니다.

프롬프트를 입력하면 모델의 로드가 시작됩니다. 이번에는 제대로 VRAM으로 로드되었습니다. 하지만 모델의 크기는 16.2GB인데 추론 시에는 KV 캐시 등에도 메모리를 사용해야 하므로 총 VRAM 사용량은 30GB에 가까워졌으며 들어가지 않았던 4GB 초과 데이터가 일반 RAM에 로드되고 있습니다.

설정 화면에서의 표기는 여전히 “모두 GPU 상”의 상태이지만, 실제로는 일부 데이터가 RAM에 저장되어 있는 것으로 인해 추론 속도는 초당 1개 토큰 정도로 상당히 느려지게 되었습니다.

Hermes Agent 표준의 “Qwen3.8 27B”는 내부적으로는 Q4_K_M을 사용하므로, 동일한 4비트 양자화 모델이지만 1GB 용량의 작은 “Q4_K_S”를 시도해 보겠습니다.

변경하여 시도해 보면 VRAM 사용량은 26GB였습니다. 공유 메모리인 RAM 측에도 일부 데이터가 로드되고 있지만, 추론 시에 사용되는 부분은 제대로 VRAM에 올라오고 있어서 Q4_K_M의 때와는 대조적인 속도로 추론이 진행됩니다.

성능도 충분합니다. Solar Pro 4를 사용하던 시절에는 여러 번 실패하면서도 어찌어찌 요약 작업을 수행하고 있었지만, Qwen3.8 27B는 어떠한 문제 없이 순식간에 요약 작업을 완료했습니다.

“여기서 가장 흥미로운 기사를 하나 골라, GIGAZINE 기사를 요약해 주세요”라는 추가 프롬프트를 전송했습니다. Solar Pro 4는 개별 기사 URL을 열기에 어려움을 겪었지만, Qwen3.8 27B는 10초 정도 내에 출력을 시작했습니다. 출력 내용은 꽤 높은 품질입니다.

2개의 기사를 연속으로 다음 예고를 무시했지만, 다음에는 Bot Mode를 시도해 볼 수 있을 겁니다. 기대해주세요!

[원문 보기](https://gigazine.net/news/20261001-hermes-agent-arc-pro-b70/) | 출처: Gigazine