# AI 에이전트 “Hermes Agent” 신 기능 “Local Models”로 로컬 AI 모델 “Qwen3.8 27B”를 직접 실행해 보았습니다. 16GB의 VRAM에서도 양자화로 고속 동작이 가능합니다.

> https://bookfactory.kr/board/news/16961
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-16T23:13:25.313Z

---

Hermes Agent에서는 이전에 Ollama나 llama.cpp 등으로 실행된 로컬 AI 모델을 활용할 수 있었지만, 2026년 9월 상순 업데이트로 Hermes Agent 자체가 llama.cpp 및 모델 다운로드/관리까지 수행하는 “Local Models” 기능이 이용 가능해졌습니다. 이번에는 Local Models 기능으로 로컬에서 AI 모델을 실행해 보겠습니다. Local Models | Hermes Agent https://hermes-agent.nousresearch.com/docs/user-guide/local-models 기존 AI 에이전트 “Hermes Agent”를 사용하여 웹 검색이나 브라우저 조작을 하거나, 실제로 수행한 작업을 “스킬”로 저장하거나, 지정한 시간에 작업을 자동 실행시키는 등의 기능을 시험해 왔습니다. 이전에는 사용자의 취향 등을 장기적으로 저장하는 “기억(Memory)” 기능(Memory)을 시험했습니다. 사용 횟수가 많아질수록 성장하는 AI 에이전트 “Hermes Agent”에 취향을 익히게 하고 새로운 채팅에서도 기억을 이어서 사용할 수 있는 “기억(Memory)” 기능(Memory)을 시험해 보았습니다 - GIGAZINE

지난 게시글 말미에 다음으로 “Bot Mode”를 시도할 예정이었으나, Hermes Agent에 업데이트가 적용되어 이번에는 예정 변경을 통해 양자화된 “Qwen3.8 27B”를 Hermes Agent에서 실행하며, 로컬 AI 모델로도 AI 에이전트로서 어느 정도 실용적으로 사용 가능한지 시험해 보려고 합니다. Hermes Agent 설정에서 “프로바이더”의 “로컬 모델”에서 “런타임을 설치”를 클릭합니다.

잠시 기다리자 “로컬 런타임 설치가 완료되었습니다”라는 메시지가 나타나고 설정 화면도 “llama.cpp 런타임을 설치했습니다”로 표시가 변경되었습니다.

바로 AI 모델을 선택해 나가겠습니다. 모델 항목을 보면 “Qwen 3.8 27B”, “Qwen3.6 35B-A3B”, “Qwen3.8 Flash Next”, “DeepSeek V4 Flash”의 4개의 모델이 표시되었습니다. 이번 PC는 NVIDIA GeForce RTX 5070 Ti를 탑재하고 있으며, VRAM은 16GB이고 RAM은 64GB가 탑재되어 있습니다. VRAM에 채워지지 않는 모델은 “시스템 RAM을 사용”으로 표시되고, RAM에도 채워지지 않는 모델은 “이 기계에는 너무 큽니다”라고 표시되어 다운로드 버튼이 비활성화됩니다.

더 작은 양자화 모델을 찾기 위해 아래로 스크롤하여 “더 모델 찾기” 검색창에 “Qwen3.8”을 입력합니다. Qwen3.8의 양자화 모델을 제공하는 unsloth의 “Qwen3.8-27B-GGUF”가 표시되면 “파일 표시”를 클릭합니다.

unsloth가 제공하는 양자화 모델 목록이 표시되었습니다. “GPU에 완전히 맞습니다”로 표시되는 중에서 가장 큰 “Q2_K_KL”를 클릭하여 다운로드합니다.

다운로드가 완료되면 “Qwen3.8-27B-UD-Q2_K_XL”이 모델 목록에 추가되므로 “사용”을 클릭합니다.

이제 “새로운 세션”을 열면 자동으로 로컬의 Qwen3.8 27B가 선택되도록 되었습니다.

바로 사용해 보겠습니다. 이전 게시물에서도 사용한 “GIGAZINE의 최근 게시물 중 가장 재미있는 내용의 게시물을 선택하여 요약해 줘”라는 프롬프트를 작성했습니다.

프롬프트 처리 중 GPU가 완전히 가동되었지만, 어쩐지 GPU 사용률이 곧바로 감소했습니다.

추론 중 CPU 사용률이 높고 GPU가 거의 사용되지 않았습니다. VRAM 정보에서 전용 GPU 메모리 사용량이 16GB 중 8.1GB밖에 되지 않았지만, 공유 GPU 메모리는 6.2GB도 사용되었습니다. 토큰의 출력 속도는 초당 5토큰 정도밖에 없습니다.

토큰의 출력 속도는 느리지만, Qwen3.8 27B는 시간을 들여 작업을 진행하고 있습니다. 중간에 명령의 실행 허가를 요청하는 장면이 있었습니다. “명령”을 클릭하여 내용을 확인합니다.

명령의 내용이 표시되었습니다. 특히 문제가 없어 보였지만, 꼼꼼히 검토하다가 클릭하기 전에 타임아웃으로 인해 강제로 거부 처리되었습니다.

하지만 도구를 사용하면 사이트의 데이터를 직접 가져올 수 있는 것으로 보입니다. Qwen3.8 27B는 특히 문제 없이 다음 작업을 수행했습니다.

시간을 들여도 작업을 완료했습니다. 이전 기사에서 설정한 메모리가 남아있고 “처음 3줄 요약” 형식으로 되어 있습니다. 선택된 기사는 “12억 원 상당의 가상 화폐를 훔치려던 해커가 수 초의 차이로 봇에 훔친 가상 화폐를 완벽하게 가로채는” 내용이었습니다.

Qwen3.8 27B에 의한 “흥미로운 포인트”에 대한 설명은 다음과 같습니다. 의미 있는 읽기 쉬운 일본어이며, Qwen3.8 27B의 실력을 느낄 수 있습니다.

다시 설정 화면을を見ると “Qwen3.8-27B-UD-Q2_K_XL”가 “일부 RAM 상”으로 표시되어 있었습니다. 다운로드 이전의 표시가 단순한 추정이며, 실제로 작동시키지 않으면 VRAM에 올라가 되는지는 알 수 없는 것 같습니다.

더욱 작고 작은 “IQ2_S”를 시도해 보겠습니다.

다운로드가 완료되면 “사용”을 클릭하여 전환합니다.

모델의 로드가 완료된 상태에서 VRAM 사용량이 12.4GB, 공유 GPU 메모리 사용량이 0.9GB로 나타나며, “IQ2_S”의 경우 거의 VRAM 내에서 처리될 수 있는 것으로 보입니다.

추론의 실행에서도 끝까지 GPU 사용률이 100% 근처를 유지하며, 반대로 CPU 사용률은 수% 정도였습니다. 토큰의 생성 속도는 초당 20토큰에서 30토큰 가까이 증가하여 폭발적으로 빠른 속도로 작업이 완료되었습니다.

그러나 이번에 고속으로 작동한 UD-IQ2_S는 2비트까지 양자화된 모델입니다. 이번의 출력 결과에서 보기에 문제는 없어 보였지만, Hermes Agent의 공식 문서에서는 “4비트 미만에서는 품질 저하가 큼”이라고 하며 표준 모델 카탈로그에서는 4비트 미만의 모델을 제공하지 않는 정책이 제시되어 있습니다. 다음에는 다시 Bot Mode를 시도해 보겠습니다. 기대해주세요!

[원문 보기](https://gigazine.net/news/20260916-hermes-agent-local-ai-model/) | 출처: Gigazine