MIT에서 스핀오프한 AI 기업 ‘리퀴드 AI’가 소형 AI 모델 ‘LFM2.5’ 시리즈의 에이전트 대응 모델로 ‘LFM2.5-2.6B’를 2026년 8월 4일에 출시했습니다. 스마트폰으로 작동하는 데 그 정도의 크기이며, 계획 수립, 툴 호출, 다중 단계의 작업 처리를 포함한 에이전트 워크플로우를 구동할 수 있는 충분한 성능을 갖추고 있습니다.
LFM2.5-2.6B: Deploy Agents Everywhere — Blog — Liquid AI ([https://www.liquid.ai/blog/lfm2-5-2-6b](https://www.liquid.ai/blog/lfm2-5-2-6b))
클라우드 API에 의존하는 에이전트와 달리, 로컬 에이전트는 무료로 추론을 실행할 수 있으며, 지연을 줄이는 데 효과적이고, 더 나아가 개인 정보 보호 측면에서도 우수합니다. 또한 리퀴드 AI에 따르면, 토큰별 비용이 없어지면 에이전트는 로컬 하드웨어에서 대규모로 병렬화되어 수백만 토큰을 소비하는 백그라운드 작업을 제한 비용으로 실행할 수 있게 됩니다.
LFM2.5-2.6B의 벤치마크 결과를 ‘Gemma 4 E28 it(5.18B)’, ‘Gemma 4 E48 it(8B)’, ‘Qwen3.5(4.7B)’, ‘Qwen3.5-9B(9.7B)’와 비교한 그림이 아래에 있습니다.
LFM2.5-2.6B는 에이전트 워크로드에 특화되어 특별히 훈련된 2.6B 파라미터 모델이며, 약 34T 토큰의 학습 데이터를 사용하여 사전 훈련되었습니다. 에이전트 워크로드에 필요한 긴 입력을 모델이 처리할 수 있도록, 훈련 중에 별도의 128K 컨텍스트 확장 페이즈를 포함했습니다. 아래는 베이스 모델인 LFM2.5-2.6B-Base를 LFM2.5-2.6B로 파인튜닝하는 4단계의 훈련 후 파이프라인을 요약한 그림입니다. 구체적으로, 지도 학습 파인튜닝, 지도 불량 학습, 다중 영역 기반 정책 증류, 그리고 에이전트 기반 강화 학습이라는 프로세스가 사용되었습니다.
리퀴드 AI에 따르면, LFM2.5-2.6B는 효율적인 LFM2 아키텍처 덕분에 프롬프트의 로딩과 답변 생성에서 테스트한 중 가장 빠른 모델입니다. Apple M5 Max에서는 매초 220 토큰, Ryzen AI Max+ 395에서는 매초 113 토큰을 디코딩하며, 메모리 사용량은 2.5GB 미만에 억제됩니다. 스마트폰에서는 최대 매초 30 토큰을 처리할 수 있으므로, 고성능 에이전트를 자신의 장치에서 즉시, 그리고 사적으로 실행할 수 있습니다. 아래는 각 모델을 SGLang 0.5.16 환경에서, 입력 토큰 1024개, 출력 토큰 최대 256개, BF16 설정에 따라 벤치마크하고, 병렬도 수준별로 평균 3회 실행한 후, 단위 시간당 처리 능력을 비교한 그래프입니다. LFM2.5-2.6B는 동 크기 클래스에서 가장 빠른 모델이며, 고 병렬도에서는 매초 약 1만 5000개의 출력 토큰을 생성하며, NVIDIA의 AI용 GPU ‘H100’ 1기로 1일당 약 13억 토큰을 처리할 수 있다고 합니다.
실제 스마트폰상의 Liquid Agent 하르네스 내에서 LFM2.5-2.6B를 실행한 데모가 아래에 있습니다. 클라우드 API 호출을 전혀 하지 않고, 기기 내에서 작업의 계획, 툴 호출, 실제 작업 실행까지 모두 완결합니다. 24시간 7일 On-Device Agents: LFM2.5-2.6B가 결혼 여행 계획을 세우다 - YouTube
LFM2.5-2.6B-Base 및 LFM2.5-2.6B는 Hugging Face에서 다운로드할 수 있습니다. LiquidAI/LFM2.5-2.6B-Base · Hugging Face https://huggingface.co/LiquidAI/LFM2.5-2.6B-Base LiquidAI/LFM2.5-2.6B · Hugging Face https://huggingface.co/LiquidAI/LFM2.5-2.6B
원문 보기 | 출처: Gigazine