# 스마트폰에서 실행되는 소형 AI 모델 “LFM2.5”에 메모리 최적화를 적용하면서 성능 저하를 최소화한 QAD 버전이 출시되었습니다.

> https://bookfactory.kr/c/news/10159
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-20T12:32:24.092Z

---

AI 기업 Liquid AI는 노트북이나 스마트폰과 같은 저사양 기기에서도 실행 가능한 소형 AI 모델인 LFM2.5 시리즈를 제공합니다. 최근 LFM2.5 시리즈에 양자화 인식 증류(QAD)라는 메모리 감소를 하면서 성능 저하를 억제하는 기술을 적용한 버전을 오픈 모델로 공개했습니다. LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment — Blog — Liquid AI[https://www.liquid.ai/blog/qad] AI 모델을 경량화하는 데에는 “양자화”라는 기술이 널리 사용됩니다. 하지만 양자화는 “모델의 계산 정확도를 낮추는” 방식으로 크기를 줄이는 것이므로, 양자화된 모델은 기본 모델과 비교하여 성능이 저하됩니다. QAD는 고정밀도 모델을 교사 모델로 사용하여 양자화로 인해 손실된 성능을 회복시키는 기술로, 메모리 감소를 하면서 성능을 유지하는 기술로 주목받고 있습니다.

LFM2.5 시리즈는 파라미터 수와 용도의 다른 여러 모델이 공개되어 있습니다. 이번에 QAD 버전이 공개된 것은 “LFM2.5-230M”, “LFM2.5-350M”, “LFM2.5-1.2B-Instruct”, “LFM2.5-2.6B”의 4가지 종류이며, Q4_0로 양자화된 모델에 증류를 적용하여 성능을 향상시켰습니다. LFM2.5-230M을 “M5 Max 탑재 MacBook Pro”, “AMD Ryzen AI Max+ 395를 탑재한 미니PC(NucBox EVO-X2)”, “Samsung Galaxy S26 Ultra”, “Raspberry Pi 5”에서 실행했을 때 양자화 정확도에 따른 벤치마크 점수를 나열한 그림은 다음과 같습니다. QAD 버전은 Q4_0 버전보다 성능이 크게 향상되어 Q5_K_M 버전에 가까운 성능을 보입니다. 파일 크기는 Q5_K_M 버전이 172MB, QAD 버전이 149MB이므로, QAD 버전이 메모리 감소를 하면서 성능 저하를 억제한 것이 확인됩니다.

LFM2.5-350M에서도 마찬가지로 성능 저하를 억제하면서 메모리 감소에 성공했습니다.

LFM2.5-1.2B-Instruct에서도 동일한 효과를 발휘합니다.

LFM2.5-2.6B의 경우에는 Q4_0 버전보다 성능이 향상되었으나, Q4_K_M 버전에는 미치지 못하는 결과가 되었습니다.

LFM2.5 시리즈는 오픈 모델로 무상 공개되어 있으며, 각 모델의 QAD 버전도 다음 링크에서 배포됩니다. LiquidAI/LFM2.5-230M-GGUF · Hugging Face[https://huggingface.co/LiquidAI/LFM2.5-230M-GGUF] LiquidAI/LFM2.5-350M-GGUF · Hugging Face[https://huggingface.co/LiquidAI/LFM2.5-350M-GGUF] LiquidAI/LFM2.5-1.2B-Instruct-GGUF · Hugging Face[https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct-GGUF] LiquidAI/LFM2.5-2.6B-GGUF · Hugging Face[https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF]

[원문 보기](https://gigazine.net/news/20260820-lfm2-5-qad/) | 출처: Gigazine