친애하는 독자 여러분께. 잘 아시다시피 가격 급등 등의 악영향으로 인해 서버 운영이 매우 어려운 상황입니다. 회선 및 서버 수를 정리하고 검토할 수 있는 부분은 모두 검토했지만, 역시 아직 위험 수위입니다. 이대로라면 1페이지를 10분할 정도로 무리하게 PV(페이지 뷰)를 늘려야 할 수도 있습니다. 이에 GIGAZINE의 물리적인 서버들을, 1원이라도 좋으니 독자 여러분의 지원을 부탁드린다면 정말 큰 도움이 될 것입니다! 지금 바로 기부는 위의 버튼에서! ・이전 GIGAZINE 지원자 목록 비밀번호 - 비밀번호 재발급 미국에 본사를 둔 AI 기업 Liquid AI가 시각 언어 모델 “LFM2.5-VL-3B”를 발표했습니다. LFM2.5-VL-3B는 스마트폰에서도 작동이 가능하다는 확인 결과가 있는 경량 VLM(Vision-Language Model)으로, 문서의 OCR(광학 문자 인식) 및 UI(사용자 인터페이스) 인식 등이 가능합니다. 오픈 모델로 공개되어 있으며, 무상으로 다운로드할 수 있습니다. LFM2.5-VL-3B: 에지 환경을 위한 더 나은, 더 빠른 비전-언어 모델 — 블로그 — Liquid AIhttps://www.liquid.ai/blog/lfm2-5-vl-3b LFM2.5-VL-3B는 LFM2.5-2.6B와 동일한 기반 모델을 기반으로 구축된 VLM입니다. 파라미터 수는 31억 개이며, 메모리 사용량은 3.3GB 이내로 수렴합니다. “LFM2.5-VL-3B(3.1B)”, “LFM2-VL-3B(3.1B)”, “gemma-4-E2B-it(5.1B)”, “gemma-4-E4B-it(8B)”, “InternVL 3.5 2B(2.4B)”, “InternVL 3.5 4B(4.7B)”, “Qwen3.5-2B(2.3B)”, “Qwen3.5-4B(4.7B)”의 추론 성능 및 시각 인식 성능을 측정한 결과가 다음과 같습니다. LFM2.5-VL-3B는 gemma-4-E4B-it 및 Qwen3.5-4B와 같은 비교적 대형 모델보다 높은 점수를 기록했습니다. LFM2.5-VL-3B는 NVIDIA, AMD, Apple, Qualcomm의 프로세서를 지원하며, 노트북이나 스마트폰에서 실행할 수도 있습니다. 아래 그림은 “AMD Ryzen AI Max+ 395를 탑재한 PC”, “Apple M5 Max를 탑재한 Mac”, “Qualcomm의 SoC(시스템 온 칩)를 탑재한 Galaxy S26 Ultra”에서 각종 모델에 이미지와 텍스트를 입력한 경우 “첫 번째 토큰 출력까지의 지연 시간(밀리초)”, “디코딩 속도(토크/초)”, “사용 메모리(MB)”를 나타냅니다. LFM2.5-VL-3B는 Galaxy S26 Ultra에서 매초 20개의 토큰을 디코딩할 수 있습니다. NVIDIA의 H100에서 각종 모델에 이미지와 텍스트를 입력한 경우 첫 번째 토큰 출력까지의 시간을 비교한 그래프가 다음과 같습니다. LFM2.5-VL-3B는 “256×256 픽셀, 5프레임의 비디오”를 입력하는 작업에서도 34밀리초라는 짧은 지연 시간으로 처리 가능합니다. LFM2.5-VL-3B은 영어, 아랍어, 중국어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 스페인어, 베트남어, 태국어, 인도네시아어, 힌디어, 러시아어, 폴란드어 등의 언어를 지원합니다. 다음 비디오에서 LFM2.5-VL-3B를 사용하여 문서의 OCR을 수행하는 것을 확인할 수 있습니다. LFM2.5-VL-3B: Document OCR and Layout Understanding in WebGPU - YouTube PC 또는 스마트폰 화면 UI를 정확하게 인식할 수도 있습니다. LFM2.5-VL-3B: Screen and UI Understanding in WebGPU - YouTube LFM2.5-VL-3B는 다음 링크에서 공개되어 있습니다. 이미 “llama.cpp”, “MLX”, “vLLM”, “SGLang”, “ONNX”에서 작동하도록 지원하며, 온디바이스 처리부터 대규모 서비스 배포까지 지원합니다. LiquidAI/LFM2.5-VL-3B · Hugging Facehttps://huggingface.co/LiquidAI/LFM2.5-VL-3B 또한, 문서는 다음 링크에서 확인할 수 있습니다. LFM2.5-VL-3B - Liquid Docshttps://docs.liquid.ai/lfm/models/lfm25-vl-3b * 관련 기사 스마트폰에서 작동하는 에이전트 대응 소형 AI 모델 “LFM2.5-2.6B” 등장, 로컬 환경에서 AI 에이전트 실행 가능 - GIGAZINE 스마트폰에서도 작동하는 일본어 대응 소형 AI 모델 “LFM2.5-8B-A1B” 등장 - GIGAZINE iPhone에서 작동하며 Bonsai 27Bと同등 성능으로 13배 빠름 AI “Maple-Preview” 등장, 로컬 AI가 또 1발짝 전진 - GIGAZINE iPhone에서 로컬 실행 가능한 270억 파라미터의 AI 모델 “Bonsai 27B” 등장, Qwen3.6-27B를 메모 사용량 3.9GB까지 소형화하여 스마트폰 단독으로 실용적인 속도로 작동 - GIGAZINE iPhone에서 로컬 작동하는 이미지 생성 AI “Bonsai Image 4B” 등장したので使ってみた, FLUX.2 Klein 4B를 1bit 버전으로 마조가하여 메모 사용량을 8.3분의 1로 감소 - GIGAZINE Mistral AI의 플랫폼에서 제3자 제작 오픈 모델이 선택 가능하게 되었습니다. (초기 모델은 Z.ai의 GLM-5.2) AI 에이전트로 구축된 “자율형 해킹 툴”이 아시아 정부 기관을 공격, 중국의 대만에 대한 공격인지 논란 - inAI, 2026년 08월 13일 16시 31분 00초 스마트폰 호환 시각 언어…. 최근 24시간 (1시간마다 업데이트, 5분 간격으로는 여기) 죄송합니다. 독자 여러분을 위한 기사를 계속 게시하기 위해, 서버 유지 비용으로 300원 기부해 주시겠습니까? 이메일로 리마인드해 드리겠습니다. 계속해서 기사를 읽어주십시오. 원문 보기 | 출처: Gigazine