이미지 출처: 기술評論社(Gihyo Direct)
기술평론사는 2026년 9월 28일, 이미지, 음성, 비디오 등 여러 종류의 데이터를 다루는 AI의 메커니즘을 설명하는 『멀티모달 모델 입문』을 출간했다. 트랜스포머의 기초부터, 시각·음·비디오·3차원 데이터를 다루는 모델, 여러 데이터 형식을 통합하는 오므니모달 모델까지를 전 6장으로 다룬다. 종이책의 정가는 3,960엔(세금 포함), B5 변형판으로 352페이지.
## 이미지와 언어의 통합부터, 음·비디오·3차원 데이터로
본서는 멀티모달 모델을 연구 및 개발에 활용하기 위한 기초 지식과 메커니즘을 설명하는 입문서이다. 출판사는 자율주행, 로봇, AI 에이전트가 실세계의 정보를 이해하고 인간과 소통하기 위한 기술을, 기초부터 체계적으로 설명한다고 밝혔다.
제1장에서는 Transformer, 토큰, 대규모 언어 모델(LLM)의 능력과 학습 방법론을 다룬다. 제2장 “Vision and Language”에서는 시각과 언어를 다루는 모델의 기초와 LLaVA를 소개하고, 성능에 영향을 미치는 요소, 시각 토큰의 내부 분석, 평가 방법론까지 설명한다.
제3장에서는 음 데이터로 음성뿐만 아니라 음악 및 기타 청각 음도 포함한다. 음을 다루는 기반 모델, 뉴럴 오디오 코덱, 음과 언어를 결합하는 모델을 다룬다. 제4장에서는 비디오 이해 작업, 비디오 기반 모델 학습, 데이터셋 및 평가에 대해 설명한다. 제5장은 3차원 데이터와 LLM 및 시각-언어 모델 (VLM) 통합 기술을 다룬다.
제6장에서는 여러 데이터 형식에 대응하는 오므니모달 모델을 다루고, NExT-GPT 학습 및 평가, 과제 및 전망을 설명한다.
## 일본어 대응 LLaVA 실행 및 추가 학습 및 내부 분석 코드 공개
공식 지원 리포지토리에서는 제2장과 대응하는 3개의 노트북 링크를 공개하고 있다.
내용은 Transformers를 사용하여 일본어 대응 LLaVA 기반 모델을 실행하는 방법, 개별 작업에 맞게 대규모 시각-언어 모델을 미세 조정하는 방법, 시각 토큰에 저장되는 정보를 분석하는 방법을 포함한다. 공개 코드는 Transformers를 사용하여 일본어 대응 LLaVA 기반 모델 실행, 개별 작업에 맞게 모델을 추가 학습하는 미세 조정, 시각 토큰에 저장되는 정보 분석을 다룬다.
## 시각, 음, 비디오 등 연구에 참여한 9명이 집필
저자는 栗田修平氏, 品川政太朗氏, 柳凜太郎氏, 塩野大輝氏, 高道慎之介氏, 仁泉大輔氏, 中村友彦氏, 八木拓真氏, 篠原崇之氏의 9인. 자연어 처리, 시각언어 처리, 음성·음악 신호 처리, 동영상 이해, 컴퓨터 비전 등의 연구에 携わる著자가 각 분야를 분당하고 있다.
AMD가 최초의 시각언어 모델 “Instella-VL-1B”를 발표했습니다. 자체 GPU인 MI300X로 훈련된 멀티모달 AI입니다.
관련 기사: 구글, 젬마 3n을 공식적으로 출시 – 저메모리·저전력으로 스마트폰 실행도 가능한 멀티모달 AI
관련 기사: 구글, 오픈 모델 “Gemma 4” 공개 – Gemini 3 기술을 기반으로 추론 및 AI 에이전트 기능을 강화하여 Apache 2.0 라이선스로 제공합니다.
원문 보기 | 출처: Ledge.ai