# 엘리자, 일본 내 “LLM-jp-4” 기반 추론 모델 2종 무료 공개, “AI에 의한 AI 개발” 연구 조직 설립

> https://bookfactory.kr/board/news/20223
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-05T23:48:22.610Z

---

이미지 출처: ELYZA 공식 발표

KDDI 그룹의 AI 개발 기업 ELYZA는 2026년 10월 2일, 국립정보학연구소(NII)의国産 대규모 언어 모델 “LLM-jp-4”를 기반으로 하는 추론 모델 2종을 무료 공개했다. 이 모두 Apache 2.0 라이선스를 채택했으며, 상업적 이용이 가능하다. 당일, “AI에 의한 AI 개발” 연구를 추진하는 조직 “ELYZA RSI Research”의 설립도 발표했다.

국산 기반을 활용하여 일본어의 추론 및 지시 따르기를 강화

공개된 것은 ELYZA-Thinking-1.0-llm-jp-4-33b와 ELYZA-Thinking-1.0-llm-jp-4-32b-a3b이다. 33B 버전은 Dense 모델이고, 32B-A3B 버전은 여러 개의 전문 부분을 사용 분리하는 Mixture of Experts (MoE) 모델이며, Hugging Face에서 입수할 수 있다.

일본 내에서 제로에서 시작하여 사전 학습된 LLM-jp-4에, ELYZA가 중간 학습, 지도 학습 기반 미세 조정, 강화 학습을 실시했다. 수학, 코딩, 과학 기술 분야의 데이터를 일본어로 번역했으며, 부피와 한자 수 등 일본 특유의 조건 포함 지시 추종 데이터를 정비했다. 일본어판 위키백과와 위키데이터를 기반으로 한 합성 데이터를 사용하여 일본 고유의 지식을 끌어내는 능력을 강화하고 있다.

■ LLM-jp-4 계열의 후치 학습 완료 모델을 20종의 벤치마크로 비교한 종합 점수. ELYZA의 공표 평가에 의한

이미지 출처: ELYZA 공식 발표

ELYZA의 평가에서는, 종합 점수가 33B 버전이 61.7, 32B-A3B 버전이 58.5가 된 것으로 나타났다. 비교 대상 LLM-jp-4.1의 Thinking 모델은, 추론 설정을 “high”로 설정한 경우, 33B 버전이 60.6, 32B-A3B 버전이 53.9로, 이 모두 ELYZA의 모델이 상회했다. 33B 버전에서는 일본어의 지식에 관한 질문 응답이나 지시 추종에서 높은 점수를 보여주는 한편, 수학이나 툴 호출에는 LLM-jp-4.1을 하회하는 항목도 있었다.

## 학습부터 평가까지, 사람이 개입하는 작업을 1~2인일에

개발에는, ELYZA가 정비한 내부의 LLM 학습 기반을 활용했다. 회사에 따르면, 사람이 개입하는 작업을 1~2인일 정도로 줄이면서, 중간 학습 및 후치 학습부터 평가까지 실행했다.

■ 사람이 담당해 왔던 기반 모델이나 하르네스의 개발 및 개선을, AI 에이전트가 보완 및 대체하는 구상을

이미지 출처: ELYZA 공식 발표

ELYZA RSI Research에서는, AI 에이전트가 기반 모델과, 동작 및 툴 이용을 제어하는 “하르네스”를 개선하고, 평가 결과를 다음 개발에 반영하는 시스템을 연구한다. 향후에는, 개발을 담당하는 AI 에이전트 자신도 개선 대상에 포함하는 “재귀적 자기 개선 (RSI)”을 목표로 한다.

■ 자기 개선 및 인간 개입 감소 AI 개발 4단계

이미지 출처: ELYZA 공식 발표

현재 시점에서는 RSI에 이르는 전 단계의 요소 기술을 연구하고 있습니다. 회사는 RSI 자체를 실현한 것이 아니라고 설명하고 있습니다.

■ 연구 영역별 진척 상황. 기반 모델의 후처리 학습, 벤치마크 생성, 하네스 개선에서는 인과 AI가 담당하는 범위가 다름

이미지 출처: ELYZA 공식 발표

## 평가의 반자동화 및 업무 특화형 에이전트 개발도

평가 기구의 연구에서는 일본어 질의 응답 업무를 대상으로 하는 벤치마크 “ELYZA Agent Tasks: 고객 서비스”도 공개했습니다. 음성과 텍스트에 대응하며 업무 절차 선택, 도구 이용, 최종 처리 결과 등을 평가합니다.

■ 사람이 전제 지식이나 시나리오의 개요를 제시하고 AI가 업무 절차서, 도구, 데이터베이스 등의 작성 과정을 진행합니다. 사람은 오류 확인 및 수정 요청을 담당합니다.

이미지 출처: ELYZA 공식 발표

동 벤치마크를 사용한 하네스의 자율 개선 실험에서는 개선에 사용하지 않은 테스트 데이터에서의 완수율이 34.3%에서 52.9%로 향상되었다고 합니다.

■ 자율 개선 에이전트의 정밀도 및 비용 개선을 설명하는 영상의 한 장면. 화면의 숫자는 설명용이며, 본문에 기재된 실험 결과와는 구별됩니다.

@YouTube

■ 산업 및 업무별 전문 지식과 평가 기관을 자율 연구 기반에 통합하여 영역 특화형 AI 에이전트 개발 구상

이미지 출처: ELYZA 공식 발표

ELYZA는 연구 성과를 활용한 산업 및 업무 특화형 AI 사업도 전개한다. 첫 번째 제품으로 음성 대화 AI 에이전트 “ELYZA Voice Agent”를 개발했다.

관련 기사: 국립정보학연구소, 풀스크라치 학습의国産LLM “LLM-jp-4” 공개 8B·32B 모델을 오픈 소스에서 제공

관련 기사: Transformer를 대체하는 선택지──ELYZA, 일본어 특화의 확산 모델 기반 LLM “ELYZA-LLM-Diffusion”을 상업 이용 가능한 형태로 공개

관련 기사: 리코, “Gemma 3 27B” 기반의 일본어 LLM을 개발──gpt-oss-20b 동등 성능을 달성하면서 PC 서버에서 움직이는 온프레임용 모델로서 기업 제공을 시작

[원문 보기](https://ledge.ai/articles/elyza_thinking_llm_jp_4_rsi_research) | 출처: Ledge.ai