# Suno V5에 뒤떨리지 않는 음악 생성 AI “YuE2” 공개, 악보 생성 및 멜로디/코드 편집, 24GB GPU로 작동

> https://bookfactory.kr/board/news/16985
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-17T00:16:08.892Z

---

AI 연구 커뮤니티의 멀티모달 아트 프로젝션(M-A-P)은 2026년 9월 10일, 음악 생성 AI “유이2”를 공개했다. 가사와 곡 스타일을 입력하면 보컬과 반주를 포함한 완성 곡을 생성할 수 있으며, 멜로디나 코드를 “가락”으로 취급하여 인간이나 AI 에이전트가 편집할 수 있는 점을 특징으로 한다. 개발팀은 곡 품질에 대해 “Suno v5/v6와 경쟁력 있는” 수준이라고 평가하고 있다.

M-A-P는 공식 Hugging Face 개발 로그에서 YuE2를 “Suno v5에 뒤지지 않는 오픈 소스 프론티어 음악 생성 모델”로 설명하고 있다.

음성을 직접 생성하는 것뿐만 아니라, 먼저 “가락”을 만드는 것을 의미합니다.

YuE2의 가장 큰 특징은 음악을 생성하는 과정 중에 편집 가능한 “symbolic plan (시mb오릭플랜)”을 삽입하는 메커니즘이다.

공식 모델 카드에 따르면, 사용자가 가사와 장르, 악기, 보컬 특징, 템포(tempo) 등을 지정하면 YuE2는 먼저 멜로디와 코드를 포함한 악보(가락)를 생성한다. 그 후, 해당 정보를 음악을 나타내는 토큰이나 음향 데이터로 변환하여 보컬과 반주를 포함한 곡으로 출력한다.

악보(가락)는 ABC 작곡법으로 취급되며, 사용자는 생성 후 멜로디나 코드를 수정할 수 있습니다. 악보(가락)를 사용하지 않고 직접 곡을 생성하는 모드나, 멜로디만 고정하고 반주를 자유롭게 생성하는 모드도 제공합니다.

■ YuE2의 “From score to song”. 생성된 곡과, 멜로디와 코드 포함된 심볼릭스 코어를 대응시켜 확인 가능

AI 에이전트와 대화하면서 음악을 편집하세요.

생성된 악보를 AI 에이전트에게 전달하여 자연어 지시로 편집하는 “agentic editing”에도 대응한다.

예를 들어 “재즈풍의 코드 변환”, “가사 또는 스타일 변경”, “솔로 파트 확장”과 같은 지시를 기반으로 AI 에이전트가 악보, 가사, 스타일 설정을 수정하고 YuE2가 변경된 곡을 재생성한다.

공식 데모에서는 “The Last Train”이라는 곡을 연구자와 AI가 대화하면서 9단계, 14버전에 걸쳐 편집하는 예를 공개하고 있다. 처음에는 Mandarin pop song으로 생성한 곡을 기점으로, 화음 변경, 편성 변경, 브리지에 인용, 색소폰 추가, 영어 가사 변경 등을 거쳐 최종적으로 모던 하모니를 포함하는 영어 재즈곡으로 완성하고 있다.

■ YuE2의 “Agentic music editing” 데모. 연구자와 AI가 대화하면서 1곡을 9단계, 14버전에 걸쳐 편집해가는 흐름을 보여준다

## best-of-8에서는 SongBench에서 Suno v5를 상회한다

M-A-P은, 완전한 곡 생성 평가를 평가하는 독자적인 벤치마크 “WildSongBench”의 결과도 공개했다.

2026년 9월 12일 업데이트 비교에서는 192종의 프롬프트를 사용하여 17개의 설정을 평가했으며, 음원 품질을 7 항목에서 평가하는 “SongBench Avg”에서 8회 생성한 후보에서 평가 지표에 기반하여 1곡을 선택하는 “YuE2 (베스트 오브 8)”는 6.9632를 기록했다. Suno v5는 6.8721였다.

한편, 일반적인 YuE2는 6.7316으로 Suno v5를 하회했다. best-of-8에서는 8 후보에서 선별하는 반면, 표준적인 YuE2에서는 2 후보에서 선택한다. 또한, 모델마다 후보의 생성 및 선별 방법이 서로 다르며, 계산량을 고려한 비교가 아니었다.

개발 팀(development team)은, 이들은 자동 평가 지표(automatic evaluation metric)에 의한 결과이며, 모든 지표(metric)에서의 우위성(superiority)이나 인간의 호기(human preference)를 보여주는 것이 아니라고 밝혔다.

■ WildSongBench의 비교 결과. YuE2（best-of-8）의 SongBench는 6.96로, Suno v5의 6.87을 상회했다.한편, 일반적인 YuE2는 6.73이었다.

## 24GB의 GPU로 로컬 실행, 3.6분의 곡을 약 71초에서 생성

측정 결과, GeForce RTX 4090(24GB)를 사용한 경우 약 3.6분의 곡을 약 71초 만에 생성했다. 모델 카드에서는 Linux, Python 3.10 이상, BF16을 지원하는 NVIDIA GPU를 이용 환경으로 제시하고 있다.

유이2 모델 구성. 심보리랙스 코어에서 중간 표현을 거쳐 음성을 생성하는 메커니즘과, 작곡, 커버 생성, 편집에 대한 대응을 보여준다.

M-A-P에 따르면, YuE2의 학습에는 34만 6천 시간 분량의 음악 데이터를 사용했다. 동 팀은 YuE2를 포함한 모델 군에 대해 주로 CC0 음악과 합성 데이터를 사용하여 학습했으며, 합성 데이터의 대부분은 Tokenwave.AI로부터 라이선스 제공을 받았다.

YuE2의 추론 코드 등은 Apache License 2.0으로 공개되어 있다. 반면, YuE2-3B와 같은 모델 가중치는 “CC BY-NC 4.0”으로 공개되어 있으며, 상업적 이용을 허용하지 않는 조건이 붙는다. 개발 팀은 YuE2를 “open-source”라고 표현하고 있지만, 모델 가중치의 이용에는 이 라이선스 조건을 확인해야 한다.

[원문 보기](https://ledge.ai/articles/yue2_music_generation_ai) | 출처: Ledge.ai