안녕하세요, 카미모토입니다!
MiniMax H3의 초기 흥미가 식어가는 가운데, 고성능보다는 응용 애플리케이션에 대한 관심이 높아지고 있지만, 이렇게 되돌아오면서 새로운 판단 모델인 “Jev”가 엄청나게 뜨고 있습니다!
X에서는 마리오를 플레이시키거나, 응모 서류를 고속으로 분류하는 등 다양한 유스케이스가 가능하며, 실제로 데모로 공개되어 있습니다.
저도 이 거대한 파도에 탑승하기 위해 Jev의 응용 사례를 탐구했지만, Jev의 특징으로 인해
- 클라우드를 통해 빠른 응답(실시간 처리에 적합)을 제공합니다.
- LLM에서 파생된 지능적인 판단 능력(고성능 if 문)
그러한 특성을 활용할 수 있는 것이 적합하다고 생각했습니다. 따라서 단순한 분류 문제와 같은 경우에는 적합하지 않으며, 고속 성능과 더불어 고성능 판단 능력이 필요한 것이 좋다고 생각했습니다.
그러다가 떠올린 아이디어가 MiniMax H3 영상 제작 AI의 내부 계산을 다른 AI에게 조정하게 하면 어떨까 하는 것이었습니다. 즉, Attention 기능을 희소(거칠게 계산)하는 데 Jev를 사용하면 영상 생성 속도를 높일 수 있지 않을까라는 아이디어였습니다.
이번에는 판단용 모델 Jev를 MiniMax H3의 추론 처리와 연결하여 “어떤 층의 Attention을, 어느 정도 남겨두는가”를 생성 중에 결정하는 메커니즘을 만들었습니다! 생성 모델의 계산 배분을 실시간으로 판단 대상으로 삼는 시도이며, 게다가 영상 생성 중에 클라우드 액세스라는 무모함까지!
이 글에서는 일반적인 성능 향상 소개보다 조금 더 깊이 들어가 배경, 제안 방법, 실험, 결과, 고찰 순으로 정리합니다. 평소보다 논문 형식으로 작성될 수 있으니 양해 부탁드립니다.
덧붙여 “방법은 중요하지 않으니 결과만 보여줘!”라는 의도에 맞게 제작된 X(엑스) 게시물을 공유합니다. 이것만으로도 충분합니다.
최신 Jev를 MiniMax H3에 통합하여 영상 생성 속도를 높여보았다! Attention 처리를 희소화하는 데 Jev를 활용했다.
* 각 층마다 Jev가 중요도를 판별(4단계 49층 대상)
* Jev를 희소율 1%, 3%, 5%, 10%로 설정
RTX 4070에서 6분 7초 → 3분 34초로 41.7% 단축! 영상 생성 중 Jev 클라우드에 문의하는 것임에도 불구하고 빠르다!
해리 포터와 저주받은 자식’을 읽고 감상을 적어 보았습니다.
마법 학교에 가고 싶은 마음, 해리처럼 같은 동료들과의 우정, 그리고 어둠의 세력과의 싸움…
모두가 정말 재미있었습니다.
특히, 볼드모트卿의 존재감과 그가 해리를 노리는 이유가 궁금해서 밤늦게까지 여러 번 다시 읽었습니다.
이 책을 읽고 용기를 갖는 것의 중요성과 우정의 강인함을 다시 한번 느꼈습니다.
추천합니다!
MiniMax H3의 터보 4단계 생성을 위해, 외부 판단 모델 Jev를 활용하여 Transformer의 각 층 및 단계별 Sparse Attention 유지율을 선택하는 제어 메커니즘을 구현했습니다.
본 방법을 일시적으로 J-GAS(Jev-Guided Adaptive Sparsity)라 칭합니다.
RTX 4070 12GB로 동일 조건에서 약 5초 분량의 영상을 각 방식별로 한 번씩 생성한 결과, 일반적인 matlow fused 4step + FastVAE는 366.720초였던 반면, 본 기술은 213.890초로 줄어들어 전체 생성 시간이 41.7% 단축되었습니다.
이 비교는 Native Sparse Attention(SLA)과 J-GAS를 결합한 방식 전체의 효과를 나타냅니다. 고정 Sparse Attention에 대한 Jev의 단독적인 우위성이나 음질의 동등성을 입증한 실험은 아닙니다. 오히려 유지율을 고정 10%로 설정해도 충분히 빠른 속도를 낼 수 있을 것으로 보입니다.
하지만 외부 판단 AI가 생성 과정 중인 내부 상태를 받아 다음 계산량을 층 단위로 제어하는 시스템이 실제 음성 동영상 생성에서 구현된 점은 J-GAS의 PoC로서의 성과로 충분하다고 판단합니다. “클라우드 LLM에 문의하면서 동영상을 생성하는” 것이 가능했다는 점이 중요합니다.
배경 및 질문
1.1 “얼마나 줄일지”를 고정값으로 결정하는 어려움
Attention은 토큰들 간에 어떤 정보를 참조할지를 계산하는 메커니즘입니다. 영상에서는 공간과 시간에 걸쳐 많은 토큰을 다루기 때문에, 이 계산을 줄이는 Sparse Attention이 고속화의 선택지가 됩니다.
하지만 전체 층과 전체 단계를 동일한 비율로 깎으면 중요한 처리까지 일률적으로 감소하게 됩니다. 필요한 정보량은 생성 단계, 층, 음성과 영상 간에 차이가 있을 수 있습니다.
따라서 이번 질문을 다음과 같이 설정했습니다.
생성 중인 내부 상태를 판단 AI에 전달하면, 일률적인 유지율 대신, 층과 단계에 따라 계산을 저장할 위치를 동적으로 현명하게 선택할 수 있을까.
개발 과정에서는 고정 1% 및 5%, 단계 수 변경, 층의 생략 등을 시도했지만, 최종적으로 채택된 사항만을 중심으로 설명합니다.
1.2 Jev를 사용하는 이유
Jev는 여러 가지 이유로 사용하기에 적합합니다. 첫째, Jev는 텍스트를 분석하여 핵심 내용을 빠르게 파악할 수 있도록 돕습니다. 특히, 긴 문서나 복잡한 내용을 요약하거나 중요한 정보를 추출할 때 유용합니다.
둘째, Jev는 PDF, Word, Excel 등 다양한 형식의 텍스트를 지원합니다.
셋째, Jev는 사용자 친화적인 인터페이스를 제공합니다. 누구나 쉽게 사용할 수 있도록 직관적인 디자인으로 제작되었습니다.
마지막으로, Jev는 지속적으로 업데이트되고 개선됩니다. 새로운 기능이 추가되고 성능이 향상되면서 더욱 강력하고 효율적인 도구로 발전하고 있습니다.
Jev를 사용하면 업무 효율성을 높이고 시간을 절약할 수 있습니다.
제브(Jev)는 준비된 선택지 등과 같은 템플릿 형태의 판단을 반환하는 것을 목적으로 하는 모델입니다. TypeSafe는 문장을 생성한 후 해석하는 용도와는 달리, 소프트웨어가 그대로 사용할 수 있는 판단에 적용되는 방식을 보여줍니다. TypeSafe 소개 기사
이 층은 1%, 이쪽은 10%와 같이 유한한 수의 선택지입니다. 따라서 유지율 후보를 1%, 3%, 5%, 10%로 제한하고, 다층 판단을 1회 API 요청에 모았습니다.
2. 관련 연구와 본 연구의 위치를 명확히 하자면…
영상 생성에서 Attention을 무시하는 아이디어 또는 입력에 따라 희소 계산을 선택하는 아이디어는 이미 선행 연구가 존재합니다.
- 스파스 비디오젠(Sparse VideoGen)은 영상 Diffusion Transformer의 공간 및 시간 방향에서의 희소성을 활용하여 속도 향상을 다루는 연구입니다.
- 스파르가트엔션(SpargeAttention)은 추가 학습 없이 스파스 어텐션(Sparse Attention)을 활용하여 추론 속도를 높이는 방안을 다루고 있습니다.
- AdaSpa는 영상 생성에 적합한 적응적인 스파스 어텐션과 온라인에서의 疎 패턴 탐색을 다루고 있습니다. 논문
본 연구 방법의 J-GAS의 특징은 Sparse Attention 커널 자체를 새롭게 만들었다는 점이 아닌, 기존 Attention 구현에 외부의 일반적인 판단 모델을 연결하여 프롬프트와 실행 시 통계 근거를 바탕으로 층별 보존율을 선택하도록 하는 데 있습니다.
검토한 선행 연구는 이 구성의 전부와 완전히 일치하지 않습니다. 본 기사에서는 Jev를 생성 모델 내부의 제어에 사용하는 구현 및 적용 사례로 활용합니다.
제안 방법: J-GAS (제브-가이드 적응형 희소성)
3.1 제브가 결정하는 것, SLA가 결정하는 것
본 방법인 J-GAS에서는 ComfyUI의 MiniMax H3용 Native SLA 경로를 사용합니다. Jev가 선택하는 것은 각 층에 설정하는 Attention의 유지율(keep률)입니다. 실제로 어떤 Attention 연결을 계산할지는 SLA 측에서 결정합니다.
예를 들어 keep 5%는 Sparse Attention에 전달되는 보존율 설정이 5%를 의미합니다. 모델의 파라미터를 95% 삭제하는 것이 아니며, 전체 연산량이 5%가 되는 것과는 관련이 없습니다. 보호되는 음성 부분이나 조건 부분, Attention 이외의 계산이 남아 있기 때문입니다.
전체 50개의 Transformer 블록을 4단계에서 모두 실행하며, 층 자체를 건너뛰는 방식이 아닙니다. 지금까지 게시된 맵의 49층은 블록 0를 제외한 블록 1부터 49까지의 표시입니다.
그림 1에서 Jev는 각 계층별 보존율을 선택하는 결정권자이고, SLA는 선택된 보존율을 기준으로 Attention을 계산하는 실행자입니다.
3.2 첫 번째 단계는 생성 프롬프트와 과거 레이어 통계를 기반으로 판단한다.
첫 번째 판단 단계에서는 영상 생성에 사용할 프롬프트 전체를 제브에게 전달하고 있습니다. 인물, 복장, 배경, 동작, 카메라 워크, 대사, 음향 효과까지 무엇을 생성하고자 하는지 상세히 전달하고 있습니다.
하지만, 생성을 시작하기 전이라 이번 영상에 대해 각 층이 어떻게 작동하는지를 측정한 데이터는 아직 없습니다. 따라서 과거 생성에서 얻은 “각 층을 통과하기 전후에 음성 및 영상의 내부 특징이 얼마나 변화했는지”라는 통계를 첨부합니다. 이는 이번 실측값은 아니며, 판단의 참고 자료로 제공합니다.
3.3 2단계부터 4단계까지는 바로 직전의 내부 상태를 활용하세요.
각 층의 입력과 출력에서 음성과 영상을 분리하여 최대 64 토큰 x 16 채널을 추출하며, 참조 이미지 행은 이 관측 대상에서 제외합니다.
여기서는 단순한 Attention의 출력을 측정하는 것이 아니라, Transformer 블록 전체를 통과하면서 앞뒤의 변화가 얼마나 일어났는지를 측정합니다. 주요 입력은 다음과 같이 3가지 종류입니다.
- 상대적인 잔차의 크기: 출력과 입력 간의 L2 노름 차이를 입력의 L2 노름으로 나눈 값으로, 해당 레이어에서 표현이 얼마나 변화했는지 나타내는 지표입니다.
- 층간 소음으로 인한 순위: 음성과 영상 간의 비교를 통해 그 변화가 50층 중 얼마나 큰지를 나타낸 것.
- 단계별 변화: 이번 잔차와 전 회차 잔차가 얼마나 다른지. 기록이 없는 첫 번째 관측치에서는 값을 생성하지 않고 결측값을 전달합니다.
음성 및 영상 모두에서 변화가 미미한 경우 1% 또는 3%, 일반적으로 또는 판단이 분분한 경우 5%, 어느 한쪽으로 영향을 크게 미치거나 변화가 큰 경우 10%를 고려하도록 지시하고 있습니다. 이는 사람이 제시한 판단 기준이며, Jev가 0부터 평가 기준을 발견한 것은 아닙니다.
또한, 잔차가 작다는 것은 “깎아서 안전하다”는 증거가 아닙니다. 음성의 들림새, 손가락 개수, 글자의 정확성을 직접 측정하고 있는 것 또한 아니며, 이 한계 또한 입력에 포함하고 있습니다.
2단계 이후부터는 Jev가 블록 1부터 49까지의 49층을 판단하고, 블록 0은 5% 고정입니다. 직전 단계의 관측을 바탕으로 다음 단계의 설정을 결정합니다.
## 3.4 출력 및 적용 규칙
본 장에서는 출력 및 적용 규칙에 대해 설명합니다.
**3.4.1 출력 형식**
출력 형식을 다음과 같이 정의합니다.
* **텍스트 형식:** 텍스트 형식으로 출력합니다.
* **CSV 형식:** CSV 형식으로 출력합니다.
* **JSON 형식:** JSON 형식으로 출력합니다.
**3.4.2 적용 규칙**
적용 규칙은 다음과 같습니다.
* **규칙 1:** (구체적인 규칙 내용)
* **규칙 2:** (구체적인 규칙 내용)
* **규칙 3:** (구체적인 규칙 내용)
위 규칙을 준수하여 출력 및 적용을 수행해 주시기 바랍니다.
제브의 답변을 통해 각 층별 선택 값, 신뢰도, 후보별 확률 값을 받아 실행 측은 이를 확인하여 실제 유지율을 설정합니다.
여기에는 Jev를 제외한 고정 규칙도 있습니다.
- 신뢰도가 0.3 미만인 경우, 최초 10%, 이후 순서는 5%로 대체합니다.
- API 실패 또는 부적절한 답변이 있을 경우, 해당 판단의 모든 층을 최초 10% / 이후 5%로 되돌리고, 이후 API 호출을 중단합니다.
- API는 최초 호출과 각 단계의 경계 시점에 최대 4회 호출됩니다. 49회를 매 단계별로 직렬로 호출하는 구성은 아닙니다.
- 최종 단계 이후에는 다음 계산이 없으므로 판단 API를 호출하지 않습니다.
그러므로 게시되는 배분도는 Jev의 답변에 보호 규칙과 신뢰 규칙을 적용한 실제 설정 값입니다. 최종 방식에서는 이전 시도했던 평균 예산에 대한 재배분은 수행하지 않았습니다.
API로 전송되는 데이터는 텍스트와 집계 통계이며, 영상 및 음성의 원본 데이터와 모델 가중치는 아닙니다. 반면, 프롬프트의 내용은 외부 API로 전달됩니다. 로컬 PC에서 작동하는 Jev가 제공된다면, 모든 작업을 PC 내에서 완결할 수도 있습니다.
4. 실험 설정
실험은 2023년 11월 16일에 진행되었으며, 실험 대상은 10명의 참가자였다. 참가자들은 모두 20대 후반에서 30대 초반의 남성으로, 시력이 정상이었고, 특정 질환이나 약물 복용 이력이 없는 건강한 성인 남성으로 구성되었다. 실험실은 온도와 습도가 일정하게 유지되는 환경이며, 소음이 거의 없는 조용한 공간이었다. 실험에 사용된 장비는 모두 최신식으로, 정확하고 신뢰성 있는 데이터를 얻을 수 있도록 정기적으로 교정 및 유지보수가 이루어졌다. 실험 진행자는 실험 과정 전반에 걸쳐 객관적인 시각을 유지하고, 참가자들에게 편향된 영향을 주지 않도록 주의를 기울였다. 또한, 실험 결과는 데이터 분석을 통해 객관적으로 평가되었으며, 주관적인 판단은 배제되었다.
비교 대상은 Matlow fused 4step+FastVAE를 사용하는 일반 방식과, 여기에 Jev 제어를 적용한 J-GAS입니다.
주요 공통 조건은 다음과 같습니다.
- 지피유: RTX 4070 12GB
- 생성: 참조 이미지 3장을 사용하는 Ref2VA, 1024×1792, 124프레임, 24fps, 약 5.17초.
- 샘플링: 4단계, res_multistep/simple, 시드 2026
- 공통 고속화: ChunkFFN 4, FastVAE 배치 2
- 모델: minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot.safetensors는 모델 이름 또는 파일 이름일 뿐입니다. 게시글의 본문 내용을 제공해 주시면 번역해 드리겠습니다.
- 제어 모델: jev-1.13.0. SDK 0.7.0, SDK 타임아웃 20초, 재시도 0
장면은 검은 머리를 묶은 애니메이션 스타일의 여성이 여름 공원에서 가볍게 고개를 끄덕이며 “Let’s create something amazing!”이라고 말하는 것입니다. 그녀는 검은 어깨가 드러난 크롭탑, 회색 카고 미니 스커트, 검은 앵클 부츠를 착용했습니다. 카메라 앵글은 허리 위에서부터 천천히 상반신으로 기울여 여성의 목소리와 작은 환경 소음, 배경 음악 없이 녹음되었습니다.
측정 대상은 모델 로딩, 샘플링, Jev의 판단 대기, VAE, 저장 등을 포함한 전체 생성 시간입니다. 채택 조건에서는 각 방식 1회씩이며, 여러 번의 평균은 사용하지 않습니다.
5. 결과
5.1 전체 생성 시간
오늘도 생성 AI의 생성 시간과 관련된 상세 분석에 참여해 주셔서 진심으로 감사합니다.
이번 분석에서는 특히 “별의 정원사” 생성에 소요되는 시간과 그 요인에 대해 심층적으로 파고들고 싶습니다.
구체적으로 다음과 같은 항목에 대한 상세 데이터를 수집하고 분석을 진행하겠습니다.
* 생성 모델 버전: 사용된 생성 AI 모델 버전 (예: GPT-4, Gemini Pro 등)
* 프롬프트 복잡도: 사용자가 생성 AI에 제공한 프롬프트의 길이, 복잡성, 상세 정도
* 생성 파라미터: 생성 AI가 사용한 파라미터 (예: 온도, 토픽 확률, 최대 토큰 수 등)
* 생성 시간: 생성 AI가 텍스트를 생성하는 데 걸린 시간 (초, 분 등)
* 생성된 텍스트 길이: 생성 AI가 생성한 텍스트의 문자 수, 토큰 수
* 생성된 텍스트 품질: 생성된 텍스트의 유창성, 정확성, 관련성 (인간 평가)
이러한 데이터를 종합적으로 분석함으로써 생성 AI의 생성 시간과 관련된 요인을 파악하고 개선 방안을 모색하겠습니다.
특히 “별의 정원사” 생성 시간은 프롬프트 표현 방식이나 생성 AI 모델의 특성이 영향을 미칠 수 있으므로 면밀히 검증하겠습니다.
또한 생성 시간뿐만 아니라 생성된 텍스트의 품질도 고려하여 생성 AI의 성능을 평가하겠습니다.
이번 분석 결과는 향후 생성 AI의 개발 및 운영에 중요한 지표가 될 것입니다.
협조해 주시면 감사하겠습니다.
- 일반적인 방법: 366.720초, 약 6분 7초
- 009jev:213.890초, 약 3분 34초
- 축소: 152.830초, 41.7%. 속도비에서는 약 1.71배
제브의 판단 처리는 총 4회로 5.56초 소요되었습니다. 이는 외부 API 응답 시간뿐만 아니라 로컬 워커 실행 등 코드상의 판단 구간을 포함한 전체 시간입니다. 이번 조건에서는 판단 대기 시간 포함하여 방식 전체로서 시간이 단축되었습니다.
다만, 이 그림의 좌측은 고정 10% SLA가 아닌, 이번에 비교한 일반적인 Attention 경로입니다. 41.7%를 “제프가 고정 Sparse Attention에서 추가로 단축한 비율”로 해석할 수 없습니다. 즉, 고정 10% 또는 5% SLA만으로도 이 수준에서 고속화가 가능하다는 의미입니다.
하지만 여전히, 여기서 말씀드리고 싶은 것은,
- 중요도에 따라 희소율을 동적으로 변경할 수 있습니다.
- 외부 판단 LLM을 통합하더라도 실시간으로 생성 가능합니다.
이 두 가지 사항입니다. J-GAS의 PoC로서 여기가 가장 중요합니다.
5.2 어느 계층에 얼마나 남겨 놓았는가
가로는 블록 1부터 49까지, 높이는 생성 단계의 4단계입니다. 색상은 적용 유지율을 나타냅니다. 블록 0은 그림에서 제외되었지만, 계산은 실행 중입니다.
첫 번째 시도에서 Jev는 총 50층 중 10%를 선택했습니다. 이는 첫 번째 시도를 일률적으로 10%로 고정한 결과가 아니며, 첫 번째 시도에 대한 답변에는 신뢰도에 의한 대체도 없었습니다. 추측컨대, 이전 상태가 존재하지 않았기 때문에 Jev의 판단이 고정화되었거나, “첫 번째 시도 = 최우선 = 10% 상한”이라고 정확하게 판단했을 가능성이 있습니다.
이후 각 층마다 값이 분기되었으며, 전체 50층의 단순 평균은 순서대로 10.00 → 6.34 → 7.06 → 8.18%가 되었습니다. 생성 과정이 진행될수록 일률적으로 깎는 방식이 아닌, 실제 적용 사례에서는 후반부에 유지율을 늘리는 방식을 사용하고 있습니다.
흥미로운 점은 인간의 직감과 일치한다는 것입니다. 49층 처리 과정에서 앞부분과 뒷부분은 중요하며, Jev도 각각 10%를 선택하고, 중간 처리 과정은 그렇게 중요하지 않으며, Jev는 1%, 3%, 5%를 선택하고 있다는 점입니다.
그림의 마크는 신뢰도가 낮아 5%로 대체된 위치입니다. 2~4단계에서 각각 5, 5, 4건이 있었습니다. 배분은 Jev의 출력 결과만으로도 사람이 지정한 예산에 맞도록 가공된 결과이거나, 답변과 명시적인 보호 규칙의 조합이 아닙니다. 쉽게 말해, 어떤 선택지든 확률이 크게 변하지 않기 때문에 중간의 5%를 강제한 의미입니다.
이 값들은 설정 값의 평균이며, 실제 측정된 FLOPs나 Attention 연결 수의 평균은 아닙니다. “평균 keep이 절반이라면 전체 생성 시간도 절반”이 될 수 없습니다.
5.3 생성 영상
최신 Jev를 MiniMax H3에 통합하여 영상 생성 속도를 높여 보았다! Attention 처리에 Jev를 사용하여 희소화 효과를 확인했다.
* 층마다 Jev가 중요도를 판별 (4단계 49층 대상)
* Jev의 희소율을 1%, 3%, 5%, 10%로 설정
* RTX 4070에서 6분 7초 → 3분 34초로 41.7% 단축!
* 영상 생성 중 Jev 클라우드에 문의하는 것임에도 불구하고 빠른 속도를 보였다!
영상 전반부는 동일 조건의 좌우 비교를 포함하며, 후반부는 J-GAS 영상과 층별 설정에 대한 설명입니다. 음성은 전반부의 경우 일반 방식을, 후반부의 경우 J-GAS 방식을 사용하므로 대사 차이를 순서대로 비교할 수 있습니다. 맵 전환은 설명용으로만 활용되었으며, 실제 추론 시점과 영상 재생을 동기화한 것이 아닙니다.
이번 주요 성과는 계층별 판단을 반영한 음성 동영상 생성 완료 및 전체 생성 시간을 단축할 수 있었던 점입니다. 화질과 음질은 주관적으로 거의 동등하다고 판단하며, 웨이블릿 변환 등 정량화하면 차이가 드러나 보이는 가능성도 있습니다.
또한, 유지율 고정 10%와 비교하여 J-GAS만을 고려한 속도 향상 기여율을 측정하지 않았습니다. 고정 10% 스파스만으로도 동등 수준의 고속화는 기대할 수 있지만, 중요도에 따라 유지율을 동적으로 변환하는 J-GAS가 품질 면에서 더 우수하다고 추정됩니다. 다만, 실제로 평가한 바는 없으므로 추측의 영역에 해당합니다.
6. 考察
삶의 가치와 중요한 것을 깊이 생각하게 만들었습니다. 앙투안 드 생텍쥐페리의 말은 어린 시절의 순수한 마음을 울렸고, 어른이 되어서도 저를 인도하는 나침반과 같은 존재입니다.
특히 기억에 남는 것은 ‘진실은 눈으로 보이는 것 외에 있다’는 말입니다. 눈으로 보이는 것만이 진실이 아니라는 점을, 말만이 진실이 아니며, 감정만이 진실이 아니라는 것과 같이 다양한 측면에서 사물들을 바라보는 것의 중요성을 일깨워 줍니다.
또한 ‘소중한 것은 눈에 보이지 않는다’는 말은 물질적인 풍요만을 쫓는 것이 아니라, 마음의 풍요를 소중히 여기는 것의 중요성을 강조합니다.
이러한 격언들은 저의 삶에서 여러 번 저를 지지하고 이끌어 주었습니다. 그리고 지금도 저를 지지하고 있습니다.
6.1 AI의 출력을 다음 AI 계산 설정으로 변경합니다.
이번 구성에서 흥미롭게 느낀 점은 Jev의 답변이 설명문으로 끝나지 않고, 다음 단계의 계산 설정으로 활용되는 부분입니다.
생성 모델로부터 소량의 상태를 추출하여 외부 판단 모델로 전달하고, 그 결과를 생성 모델로 다시 반환하는 과정이 있습니다. 이 흐름을 통해 사람이 각 층별 표를 고정적으로 작성하지 않아도, 생성 상태에 따라 배분이 변화하게 됩니다.
무거운 어텐션 커널 내부에서 매번 API를 호출하는 대신, 단계 경계에서 여러 층을まとめて 판단하는 구성으로 바뀌면서 외부 API와의 연결 횟수를 줄였습니다. 따라서, 비디오 생성 중에 클라우드에 연결되어 있음에도 불구하고 오버헤드가 최대 5초 정도로 줄어들었습니다. 물론, Jev 자체의 고성능이 있었기에 가능한 결과입니다.
6.2 “판단이 움직였다”와 “판단이 최적이었다”는 별개의 검증입니다.
층별 값들이 변화했다는 것을 확인했지만, 그것만으로는 각 선택이 모두 옳다고 할 수 없습니다.
예를 들어, 잔차의 크기가 큰 층이 실제로 높은 보존율을 필요로 하는지 확인하기 위해서는 동일한 조건에서 그 층만을 변경한 비교가 필요합니다. 또한, 신뢰도가 높다는 것은 화질이 보존될 확률을 직접 의미하는 것이 아니라는 점도 중요합니다.
고정 5%, 고정 10%, 단순한 계층 규칙, 무작위 배분 등을 실측 시간과 예산을 함께 비교하면 “제브에게 판단을 맡길 필요가 없는” 부분을 더욱 명확하게 구분해낼 수 있습니다. 이는 향후 평가안이며, 이번의 41.7% 축소에서 결론을 도출할 수 있는 범위 내에 있지 않습니다.
6.3 유지율을 낮추더라도 전체 생성 속도가 비례적으로 빨라지지 않는다.
전 생성 시간에는 어텐션 이외의 선형층, FFN, 메모리 전송, VAE, 읽기, 저장 등이 포함됩니다. Sparse Attention 자체에도 연결 선택 및 보호 영역 처리와 함께 Jev 측에도 관측 및 판단에 소요되는 시간이 있습니다.
따라서, 유지율만을 극단적으로 낮추는 것만으로는 개선 효과가 정체됩니다. 판단 모델에 요구되는 것은 단순히 최소한의 유지율을 달성하는 것보다, 시간에 따른 감소와 품질에 필요한 계산을 동시에 만족시키는 선택입니다.
이번 관측량은 그 목적에 대한 출발점입니다. 미래에는 소화 전후의 오차를 소량만 측정하는 방법이나, 음성 및 움직임에 대응한 지표를 검토할 수 있지만, 추가 관측 자체의 비용도 평가해야 합니다.
7. 한계와 공개 출시
지금까지의 개발 과정에서 여러 가지 문제점들이 발견되었고, 특히 성능 면에서 심각한 문제가 드러났습니다. 밸런스 조정, 버그 수정 등 기본적인 부분도 미흡했고, 무엇보다 중요한 것은 예상보다 훨씬 낮은 최적화율이었습니다. 이러한 문제들이 지속될 경우, 게임의 완성도를 떨어뜨리고 사용자 경험을 저해할 수밖에 없었습니다.
이에 개발팀은 신중한 검토 끝에, 현재의 상태를 유지하며 추가적인 개발을 진행하는 것보다 한계를 인정하고 공개 출시를 진행하는 것이 더 나은 선택이라고 판단했습니다. 물론, 공개 출시 후에도 지속적인 업데이트와 개선을 통해 문제점을 해결해 나갈 계획입니다.
이번 공개 출시에 따라 사용자들의 피드백을 적극적으로 수렴하고, 이를 바탕으로 게임의 방향성을 재정립해 나갈 것입니다. 또한, 지속적인 업데이트를 통해 게임의 완성도를 높이고 사용자들에게 더욱 즐거운 경험을 제공할 수 있도록 최선을 다하겠습니다.
특히, 이번 공개 출시에 얻은 데이터를 분석하여 향후 게임 개발에 반영할 수 있도록 노력하겠습니다. 이를 통해 앞으로 더 나은 게임을 만들 수 있는 기반을 마련할 수 있을 것입니다.
이러한 노력들을 통해 게임을 지속적으로 발전시켜 나갈 것이며, 사용자 여러분의 기대에 부응할 수 있도록 최선을 다하겠습니다.
본 검증은 단일 GPU, 하나의 프롬프트, 하나의 seed 비교를 통한 구현 검증입니다. 실행 순서를 변경한 반복 측정은 없으며, 최초 판단에는 별도의 과거 통계 조건을 사용했습니다. Jev의 API 응답이나 소프트웨어 환경에 의존하므로 동일한 seed로 동일한 배분 및 시간이 보장되지 않습니다.
ネイティブSLA에서는 조건형KV나 음성 쿼리 행을 보호하지만, 최종 음성의 일치를 보장하는 것은 아닙니다. 후방에서 음성과 영상의 정보가 영향을 주고받기 때문에 화질과 음질을 모두 평가해야 합니다.
구현은 GitHub의 exp/jev-adaptive-vsa 브랜치에 배포했습니다. 대응 커밋은 fa29225입니다. 메인 브랜치로 통합하지 않았습니다.
저장소 이름에는 W4A4/VSA가 포함되지만, J-GAS는 일반적으로 로드된 방식과 Native SLA의 별도 경로를 통해 구현됩니다. J-GAS 설명에는 도입 조건, API로 전달하는 내용, 복구 절차, 재현용 API 워크플로우를 모두 포함하고 있습니다.
8. 결론
지금까지의 논의를 종합해 볼 때, 닌자는 단순한 무협 소설 속 허구의 영웅이 아니라, 일본 역사와 문화에 깊숙이 뿌리내린 실존적인 사회 시스템의 산물이었다고 할 수 있다.
특히 ‘닌자’라는 용어가 ‘애니’(忍)라는 단어에서 유래했다는 점은 닌자들이 단순히 무력을 사용하는 자들이 아니라, 은밀하게 움직이며 정보 수집, 암살, 방해 등 다양한 임무를 수행하는 특수한 역할을 수행했다는 것을 시사한다.
또한 닌자들의 활동은 단순히 개인의 명예를 위한 것이 아니라, 가문이나 세력을 위한 전략적 자산으로 활용되었다. 닌자 가문들은 오랜 시간 동안 자신들의 기술과 전략을 발전시켜 왔으며, 이는 일본 사회의 정치적, 군사적 상황에 큰 영향을 미쳤다.
이러한 닌자의 역사는 일본 사회의 복잡한 정치적 상황과 개인의 자유, 그리고 가문의 중요성이 얽혀 있는 결과물이라고 할 수 있다. 닌자는 단순히 ‘비겁한 전사’라는 부정적인 이미지만으로 정의될 수 없으며, 일본 역사와 문화에 지대한 영향을 미친 중요한 존재였다고 평가할 수 있다.
마지막으로 닌자라는 개념이 현대 사회의 다양한 분야에 영향을 미치고 있다는 점을 주목해야 한다. 영화, 게임, 소설 등 다양한 매체에서 닌자는 끊임없이 재해석되고 있으며, 이는 닌자가 여전히 우리에게 흥미로운 존재로 남아 있다는 것을 보여준다. 닌자의 역사는 과거를 이해하는 데 중요한 통찰력을 제공할 뿐만 아니라, 현대 사회에도 시사하는 바가 크다고 할 수 있다.
Jev를 MiniMax H3의 추론에 연결하고, 4단계 생성 과정에서 각 층별 Attention 유지율을 판단시키는 J-GAS를 구현했습니다. 전체 50층을 실행하면서 SLA에 전달되는 유지율을 단계적으로 변경할 수 있습니다.
채택한 동일 조건 비교 결과, 방식 전체로서의 총 생성 시간을 41.7% 단축했습니다. Jev 단독의 상여 효과와 품질의 일반성은 향후 과제이지만, 판단 AI를 생성 AI의 내부 계산 통제 주자로 활용한다는 응용은 실제로 작동하는 형태로 구현되었습니다.
AI에게 “무엇을 만들지”뿐만 아니라 “만들 과정에서 어디에 계산을 활용할지”도 판단하도록 하는 방식입니다. 이러한 연결 방식에는 아직 충분한 시도 가능성이 남아있다고 생각합니다!
참고 문헌
- TypeSafe를 소개합니다. System One 모델 및 Jev를 소개합니다.
- 시에이(Xi) 연구팀 등의 Sparse VideoGen: 공간-시간 희소성을 활용한 비디오 확산 트랜스포머 가속화, 2025.
- 장 et al., SpargeAttention: 정확하고 학습 없이 작동하는 희소 주의 가속을 통해 모든 모델 추론을 가속화, 2025.
- 샤 et al., 비훈련형 및 적응형 희소 주의를 이용한 효율적인 장형 비디오 생성, 2025.
- 본 검토의 측정 기록 및 채용 조건, 제어 구현, Jev 관련 질문 정의.
긴 글을 끝까지 읽어주셔서 감사합니다!
만약 이 글이 “재미있었다”, “유익했다”고 생각해주신다면, 화면 아래의 【좋아요】 버튼을 눌러 주시면 감사하겠습니다!
앞으로도 지역 AI에 대한 흥미로운 검증 및 실질적인 노하우를 계속해서 제공해 드릴 예정이니, 꼭 팔로우 부탁드립니다!
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 80청크
원문 보기 | 출처: note.com