ChatGPT의 공동 개발자이지만 디오고·알메이다 박사가 CEO를 맡는 TypeSafe AI가 개발한, 의사 결정 모델 “Jev”과 동일하게, 요청 형식으로 코드에 통합할 수 있는 소형의 의사 결정 모델이 “Jeff”입니다. RTX PRO 6000의 경우 1회의 의사 결정 당 평균 약 22밀리초, Apple의 M4 Max의 경우 1회의 의사 결정 당 평균 약 28밀리초로 동작이 가능합니다. GitHub - firelex/jeff: Qwen3.5와 Gemma 4를 활용한 제로샷 분류를 위한 Jeff의 미세 조정 · GitHubhttps://github.com/firelex/jeff
Jev와 동일하게 요청 형식으로 코드에 통합할 수 있는 소형 및 고속 의사 결정 모델이 “Jeff”입니다. 0샷 분류를 이용함으로써, 분류 항목별로의 훈련 없이도 선택지 중에서 답을 선택할 수 있다고 어필되고 있습니다. 로컬 환경에서 동작 가능한 소형 모델이며, 파라미터 사이즈 8억의 모델이라면 RTX PRO 6000 탑재 PC에서 1 판단 당 략가 22밀리초, M4 Max 탑재 Mac에서도 1 판단 당 략가 28밀리초로 의사 결정을 수행할 수 있습니다.
제프는 “Qwen3.5 0.8B”, “Qwen3.5 2B”, “Gemma 4 E2B”를 기반으로 추가 학습된 3종류가 존재한다. 코드는 MIT 라이선스, 모델의 가중치는 Apache 2.0으로 공개되어 있다.
mstrasser/Jeff-Qwen3.5-0.8B · Hugging Facehttps://huggingface.co/mstrasser/Jeff-Qwen3.5-0.8B
mstrasser/Jeff-Qwen3.5-2B · Hugging Facehttps://huggingface.co/mstrasser/Jeff-Qwen3.5-2B
mstrasser/Jeff-Gemma4-E2B · Hugging Facehttps://huggingface.co/mstrasser/Jeff-Gemma4-E2B
제브의 훈련은 1대의 RTX PRO 6000을 탑재한 워크스테이션 상에서 진행되었으며, 파라미터 사이즈 8억의 모델의 경우 훈련에 걸리는 시간은 약 2시간, 20억의 모델로도 약 3시간 반이다. 훈련 데이터는 2대의 DGX Spark에서 동작하는 오픈 모델인 Qwen3.8-Flash-Next로 기록되었으며, 테스트는 MacBook에서 진행되었다. 클라우드 GPU는 사용하지 않았으며, 훈련 데이터에 닫힌 모델의 출력은 포함되지 않았고, 닫힌 모델은 훈련 데이터 샘플 품질 체크에만 이용되었다. 아래 그래프는 제브와 3종류의 제프를 여러 벤치마크에서 비교한 결과를 요약한 것이다. 실행한 벤치마크는 고도의 논리 추론 능력 및 다단계의 사고 능력 측정 벤치마크인 “BIG-Bench Hard(BBH)”, 금융 및 경제 텍스트의 감성 분석 능력을 측정하기 위한 벤치마크 “Financial PhraseBank”, AI의 능력을 객관적이고 엄격하게 측정하기 위한 벤치마크 “JudgeBench”, AI의 할루시네이션(환각)을 얼마나 정확하게 검출할 수 있는지를 측정하는 벤치마크 “RAGTruth”, 상식적인 추론 능력을 측정하기 위한 벤치마크 “WinoGrande”, 제브의 개발원인 TypeSafe AI가 만든 의사 결정 모델용 벤치마크인 “JevBench”이다. “Overall”는 “JevBench”를 제외한 5개의 벤치마크를 종합하여 점수화한 것이다.
벤치마크의 종류에 따라 제프는 제브에 필적하는 성능을 발휘하고 있습니다. 다만, 제프의 README에서는 “제브는 더 큰 모델로 작동하기 때문에 추론 성능에서는 미치지 못합니다”라고 설명되어 있으며, 제프가 추론을 하지 않는다는 점이 강조되고 있습니다. 또한, “소형 모델은 빠르고 정확하게 의사 결정을 수행하기 위한 것이며, 이 정도 파라미터 사이즈의 모델은 모두 다단계 추론을 기대해서는 안 됩니다”라고도 적었습니다. 이 밖에도 파라미터 사이즈가 20억의 모델은 8억의 모델보다 게임을 플레이할 때의 의사 결정 성능이 떨어지며, 이는 “위험 회피 경향이 강하기 때문”이라고 개발자가 설명하고 있습니다. 다만, 이 점에 대해서는 추가적인 조사 필요하다고도 설명했습니다. 한편, 제프는 제브와의 호환성을 어필하고 있지만, 제브를 개발한 TypeSafe AI와는 전혀 관련이 없으며, 해당 회사의 승인도 받지 않았습니다. 훈련 코드는 오픈 소스 AutoJev를 기반으로 제작되었으며, 제브와 같은 의사 결정 모델은 Qwen3.5 및 Qwen3.8을 기반으로 제작된 의사 결정 모델인 “케브(Kev)”도 등장하고 있습니다. GitHub - jaredpalmer/kev: Jev-like family of decision models built on top of Qwen3.5/3.8 you can train and run on your own · GitHubhttps://github.com/jaredpalmer/kev
원문 보기 | 출처: Gigazine