# 둠을 움직이는 Jev는 AI 에이전트의 무엇을 대체 가능한지 궁금합니다.

> https://bookfactory.kr/board/news/17611
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-09-18T07:06:00.386Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/314808580/rectangle_large_type_2_10a31c8fbdcdc50f79b60afd1e443249.png?width=1280)

TypeSafe AI의 “제브(Jev)”를 사용하여 둠을 실행하는 영상이 공개되었습니다. 게임의 상태를 받아 다음 행동을 판단하는 방식으로 플레이가 진행됩니다.

## 이것은 제가 지금까지 읽은 작품 중 가장 큰 충격을 받은 작품일지도 모릅니다. 등장인물들의 갈등과 각자의 삶에 대한 생각 차이가 매우 현실적으로 묘사되어 있어서 마치 제 자신의 것처럼 느껴졌습니다. 특히 주인공인 다나카 씨가 꿈을 좇는 것의 어려움과 그럼에도 불구하고 포기하지 않고 노력하는 것의 중요성을 알려주는 부분이 마음속에 깊이 남습니다. 이 책을 읽고 제 인생을 되돌아보는 좋은 기회가 되었다고 생각합니다. 그리고 이 책을 읽고 주변 사람들에게 감사하는 마음을 전하는 것이 중요하다는 것을 다시 한번 깨달았습니다.

- 182가지 스킬 중에서 현재 진행 중인 의뢰에 적합한 것을 추천합니다.
- 툴을 호출하기 전과 답변을 반환하기 전에도 사용할 수 있습니다.
- 함수 호출 및 인자 선택에 대해 알아보겠습니다. 위치 인자와 키워드 인자의 차이점을 이해하고, 상황에 맞는 방법을 선택하는 것이 중요합니다. 함수 정의에 선언된 인자 순서를 정확히 지켜야 하며, 인자의 이름과 데이터 유형이 함수에 적합한지 확인해야 합니다.
- 인용 확인: 인용이 적절한 근거를 제공하는지 확인한다
- 제 샘플에서는 다음 동작을 선택하게 했습니다.
- 브라우저 제품 선택
- 창고 기록을 정리하여 전달하겠습니다.
- 공식 GitHub와 다음에 시도해보고 싶은 것

TypeSafe 창립자 디오고 알메이다가 공개한 영상

> 
> 
> 저희는 이 두모 두모가 실시간 지능을 보여주고 코드와 AI를 활용하여 무엇을 할 수 있는지 보여주는 것을 매우 좋아합니다! 10초/회 = 약 7달러/시간 pic.twitter.com/nlffKxGzCB— 디오고 알메이다 (@CompleteSkeptic) 2026년 9월 15일
> 

공식 구현 예제를 읽어보면 게임 외에도 흥미로운 사용법이 있었습니다. 예를 들어, AI 에이전트가 보유한 182개의 스킬 중에서 현재 요청에 맞는 것을 추천하는 기능입니다.

에이전트가 작업을 진행하는 도중에는 사용하려는 기술이나 함수를 선택하고, 답변의 인용이 근거가 되는지 확인하는 경우가 있습니다. Jev를 사용하는 장소는 생각했던 것보다 가까이에 있었습니다.

저 역시 Codex로 샘플을 만들어 실제 API에 연결하여 테스트하고 있습니다. 공식 사용법과 제가 확인한 결과를 종합하여 어떤 부분에 적용할 수 있을지 고려해 봅니다.

## 182가지 기술 분야에서 현재 진행 중인 의뢰에 적합한 것을 추천합니다.

제브는 TypeSafe AI가 2026년 9월 15일에 발표한 모델입니다. 문장 생성 기능은 없으며, 전달받은 정보에 대해 지정된 형식으로 판단을 제시합니다. 둠 데모 역시 화면의 이미지를 읽는 대신 게임 상태를 나타내는 데이터를 전달하는 방식으로 구성되어 있습니다.

그 특성을 에이전트에게 적용한 것이 공식 Skill 제안 기능이었습니다.

에이전트에게 스킬을 추가해도 현장에서 적절한 것을 바로 불러들일 수 없다면 도움이 되지 않습니다. 이 공식 제작 예제에서 사용되는 에이전트 환경 “Hermes”에서는 스킬 목록 설명이 기본적으로 60자 이내로 잘리는 문제가 발생합니다. PowerPoint를 새로 만들 스킬과 기존 파일을 편집하는 스킬이 비슷한 설명으로 보일 수 있는 문제 등이 발생합니다.

그러한 방식으로 Jev를 사용하여 필요한 기술을 최대 1건, 에이전트에게 추천합니다.

먼저 182건의 짧은 설명을 바탕으로 후보에 순위를 매기고, 해당 작업에 필요한 기술이 있는지 판단합니다. 다음으로 상위 3건의 설명 전문과 지시사항의 앞부분을 읽고 좁혀나갑니다. 어떠한 경우에도 맞지 않으면 추천하지 않습니다.

![画像](https://assets.st-note.com/img/1789687443-yqvI7tg8rjMsmaxNP0pKOGb3.png?width=1200)

공식 처리 과정을 정리한 설명도. 어느 단계든, 적합한 항목이 없다면 추천하지 않습니다.

선택지를 고르는 데에는 공식적으로 ‘Choice’라고 부르는 질문 형식을 사용합니다. 하지만 ‘Choice’만으로는 후보 중 하나가 반드시 상위로 올라오게 됩니다. 따라서 조건을 만족하는 확률을 반환하는 ‘Noul’이라는 질문 형식을 함께 사용하여 실제로 해당되는지 별도로 확인합니다.

마지막으로 전달하는 내용은 관련 기술 명을 알리는 짧은 문장입니다. 원래 기술 목록은 에이전트에게 남아 있으며, 추천 및 채용 여부는 에이전트가 판단합니다. Jev가 전체 작업을 인수하는 방식은 아닙니다.

공식적 평가에 따르면, 해당 스킬을 갖춘 315건의 요청 중 처음에는 정확한 스킬을 읽지 못했던 비율이 16.8%에서 7.3%로 감소했습니다. 해당 스킬이 없는 173건의 경우, 불필요한 읽기 작업을 수행했던 비율도 9.8%에서 4.0%로 감소했습니다.

이는 jev-1.12와 Claude Haiku 4.5를 사용한 7월 31일의 공식 보관 결과입니다. 숙련도에 맞는 요청은 해당 설명에서 만든 문제이며, 측정된 것은 첫 번째 숙련도 선택입니다. 작업 전체의 성공률이나 자신의 Codex 환경에서의 개선을 나타내는 숫자와는 관련이 없습니다.

저의 생각에는 기술을 늘리는 것과 적절한 기술을 선택할 수 있는 것을 분리해서 시도할 수 있다는 점이 흥미롭습니다. 특히 어울리는 것이 없다면 아무것도 추천하지 않는 판단까지 포함하고 있다는 점은 실제 운영에도 도움이 됩니다.

## 툴을 호출하기 전과 답변을 반환하기 전에도 사용할 수 있습니다.

### 함수 호출 및 인자 선택

공식적인 함수 호출은 도구를 실행하기 전에 자연어의 요청으로부터 원하는 함수를 선택하여 호출하는 예시입니다.

예를 들어, NVDA와 SPY의 과거 1개월 동안의 상관관계를 확인하고 싶다는 요청에 따라 rolling_correlation을 선택하고, 종목과 기간을 인수로 전달합니다. 종목과 기간에는 선택지가 있으며, Jev가 그 중에서 선택한 값을 코드가 사용합니다.

이 예시에서는 함수에 더하여 선택지를 정의할 수 있는 인자를 1회 요청으로 질문하고, 선택된 함수가 필요한 답변만 사용하며, 요청에 언급되지 않은 항목은 함수의 기본값을 활용합니다.

기존의 기능을 자연어(문장)로 호출하는 예시입니다. 자신의 앱에서도 사용 가능한 동작이나 선택지가 정해져 있는 경우부터 접근하기 쉽습니다.

### 인용 확인: 인용이 적절한 근거를 제공하는지 검토합니다.

사용자에게 답변을 반환하기 전에 확인에도 사용됩니다. 공식 예시에서는 답변에 첨부한 인용구를 두 단계로 검토합니다.

먼저 코드로 인용구가 원문에 존재하는지 확인합니다. 존재하더라도 그것만으로 답변의 주장을 뒷받침하는 것은 아닙니다. 그래서 Jev에게 주변 문맥을 제공하고, 그 주장을 지지하는지, 모순되는지, 근거가 없는지 판단하도록 합니다.

공식 예시에서는 JWT의 사양서에서 인용한 문구가 실제로 존재하더라도 답변의 주장과 다를 수 있는 경우를 마련해 두었습니다. 문자열의 일치만으로는 찾기 어려운 문제입니다. 판단에 확신이 들지 않는 것은 사람의 확인으로 회부합니다.

이것은 8개의 인용을 사용한 예시입니다. 어떤 오인용도 모두 감지할 수라고 단정할 수는 없지만, 생성된 답변을 완전히 다시 LLM에 전달하는 것 외에도 확인을 분리하여 구현할 수 있다는 점이 밝혀졌습니다.

## 제 샘플에서는 다음 옵션을 선택하게 했습니다.

지금까지 공개된 공식 제작 예시는 게시된 코드와 결과를 참고한 것입니다. 제가 실제 API에서 확인한 것은 브라우저 상품 선택이나 창고 기록을 기반으로 처리 방식을 결정하는 샘플입니다.

### 브라우저 상품 선택

지역 기반 가상 쇼핑몰을 만들었습니다. 예를 들어, 재고가 있는 파란색 병 중에서 용량이 800ml 이상이고 가장 저렴한 것을 1개 장바구니에 담고 구매하지 않고 최종 확인 단계로 진행하는 과제입니다.

제브에게 전달된 것은 당시의 페이지 정보와 운영 후보였습니다. 저장 로그에서는 보틀을 검색하고, 조건에 맞는 상품 ‘코멧 시프(Comet Sip)’의 상세 페이지에서 재고를 확인한 후 추가하고, 최종 확인까지 진행되었습니다. 운영자를 선택하는 것은 제브로, 실제로 크롬(Chromium)을 실행하는 것은 플레이라이트(Playwright)입니다.

똑같은 12개의 항목을 GPT-5.6 Luna에서도 테스트해 보았습니다. Luna에게도 조작 후보를 전달하여 선택하도록 하고, 긴 설명문이 포함된 조건에는 하지 않았습니다.

![画像](https://assets.st-note.com/img/1789687443-6MKeUfVqSmHyhCpluQi2NxWr.png?width=1200)

둘 다 12건을 완료했으며, Jev를 사용한 구성에 걸린 시간은 루나의 약 4분의 1이었다.

![画像](https://assets.st-note.com/img/1789687444-3itvy8gIRb0Qcku72haE4Sw1.png?width=1200)

지역별 비교 화면입니다. 본문에서는 Jev와 Luna를 각각 단독으로 사용한 결과를 다루고 있습니다.

측정은 2026년 9월 17일이었다. Jev는 jev-latest를 지정했으며, 정상 응답 모델의 이름은 jev-1.13.0이었다. Luna의 추론 설정은 none이다. 소요 시간에는 준비, 여러 번의 판단, 브라우저 작동, 종료 처리가 포함된다. Jev의 API 호출 1회에 해당 시간은 포함되지 않는다.

이 검증에서는 후보를 코드에서 추출할 수 있는 사이트를 시도했습니다. 공식 Function calling과 준비한 조작 중에서 선택하는 점이 공통적입니다. 임의의 웹사이트를 자유롭게 조작할 수 있는지를 측정한 실험은 아닙니다.

### 창고 기록을 정리하여 전달하겠습니다.

창고 샘플에서는 결제, 재고, 주소, 요청 내용 등의 가상 기록을 바탕으로 출고, 보류, 담당자 확인 중 어느 단계로 진행할지 결정했습니다.

대상 ID 및 시간의 비교까지 Jev에게 맡긴 방식은 192회 중 127회, 최종 처리가 정답이었습니다. 코드 측에서 대상 및 시간을 비교하고 판단에 사용한 기록을 정리한 후 전달하면 192회 중 192회로 되었습니다. 모델이나 질문은 변경하지 않았습니다.

다만, 동일한 96건을 2회씩 사용하여 결과를 확인하고 수정하는 과정을 재실행한 비교입니다. 사용되지 않은 데이터라도 동일하게 개선되는지 여부는 아직 확인되지 않았습니다.

공식 또한 Jev 1.13이 현재 비교나 관련 없는 정보가 많은 입력을 어려워하며, 먼저 코드로 정리하는 것을 권장하고 있습니다. 제 결과도 그 점을 고려하는 데 도움이 되었습니다.

이 과제는 최신 기록이 현재 상태를 나타내도록 설계되었습니다. 과거의 경위를 읽어야 하는 업무에서, 동일하게 오래된 기록을 제외하는 것이 아닙니다.

## 공식 GitHub와 다음으로 시도해 볼 것

구현의 시작점으로, 공식적으로는 TypeScript/JavaScript SDK와 Python SDK가 있습니다. JavaScript 샘플 코드에서는 동일한 입력에 Choice, Noul, 단계 평가 점수(Score)를 함께 사용하고 있습니다.

공식적인 스킬 리포지토리도 공개되었습니다.こちらは、Codex나 Claude Code 등에 Jev를 통합하는 방법을 알려주는 스킬입니다. 앞서 Jev를 사용하여 에이전트에 스킬을 추천하는 스킬 제안과는 용도가 다릅니다.

같은 질문 형식으로 LLM과 비교하기 위한 공식 어댑터도 있습니다. Jev를 사용해야 할지는 자신의 처리에서 비교하여 결정할 수 있습니다. 이번에 제작한 샘플에서는 이 어댑터를 사용하지 않았습니다.

스킬 제안의 파이썬 코드는 공식 문서 내에 게시되어 있습니다. 다만, 참조하는 스킬 목록 등의 데이터 일괄 배포처까지는 확인되지 않았으므로, 그대로 복사해도 동일한 결과를 재현할 수 없다는 점은 아직 말하기 어렵습니다.

다음부터 제가 시도해 보겠다면, 손안에서 사용할 수 있는 스킬 목록을 활용한 추천 시스템을 사용하고 싶습니다. 단순히 사용해야 할 스킬을 선택할 수 있는 것뿐만 아니라, 필요하지 않을 때 아무것도 추천받지 않고 시간을 낭비하지 않는지, 그리고 새로운 스킬을 추가했을 때 얼마나 기다려야 하는지 확인하고 싶습니다.

둠의 데모에서 드러났던 상태에 따른 다음 행동 선택 메커니즘은 에이전트들에게도 활용할 수 있는 방법이 있었습니다. 작업 전체를 맡기는 LLM을 그대로 남겨두고, 그 중간의 판단을 어디까지 Jev에게 넘길 수 있을지 시험해 보는 것이 더 구체적입니다.

**출처:** [note 원문](https://note.com/bright_dietes994/n/nf71174a49485)

*번역: Gemma 3(.44) 초벌 + 교정 41청크*

[원문 보기](https://note.com/bright_dietes994/n/nf71174a49485) | 출처: note.com