# LLM와 프로그램 사이? 판단 전용 AI ‘제브(Jev)’를 체험하며 분석! 결론 뼈대를 새롭게 구축하는 강력한 카드들

> https://bookfactory.kr/board/news/17697
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-09-18T17:19:34.953Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/315008005/rectangle_large_type_2_1526311430bc40475b5dd5b6ecc7a9ee.png?width=1280)

TypeSafe AI는 2026년 9월 16일에 판단 전용 모델 Jev를 공개했습니다. 문장을 생성하지 않고 확률 기반의 판단 결과만 반환하는 모델입니다. 저는 공개 직후부터 하루 종일 이 모델을 사용법과 실험 결과, 활용 요점, 그리고 냉정하게 봤을 때의 한계까지 순차적으로 정리했습니다.

![画像](https://assets.st-note.com/img/1789730945-9LWxMZgbuRs6dVTPFNGOX5vj.png?width=1200)

상위 위치를 한마디로 요약하자면, Jev는 LLM의 대체재가 아닙니다. 일반적인 프로그램은 의미를 이해할 수 없으며, LLM은 의미를 이해하는 대신 몇 초 동안 걸려 비용도 높습니다. 그 틈새를 활용하여 의미를 보고 “선택”하거나 “평가”하는 것만 빠르게 저렴하게 수행하는 것이 Jev입니다.

> 
> 
> 늘 영상으로 설명했습니다.
> 

## 무슨 일이 일어났네.

### 공개된 지 2일 만에 입구가 5개로 늘었습니다.

공식 발표 이후 54시간 동안 Jev를 사용할 수 있는 장소가 하나둘씩 늘었습니다. 처음 등장한 것은 오픈소스 재현판 OpenJV였습니다.

그 이후 Vercel AI 게이트웨이와 브라우저 사용 실습이 진행되었고, Cloudflare와 OpenRouter도 추가되었습니다. 순서와 시간은 그림 2와 같습니다.

![画像](https://assets.st-note.com/img/1789730945-hY3EjH2WGSts5vuRmlOdfyJV.png?width=1200)

### 세상은 먼저 “실천”으로 놀랐다.

공개 직후 사람들의 시선을 사로잡은 것은 논쟁보다 움직이는 시위였습니다. 그레고어 주니치는 Browser Use로 항공 검색을 7초, 0.0039달러로 완료했습니다. 파올로 로sson은 PR 리뷰를 14 항목으로 자동 검사하여 1,000 PR을 7센트로 처리했습니다.

Guillermo Rauch는 Vercel에서 진행했던 안전 리뷰를 Jev로 옮기면서 p95에서 18배까지 속도 향상을 경험했다고 보고했습니다. 또한 다양한 실전 시연 결과가 정리되어 있어, 누가 어떤 작업을 몇 초에 완료했는지 표로 정리했습니다.

![画像](https://assets.st-note.com/img/1789730946-VbatMN67JvlA8CigEpe5HZr2.png?width=1200)

병렬적으로 살펴보면, 사용법에 공통점이 1가지 보입니다. 모든 예시가 1회 0.3초, 1원 미만의 판정을 대량으로 반복하고, 후보는 코드가 만들어지고, Jev가 그 중에서 선택하는 것뿐입니다. 판단에 망설이는 부분을만 LLM에 전달하는 이 빠른 쪼개기가 속도를 지지하고 있습니다.

### 반응은 두 가지로 나뉘었다. “똑똑한 스위치 문”인지, 아니면 “단순한 분류기”인지.

엔지니어들의 반응은 깔끔하게 두 가지로 갈라졌습니다. 긍정적인 측면에서는 “핵심은 정말 똑똑한 switch 문구”라며, “2016년의 분류기가 2026년에 손에 넣게 될 똑똑함을 얻은 것과 유사한”이라고 말했습니다. 문장을 생성하지 않아서 빠르고 저렴하다는 점을 환영하는 입장입니다.

질문을 제기하는 측은 단순한 분류기가 아니냐, 선택지가 255까지라면 LLM에 선택하게就好了라고 보고 있습니다. 모델의 가중치가 공개되지 않아 스스로 운영할 수 없는 점에 대한 비판도 있었습니다. 자신만만하게 틀리는 경우 환각과 같다는 우려는 저 또한 냉정하게 지켜봐야 할 부분이라고 생각합니다.

### 하르네스 문제에 대해 지나치게 확대 해석하는 표현일 수 있지만, 꽤 심각한 문제라는 의미로 해석할 수 있다.

제 개인적인 견해는 9월 17일 밤에 X에게 쓴 메모입니다.

> 
> 
> 제브는 확실히 만져봤는데, 단순하게 좋지? 익숙한 시나리오라면 간단한 평가로 사용될 가능성이 높아. 크기는 크지만, ‘하르네스의 관념을 바꾸는’ 정도는 과장된 느낌도 있어.
> 
> 그래도 상당히 크네. / 9월 17일 23시 15분 게시글
> 

> 
> 
> 단순한 개념으로 추상화하면 그렇게 참신하지 않겠지. 비슷한 설계들을 만들어내고 있는 사례를 잘 짜고 있는 사람이라면 만져보겠 정도일 거야. 놀라울 점은 속도와 비용, 그리고 그 위에 놓인 최소한의 성능이라고 생각한다. 그래서 eval로 놀랄 것보다는 내적인 루프의 UX 같은 쪽이 좋겠다고 느껴.
> 

판정 전용이라는 개념 자체는 오래전부터 존재했으며, 유사한 설계를 직접 만들어 내는 사람들도 있습니다. 제가 주목하고 있는 것은 개념의 신선함이 아니라, 속도, 비용, 그리고 최소한의 성능이 동시에 충족된 점입니다. 이 세 가지가 모두 갖춰지면 에이전트의 내부 루프 경험을 개선하는 데 도움이 되는 도구가 됩니다.

## 사용 방법

제브의 답변 품질을 결정하는 것은 모델 성능이 아닌, 제가 작성하는 평가 함수입니다. 평가 함수는 state, type, criteria, threshold의 4가지 요소로 구성되며, 먼저 호출 위치와 과금 관련 문제를 해결해야 합니다.

### 입구는 4개입니다. 과금 벽은 2단입니다.

![画像](https://assets.st-note.com/img/1789730947-uZTikBOhtVaWRq4SI06wJboG.png?width=1200)

대기 목록을 기다려야 하지만, 나머지 3개는 지금 바로 진행할 수 있습니다. 저는 Vercel AI Gateway에서 175번의 호출을 통해 실험을 진행했습니다. 어떤 입구도 챗봇이 아닌, 상태와 유형이 지정된 질문을 보내면 확률에 따라 답변이 돌아오는 방식으로, 일본어 질문도 그대로 통과됩니다.

Vercel에서 “동작하지 않는다”는 대부분의 원인은 2단계 결제입니다. 카드를 미등록하면 403 오류로 거부되고, 카드를 등록하여 무료 5달러 혜택을 받더라도 Jev는 유료 플랜에만 해당되므로 다시 403 오류가 발생합니다. 신용카드를 15달러 이상 구매해야만 정상적으로 작동하며, 그 15달러로 약 100만 건의 판단이 가능합니다.

![画像](https://assets.st-note.com/img/1789730948-c0rs3S6foWn8uBAhlQp4bm9D.png?width=1200)

요금은 입력에만 부과되고 출력이 무료이므로, 숫자가 많을수록 저렴합니다. 반면 속도는 지리적 요인에 따라 달라지며, 공인치는 미국 서해안 기준입니다. 따라서 일본에서 사용한다면 표 하단 2행을 고려해야 합니다.

### 평가 함수의 4가지 세트. 상태는 필요한 정보만, 유형은 3가지

평가 함수 4점 세트는 판단 기준을 설정하는 상태, 질문 유형, 답의 조건을 언어로 표현하는 기준, 결과 분리를 위한 임계값을 의미합니다. 기본적으로 Jev는 답을 거부하지 않습니다. 탈출구를 마련하지 않으면 잘못된 답이 0.94의 확률로 되돌아옵니다.

첫 번째 상태는 판단에 필요한 정보만 전달합니다. 제가 시도한 것은 이중 청구와 로그인 불능이 섞인 문의를 “어느 담당부에 회부할지”를 선택지로 묻는 예시입니다. 전체 내용을 그대로 전달하면 청구는 0.78, 로그인 문제에 따라 auth에 0.22가 흘러갔습니다.

결제 항목만 발췌하여 전달하면, 망설림 없이 1.00원으로 결제 옵션을 선택했습니다. 전달하는 정보를 줄이는 만큼 판단은 더욱 안정됩니다.

덧붙여 동일한 상태에 대한 질문은 한 번에まとめて 질문해도 좋습니다. 공식 예시에서는 13문제를 1회에 질문해도 답변은 변하지 않았으며, 비용은 12분의 1, 시간은 10분의 1이었습니다.

두 번째 유형은 형태이며, 선택할 수 있는 것은 boolean, choice, score의 세 가지뿐입니다. boolean은 예/아니오, choice는 여러 항목 중 하나를 선택하는 형태이고, score는 단계의 정도를 묻는 유형입니다. boolean의 경우 “이 PR은 안전한가”라는 질문에 대해 예의 확률 0.94와 같이 답변합니다.

선택 시에는 0.97, 재시도 시에는 0.02, 기타 시에는 0.01로 나누어집니다. 점수 시에는 2.0과 같은 값이면서 각 단계의 확률이 반환됩니다.

형을 선택할 때 함정이 하나 있습니다. 부울의 확률이 ‘수준’을 나타내지 않습니다. 분노의 강도를 5단계로 변화시킨 문으로 시험한 결과가 그림 3입니다.

![画像](https://assets.st-note.com/img/1789730948-SMGcHEAnvByTLOQziIw2DW1q.png?width=1200)

불리언은 3단계와 4단계 사이에 급격하게 상승했다가 그 전후는 거의 평탄하다. 점수는 문장이 강해질수록 부드럽게 상승한다. 감정의 강도와 같은 그라데이션을 측정하는 데 적합한 점수형이 전제되어 있다고 생각하면 된다.

### 평가는 시각적으로 확인되는 기준이며, 임계값은 자체 데이터로 설정됩니다.

세 번째 기준은 각 선택지에 대해 “무엇을 보았을 때 그것인지”를 작성하는 칸입니다. 테스트가 ETIMEDOUT으로 실패한 로그에 “에이전트가 다음으로 무엇을 할 것인가”를 질문하고, 선택지 설명만 바꾸어 비교했습니다. 정답은 retry입니다.

시도(retry)에는 ‘다시 시도’와 수정(fix)에는 ‘수정하기’처럼 조건문을 사용할 필요가 없는 경우 A는 다음과 같습니다. A에서는 시도가 0.74로, 수정과 요청(ask) 각각 0.13씩 감소했습니다.

B에서는 재시도 설명이 “타임아웃 또는 일시적인 네트워크 오류”로 수정되었으며, 로그를 통해 확인되는 조건에 따라 재시도 값은 1.00으로 설정되었습니다.

다른 효과적인 방법이 3가지 더 있습니다. ‘該当なし’와 같은 불필요한 ‘other’를 넣지 않아야 하며, 단락 이름은 숫자가 아닌 단어로 하는 것이 좋습니다. 부정어는 ‘NOT fixable?’으로 했을 때 0.74, ‘Is this fixable?’으로 했을 때 0.91로 차이가 있었습니다.

4번째 임계값은 0.5라는 고정선을 넘어, 자신의 데이터로 측정하여 결정합니다. 공식적인 정의에 따르면 신뢰도는 확률 분포의 “모양”을 하나의 숫자로 표현한 통계량이기 때문에 0.49와 0.51은 거의 동일한 정도로 불확실합니다.

따라서 저는 0.30에서 0.70 사이의 값을 사람에게 할당하는 밴드로 설정하고, 선의 위치는 조작의 무게에 따라 변경합니다. 잔액 조회와 같은 가벼운 조작에는 0.60, 송금 승인과 같은 무거운 조작에는 0.85를 적용합니다.

![画像](https://assets.st-note.com/img/1789730949-KfjPIXc85uvC2BedMtVE7sOS.png?width=1200)

공식 문서에는 임계값은 자신의 데이터로 측정하라고 명시되어 있습니다. 공식 문서와 제 개인 기록상 정답이 있는 데이터에서 true와 false 영역이 명확하게 구분되었기 때문에, 이 과제에서는 0.5로도 통과됩니다. 하지만 영역의 위치는 과제마다 달라지므로 이 숫자를 휴대하지 마십시오.

### 제 유튜브 채널 92개에서 Jev를 LLM과 같은 수준으로 끌어올렸습니다.

이제부터는 저의 개인적인 실험입니다. 소재는 저의 채널 영상 92편으로, 예측할 숫자는 공개 후 7일간의 조회수입니다. 목표는 공개 전에 ‘성공 가능성이 높은 기획’을 선택하는 데 있습니다.

공정성을 위해 제공된 정보는 공개 시점에 확인 가능한 내용입니다. 제공된 자료는 제목, 설명문, 공개 일시, 영상 길이(尺), 자막의 앞부분 1,500자, 최근 25개의 실적, 썸네일 이미지, 본편 영상, 공개 이후 실제 수치를 포함했습니다. 과교학을 피하기 위해 Jev의 경청 방식은 짝수 46개로 조정되었으며, 홀수 46개는 한 번만 측정했습니다.

적용면에 7가지 방법이 있습니다.

페이블과 Opus는 Claude를 도구 없이 호출했습니다. GPT-6-Astra는 Codex에서, Gemini 3.8 Flash와 SWE-2는 Devin에서 호출했습니다. Jev는 Vercel AI Gateway를 통해 호출되었습니다.

7번째 방법은 “무엇을 생각하지 않는 예측”입니다. 최근 영상의 재생 수 중앙값을 가져와서 다음 영상의 예상으로 그대로 제시하는 방식입니다.

중위수는 계산 방식에 따라 8월 27일 전후로 분리하고 있습니다. 아무런 노력 없이 엉터리 예측만 가능한 예측기는 근본적으로 잘못되었다는 기준으로 삼았습니다.

점수는 예상과 실제 측정 간의 차이를 배수로 계산합니다. 예상 4,800회, 실제 측정 4,923회라면 약 1.03배의 차이로 맞추는 것이고, 예상 8,200회, 실제 측정 5,008회라면 약 1.64배로 벗어나는 것입니다. 지표는 모든 동영상의 차이를 나열한 가운데 값으로, mdALE라고 합니다.

이후 표의 숫자는 단순히 배율 자체가 아니라 배율의 로그를 나타냅니다. 0.26은 약 1.3배, 0.41은 약 1.5배, 0.69는 약 2.0배의 오차로 읽어주시면 됩니다. 숫자가 작을수록 더 유리합니다.

### 결과 1부터 3까지. 상위 순위를 선택하는 데 유용하지만, 하위 순위를 좁히는 데는 활용하기 어렵다.

첫 번째 측정 방법으로 92권 전체를 측정한 결과입니다.

![画像](https://assets.st-note.com/img/1789730950-9a0OAN2kzRtC4F5JgBsfTLbG.png?width=1200)

LLM은 5가지 모두를 예상치 못한 결과로 이기며, 첫 번째 Jev는 패배했습니다. 이 질문 방식은 “재생수가 1,000에서 40,000 사이 어느 단계에 해당하는가?”라는 형태로, 9단계의 숫자 중에서 선택하도록 하였으나, 이전 절의 방식에 비추어 볼 때 좋지 않은 예시였습니다. 따라서 모델은 변하지 않고 질문의 형태만 재구성하여 46개 항목으로 측정했습니다.

![画像](https://assets.st-note.com/img/1789730951-uDOwqsW8ALlEXeVMHY3UF5pP.png?width=1200)

결과 2로서, 재생 수와 총 재생 시간의 차이는 fable과 일치했습니다. 다만 일치한 것은 평균적인 차이뿐입니다. 어떤 영상이 가장 많이 성장하는지의 순위 일치도는 Jev가 0.56, LLM이 0.77로, 순위는 LLM이 그대로 유지되었습니다.

결과 3는 이 예상치를 어떻게 활용할지를 보여줍니다. 상위 20%에 해당하는 18편을 살펴보면 Opus와 Fable이 17편이 중앙값 이상을 기록했고, 1편만 하락했습니다. Jev는 12편이 중앙값 이상을 기록했으며, 6편이 하락했습니다.

반대로 하위 50%를 삭제하면, 실제로 뛰어오른 11 작품 중 LLM은 3 작품, Jev는 4 작품을 함께 제외합니다. 제외되는 것은 기법 설명이나 실제 사용 리뷰의 에피소드이며, 공개 전에는 주목받지 못하는 기획입니다. 따라서 예상은 상위 작품을 부각하기 위해 사용하고, 하위 작품을 제외하기 위해 사용하지 않습니다.

제 운영은 두 단계로 나뉩니다. Jev로 빠르게 후보를 골라내는 데는 1초가 걸리고 비용은 92본에 0.1엔 미만입니다. 남은 본命만 15~25초 정도 소요되는 LLM에 맡겨 판단하도록 합니다.

### 무엇을 바꿨나. C1부터 C9까지의 시도착오

첫 번째 청취 방식 C1은 한 번의 호출에 제목, 설명, 길이, 공개일시, 자막 시작 부분, 최근 25개의 성과표까지 모두 담아 넣었습니다. 질문은 조회수, 총 재생 시간, 구독자를 각각 9단계의 선택지를 통해 청취했으며, 단계의 대표값을 그대로 예상했습니다.

수정된 C9은 호출을 대상별로 분리하고, 상태를 제목, 길이, 공개 요일 등의 기계적 특징, 최근 중앙값에만 축소했습니다. 질문은 최근 중앙값의 0.5/0.7/0.9/1.2/1.6/2.4배를 초과하는지 여부를 묻는 부울 6가지 질문입니다. 코드는 6가지 확률을 연결하여 재생 횟수로 재생 시간을 계산하며, 총 재생 시간은 재생 횟수에 길이와 과거 시청률을 곱하여 계산합니다.

![画像](https://assets.st-note.com/img/1789730951-u6WJIVyg7ObUievQS5oCwdqc.png?width=1200)

효과적이었던 것은 단의 이름을 명확히 하고, 전달하는 정보를 줄이며, 평소보다 훨씬 더 많은 질문을 하며, 예/아로 나누는 네 가지였습니다. 반대로 C6처럼 단이나 정보를 늘리고 Jev에게 복잡한 사고를 요구하면 판단은 흐려집니다. Jev가 하는 것은 ‘평소보다 얼마나 많이’를 선택하는 것뿐이며, 실제 수로 되돌리거나 곱셈, 코드 작업은 다른 사람의 몫입니다.

## 사용 목적

이 장에서는 공식적인 18건의 사례와 제가 제 개인의 에이전트와 돌린 기록을 바탕으로 Jev를 어디에 배치할지를 정리합니다. 먼저 결론을 말씀드리면, 기존의 평가자를 대체하는 것보다 평가가 전혀 없었던 곳에 추가하는 것이 더 효과적입니다.

### 공식적인 18건의 사례는 에이전트의 흐름에 어떤 지점에 걸리는지 보여준다.

공식 문서상의 쿡북은 총 18권 있습니다. 에이전트의 흐름을 입력, 계획, 툴 실행, 결과 확인, 출력의 5가지 요소로 나눈다면 모든 예시는 이 중 하나에 해당합니다. 입력에서는 위험한 요청을 막는 감시자나 분류, 계획에서는 스킬 제안, 툴 실행에서는 검색 순위 정렬이 이루어집니다.

결과 확인 단계에서는 자료 선별 및 인용의 일치 여부를 확인하고, 출력 단계에서는 서식 복원을 진행합니다. 루프 밖에는 질문 자체를 발전시키는 특징량 탐색과 정답의 변동을 측정하는 예시가 있습니다.

모든 예시에도 공통되는 점은 Jev에게 복잡한 추론을 맡기지 않고, 흐름이 정해진 틈새에 작은 판단을 한 번 내리는 것뿐입니다.

![画像](https://assets.st-note.com/img/1789730953-EGFmTgviD6rChVjkB5znlIb0.png?width=1200)

표의 숫자는 각 페이지에 기재된 값의 정확한 횟수를 나타내며, 공식 페이지에 집계 숫자가 없는 경우 “없음”으로 표기했습니다. 모두 Jev 단독으로 완성되지 않고, 코드의 임계값이나 다른 모델과의 연계에서 비롯됩니다.

### 스킬 제안. 요청에 맞는 스킬을 제브가 선택한다.

공식 사례에서 가장 이해하기 쉬운 것은 계획 단계에서 사용하는 skill_suggestion입니다. 숫자는 공식 문서의 값이며, 제 실험이 아닙니다. 사용자가 요청을 쓰면, 코드는 182개의 skill에 대한 1행 설명을 모읍니다.

Jev에게는 ‘어느 것이 맞느냐’에 대한 182개 선택지와 ‘애초에 스킬이 필요한가’에 대한 3개 질문을 1회 요청으로 묻습니다.

3개의 질문의 평균이 0.30 미만이면 아무것도 제공하지 않습니다. 필요하다면 상위 3개의 질문에 대한 설명과 도입부 700자를 전달하여 다시 한 번 확인하고, 후보별로 가장 적합한(fits) 값이 0.30 미만이면 모두 거부합니다. 승리한 1개의 질문만 시스템 프롬프트의 끝에 1행을 추가하고, 에이전트는 그것을 읽어 스킬을 読み込みます.

요청 488건에서 테스트한 결과, 스킬의 읽기 오류는 16.8%에서 7.3%로 감소했으며, 불필요한 읽기 오류 또한 9.8%에서 4.0%로 감소했습니다.

1회의 호출은 2회로 이루어지며, 평균 0.3초입니다. “필요한가”를 먼저 질문하고 거절 사항을 짚어내는 이 설계가 실용의 핵심이라고 생각합니다.

### 제 에이전트와 함께 확인도 하지 않은 채로 통보했던 5곳에 Jev를 더했습니다.

제가 개발 중인 에이전트에는 속도와 비용의 문제로 이전에 검사하지 않고 지나쳤던 곳들이 있었습니다. 그곳에 5곳, Jev의 판정을 추가했습니다. 위치는 그림 4와 같습니다.

![画像](https://assets.st-note.com/img/1789730954-SjZpiXJ8IgfDPCc3YTh6RFNt.png?width=1200)

입구 점검에서는 삽입된 명령을 0.99로 확인했으며, 사람을 위한 절차서는 0.06으로 통과시켰습니다. 검색 1위에 섞여 들어온 삽입 문서는 0.99로 제외할 수 있었습니다. 매 턴의 감시는 6건 중 6건을 정확히 맞추었고, 堂々巡りのループ(돌림루프)는 0.95, 인증 실패로 사람에게 돌려야 할 상황은 0.92로 정확히 포착했습니다.

출구 일치 검사에서 테스트 실행임에도 불구하고 “실행 환경 반영 완료”라고 주장하는 모순을 1.00으로 감지했습니다. 기억의 주고받기에서는 의미 전환의 중복을 0.91로 무시하고 판단했으며, 승인 자동 응답은 상태가 클수록 1회 0.7초, 0.01센트가 소요되고 있습니다. 모두 무거운 LLM의 평가자를 대체하지 않고, 확인 없이 통과하는 틈새에 가벼운 판단을 끼워 넣은 것에 불과합니다.

### 규칙은 코드에, 의미 판단은 Jev에게, 문장은 LLM에 맡긴다.

판단은 어떤 도구에 맡길 것인지, 원의 내심에서 생각하면 쉽게 알 수 있습니다. 안쪽은 빠르고 저렴하지만, 안쪽에서 바로바로 해결할 수 있다는 점이 제 설계의 기본입니다.

![画像](https://assets.st-note.com/img/1789730954-VCOQqPdl908YDxZSiFJL3evh.png?width=1200)

의미를 보기에 급급하지 않더라도 예/아니요로 충분하다면 Jev에서 멈춥니다. 문장 전체를 읽고 이유나 수정안을 쓸 때만 외부 LLM을 호출합니다. 그림 오른쪽에 있는 문장 검사의 분담 예시처럼, 같은 ‘검사’라도 규칙마다 두는 층이 다릅니다.

제브의 역할은 선택과 채점에 집중하는 것이 핵심입니다. 이메일에서 청구 금액을 추출하는 경우, 정규 표현으로 금액처럼 보이는 문자열을 많이 긁어 Jev에게 “이 중에서 청구 금액은 무엇인가”를 choice와 other로 선택시킵니다. 제브는 후보에 없는 문자를 만들 수 없기 때문에 원문에 없는 금액이 나오는 일은 없습니다.

선택된 문자열을 숫자로 변환하는 처리와 임계값을 기준으로 분리하는 처리는 코드 영역입니다. 제 경우에는 선택 확률이 0.97이고, 0.9를 밑돌 경우에만 사람이나 LLM에게 인계를 넘깁니다. 력 계산이나 숫자 변환과 같은 결정론적 처리는 역시 코드 영역입니다.

이 형태는 공식 사례 18건 중 대부분에도 나타납니다. 정규 표현 후보에서 선택하여 값의 조작과 자릿수 변경을 0%로 한 사례나, Jev의 채점을 코드에 구현한 4개의 임계값을 사용하여 통과시키고 불통과시키는 사례가 있습니다. 신뢰도 0.9 미만인 경우 뭉개진 분류로 결과를 반환하고, 불확실한 30건의 정답률을 40%에서 70%로 향상시킨 사례도 있습니다.

날짜 요소를 Jev에 선택하게 하고, 력을 계산은 코드에서 수행하는 방식도 유사한 형태입니다. 작은 모델에서 추출하여 임계값 0.7을 초과하는 경우에만 큰 모델로 회수하는 방식 역시 이 분배 원칙에 부합합니다.

### 브라우저 사용 재현. 비용은 동일한 0.6엔, 시간이 2배이다.

브라우저 사용의 항공권 검색을 제 손으로 9월 17일에 실행하여 측정했습니다. Google Flights 검색 결과, 모델의 출력이 화면에 있는 부품 번호만이고, 작동은 클릭, 입력, 선택, 대기, 완료, 막힘의 6가지입니다. 완료는 별도의 코드로 7 항목으로 확인합니다.

![画像](https://assets.st-note.com/img/1789730955-DG3nWldfspPAVtXmSa7Nkyxe.png?width=1200)

시간이 거의 2배 늘어난 이유는 일본과의 거리와 게이웨이의 중계 때문입니다. 1회당 약 320ms의 지연이 호출 횟수만큼 누적되었습니다. 반면 비용은 원본 게시물과 거의 같고, 속도는 지리적 요인으로 인해 감소했지만, 가격은 감소하지 않았다는 것을 알 수 있습니다.

19회 중 8회는 판정을 버리지만, 이 가격이라면 버리는 것을 망설이지 않습니다. 버려도 아깝지 않은 저렴함이 Jev의 강점 중 하나입니다.

### 배포된 내용: ref-jev-evaluate

ref-jev-evaluate라는 이름의 Claude Code용 참조 스킬을 공개했습니다. 즉시 Jev를 시험해 보고, 에이전트가 동일한 유형의 판단을 수십 번 반복해야 하는 상황에서 활용됩니다.

더 자세한 내용은 동영상으로 확인해 주세요.

## 얼마나까지 믿어야 할까

빠르고 저렴한 제품은 진품이지만, 지혜는 해석의 관점에 따라 크게 달라집니다. 이 장의 숫자는 원본 기사를 참고하여 확인한 내용만 사용했습니다.

### 제3자의 실측 1: 이력서와 구인 광고의 일치에서는 Jev가 정확도와 비용 모두에서 우위를 보였다.

먼저 말씀드리고 싶은 것은 이것이 제 실험이 아니라는 점입니다. 스탠포드 연구원 h_nilforoshan이 자신의 구직 앱에서 사람들이 “이력서와 구직 조건이 맞는지”를 평가한 데이터를 활용하여 검증을 진행한 것입니다. AI의 평가와 상관관계를 Spearman 척도로 측정했으며, 1에 가까울수록 사람과 같은 판단을 내리게 됩니다.

![画像](https://assets.st-note.com/img/1789730956-yWfMGuQ8gbYJzD1daZ9sVwxr.png?width=1200)

이 과제에서 Jev는 상관관계와 비용 모두에서 우수했습니다. 공식 자체 평가 결과, Jev의 정답률은 67.8%, 비용은 0.0004 달러, 시간은 0.4초였습니다. DeepSeek V4 Flash를 사용한 절차는 64.4%, 0.0059 달러, 51.9초입니다.

소네트 5를 활용한 절차 역시 67.8%로 제브와 동일한 값을 보였으나, 이는 자사의 수치이므로 참고 자료로 활용하시기 바랍니다.

### 제3자의 실측 2: 저렴하게 했지만, 전체적으로는 비싸졌다

이는 제 실험이 아닙니다. 데이터 기반 솔루션 회사 ytal.io가 자체 본사 처리를 Jev로 재실행하여 블로그에 공개한 실제 측정 결과입니다.

처리 방식은 “동일 인물의 중복을 통합하는” 방식으로 진행되었으며, 525 건을 Jev로 회수했습니다. Jev 자체보다는 처리 전체를 기준으로 보고하는 예시이기 때문입니다.

Jev의 판정 자체는 약 96%나 감소했습니다. 그러나 확신도가 낮은 부분은 원래 LLM의 처리를 유지하면서, 그 부분을 합하면 전체 비용은 0.787달러에서 0.819달러로 상승하여 4.1% 증가했습니다.

돌려놓는 양을 줄이려고 임계값을 낮추면, 이번에는 다른 사람을 동일 인물로 잘못 통합하는 오류가 증가합니다.

![画像](https://assets.st-note.com/img/1789730957-ysr2XYFhqP7B5K9OW3v41xid.png?width=1200)

제가 여기서 얻은 교훈은 하나입니다. 손익분기를 Jev 단체만 보지 않고, 망정할 분의 회수 가능 범위까지 세어서 결정합니다.

### 제3자의 실측 3: 놓치는 부분은 과제에 따라 다릅니다.

다음 두 가지는 저의 실험이 아닌 해외 개발자들이 실시한 제3자 실측입니다. 첫 번째는 Mike Taylor의 Every에 대한 원고 검토로, 원고 37권에 21문씩, 총 777개의 판단을 Jev에게 실행했습니다. 0.7초 미만, 약 0.25센트로 종료되었습니다.

제작 과정에서 발견된 문제점 7건 중 6건은 감지했지만, 동일한 1건은 3회 모두 놓쳤습니다. 비교에 사용된 Claude Fable 5.1은 7건 모두를 감지했습니다. 두 번째는 셸 명령어가 안전한지 위험한지 판단하는 134건의 검증에서 위험한 43건의 자동 실행이 0건, 즉 놓침이 없었습니다.

같은 검증 결과에서 정규 표현 기반의 블랙리스트 14건을 놓치는 바람에, 이번 과제에서는 Jev가 더 안전한 선택입니다. 하지만 Jev는 의심스러운 항목들을 안전을 위해 지나치게 많이 덮어씌워 픽업하는 습관이 있습니다.

저의 약점은 다른 부분에도 있습니다. 정답이 앞쪽에 있을 때는 88%, 뒤쪽에 있을 때는 57%로 위치에 따라 답이 움직입니다. 512건의 긴 상태의 중간 부분은 6분의 1 밖에 득을 보지 못했으며, 문자 수는 216회 중 117회로 세어 엉뚱한 수를 냈습니다.

제 기준으로 Jev는 ‘빠르고 엉성한 테스트’라고 생각합니다. 많은 부분을 겹쳐서 네트워크를 구축하는 데는 적합하지만, 지나간 것은 확인 완료라고 말할 수 없습니다.

### 오늘의 차이는 비용 15배, 시간 130배입니다. 다음 달도 이것과는 같지 않다는 사람은 아무도 말하지 않았습니다.

공개로부터 19시간 만에 Qwen3.5-4B를 기반으로 한 재현 오픈제브(openjev)가 공개되었습니다. 공개된 102건 중 정답률은 0.845로, 본가의 0.883에 근접합니다. 다만, 선택지를 역순으로 제시하면 36개 중 10개에서 정답이 달라지므로, 위치에 대한 약점 역시 본가와 동일한 종류입니다.

공식적인 평가에 따르면 DeepSeek V4 Flash와 비교했을 때 비용은 1/15, 시간은 1/130 수준입니다. 저희 사에서 자체적으로 측정한 값이기 때문에 할인 적용은 하지만, 그럼에도 불구하고 현재 시점의 차이는 여전히 큽니다.

한편, The Neuron은 특정 모델이 끊임없이 진화하는 범용 모델을 앞서나가야 하며, 그 격차를 유지해야 한다고 지적하고 있습니다. 다음 달에도 동일한 격차가 유지될 것이라는 보장은 없습니다.

그럼에도 불구하고 남아 있는 것은 있습니다. 상태와 유형이 지정된 질문을 전달하면 확률이 반환되는 이 API의 형태는 손에 남아 있으며, 출력이 무료라는 요금 체계도 남아 있습니다. 이름의 유래가 된 Jevons의 역설처럼, 효율이 상승할수록 측정되는 회수는 기수로 크게 늘어날 것입니다.

세 가지 도구를 나열하면, Jev의 자리는 다음과 같습니다.

![画像](https://assets.st-note.com/img/1789730957-tqUSBgc457jCFklDGhA0I9wR.png?width=1200)

제브의 자리에는 “동일한 형태의 판정을 수십 번 반복하는 부분”이 있었고, 그 이유는 LLM이다. 이 표는 나의 실측과 제3자의 검증을 종합하여 만들었다.

### 0.3초 내에 숫자가 반환되어 즉석에서 대응할 수 있습니다.

0.3초 내에 판정이 반환된다는 것은 사람의 조작이나 게임 루프의 템포에 판정이 맞춰질 수 있다는 의미이므로, 루프 안에 직접 挟입니다.

제가 하고 싶은 것은 AI 캐릭터와의 대화에 적용하는 것입니다. 상대방의 말에서 “현재 감정”을 점수로 숫자로 변환하고, 표정과 답변을 즉석에서 바꿉니다. 이는 제 아이디어로, 아직 구현하지 않았습니다.

다른 사람의 시연에서는 Faadil Shaik가 1 동작마다 “이 행동이 좋습니까?”를 평가하며 Super Mario를 Jev로 조작하고 있었습니다. 공식 데모는 Doom을 초당 10회 판정 루프로 실행하여 비용이 약 7달러/시였습니다.

하산 엘 므가리는 이메일 100건을 1.42초 만에 분류했으며, 망설인 31건만 김 키 K3로 회전하여 96/100의 정답률을 기록했습니다. 모리츠 크렘브의 음성 브라우저 조작은 말한 후 약 300ms 만에 확률이 반환되었으며, 말을 끝내기도 전에 클릭이 완료되었습니다.

공통점은 판정 1회가 0.3초로 거의 무료하기 때문에 루프 안에서 처리될 수 있다는 것입니다. 여기에 아직 시도하지 않았던 아이디어를 적어보겠습니다.

문제가 되는 것은 LLM에게 문장을 만들어보게 하더라도, 그 결과가 수용자에게 어떤 감정을 불러일으키는지는 직접 테스트해보지 않고는 알 수 없다는 점이다. 또한 사람에게 보여주고 수정하는 과정이 반복되다 보니 시간이 오래 걸리는 것이다. 그래서 LLM에게 후보 3개를 만들어 Jev에게 “이 단어를 들은 사람이 어떤 감정을 느끼는가”를 5단계 점수로 평가받고, 가장 좋은 후보를 선택한다. 수용자의 취향은 인물로서 state에 기록할 수 있으며, 1회 평가가 0.3초밖에 걸리지 않으므로 후보를 몇 개 만들어도 상대방을 기다리게 하지 않는다.

하지만 평가 함수가 지나치게 완만하면 생성 측이 그 완만함에 맞춰 엉뚱한 문장에 치우치게 됩니다. 따라서 실제 반응의 정답과 함께 있는 데이터로 임계값을 결정한 후 시도할 계획입니다.

### 요약과 다음 단계

제브가 놀라운 점은 개념의 신선함이 아니었다. 속도, 비용, 최소한의 성능이 동시에 갖춰졌다는 사실이었다.

판정의 질은 모델보다 상태, 유형, 기준, 임계값의 4가지 요소로 결정됩니다. 제프는 반드시 답변합니다. 따라서 다른 항목과 임계값을 추가하여 동일한 판정을 수십 회 반복하는 위치에 배치합니다.

제 실험에서는 상위 후보를 선별하는 데는 활용 가능했지만, 하위 후보를 제거하는 데는 효과가 없었습니다. 활용할 만한 부분은 기존 평가자를 대체하는 것이 아니라, 이전에 평가가 이루어지지 않았던 부분입니다. “평가 방식의 통념이 바뀐다”라는 표현은 과장된 측면이 있지만, 제가 직접 사용해 본 결과로는 상당히 큰 변화라고 생각합니다.

다음 단계는 3단계입니다. 우선 기존 에이전트 중에서 비용이나 속도 때문에 평가 및 필터링을 포기했던 부분을 하나 찾습니다. 다음으로, 섣부른 시도를 하지 않고 정답이 있는 데이터를 30건 이상 준비하여 신뢰도 범위와 임계값을 자신의 데이터에 맞게 설정합니다.

마지막으로, 배포한 ref-jev-evaluate를 입구로 하여 현장에서 1개의 판정을 실행하고, 수익성과 정확성을 파악할 수 있을 때 본격에 들어갑니다.

속도는 지리적 의미를 잃어버리고, 가격은 희석되지 않는다. 판정의 질은 이 평가 함수로 결정되며, 통과했다는 것은 확인되지 않은 상태임을 의미한다. 이 세 가지를 포괄하는 동시에 “평가가 없었던 곳에 더하는” 것이 내가 하루 만에 도달한 Jev의 활용 방식이다.

## 참고 문헌

공식: 2023년 11월 16일 17:30～19:00

- 시스템 원 모델과 Jev를 소개합니다. TypeSafe AI에서 개발한 최신 모델인 시스템 원 모델과 Jev에 대한 정보를 공유합니다. 시스템 원 모델은 특히 복잡한 데이터 분석 및 예측에 강점을 보이는 모델로, 다양한 산업 분야에서 활용될 가능성을 보여주고 있습니다. Jev는 시스템 원 모델과 함께 작동하여 더욱 강력한 분석 결과를 제공하는 데 기여합니다. Jev는 사용자 인터페이스를 통해 데이터 시각화 및 분석 작업을 더욱 직관적으로 수행할 수 있도록 지원하며, 복잡한 데이터도 쉽게 이해할 수 있도록 돕습니다. TypeSafe AI는 시스템 원 모델과 Jev를 통해 데이터 기반 의사 결정을 향상시키고, 기업의 경쟁력을 강화하는 데 기여할 것으로 기대하고 있습니다.
- Typesafe.ai (요리책 18권 / 신뢰도 / 기본 요소 / 모델 불규정성)
- TypeSafe AI CEO의 공개 발표 (X)
- TypeSafe AI 공식 발표
- Vercel AI Gateway 업데이트 내용: Jev가 이제 이용 가능합니다.
- OpenRouter 공식: 제브가 OpenRouter에 출시되었습니다. (베타)
- OpenRouter 모델 페이지 typesafe/jev-latest
- 제발, Cloudflare 개발자 공식 계정에서 Jev on Workers AI/AI Gateway(X)에 대한 게시물을 확인해 보세요.
- Cloudflare 문서: typesafe/jev
- ## 브라우저 사용법: JEV Ultrafast (GitHub)

JEV Ultrafast는 웹 페이지 렌더링 속도를 측정하는 데 사용되는 도구입니다. 웹 브라우저의 성능을 테스트하고 분석하는 데 활용되며, Chromium 기반 브라우저(Chrome, Edge 등)에서 작동합니다. 이 도구는 웹 페이지 렌더링 과정을 기록하고 분석하여 다양한 성능 지표를 제공합니다.

**설치 및 실행:**

1.  JEV Ultrafast는 GitHub에서 다운로드하여 설치할 수 있습니다. [https://github.com/j-e-v/jev-ultrafast](https://github.com/j-e-v/jev-ultrafast)
2.  설치 후 명령 프롬프트 또는 터미널에서 `jev` 명령어를 실행하여 도구를 시작합니다.
3.  JEV Ultrafast는 웹 페이지 URL을 입력하라는 메시지를 표시합니다. URL을 입력하고 Enter 키를 누릅니다.
4.  JEV Ultrafast는 웹 페이지를 렌더링하고 렌더링 과정을 기록합니다.
5.  렌더링이 완료되면 JEV Ultrafast는 웹 페이지의 성능 지표를 표시합니다.

**주요 기능:**

*   **렌더링 시간 측정:** 웹 페이지 렌더링 시간을 정확하게 측정합니다.
*   **렌더링 단계 분석:** 웹 페이지 렌더링 과정을 단계별로 분석하여 병목 지점을 파악합니다.
*   **성능 지표 제공:** 렌더링 시간, 렌더링 단계, CPU 사용량, 메모리 사용량 등 다양한 성능 지표를 제공합니다.
*   **다양한 브라우저 지원:** Chromium 기반 브라우저(Chrome, Edge 등)를 지원합니다.
*   **스크립트 실행:** 렌더링 과정에서 사용자 정의 스크립트를 실행하여 성능 테스트를 더욱 정교하게 수행할 수 있습니다.

**사용 예시:**

1.  JEV Ultrafast를 실행합니다.
2.  다음 URL을 입력합니다: `https://www.google.com`
3.  JEV Ultrafast는 Google 웹 페이지를 렌더링하고 렌더링 과정을 기록합니다.
4.  렌더링이 완료되면 JEV Ultrafast는 Google 웹 페이지의 렌더링 시간, CPU 사용량, 메모리 사용량 등 다양한 성능 지표를 표시합니다.

**참고:**

*   JEV Ultrafast는 웹 페이지의 성능을 측정하는 도구이며, 측정 결과는 웹 페이지의 환경 및 설정에 따라 달라질 수 있습니다.
*   JEV Ultrafast를 사용하여 웹 페이지의 성능을 개선하기 위해서는 렌더링 과정에서 발생하는 병목 지점을 파악하고, 해당 부분을 최적화해야 합니다.
*   JEV Ultrafast는 Chromium 기반 브라우저에서만 작동합니다.

**추가 정보:**

*   JEV Ultrafast GitHub 저장소: [https://github.com/j-e-v/jev-ultrafast](https://github.com/j-e-v/jev-ultrafast)
- 이 게시글은 현재 공개되어 있지 않아 번역할 내용이 없습니다.

제3자 직접 측정

- 스탠포드 대학 연구자 h_nilforoshan의 이력서와 채용 공고 비교 실측 (X)
- 따라서, 이 처리의 실행 결과는 시청 영상에서 확인하실 수 있습니다. 영상에서 설명드린 것처럼, 이 처리는 중복을 모으고 삭제하는 두 가지 처리를 결합하여 데이터를 효율적으로 처리합니다. 특히 대량의 데이터를 다룰 때 효과적입니다. 시청 영상에서 이 처리가 어떻게 작동하는지 확인해주시기 바랍니다. 궁금한 점은 언제든지 문의해주세요.
- 마이크 테일러: 제브는 내가 쓴 모든 글을 0.7초 만에 평가했다.
- 해커 뉴스 스레드

기사에서 인용한 X의 게시물

- 그레고르 주닉 (브라우저 사용): 항공 검색 7초 / 0.0039달러
- 파올로 로sson: PR 리뷰 14가지 자동 검사
- 파올로 로sson: 루빅 큐브의 다음 수
- 질리모 라우히 (Vercel): 보안 검토 전환과 p95 18배 증가
- 라이리 브라운: 이메일 500건 분류
- 매튜 베르만: 광고 724호의 해체
- 하산 엘 므가리 (Together AI): 100건의 이메일 분류 및 Kimi K3로의 배분
- 모리츠 크렘브: 음성으로 브라우저 제어
- 자로드 웨츠: 가격을 보고 사고팔 것을 결정한다.
- 파 Adil Shaik: 제브(Jev)로 슈퍼 마리오 조작

**출처:** [note 원문](https://note.com/masa_wunder/n/ne5540ae961f4)

*번역: Gemma 3(.44) 초벌 + 교정 109청크*

[원문 보기](https://note.com/masa_wunder/n/ne5540ae961f4) | 출처: note.com