이미지 출처: TypeSafe AI : 4가지 워크플로우에 대한 정확도 및 비용 비교. X축은 대수평. 동일사 평가
TypeSafe AI는 2026년 9월 15일 (현지 시간), 소프트웨어 내의 판단에 특화된 AI 모델군 “System One Models”를 발표하고, 1탄 “Jev”의 조기 액세스 제공을 시작했다. Jev는 문장을 생성하지 않고, 사전에 정의된 선택지 또는 평가 척도에 따라 판단을 확률과 함께 반환한다. 분류 또는 분리 등 업무의 자동화에의 통합을 염두에 두고 있다.
동사의 창업자이자 최고 경영자(CEO)인 디오고 알메이다 氏は、전직 OpenAI 연구원으로, 인간의 지시를 따르는 언어 모델 “InstructGPT” 등 ChatGPT와 연동되는 기술의 개발에 관여했다. 이번 발표에서는 대화 모델의 능력이 향상되어도 업무 자동화가 충분히 진행되지 않았다는 문제의식을 보여주며, 소프트웨어가 직접 이용할 수 있는 판단을 반환하는 모델 개발에 노력해 왔다고 설명하고 있다.
## 문장 아닌, 프로그램이 사용할 수 있는 판단을 반환
제베에는, 판단의 기준으로 되는 텍스트 또는 애플리케이션 상태 데이터와 답변 형식을 정의한 질문을 입력한다. 여러 질문에 대한 출력을 병렬로 생성하고, 그 결과를 프로그램의 처리에도 활용할 수 있도록 설계되었다. 억(억), 만(만) 등의 용어는 그대로 사용.
공식 API에서는 3가지 유형의 질문 형식을 제공합니다. “Choice”는 지정된 선택지 중 하나를 선택하고 각 선택지의 확률도 반환합니다. “Score”는 사용자가 설정한 평가 척도에 따라 점수를 매기고, “Noul”은 긍정/부정을 0부터 1의 값으로 반환합니다.
예를 들어, 고객으로부터 받은 문의에 대해 담당 부서를 선택하고, 긴급성을 판단하고, 불만 정도를 평가하는 등의 처리를 조합할 수 있습니다. 답변 문구를 해석하는 단계를 거치지 않고 판단 결과를 분배하거나 조건 분기에 사용합니다.
■ AI 판단과 코드 기반 분기를 통해 보안 경고 대응 워크플로우
이미지 출처: TypeSafe AI
회사에서 공개한 보안 대응 워크플로우에서는 경고 및 관련 기록을 기반으로 AI가 악의적인 작동인지, 작동을 설명하는 기록이 있는지, 증거는 어느 정도 강도인지 판단합니다. 일반적인 코드가 이러한 결과와 대상 시스템의 중요도 등을 결합하여 대응 종료, 확인 대기, 추가 조사 또는 격리 등의 처리를 분기시킵니다.
## 판단과 확률을 학습하는 “RLCD”, 출력 토큰은 무료
학습에는 “Reinforcement Learning for Calibrated Decisions (RLCD)”라고 부르는 방법을 채택했습니다. 공식 기술 설명에서는 문장 생성 대신 판단과 교정된 확률을 반환하는 것을 학습 목표로 합니다.
확률 보정은 예를 들어 “80%”로 예측한 사례를 다수 집적했을 때, 실제에도 약 80%로 그 결과가 발생하도록 하는 접근 방식이다. 소프트웨어 측면에서는 이러한 확률을 활용하여, 자동으로 처리할지, 아니면 사람의 검토에 돌릴지를 결정할 수 있다.
공식 모델 사양에 게시된 요금은 입력 100만 토큰당 0.042달러이며, 출력 토큰은 무료이다. 입력은 텍스트에 한하며, 이미지, 음성, 비디오를 다루는 경우에는 미리 텍스트 또는 구조화된 항목으로 변환해야 한다.
주요 학습 언어는 영어이며, 정확도 또한 영어에 가장 높은 수준이라고 하고 있다. 일본을 포함한 다른 언어도 다루지만, 영어와 동등한 정확도를 보장하는 것은 아니며, 실제 업무 데이터로 검증하도록 안내하고 있다.
## 출력 형식 보증과 판단의 정확성은 별도
본사는 Jev에 대해 “환각하지 않는다”고 설명하는 한편, 그 근거로 출력이 사전에 정해진 형식에 반드시 부합함을 제시하고 있다. 이는 선택지 또는 유형의 제약을 준수한다는 설명이며, 판단 내용이 항상 정확하다는 것을 보증하는 것은 아니다.
■ 구조화 출력 및 툴 호출 오류율. Jev의 0%는 실측치에 해당하지 않으며, 출력 형식 부합 보증에 따른 표시
이미지 출처: TypeSafe AI
또한, 확률 보정에 대해서도, 공식 자료는 다수의 예측을 모았다際の 특성을 나타내며, 개별 답변의 정확성을 보장하는 것이 아니라고 명시하고 있습니다. 출력 형식의 적합성과 업무상의 판단 정밀도를 분리하여 평가해야 합니다.
또한, 확률 보정에 대해서도, 공식 자료는 다수의 예측을 모았다際の 특성을 나타내며, 개별 답변의 정확성을 보장하는 것이 아니라고 명시하고 있습니다. 출력 형식의 적합성과 업무상의 판단 정밀도를 분리하여 평가해야 합니다.
관련 기사: Spotify, Claude Code의 대량 파일 읽기(대량 파일 읽기)로 토큰 소비를 평균 90% 감소시켰으며, 단순 작업을 다른 AI로 분배하는 “shunt” 공개. 스포티파이와 Claude Code는 대용량 파일 읽기를 통해 평균 토큰 소비를 90%까지 줄였다고 발표했습니다. 또한, 단순 작업을 다른 AI 모델로 분산 처리하는 “shunt”라는 공개 모델을 선보였습니다.
관련 기사: NVIDIA Research, “에이전트 AI의 미래는 소규모 언어 모델(SLM)”로 제언──LLM은 “필요시만”, 하이브리드 구성(구성)을 추천
NVIDIA Research는 “에이전트 AI의 미래는 소규모 언어 모델(SLM)”로 제언하며, 거대 언어 모델(LLM)은 “필요시만” 활용하고, 하이브리드 구성(구성)을 추천하는 것으로 나타났습니다.
관련 기사: OpenAI가 대규모 언어 모델의 “환각(환각)”의 원인을 설명하며, 평가 방법(평가 방법)의 설계에 문제(문제)를 지적
원문 보기 | 출처: Ledge.ai