안녕하세요, 소네치입니다.
AI인 Jev(ジェブ)이 개발자들 사이에서 화제가 되고 있습니다. 새로운 AI 이름들이 계속 등장하고, 뒤따라가느라 정신이 없지만, 이 Jev는 평소에 사용하던 ChatGPT나 Claude와는 조금 다릅니다.
그렇다, 그 차이가 명확하지 않다는 말씀이시군요…
판단을 템플릿화된 값으로 반환한다” “문장을 만들지 않고 판단만 하는 AI”라고 설명되어 있어도, 문과 직군 비즈니스맨의 머릿속에는 “?”가 떠오른다. 판단한다는 것은 평소 AI들도 하는 것이 아니냐고 생각할 것이다.
그러므로 이번에는 LLM과 Jev가 무엇이 다른지, 그 차이가 업무에 어떻게 도움이 되는지를, 전문 용어를 최대한 쉽게 풀어서 설명해 보겠습니다.
어떤 회사가 언제 발표한 것인지
제브(Jev)는 미국 샌프란시스코를 기반으로 하는 TypeSafe AI에서 2026년 9월 15일에 출시될 예정인 AI 모델입니다.
공동 창업자 디오고 알메이다 씨는 OpenAI에서 ChatGPT에 이어진 InstructGPT 연구에 참여한 사람입니다. 팀에는 메타(Meta) 출신 인사들도 포함되어 있습니다. AI 개발의 핵심 인재들이 모여 만든, 정도로 이해하시면 됩니다.
TypeSafe는 Jev처럼 소프트웨어가 사용하는 판단을 반환하는 모델을 “System One 모델”이라고 명명합니다. System One 모델은 종류의 이름이고, Jev는 구체적인 모델의 이름입니다.
사람들과 대화하는 AI를 개발해 온 사람들이 이제는 “소프트웨어 내에서 작동하는 AI”를 만들고 있습니다. 저는 여기도 매우 흥미롭다고 생각합니다.
TypeSafe 발표 기사 / 개발팀
LLM(Large Language Model)과 시스템 원 모델의 차이
먼저, LLM은 ‘대규모 언어 모델’의 약자입니다. 여기서는 ChatGPT나 Claude에서 문장을 생성할 때 사용되는 일반적인 생성형 모델을 염두에 두십시오.
LLM은 입력된 내용과 그때까지 나온 단어들을 바탕으로 다음에 이어질 단어 후보와 확률을 계산합니다. 이를 반복하여 문장을 만들어 갑니다.
엄밀히는 “토큰”이라는 단어나 문자 조각을 다루지만, 우선은 “문맥을 보면서, 조금씩 조금씩 문맥을 이어붙여 완성하는 것”으로 이해하는 것이 더 명확합니다.
사람과 비유하자면, 지금의 저처럼 “어떻게 표현해야 전달될까” 고민하며, 말을 통해 설명해 나가는 느낌입니다. 하지만 사람과 똑같은 의식을 가지고 생각하고 있는 것은 아닙니다.
Google의 언어 모델은 2017년 3월에 처음 공개된 모델입니다. 이 모델은 Google의 딥러닝 연구팀에서 개발되었으며, 특히 BERT(Bidirectional Encoder Representations from Transformers)라는 새로운 아키텍처를 사용했습니다. BERT는 양방향으로 문맥을 이해하여 단어의 의미를 더 정확하게 파악할 수 있도록 설계되었습니다.
BERT는 다양한 자연어 처리 작업에서 뛰어난 성능을 보여주었습니다. 특히 질문 답변, 텍스트 분류, 개체명 인식 등의 작업에서 기존 모델보다 훨씬 높은 정확도를 달성했습니다. 또한 BERT는 비교적 적은 데이터로도 학습이 가능하며, 다양한 언어에 적용될 수 있다는 장점을 가지고 있습니다.
BERT의 성공은 Google의 언어 모델 연구에 큰 영향을 미쳤으며, 이후 다양한 언어 모델 개발의 기반이 되었습니다. 현재까지 BERT는 여러 버전으로 업데이트되었으며, 계속해서 성능이 향상되고 있습니다.
BERT는 Google의 PaLM(Pathways Language Model)과 같은 최신 언어 모델의 핵심 구성 요소로 사용되고 있으며, Google의 다양한 서비스에 적용되어 사용자 경험을 개선하는 데 기여하고 있습니다.
제브는, 돌려받는 것이 다릅니다.
상황과 질문이 제시되면, 준비된 선택지 중 어떤 것에 해당하고 어느 정도 조건에 부합하는지 등을 판단하여 결과를 제공합니다. 답변 문장을 한 글자씩 작성하여 그 안에 답을 숨기는 필요가 없습니다.
예를 들어 “이 발언은 결정된 사항인가요? 아니면 검토 중인가요?”라고 묻는다면 “결정된 사항, 검토 중, 해당 없음”이라는 선택지를 준비해 둡니다. 제브는 그 중에서 선택하고 확률도 반환합니다.
LLM은 언어를 연결하여 문장을 생성한다. Jev는 상황을 파악하여 정해진 형식에 따라 판단을 반환한다.
먼저 다루고 싶은 부분은 바로 이것입니다. 물론 LLM도 분류나 판단을 할 수 있습니다. 다른 점은 “판단이 가능한지 여부”가 아니라 어떤 것을 출력하기 위해 만들어졌는지를 묻는 것입니다.
공식 해설: 시스템 원
사람에게 비유하면 “설명하기 전에 알아차리는” 듯한 느낌입니다.
예를 들어, 회의가 끝나고 상사에게 “잠시 남아 계세요”라고 하셨다고 가정해 보겠습니다.
목소리의 톤이나 표정으로 “아, 이건 뭔가 있구나”라고 알아차리고, 조금 찝찝한 땀이 나지. 상황을 받아들이고 있는 거야.
물론, 단순히 좋은 이야기일 뿐일 수도 있겠어요.
제브를 이해하는 입구로는, 이러한 맥락에서 먼저 상황을 빠르게 파악하고 핵심을 짚어내는 느낌과 유사할 것입니다.
시스템 원은 인간의 빠르고 직관적인 사고를 지칭하는 “시스템 1”의 접근 방식에서 유래되었습니다.
단지 뜨거운 것에 손을 대고 빼내는 듯한 몸의 반사를 재현한 기술이 아닙니다. 오직 역할을 이해하기 위한 비유일 뿐입니다.
여기서 “제브는 추론하지 않는다”라고 딱 잘라 말하는 것은 조금 이야기의 흐름을 벗어나는 것 같습니다.
AI 분야에서는 학습된 모델이 입력으로부터 답을 계산하는 것 자체도 “추론”이라고 부릅니다. Jev 역시 그 계산을 하고 있습니다. 생략하는 것은 이유나 답변을 자유로운 문장으로 생성하는 것입니다.
반면에, LLM이 문장을 생성할 때마다 반드시 긴 사고 과정을 구성하고 있는 것은 아닙니다.
그러므로 “생각하는 AI와 무심결에 생각하지 않는 AI”로 나누는 것보다 “말로 답변을 구성하는 AI와 판단을 직접 제공하는 AI”로 이해하는 것이 오해를 줄일 수 있다고 생각합니다.
게임으로 실행하면 차이가 더 잘 와닿을 거예요.
TypeSafe는 게임 “둠”을 Jev로 실행하는 데모를 공개하고 있습니다.
여기 전달하고 있는 것은 게임 화면의 이미지 자체로서는 아니며, 게임의 상황을 문자나 데이터로 나타낸 것입니다.
현재 상황을 인지하고 → 다음 조치를 선택하며 → 프로그램이 해당 조치를 수행하고 → 변화된 상황을 다시 인지하는 이러한 반복적인 흐름입니다.
매번 “현재 상황을 분석한 결과, 다음에는 이렇게 움직이는 것이 좋겠어”라고 말할 필요 없이, 다음 조치가 결정되면 게임은 진행된다.
일이 자동화되더라도 비슷한 상황이 있겠죠. 다음으로 열릴 자료를 선택하고, 결과를 남기거나 판단하며, 확인이 필요한 사항은 담당자에게 전달합니다.
다음 동작이 결정되면 실행할 수 있는 장면에서는 설명문 작성하지 않는 것이 오히려 더 유리할 것이다.
하지만 둠 데모가 “어떤 게임이든 잘한다”는 증거는 아닙니다. 개발사는 둠 전용으로 제작한 기존 방식의 프로그램이 더 잘 작동할 가능성을 명시적으로 밝히고 있습니다.
공식 발표 내의 둠 데모와 부록
왜 글을 쓰지 않아도 판단할 수 있을까요?
설명 없이도 답이 어디에서 나오는 걸까요?
글을 이해하는 것과 그 결과를 글로 설명하는 것은 분리될 수 있습니다. 스팸 메일 판별 역시, 메일을 읽고 분류하기 위해 매번 이유를 설명할 필요는 없습니다.
제브도 학습한 모델로 입력과 질문을 평가하고 답변을 제시합니다. 답변 방식을 “선택지”, “평가 점수”, “조건이 성립할 확률”으로 좁히는 방식으로 프로그램에서 바로 사용할 수 있도록 하고 있습니다.
단지 LLM에 “선택지만으로 답변해”라고 지시한 것과는 다릅니다. TypeSafe는 모델의 구조, 답변을 병렬로 반환하는 방식, 학습 방법을 이러한 용도에 맞게 구축했다는 설명을 담고 있습니다.
그 학습 방법은 “RLCD”입니다.
판단과 확률이 실제 결과에 맞도록 훈련하는 학습으로 이해하면 더 명확할 것입니다. 예를 들어 80%의 확률을 둔 예측을 많이 모으면, 대체로 80%의 비율로 맞을 것이라는 목표를 세우는 것입니다.
어떤 특정 결과의 정확성을 보장하는 것은 아니지만, 불확실성을 수치로 다룰 수 있다면 자동으로 진행할 수 있는 범위와 사람에게 확인을 요청할 수 있는 범위를 설계하기 쉬워집니다.
참고로, 공식 자료에서는 RLCD가 사전 학습된 언어 모델을 출발점으로 삼아 학습의 방향 중 하나로 설명되어 있습니다. LLM과 완전히 무관한 기술이 아니라는 점도 주목해야 합니다.
차이점은 학습 목표를 설정하고 모델이 어떤 답변을 생성하도록 완성시키느냐에 있습니다. 내부 구조에 대한 자세한 정보가 공개되어 있지 않으므로 ‘단 한 번의 계산으로 모든 것을 이해할 수 있다’고 단정할 수 없습니다.
공식 해설: 학습의 목적과 RLCD/확률 및 신뢰도 처리
업무에서는 “선택”과 “작성을” 분담할 수 있습니다.
방금 전 회의의 예시를 다시 살펴보면 차이점이 좀 더 명확하게 드러납니다.
회의록에는 “다음 달부터 이 방침대로 진행하겠습니다”와 같은 내용도 있지만, “다음 달부터는 어떻게 변경하는 것이 좋을까요?”와 같은 내용도 있습니다.
둘 다에 “다음 달”이 포함되어 있지만, 전자는 결정이고 후자는 제안입니다. 단어만으로는 기계적으로 구분하기 어렵지 않으세요?
그러므로 발언과 필요한 전개 사항을 Jev에 전달하여 결정 사항인지, 검토 중인지 선택하게 한다. 결정 사항으로 선택된 원문을 목록에 정리하는 프로그램이 작동한다. 부내에서 공유할 문구가 필요하면, 해당 목록에서 LLM에 작성해 달라고 요청한다.
이는 시스템을 이해하기 위한 예시이지만, 이렇게 역할을 분담할 수 있습니다.
제브가 제시하는 답변에는 “Choice”(선택지), “Score”(점수), “Noul”(조건부 확률) 등의 옵션이 있습니다. 기술자와 이야기할 때는 “여기서는 어떤 것을 원하는가? 선택 결과? 평가 숫자?” 와 같이 사용처를 상담하기 용이합니다.
단순히 날짜 순으로 정렬하는 것 이상의 복잡성이 있기 때문입니다. Jev를 검토하는 것은 맥락이나 의미를 파악하지 않으면 판단하기 매우 어렵습니다.
또한, 선택지 중에서 답을 선택하는 것만으로는 선택 오류가 사라지는 것은 아닙니다. 중요한 결정 사항을 놓치지 않았는지 확인하기 위해서는 실제 기록을 통해 확인해야 합니다.
정말 기쁜 것은 세세한 판단을 여러 번 挟을 수 있는 점이다.
제프가 노리는 것은 이러한 판단을 ‘신속하게’, ‘대규모로’, ‘저비용으로’ 반복하는 것입니다.
제가 주목하고 있는 것은 한 번의 답변이 더 빨라지는 것 이상으로, 지금까지 시간과 비용의 문제로 미루고 있던 확인을 업무 중간에 더 쉽게 삽입할 수 있다는 점입니다.
데이터 100건 각각이 이번 조사와 관련이 있는가. AI가 만든 답변이 참조 자료에 부합하는가. 지금 완료된 작업으로, 다음 단계로 진행하는 것이 좋을까.
이렇게 작은 판단을 저렴하고 빠르게 처리할 수 있다면, AI에게 업무를 맡기는 시스템도 변화해 올 것입니다. 실제 효과는 업무별 검증이 필요하지만, 개발자들이 반응하는 이유는 여기에 있다는 것을 나는 보고 있습니다.
상급자와 설명할 때는 “Jev는 단순히 글을 쓰는 AI가 아니라, 업무 진행 중 발생하는 선별 및 검토를 담당하는 AI입니다. LLM과 함께 사용하면 반복적으로 발생하는 판단 지연 및 비용을 줄일 수 있을 것입니다.”
그렇고자, Jev와 LLM의 차이점에 대해 말씀드렸습니다. 구체적으로 어떤 방식으로 사용되고 있는지에 대해서는 별도의 게시글에서 소개하겠습니다.
까지 읽어주셔서 감사합니다!
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 44청크
원문 보기 | 출처: note.com