도입
여러분은 ‘인공지능(AI)’이라고 들으면 어떤 모습이 떠오르시나요? 마치 인간처럼 자연스럽게 대화할 수 있는 ChatGPT나 Claude처럼, ‘질문을 던지면 술술 흐르는 듯한 문장을 써서 답해주는 똑똑한 로봇’을 떠올리는 분이 많지 않을까요? 숙제 상담을 해주기도 하고, 재미있는 이야기를 만들어주기도 하고, 영어를 깔끔한 한국어로 번역해주기도 하는 등, 문자를 사용해 사람과 대화하는 AI는 우리의 생활을 단숨에 편리하게 만들었습니다.
그러나 컴퓨터 기술을 날마다 연구하고 있는 세계의 최전선에서는 지금, 이와는 전혀 반대되는 놀라운 발상이 큰 주목을 받고 있습니다. 그것은 “애초에 AI는 매번 긴 문장을 쓸 필요가 있을까?”라는 근본적인 의문입니다.
사실 스마트폰과 컴퓨터 뒤에서 동작하는 다양한 프로그램에게 AI가 쓰는 정중하고 인간다운 수다는 결코 반가운 것만은 아니었습니다. 오히려 수다스럽기 때문에 “답변이 돌아올 때까지 몇 초씩 기다려야 한다”, “사용에 드는 전기료와 비용이 엄청나게 높아진다”, “정해진 형식대로 답해주지 않아 프로그램에 오류가 생겨 멈춰 버린다”와 같은 골치 아픈 문제를 수없이 일으키고 있었던 것입니다.
그런 가운데 2026년 9월에 미국에서 발표된 것이 'Jev(제브)'라는 이름의 전혀 새로운 유형의 AI입니다. 이 Jev는 놀랍게도 지금까지의 AI가 가장 잘한다고 여겨졌던 '글을 쓰는 것'을 완전히 버렸습니다. 문자나 이야기, 프로그램 명령문은 전혀 만들지 않는 대신, 전달된 정보를 순식간에 읽어들여 '이것은 예스인지 노인지', '어떤 선택지가 가장 적합한지'라는 판단만을 전광석화와 같은 속도로 내리는 데 특화되어 있습니다.
이 기사에서는 문장 생성을 그만둔 이 신기한 AI “Jev”가 왜 전 세계 기술자들을 열광시키고 있는지, 그 기술의 원리부터 우리의 생활과 산업에 미치는 영향까지, 전문 지식이 없는 10대도 속 시원히 이해할 수 있도록 그 어디보다 자세하고 알기 쉽게 풀어 설명하겠습니다.
제1장: AI가 직면했던 벽과 'Jev'의 탄생 스토리
1-1. 2026년 가을, 실리콘밸리에서 전해진 놀라운 소식
2026년 9월 15일, 전 세계 최첨단 IT 기업들이 모여 있는 미국 캘리포니아주 샌프란시스코에서 인공지능 업계를 크게 뒤흔드는 소식이 전해졌습니다. 갓 설립된 스타트업 기업(혁신적인 기술로 급성장을 노리는 회사)인 TypeSafe AI(타입세이프 에이아이)사가 약 2년간 비밀리에 연구를 이어 온 '스텔스 개발' 기간을 마치고, 새로운 인공지능 'Jev(제브)'를 전 세계 엔지니어를 대상으로 공개(얼리 액세스 개시)한 것입니다.
이 Jev가 세계를 놀라게 한 이유는 그 설계 사상의 과감함에 있었습니다. 지금까지 세상에서 유명했던 AI, 예를 들어 ChatGPT나 Claude 등은 전문 용어로 '대화형 대규모 언어 모델(Large Language Models, 약칭 LLM)'이라고 불립니다. 이들은 인터넷상에 있는 방대한 문장을 읽고 학습하여, 인간처럼 풍부한 언어를 사용해 질문에 대한 답변이나 소설, 프로그래밍 코드 등을 자유롭게 쓸 수 있습니다.
그런데 Jev는 그런 문장을 단 1글자도 생성하지 않습니다. Jev가 할 수 있는 것은 소프트웨어의 현재 상태나 질문이 주어졌을 때 미리 정해진 선택지나 기준 중에서 ‘고른다’, ‘점수를 매긴다’, ‘옳은지 여부를 확률로 답한다’는 작업뿐입니다. 인간의 마음과 사고의 구조를 연구한 유명한 학자 ダニエル・カーネマン은 인간의 사고에는 ‘직관으로 순식간에 빠르게 결정하는 모드(システム1)’와 ‘충분히 시간을 들여 논리적으로 생각하는 모드(システム2)’의 두 가지가 있다고 주장했습니다. Jev는 바로 이 이론에서 착안해 컴퓨터 세계에서 순간적인 직관을 담당하는 ‘システム・ワン・モデル(System One Model)’이라 명명되었습니다. 문장을 술술 늘어놓듯 말하는 대신 필요한 결론만을 명확한 디지털 데이터로 반환해 주는, 전혀 새로운 도구가 등장한 것입니다.
1-2. 지금까지의 AI는 왜 ‘곤란한 문제’를 안고 있었을까?
Jev와 같은 존재가 필요해진 배경에는 지금까지의 생성형 AI가 안고 있던 심각한 약점이 있었습니다. 전 세계적으로 AI 붐이 일어난 결과, 많은 기업과 개발자들은 "어떤 일이든, 모두 만능 거대 언어 모델(범용 LLM)에 맡기면 된다"는 생각에 지나치게 편중되어 있었습니다. 이를 "범용 LLM에 대한 단일 의존"이라고 부릅니다.
하지만 무엇이든 할 수 있는 만능 AI에만 전적으로 의존하는 것에는 큰 무리가 있었습니다. AI가 문장을 쓸 때, 컴퓨터 안에서는 말을 ‘토큰’이라는 작은 퍼즐 조각 같은 단위로 잘게 잘라 처리합니다. 예를 들어 ‘こんにちは’라는 말이라면, 몇 개의 토큰으로 나뉘어 계산됩니다. 그리고 지금까지의 일반적인 AI는 바로 직전에 쓴 말을 바탕으로 ‘그다음에 올 확률이 가장 높은 말’을 1토큰씩 순서대로 예측해 덧붙여 가는 방식을 취하고 있었습니다. 이를 전문 용어로 ‘자기회귀형 생성(Autoregressive Generation)’이라고 합니다.
이 ‘한 글자씩 순서대로 생각하며 써 나가는’ 방식은 인간이 긴 보고서나 이야기를 읽을 때는 훌륭한 힘을 발휘합니다. 하지만 기계와 기계가 연계되어 자동으로 동작하는 시스템 내부에서는 엄청난 걸림돌이 되고 있었습니다. 우선, 문장이 길어지면 길어질수록 다음 글자를 생각하기 위한 대기 시간이 발생합니다. 답변이 돌아오기까지 몇 초에서 수십 초, 때로는 몇 분씩 기다려야 하는 경우도 있는데, 이를 전문 용어로 ‘지연(레이턴시)’라고 부릅니다. 스마트폰에서 버튼을 눌렀는데 몇 초 동안 화면이 멈춰 있으면 누구나 짜증이 나겠죠.
게다가 AI 이용 요금의 상당 부분은 ‘입력한 말의 양(입력 토큰)’뿐만 아니라 ‘AI가 생성한 말의 양(출력 토큰)’에 따라 요금이 청구되는 구조로 되어 있습니다. AI가 말을 많이 늘어놓을수록 서버를 가동하는 전기료와 컴퓨터의 연산 비용이 불어나 기업의 청구서는 치솟았습니다.
또 하나의 치명적인 문제는 '형식 붕괴'와 '거짓말'입니다. 컴퓨터 프로그램끼리 대화할 때는 'JSON(제이슨)'과 같이 기호와 정해진 규칙으로 정리된 전용 표기법(구조화 데이터)을 사용하는 것이 일반적입니다. 하지만 자유롭게 문장을 쓰는 AI에게 "이 형식대로 써줘"라고 부탁해도, 불필요한 인사말을 덧붙이거나 닫는 기호를 빠뜨려 프로그램이 데이터를 읽지 못하고 오류를 일으키는 사고(파싱 실패)가 일상다반사였습니다. 게다가 AI가 그럴듯한 거짓말을 당당하게 늘어놓는 '할루시네이션(환각)' 문제도 있습니다. 이처럼 '문장을 쓰게 한다'는 과정 자체가 컴퓨터 처리를 느리게 하고, 비용을 높이고, 정확성을 떨어뜨리는 최대의 원인(병목)이 되었던 것입니다. Jev는 이 잡담 과정을 아예 없애버림으로써 오랜 고민을 단번에 날려버리려 했습니다.
1-3. 개발자들의 도전――대화형 AI를 탄생시킨 이들이 깨달은 것
이 대담한 Jev를 만들어낸 사람들은 사실 세계 최고 수준의 문장 생성 AI를 누구보다 깊이 이해하는 연구자들이었습니다. TypeSafe AI사를 설립한 중심 인물인 디오고 알메이다(Diogo Almeida), 에릭 가프니(Erik Gafni), 사샤 셩(Sasha Sheng) 세 사람은 과거 ChatGPT 등을 개발한 세계 최대 AI 연구 조직인 미국 OpenAI사에 소속되어 있었습니다. 그들은 그곳에서 AI가 인간에게 친밀하게 다가가 자연스럽게 대화할 수 있도록 단련하는 “InstructGPT”와 인간의 평가를 바탕으로 AI의 행동을 바람직하게 교정하는 학습 기법인 “인간 피드백 기반 강화학습(RLHF)”의 기초 연구를 최전선에서 이끌어온, 그야말로 전설적인 전문가들이었던 것입니다.
바로 그런 그들이었기에 누구보다 먼저 하나의 아이러니한 사실을 깨달았습니다. 인간이 편안함을 느끼는 대화를 하게 하기 위한 기술(RLHF)은 인간과 AI가 직접 대화할 때는 도움이 됩니다. 그러나 소프트웨어 프로그램끼리 배후에서 통신하는 장면(머신 투 머신 통신)에서는 이 메커니즘이 오히려 “불필요한 수다스러움”, “느린 응답 속도”, “기계로서의 불확실성”, 나아가 “인간에게 아첨하며 비위를 맞추려는 부자연스러운 습성(사이코팬시)”을 낳는 원인이 되고 말았던 것입니다.
지금까지 현장의 엔지니어들은 기계적인 판정이 필요할 때조차 무리하게 AI에게 지시해 장황한 문장을 쓰게 한 뒤, 그 안에서 필요한 부분을 애써 뽑아내는 매우 비효율적인 작업을 견디며 계속해 왔습니다. 이를 지켜본 알메이다 일행은 "이제 문장을 쓰게 하는 건 그만두자. 기계가 필요로 하는 것은 수다가 아니라 확실하고 신속한 판단뿐이다"라고 결심했습니다. 이 획기적인 아이디어에 공감한 미국의 유명 벤처캐피털인 DCVC 등의 투자자들은 회사가 출범한 지 얼마 되지 않은 단계(시드기)임에도 불구하고 4,000만 달러(일본 엔화 기준 약 60억 엔 규모)라는 거액의 자금을 투자했습니다. 이로써 TypeSafe AI사는 기업 가치가 2억 달러(약 300억 엔 규모)로 평가받으며, 문장을 전혀 쓰지 않는 '판단 전용 AI'의 개발이 일거에 가속화된 것입니다.
1-4. 전 세계에서 벌어지는 대논쟁과 확산되는 국제적 파문
Jev가 베일을 벗은 순간, 전 세계 소프트웨어 개발자 커뮤니티에 큰 충격이 일었습니다. 미국에 기반을 두고 전 세계의 우수한 프로그래머와 기술자들이 모이는 유명한 토론 사이트 'Hacker News(해커 뉴스)'에서는 Jev에 관한 게시물이 순식간에 1,790포인트라는 극히 높은 평가를 받고, 470건이 넘는 뜨거운 댓글이 달렸습니다. "이것이야말로 우리가 줄곧 기다려온 도구다!"라며 극찬하는 목소리가 있는 한편, "글을 쓰지 않는 AI가 정말 유용한가?"라는 논쟁이 깊은 밤까지 이어졌습니다.
또한, 전 세계적으로 인터넷과 AI의 기반을 떠받치고 있는 기술 기업들도 경이로운 속도로 반응했습니다. 예를 들어, 다양한 AI를 조합해 고도한 시스템을 구축하기 위한 세계 표준 도구인 “LangChain”, 전 세계 웹사이트를 가속화하고 보호하는 미국 Cloudflare사가 제공하는 “Cloudflare Workers AI”, 차세대 웹 개발 분야에서 전 세계적인 지지를 받고 있는 미국 Vercel사의 “Vercel AI Gateway”와 같은 저명한 글로벌 플랫폼들이 Jev 발표 직후 즉시 공식 지원(네이티브 지원)을 발표했습니다. 전 세계 개발 현장이 이 기술에 얼마나 굶주려 있었는지를 잘 보여주는 사례입니다.
지금 세계 AI 개발 트렌드는 단 하나의 거대한 AI에 모든 것을 떠맡기는 ‘LLM 퍼스트’라는 낡은 방식에서, 역할이 서로 다른 여러 개의 작은 AI와 전문 프로그램을 현명하게 조합하는 ‘컴파운드 AI 시스템(Compound AI Systems: 복합 AI 시스템)’이라는 사고방식으로 급속히 방향을 틀고 있습니다. 천천히 글을 쓰거나 복잡한 계획을 세우는 어려운 일은 OpenAI사의 ‘o1’이나 차세대 ‘GPT-5’와 같은 똑똑한 대형 AI(시스템 2)에 맡기고, 컴퓨터 이면에서 1초에 수백 번씩 발생하는 ‘이것은 안전한가?’, ‘다음에 어떤 버튼을 눌러야 하는가?’와 같은 순간적인 판단 작업은 Jev와 같은 초고속 판단 AI(시스템 1)가 순식간에 처리합니다. 이처럼 전 세계의 컴퓨터 시스템이 각자의 전문 분야에 따라 역할을 분담하는 성숙한 구조로 진화하기 시작한 것입니다.
제2장: 산업과 사회는 어떻게 바뀌는가? ‘Jev’가 가져오는 거대한 영향
2-1. 지금 당장 일어나는 극적인 변화――비용의 90퍼센트 이상이 사라지는 마법?
Jev가 실제 비즈니스와 사회에 가져오는 단기적인 변화 중에서 가장 알기 쉽고 강렬한 것은 ‘비용의 극적인 절감’과 ‘대기 시간의 소멸’입니다. 특히 큰 혜택을 받는 것은 매일 수만 건, 수백만 건에 달하는 방대한 데이터를 처리하는 기업과 서비스입니다. 예를 들어 인터넷 게시판이나 SNS에서 위험한 게시글이나 부적절한 이미지가 없는지 감시하는 업무(보안 모더레이션)와 지원센터에 매일 도착하는 고객 메일을 ‘이것은 불만’, ‘이것은 사용법 문의’, ‘이것은 해지 절차’로 분류하는 작업(1차 트리아지), 그리고 자동으로 업무를 진행하는 AI 로봇(AI 에이전트)이 다음에 사용할 도구를 잘못 선택하지 않았는지 확인하는 작업 등이 이에 해당합니다.
지금까지 많은 회사는 이러한 분류 작업만을 위해 인간처럼 대화할 수 있는 최고 성능의 초대형 AI(프론티어 LLM)를 고용하고 있었습니다. 이를 비유하자면 “편지를 받는 사람별로 분류하는 일만을 위해 최고급 리무진과 초일류 학자를 수십 명이나 고용해 대기시키고 있던” 상태였습니다. 그 때문에 매달 지불하는 AI 이용 요금은 막대한 금액으로 불어나 있었습니다.
그런데 이 분류 작업 현장에 Jev를 도입했더니 믿기 힘든 수준의 비용 절감이 보고되고 있습니다. 실제 숫자로 살펴보겠습니다. 예를 들어, 어떤 회사가 한 달에 4만 건의 문의 메일을 자동으로 담당 부서에 배분하는 시스템을 운영하고 있었다고 가정해 보겠습니다. 기존의 최고 수준 LLM을 사용했을 때는 문장 처리에 드는 연산 비용으로 매달 약 900달러(약 13만 5,000엔) 정도의 청구서를 받고 있었습니다. 하지만 똑같은 업무를 Jev에 맡겼더니 놀랍게도 한 달에 드는 비용이 '약 1.34달러(약 200엔)'로 급감한 것입니다. 900달러가 고작 1.34달러가 되었으니, 비용의 무려 99퍼센트 이상이 사라진 셈이 됩니다.
왜 이토록 저렴해지는가 하면, Jev의 요금 설정이 극단적이기 때문입니다. Jev를 이용할 때 드는 비용은 입력 문장량을 기준으로 “100만 토큰당 0.042달러(수 엔 정도)”라는 파격적인 수준으로 저렴합니다. 더욱 놀라운 것은 AI가 답변을 반환할 때의 요금(출력 토큰 요금)이 “완전 무료(0달러)”로 설정되어 있다는 점입니다. 일반적인 AI는 “긴 글을 쓸수록 돈이 든다”는 구조였지만, Jev는 애초에 문자를 쓰지 않기 때문에 출력에 대한 요금이라는 개념 자체를 없애 버린 것입니다.
이 압도적으로 저렴한 가격 덕분에, 지금까지 "비용이 너무 많이 들어서 중요한 부분만 가끔 확인하자"며 포기했던 회사들도 모든 데이터를 24시간 언제든지 빠짐없이 확인할 수 있게 되어 인터넷의 안전성이 대폭 향상될 것으로 기대되고 있습니다.
2-2. 미래의 컴퓨터는 어떻게 바뀔까? — '제번스의 역설'
Jev가 가져올 장기적인 영향은 우리 주변의 모든 소프트웨어를 만드는 방식을 근본부터 뒤바꿔 버릴 가능성을 지니고 있습니다. 특히 큰 변화가 예상되는 분야는 최근 전 세계에서 연구되고 있는 “AI 에이전트”의 세계입니다. AI 에이전트란 인간이 세세하게 지시하지 않아도 “다음 주 가족 여행 계획을 세워 신칸센과 호텔을 예약해 둬”라고 부탁하기만 하면 스스로 생각하여 인터넷을 검색하고, 일정을 짜고, 예약까지 완료해 주는 미래의 집사와 같은 프로그램입니다.
지금까지의 AI 에이전트는 하나의 행동을 취할 때마다 매번 무겁고 비싼 거대 AI를 호출해 자문했습니다. "다음에는 검색해야 할까?" "어떤 페이지를 열어야 할까?"를 생각할 때마다 몇 초씩 고민하느라 막대한 전기와 비용을 소비했기 때문에, 동작이 느리고 실용화가 어렵다고 여겨졌습니다. 하지만 Jev와 같은 '판단에 특화된 전문가'가 등장하면서, 앞으로의 AI 에이전트는 똑똑한 3층 구조의 팀플레이로 움직이게 됩니다.
- 1층: 정해진 계산을 절대 틀리지 않고 수행하는 일반 프로그램(결정론적 코드)
- 2층: “다음은 오른쪽으로 가야 할까, 왼쪽으로 가야 할까”를 순식간에 결정하는 고속 판단 엔진(Jev)
- 3층: 도저히 풀기 어려운 문제에 부딪혔을 때나, 마지막 정중한 편지를 쓸 때만 등장하는 최고 수준의 지능(고성능 LLM)
이렇게 역할을 깔끔하게 정리하면, 불필요한 대기 시간이나 비용 없이 매끄럽고 효율적으로 일하는 AI 에이전트가 완성됩니다.
그리고 이러한 비용의 극적인 하락은 경제학계에서 매우 유명한 현상을 일으킬 것으로 예상됩니다. 바로 그것이 모델명 'Jev'의 유래가 된 '제번스의 역설(Jevons Paradox)'입니다. 지금으로부터 150여 년 전인 19세기, 영국의 경제학자 윌리엄 스탠리 제번스는 석탄을 효율적으로 태울 수 있는 뛰어난 증기기관이 발명되었을 때, '석탄 소비량은 줄어들 것이다'라는 대다수의 예상과는 반대로 오히려 사회 전체의 석탄 소비량이 폭발적으로 늘어났다는 사실을 발견했습니다. 효율이 좋아져 저렴하게 사용할 수 있게 된 결과, 공장, 선박, 철도 등 모든 곳에서 증기기관이 사용되기 시작했기 때문입니다.
이와 똑같은 일이 AI의 '지능' 세계에서도 일어나려 하고 있습니다. 사물을 판단하는 비용이 거의 제로에 가까워지면서, 지금까지 프로그래머가 애써 '숫자가 10 이상이면 오른쪽으로, 그렇지 않으면 왼쪽으로'라고 일일이 딱딱하게 써 왔던 무수한 조건 분기(프로그램의 if문이나 switch문) 속에, '인간의 뉘앙스와 분위기를 부드럽게 읽어내 순간적으로 판단하는 작은 AI'가 당연한 것처럼 수천 개, 수만 개씩 내장되는 미래가 다가오고 있는 것입니다.
제3장: 왜 그렇게 빠르고 정확한가? 기술의 원리를 파헤친다
3-1. 한 글자씩 쓰지 않는 ‘비자기회귀형’의 비밀
그렇다면 Jev는 왜 이토록 압도적인 속도와 저렴함을 실현할 수 있는 것일까요? 그 심장부에 담긴 수학적·구조적 비밀을 들여다보겠습니다. 가장 중요한 열쇠를 쥐고 있는 것은 전문 용어로 '비자기회귀형(Non-Autoregressive) 병렬 샘플러'라고 불리는 설계입니다. 말은 무척 어려워 보이지만, 작동 원리는 매우 단순합니다.
앞서 말씀드린 것처럼, 일반적인 대화형 AI(ChatGPT 등)는 ‘자기회귀형’이라는 방식을 취하고 있습니다. 이를 비유하자면, “원고지를 마주하고 앞의 문맥을 몇 번이고 다시 읽으면서, 한 글자 쓰고는 고민하고, 또 다음 한 글자를 쓰고는 고민하는 작가”와 같은 움직임입니다. AI는 “吾輩は”라고 쓰면, 다음에 이어질 말로 “猫”이 가장 확률이 높다고 계산해서 덧붙여 씁니다. 그 뒤에는 이번에는 “吾輩は猫”이라는 문장 전체를 다시 읽고, 다음에는 “で”를 쓰는 작업을 끝없이 반복합니다. 이 때문에 긴 문장을 쓰면 쓸수록 컴퓨터의 계산용 두뇌인 GPU(그래픽스 프로세싱 유닛)를 오랜 시간 점유하게 되어, 대기 시간도 전기 요금도 눈덩이처럼 불어나게 되는 것입니다.
이에 반해 Jev가 채택한 '비자기회귀형'은 전혀 다릅니다. Jev는 문장을 쓰는 작가가 아니라, '마크시트 시험 용지를 특수 판독기에 슥 통과시키는 순간'처럼 동작합니다. 사람이 입력한 상황 설명 문장(State)과 미리 정해 둔 질문 형식(Schema)을 받으면, Jev는 GPU 안에서 단 한 번의 계산(단일 포워드 패스)만으로 모든 선택지에 대한 확률 분포를 한꺼번에 동시에 계산합니다. 문장을 한 글자씩 릴레이처럼 이어 가는 반복 처리 자체가 존재하지 않기 때문에 계산은 순식간에 끝납니다. 출력하는 문장이 없으므로, '몇 글자를 썼으니 얼마를 지불하세요'라는 출력 토큰 과금 규칙도 성립하지 않아 완전히 무료로 만들 수 있었던 것입니다.
3-2. 새로운 학습법 “RLCD”——확신도에 대해 거짓말하지 않는 AI
Jev의 또 다른 큰 기술적 특징은 학습 방법에 있습니다. Jev는 “RLCD(Reinforcement Learning for Calibrated Decisions: 보정된 의사결정을 위한 강화학습)”이라는 완전히 새로운 독자적 기법으로 훈련되었습니다.
지금까지의 AI에서 널리 사용되어 온 'RLHF(인간 피드백을 통한 강화학습)'는 인간 평가자가 '이 답변이 더 정중하고 이해하기 쉽네', '이쪽이 더 상냥한 표현이네'라고 칭찬하는 방식으로 AI를 똑똑하게 만들어 왔습니다. 그 때문에 AI는 어떻게든 인간에게 잘 보이려다 보니, 사실은 확신이 없는 내용도 자신만만하게 말하거나, 입에 발린 아첨을 늘어놓는 버릇이 생겨버렸습니다.
그러나 Jev가 사용하는 'RLCD'의 목적은 인간을 만족시키는 것이 아닙니다. RLCD가 목표로 하는 것은 단 하나, "모델이 제시하는 신뢰도(확률)가 실제 정답률과 한 치의 오차도 없이 일치하는 것"입니다. 이를 전문 용어로는 '확률 보정'이라고 합니다.
예를 들어, 평범한 AI에게 “이 답이 맞아?”라고 물었더니 “90퍼센트 확률로 맞습니다!”라고 힘차게 대답했는데, 실제로 확인해 보니 절반 정도는 틀렸던 경험이 있는 사람이 많을 것입니다. 이래서는 무서워서 일을 맡길 수가 없습니다. 하지만 RLCD로 철저하게 단련된 Jev가 “확신도 0.90(90퍼센트)”이라고 말했을 때는 수학적으로 극히 엄밀한 의미를 가집니다. 비슷한 조건으로 100번 테스트하면 정말 정확히 90번은 맞고 10번만 틀리도록 확률의 눈금이 빈틈없이 맞춰져 있는 것입니다. 거짓말하지 않고 자신의 실력을 한 치의 오차도 없이 정직하게 고백할 수 있다는 것, 바로 그것이야말로 기계의 세계에서 신뢰받는 최대의 무기가 됩니다.
3-3. Jev와의 대화 규칙――세 가지 질문 유형과 확률 계산식
컴퓨터 프로그램이 Jev에 요청할 때는 매우 체계적인 규칙에 따라 데이터를 주고받습니다. Jev에 입력하는 판단 자료가 되는 텍스트 데이터를 “State(스테이트: 상태)”라고 부릅니다. 예를 들어, “고객이 보낸 메일 본문”이나 “시스템 에러 로그” 등이 이에 해당합니다.
그리고 Jev에게 던지는 질문은 다음의 정해진 3가지 “타입(데이터 타입/프리미티브)” 중 하나로 정의해야 합니다. 자유로운 질문문을 장황하게 늘어놓는 것은 허용되지 않습니다.
- Choice(초이스): 준비된 선택지 중에서 가장 해당하는 항목 하나만 선택하게 하는 유형입니다. 한 번에 최대 255개까지의 선택지를 나열할 수 있습니다. 예를 들어, “이 메일의 문의 내용은 해지, 구매, 클레임, 질문 중 어느 것입니까?”와 같은 질문에 사용합니다.
- 스코어(Score): 상황의 수준을 2단계부터 10단계까지의 눈금(순서 척도)으로 평가하도록 하는 유형입니다. 예를 들어, "이 문장에서 느껴지는 분노의 수준을 1(차분함)부터 5(격노)까지의 숫자로 판단해 주세요"와 같은 평가에 사용합니다.
- Noul(노르): 특정 조건에 대해 맞는지 틀린지(Yes인지 No인지)를 0.0부터 1.0까지의 실수 확률로 반환하는 타입입니다. “이 게시글에는 개인정보가 포함되어 있습니까?”라는 질문에 대해 “0.98(98퍼센트 확률로 Yes)”과 같은 형태로 답해줍니다.
또한, Jev가 답을 제시할 때 그 답에 대한 확신 정도를 나타내는 ‘확신도(Confidence)’는 가장 확률이 높은 선택지의 확률을 ‘P_max’라 할 때 다음과 같은 계산식으로 수학적으로 산출됩니다.
확신도 = (3 × P_max − 1) ÷ 2
이 계산식으로 도출된 확신도는 항상 정확한 확률로 프로그램에 전달됩니다. 그리고 무엇보다 훌륭한 점은, Jev가 출력하는 데이터의 형태(스키마)는 프로그램 구조상 미리 단단히 고정되어 있기 때문에, 일반 AI에서 흔히 발생했던 “프로그램이 읽을 수 없는 이상한 형식으로 문자를 출력해 시스템이 충돌하는 사고(JSON 파싱 오류)”의 발생률이 구조적으로 절대 일어날 수 없는 “0.00퍼센트”가 되어 있다는 점입니다. 고장 나지 않는다는 안심감이 있기에 엔지니어는 안심하고 자율주행을 맡길 수 있습니다.
3-4. 숫자로 보는 압도적인 실력――라이벌들과의 벤치마크 대결
TypeSafe AI사가 공표한 공식 데이터와 전 세계 제3자 기관이 엄격히 검증한 테스트 결과(벤치마크)를 보면, Jev가 기록한 수치의 대단함을 잘 알 수 있습니다.
먼저 '속도(레이턴시)'입니다. Jev가 질문을 받아 답변을 반환하기까지 걸리는 시간은 공식 수치로 70밀리초에서 500밀리초(0.07초에서 0.5초)라는 전광석화와 같은 속도입니다. 지금까지의 최정상급 LLM이 처음부터 끝까지 처리를 마치는 데 3초에서 329초 정도 걸렸던 것과 비교하면 40배에서 200배(자사 테스트에서 가장 차이가 벌어진 순간은 193.6배)나 빠릅니다. 일본의 유명 IT 지원 기업인 클래스메서드사(DevelopersIO)가 실제로 Jev를 사용해 실험한 보고서에서도 40회 연속으로 시스템을 호출한 결과 한 번도 실패하지 않고 모두 성공했으며, 중앙값(정확히 중간에 해당하는 평균적인 속도)으로 약 0.643초에서 0.674초라는 매우 안정적인 속도를 기록했습니다. 또한 해외 기술 미디어인 Every사가 진행한 테스트에서는 37개의 문서에 대해 총 777건에 달하는 판단을 수행하게 했는데, 그 모든 것을 0.7초 미만으로 순식간에 처리했다고 보고되고 있습니다.
다음은 '가격(가성비)'입니다. Jev의 입력 요금은 100만 토큰당 0.042달러(10억 토큰분이라는 천문학적인 분량의 문서를 읽게 해도 고작 42달러=약 6,300엔)이며, 출력 요금은 완전 무료(0달러)입니다. 이를 최첨단 초대형 AI인 'GPT-5.6 Terra'(입력 100만 토큰당 2.00달러, 출력 100만 토큰당 12.00달러)와 비교하면, 입력을 처리하는 단가만으로도 약 48배 저렴하고, 실제로 드는 총비용으로 계산하면 최대 400배 이상 저렴하다는 놀라운 결과가 나옵니다. 마찬가지로 경쟁 모델인 'Claude Fable 5.1'과 비교해도 약 238배 저렴합니다. 해외 독립 IT 뉴스 사이트인 SiliconANGLE의 보도에 따르면, 1,000건의 업무 워크플로를 처리했을 때 든 비용은 Jev가 겨우 '0.39달러'였던 데 비해, 소형 'GPT-5.6 Luna'는 3.31달러, 경량판 'Claude Haiku 4.5'는 19.49달러나 들었습니다.
그렇다면 '지능(판단의 정확성)'은 어떨까요. TypeSafe AI사가 마련한 4개의 실제 비즈니스 업무를 본뜬 테스트(기준이 되는 모범 답안은 초대형 AI인 GPT-6 Astra와 Claude Fable 5.1에게 몇 분 동안 깊이 생각하게 하여 도출한 답의 평균값)에서 Jev가 모범 답안과 일치한 확률은 67.8퍼센트였습니다. 이는 큰 인기를 끌고 있는 중형 모델인 “GPT-5.6 Terra”의 67.9퍼센트와 거의 완전히 동등한 성적입니다. 물론 세계 최고 수준의 지능을 지닌 “GPT-5.6 Sol”(74.1퍼센트)이나 “Claude Opus 5”(73.1퍼센트)에는 몇 퍼센트 미치지 못하지만, 몸집은 몇 배나 작고 속도는 몇백 배나 빠른 모델이면서도 중견급 거대 AI와 어깨를 나란히 하는 지능을 갖추고 있음이 증명되었습니다.
더 결정적인 것은 "정해진 형식을 정확히 지킬 수 있는가(구조화 출력 오류율)"의 승부입니다. 최고 수준의 지능을 갖췄はず인 "Claude Opus 5"조차 5.73퍼센트의 확률로 형식을 틀리고, 경량 버전인 "Claude Haiku 4.5"에 이르러서는 45.5퍼센트로 절반 가까이 형식 오류를 일으켜 프로그램을 멈춰버린 반면, Jev의 오류율은 정확히 "0.00퍼센트(제로)"를 기록했습니다. 기계에게는 "반드시 규칙대로 된 형태로 데이터를 반환해준다"는 신뢰감이 무엇과도 바꿀 수 없는 가치입니다.
3-5. 냉정한 전문가의 눈――숀 게데케 씨의 날카로운 지적
그러나 아무리 훌륭한 기술이라도 세상의 홍보 문구를 그대로 믿어서는 안 됩니다. 해외 기술자 커뮤니티에서는 냉정하고 비판적인 검증도 철저히 이루어지고 있습니다. 그중에서도 특히 날카로운 의견을 던져 주목을 모은 인물은 해외에서 저명한 소프트웨어 엔지니어인 숀 괴데케(Sean Goedecke) 씨입니다.
게데케 씨는 TypeSafe AI사가 광고에서 대대적으로 내세우고 있는 "할루시네이션(거짓 출력) 제로!"라는 문구에 제동을 걸었다. "타입 오류가 발생하지 않는 것과 AI가 선택한 답이 정말로 옳은 것은 전혀 별개의 문제다. 이는 말장난이 아닌가"라고 그는 냉정하게 지적했다.
이것은 매우 중요한 핵심입니다. 이해하기 쉬운 비유로 생각해 봅시다. 만약 AI에게 "오늘 낮 하늘은 무슨 색입니까?"라고 질문하고, 선택지로 "파랑, 빨강, 초록, 검정"을 준비했다고 가정해 보겠습니다. Jev는 이 중에서 형식 오류를 절대 일으키지 않고, 깨끗한 데이터 형태로 "빨강"이라는 답을 출력할 수 있습니다. 프로그램으로서는 한 글자의 어긋남도 없이 완벽하게 데이터를 받을 수 있으니, "타입 오류"는 제로입니다. 하지만 현실의 하늘은 파란색이므로, 인간이 보기에는 "크게 틀린 답(의미 오류/시맨틱 오류)"을 내놓은 셈입니다. 즉, Jev가 약속하는 것은 "데이터 형식이 깨지지 않는 것"일 뿐, "인간에게 절대적으로 올바른 답을 계속 골라내는 것"까지 보장하는 것은 아닙니다.
또한 게데케 씨는 “Jev는 답을 작성하면서 중간에 생각하는 시간(추론 시 계산/테스트타임 컴퓨트)을 갖지 않기 때문에, 그 지능의 한계는 기존의 소형 AI와 동등한 수준에 머물 가능성이 높다”고도 경고했습니다. 복잡한 퍼즐처럼 여러 단계의 논리적 사고를 차곡차곡 쌓아야 풀 수 있는 어려운 문제에 대해서는, Jev와 같은 순발력뿐인 AI로는 상대가 되지 않는 한계가 있다는 점을 우리는 확실히 이해해 두어야 합니다.
제4장: 실제로 사용한다면 어떻게 해야 할까? 현장에서 실패하지 않기 위한 실전 가이드
4-1. 확률의 경계선(임계값)을 현명하게 정하는 방법
이제부터는 실제로 Jev를 이용해 업무 시스템을 구축하는 엔지니어와 기업 리더들이 반드시 알아야 할 실무 노하우에 대해 설명하겠습니다. 먼저 가장 해서는 안 되는 초보자의 실수는, Jev가 반환하는 확신도(Confidence)에 대해 "일률적으로 0.8(80퍼센트) 이상이면 무조건 자동 실행해도 OK!"와 같은 엉성한 규칙(고정 임계값)을 만들어 버리는 것입니다.
비즈니스 현장에서는 일의 내용에 따라 '실패했을 때의 피해 규모'가 전혀 다릅니다. 예를 들어 쇼핑 사이트에서 고객에게 '추천 상품'을 표시할 때라면, AI가 취향을 조금 잘못 파악하더라도 누구도 큰 피해를 입지 않습니다. 하지만 이것이 '부정 이용이 의심되는 사용자의 계정을 강제 정지한다'거나 '은행 계좌에서 임의로 돈을 환불한다'와 같은 중대한 처리(파괴적인 처리)라면 어떨까요. AI의 단 한 번의 오판으로 무고한 고객의 계정을 정지해 버리면, 대규모 논란이나 손해배상 문제로 번질 수 있습니다.
그 때문에 프로 개발 현장에서는 AI가 틀렸을 때 발생하는 손해의 크기(인시던트 비용)와 사람이 눈으로 직접 확인하는 데 드는 인건비(리뷰 비용)를 저울질하여 확률의 경계선(임계값)을 계산하여 정해야 합니다. 구체적으로 권장되는 것은 다음과 같은 “3단계 안전망 설계”입니다.
- 초고확률 영역(확신도 0.95 이상 등): Jev가 “절대 틀림없습니다!”라는 강한 확신을 가진 경우에만 인간의 확인 없이 프로그램이 완전 자동으로 처리를 실행합니다.
- 중간 그레이존(확신도 0.60~0.95 등): "아마 맞을 것 같긴 한데, 조금 불안하다" 싶을 때는 무리하게 기계만으로 해결하려 하지 않고, 사람 스태프가 확인하기 위한 화면(확인 큐)으로 작업을 넘깁니다.
- 저확률 영역(확신도 0.60 미만 등): Jev 스스로 "이건 어려워서 잘 모르겠다"며 백기를 든 상태입니다. 여기서는 Jev의 판단을 포기하고, 다소 비용과 시간이 들더라도 월등히 뛰어난 "GPT-5.6 Sol"과 같은 초대형 추론 AI를 호출해 충분한 시간을 들여 생각하게 합니다 (폴백 처리).
이렇게 위험도나 자신감의 정도에 맞춰 바톤터치 체계를 마련해 두는 것이야말로 현명한 어른의 시스템 설계입니다.
4-2. 버전 관리의 함정——‘최신 버전’을 그대로 사용해서는 안 되는 이유
다음으로 주의해야 할 것은 프로그램 내에서 지정하는 “AI 버전 번호”를 다루는 방식입니다. 스마트폰 앱 등에서 흔히 볼 수 있는 “항상 최신 버전으로 자동 업데이트” 설정이 있지만, Jev를 회사의 기간계 시스템에 통합할 때는 “항상 최신 버전을 사용한다(jev-latest라는 편리한 별칭을 사용한다)”는 설정은 절대 금지되어 있습니다.
왜냐하면, Jev의 학습에 사용된 'RLCD'라는 기술은 AI 버전이 조금만 새로워져도 출력되는 '확신도 숫자의 특성'이 미묘하게 달라지기 때문입니다. 예를 들어, 구버전 Jev에서는 '확신도 0.85'라면 거의 완벽하게 정답이었는데, 개발사가 선의로 모델을 업데이트한 결과 신버전에서는 '확신도 0.85'일 때의 정답률이 조금 떨어지는 식의 차이가 발생할 수 있습니다. 만약 시스템이 임의로 최신 버전으로 전환되면, 엔지니어가 공들여 조정한 '0.85 이상이면 자동 실행'이라는 안전 규칙의 의미가 달라져 예상치 못한 오작동이나 시스템 장애(운영 인시던트)를 유발하게 되는 것입니다.
그러므로 실제 운영 시스템을 만들 때는 반드시 "jev-1.13.0"과 같이 어느 시점의 어느 버전을 사용할 것인지 명확히 지정하여 고정(핀 지정)해야 합니다. 그리고 만일 사고가 발생했을 때 원인을 조사할 수 있도록 AI가 반환한 모델 ID 번호를 반드시 매번 감사 로그에 확실히 저장하는 인프라 구성이 필수적입니다.
4-3. Jev의 서툰 점(재기드니스)을 알고, 사람의 손으로 돕기
아무리 뛰어난 도구에도 잘하는 일과 못하는 일이 있습니다. AI의 능력에 울퉁불퉁한 편차가 있어서, 어떤 일은 초인적으로 해내면서도 다른 간단한 일은 전혀 해내지 못하는 현상을 전문 용어로 '재기드니스(Jaggedness)'라고 부릅니다. TypeSafe AI사는 매우 성실한 회사로, Jev 버전 1.13이 가진 약점 명세서(Jev 1.13 Jaggedness)를 숨김없이 공개하고 있습니다. 우리가 Jev를 사용할 때는 이 약점을 미리 이해하고 인간이 지원해 주어야 합니다. 절대로 Jev에게 직접 맡겨서는 안 되는 일은 주로 다음 세 가지입니다.
- 산수나 계산, 숫자 비교: Jev는 덧셈이나 뺄셈, 합계 금액 계산, “매출이 100만 엔 이상인지”와 같은 숫자의 대소 비교에 매우 약합니다. 이러한 계산은 AI에게 맡기는 것이 아니라, 일반적인 프로그래밍 언어(Python이나 JavaScript 등)의 계산 기능으로 빠르게 계산한 뒤, “매출은 100만 엔을 초과했습니다”라는 확정된 결과 문장으로 만들어 Jev에게 전달하는 것이 정답입니다.
- 날짜나 시간의 전후 관계 판정: Jev는 달력의 원리를 깊이 이해하고 있는 것이 아니라 날짜를 그저 문자로 바라보고 있습니다. 그렇기 때문에 "제출 기한이 지났는가?"라든가 "지금은 몇 분기인가?"와 같은 시간의 전후 관계를 판단하게 하면 자잘한 실수를 연발합니다. 날짜의 뺄셈이나 비교도 프로그램 측에서 정확히 계산해 답을 낸 뒤 Jev에게 알려주도록 합시다.
- 선택지 안에 정답이 없을 때의 위험: 이것이 가장 주의해야 할 점입니다. Choice형(선택 문제)으로 Jev에게 질문했을 때, 만약 사람이 준비한 선택지 안에 진짜 정답이 하나도 포함되어 있지 않다면 어떻게 될까요. 놀랍게도 Jev는 "정답이 없습니다"라고 포기하는 것이 아니라, "나열된 틀린 선택지 중에서 가장 그럴듯해 보이는 오답"을 당당하게 골라 버립니다. 이를 막기 위해서는 선택지를 만들 때 반드시 마지막에 "해당 없음(Other / Unknown)"이라는 탈출구 선택지를 하나 추가해 두는 것이 절대로 잊어서는 안 되는 철칙입니다.
4-4. 일본어 및 아시아 언어 사용 시 특별 주의사항
일본에서 살아가는 우리에게는 또 하나 결코 무시할 수 없는 중요한 과제가 있습니다. 그것은 “언어의 벽”입니다. Jev가 처음 학습한 방대한 데이터와 RLCD에서 확률을 조정하기 위한 훈련은 그 대부분이 영어를 중심으로 이루어지고 있습니다. 따라서 일본어를 비롯한 중국어나 한국어(이들을 통틀어 CJK 문자라고 부릅니다)를 다룰 때에는 영어에는 없는 특유의 함정이 존재합니다.
첫 번째 함정은 '토큰 소비량'입니다. AI가 문자를 잘게 분해할 때 영어 단어는 매우 효율적으로 묶이는 반면, 한자나 히라가나 등의 일본어는 잘게 조각난 복잡한 토큰으로 분해되는 경향이 있습니다. 같은 내용을 전달하고 있다고 생각해도 일본어 문장은 영어에 비해 컴퓨터 내부에서 몇 배나 많은 토큰 수를 소비해 버립니다. Jev에는 '1회 요청 전체에서 64,000토큰까지', '상황 설명과 가장 긴 질문을 합쳐 32,000토큰 이내'라는 엄격한 용량 제한이 있습니다. 일본어 장문을 그대로 입력하면 순식간에 이 상한의 벽에 부딪혀 오류가 발생할 위험이 있습니다.
두 번째 함정은 "일본어 특유의 뉘앙스의 어려움"입니다. Jev의 공식 설명서에도 명시되어 있듯이, 일본어 특유의 정중한 경어, 돌려 말하는 표현, 본심을 숨긴 모호한 표현, 그리고 "~가 아니라고는 말할 수 없다"와 같은 이중부정 문장 등은 영어에 비해 판단의 정확도가 눈에 띄게 떨어집니다.
그렇다면 일본 기업은 Jev를 사용할 수 없는 것일까요? 물론 그런 것은 아닙니다. 현명한 우회책이 있습니다. 예를 들어, 고객으로부터 받은 메일 등의 상황 설명(State)은 일본어 그대로 Jev에 읽어 들이면서, AI에 대한 질문이나 판단 기준(Criteria)은 "명확하고 오해의 여지가 없는 표준적인 영어"로 기술하는 현명한 하이브리드 설계를 채택하는 것입니다. 이것만으로도 판단의 편차를 대폭 줄일 수 있습니다. 또한 본격적으로 회사 시스템에 도입하기 전에는 자사가 과거에 수집한 실제 일본어 데이터를 사용해 테스트를 실시하고, Jev가 어느 정도의 확률로 올바른 판단을 내릴 수 있는지를 미리 측정해 보정해 두는 것이 극히 중요합니다.
제5장: 앞으로의 AI는 어떻게 진화할까? 미래 시나리오와 우리가 나아가야 할 길
5-1. 열광에 휩쓸리지 않기 위한 “냉철한 시각”
새로운 기술이 등장하면 세상은 흔히 축제와도 같은 열광에 휩싸입니다. “이것으로 모든 문제가 해결됐다!” “낡은 기술은 내일이라도 전멸한다!” 같은 극단적인 말들이 오가지만, 프로 편집자나 기술자로서 우리는 항상 한 발 물러선 냉정한 리얼리즘(현실적인 시선)을 가져야 합니다.
먼저, Jev의 광고에서 내세우는 “193.6배 고속!”, “비용이 444.6배 저렴!”이라는 화려한 숫자에 대해서입니다. 이는 결코 거짓이 아니지만, 어디까지나 TypeSafe AI사가 직접 마련한 특정 실험 조건에서 가장 차이가 크게 벌어진 순간을 잘라낸 ‘이론상의 상한값’에 가까운 것입니다. 앞서 소개한 제3자의 테스트 결과에서 알 수 있듯이, 실제 일상적인 시스템 운용에서의 속도 향상은 평균적으로 수 배에서 수십 배 정도에 머무는 것이 현실입니다. 물론 수십 배만으로도 역사적인 대진화이지만, 마법처럼 수백 배나 빨라질 것이라고 과도하게 기대하는 것은 금물입니다.
또한, “할루시네이션 제로”라는 홍보 문구도 앞에서 말한 대로 “데이터가 손상되지 않는다”는 의미일 뿐, “답이 절대 틀리지 않는다”는 의미가 아닙니다. Jev라도 틀린 답을 확신에 차서 높은 확률로 선택해 버리는 경우가 있습니다.
그리고 Jev가 안고 있는 가장 큰 구조적 한계는 “왜 그 판단을 내렸는지, 이유를 문장으로 설명해 주지 않는다”는 점입니다. 보통의 대화형 AI라면 “A라는 이유와 B라는 배경이 있기 때문에, 저는 C라는 선택지가 옳다고 판단했습니다”라고 인간이 이해하기 쉽게 설명해 줍니다. 하지만 문장을 쓰는 기능을 버린 Jev는 차갑게 “선택지 C, 확률 95퍼센트”라는 숫자의 데이터만 돌려줍니다. 이래서는 만일 AI가 판단을 잘못해서 큰 사고가 일어났을 때, “왜 AI가 그런 판단을 했는지”를 인간이 나중에 조사하고 납득하기가 매우 어려워집니다. 특히 유럽 등에서 엄격하게 정하고 있는 AI 관련 법률(EU AI법 등)이나, 돈을 다루는 금융, 생명을 맡는 의료, 정의를 지키는 법률처럼 엄격한 설명 책임이 요구되는 분야에서는 Jev만을 단독으로 운용하는 것은 너무나 위험합니다. 모든 판단의 확률 로그를 철저하게 기록하고, 의심스러울 때는 반드시 인간 전문가와 상의하도록 하는 이중 삼중의 안전망(다층 방어 파이프라인) 안에 편입시켜야 비로소 안심하고 사용할 수 있는 도구가 되는 것입니다.
5-2. 세계는 어떻게 움직일까? 예상되는 2가지 미래 시나리오
Jev라는 전혀 새로운 도전자가 등장하면서 세계 AI 업계는 어디로 향하게 될까요. 확실한 것은 단 하나 있습니다. 그것은 “단 하나의 거대한 언어 모델에 처음부터 끝까지 모든 일을 맡기던 시대는 완전히 끝났다”는 것입니다. 앞으로의 컴퓨터 시스템은, 정확하게 짜인 프로그램 코드, 빠르고 직관적으로 판단하는 고속 판단 층(시스템1), 그리고 신중하게 깊이 생각하는 추론과 풍부한 문장 작성을 담당하는 층(시스템2)이라는 세 가지가 조화롭게 손을 맞잡는 형태로 재구축되어 나갈 것입니다.
앞으로 세계의 기술 개발에는 크게 두 가지 미래 시나리오를 생각해 볼 수 있습니다.
- 시나리오 A(새로운 기술의 보급과 표준화): Jev가 개발한 'RLCD'라는 학습 방법과, 문장을 쓰지 않고 순식간에 확률을 반환하는 API(시스템)가 전 세계 업계 표준이 되어 가는 미래입니다. 이를 본 OpenAI나 Anthropic, 혹은 중국 등에서 급성장하고 있는 Qwen 등의 오픈소스(전 세계에 설계도가 무료로 공개된 AI) 커뮤니티가 Jev를 따라 하며 "저희도 초고속 판단 전용 AI를 만들었습니다!"라며 잇달아 뛰어드는 패턴입니다. 만약 이렇게 되면, 전 세계적으로 판단 AI의 가격 파괴와 속도 경쟁이 일어나 모든 앱이 더욱 빠르고 쾌적하게 동작하게 됩니다.
- 시나리오B(오래된 기술의 진화에 의한 흡수): 현재의 작은 언어 모델(소형 LLM)이 맹렬하게 진화하여 Jev의 기술을 삼켜 버리는 미래입니다. 일반적인 문장을 쓰는 AI 내부에서 정해진 형식의 데이터만을 엄청난 속도로 출력시키는 기술(제약 디코딩 등)에 대한 연구가 전 세계적으로 진행되고 있습니다. 만약 일반적인 AI가 문장 생성 능력을 유지한 채 Jev와 같은 수준의 초고속과 초저가격을 달성해 버린다면, 굳이 Jev와 같은 전용 모델을 따로 마련할 필요가 없어질지도 모릅니다.
미래가 시나리오A와 시나리오B 중 어느 쪽으로 흘러가더라도, 단 하나 절대 변하지 않는 진실이 있습니다. 그것은 “애초에 글을 쓸 필요가 없는 뒷단의 판단 처리는 말 많은 생성형 AI로부터 분리해야 한다”는 설계 사상 자체는 이제 두 번 다시 과거로 돌아가지 않으리라는 것입니다. Jev가 그은 이 새로운 경계선은 컴퓨터의 역사에 확고히 새겨졌습니다.
5-3. 내일부터 할 수 있는 '다음 한 수'
이 기사를 끝까지 읽어주신 기술자와 비즈니스 리더 여러분이 내일부터 각자의 현장에서 취해야 할 가장 현명한 '다음 한 수'는 무엇일까요. 그것은 갑자기 회사 시스템 전체를 Jev로 다시 만들려고 하는 것이 아닙니다.
우선, 우리 회사나 서비스 안에서 ‘AI에게 글을 쓰게 하고 있지만, 잘 생각해 보면 이건 예스인지 노인지 고르게 하고 있을 뿐이 아닐까?’ 싶은 곳을 딱 하나만 찾아내는 것입니다. 예를 들어, 매일 아침 대량으로 도착하는 문의 메일을 3개의 담당 부서로 분류하는 작업일지도 모릅니다. 혹은 사용자가 입력한 문장 안에 악의적인 공격용 프로그램(프롬프트 인젝션)이 섞여 있지 않은지 감시하는 첫 번째 보안 체크 관문일지도 모릅니다.
그러한 ‘빈도가 높고, 정형화되어 있으며, 잡담이 필요 없는 작업’을 하나 골랐다면, 과거의 실제 데이터 100건 정도를 모아 테스트 데이터를 만들어 보세요. 그리고 Jev에게 그 100건을 판정하게 해 보고, 돌아온 확신도(Confidence)의 정확성, 걸린 시간, 그리고 청구되는 비용을 지금 사용하고 있는 일반적인 AI와 꼼꼼히 비교해 보는 것입니다. 이 작고 확실한 파일럿 실험(시범 실험)을 직접 실행해 보는 것이야말로 새로운 AI 시대에 뒤처지지 않고 최첨단의 물결을 타기 위한 가장 확실하고 현명한 출발선이 됩니다.
결론
글을 잘 쓰는 AI의 등장으로 시작된 현대의 AI 붐은, 이제 “굳이 글을 쓰지 않는다”는 역전의 발상을 얻으면서 완전히 새로운 성숙의 단계에 접어들었습니다.
쉴 새 없이 떠들어대는 것만이 지능의 증명은 아닙니다. 불필요한 수다는 일절 멈추고, 주어진 질문에 즉각적으로, 정확하게, 그리고 '얼마나 자신 있는지'를 거짓 없이 숫자로 답해 주는 조용한 동반자――그것이야말로 컴퓨터의 깊은 곳에서 수억 번의 통신을 뒷받침하기 위해 세계가 오랫동안 기다려 온 새로운 AI의 모습이었습니다.
물론, Jev와 같은 판단 특화형 AI는 사람의 마음을 울리는 아름다운 시를 써 주지도 않고, 진심 어린 태도로 고민을 들어 주지도 않습니다. 하지만 그런 인간다운 따뜻한 표현을 만들어 내는 거대한 AI를 뒤에서 든든하게 받쳐 주며, 인터넷 세상을 안전하고 빠르고 놀라울 정도로 저렴하게 계속 움직이게 하는 숨은 조력자로서 이보다 든든한 존재는 없습니다.
기술의 진화는 언제나 '덧셈'만으로 이루어지는 것이 아니라, 불필요한 것을 과감히 덜어내는 '뺄셈'의 용기를 통해 예상치 못한 돌파구를 이뤄냅니다. 언어를 버리고 결단을 손에 넣은 AI 'Jev'의 등장은, 우리에게 '진정으로 필요한 기술의 본질이란 무엇인가'를 조용히 묻고 있습니다. 앞으로 컴퓨터의 세계가 어떤 새로운 풍경을 보여줄지, 그 설레는 미래를 꼭 함께 지켜봅시다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 94청크
원문 보기 | 출처: note.com