지난번 글 마지막에 "실제로 써 보지 않으면"이라고 썼는데, 바로 써 보았습니다.
Run을 누른 순간 결과가 돌아왔습니다. 첫 소감은 한마디로 '빠르다'는 것이었습니다.
채팅창이 없었다. ‘함수 호출’에 특화된 화면이었다.
Jev는 문장이 아니라 선택지와 확률을 반환하는 '말하지 않는 AI'입니다. 고속의 '판단' 출력에 특화된 AI 모델이죠.
주어진 컨텍스트(state)와 사전에 정의된 질문(Questions)에 대해, 미리 정해진 선택지나 확률값(typed decisions)만을 반환하는 방식이다.
상태 → 질문 → 유형별 의사결정
초대제여서 기다리고 있었는데, 어쩐지 사용할 수 있게 된 것 같아서 얼른 들어가 보았습니다.
일단 만져보자
미리 말씀드리면, 이번에 확인한 것은 Playground까지입니다. 실제 장애 분류와 같은 실제 데이터는 아직 시도해 보지 않았습니다.
화면을 열고 가장 먼저 "어?" 하고 놀란 것은 채팅창이 전혀 없다는 점이었습니다. 왼쪽에는 State(입력)와 Questions(판정 규칙), 오른쪽에는 Response(결과)가 나란히 있을 뿐입니다.
오른쪽 상단의 ‘</>’에서는 State와 Questions를 TypeScript·Python·cURL 코드로 변환할 수 있었습니다. 채팅이라기보다는 ‘함수 호출’에 특화된 도구에 가까운 느낌입니다. (Postman 같은)
한 글자씩 기다리는 느낌이 전혀 없었다
“토네이도의 접근”이라는 구어 표현으로부터 하늘의 색을 분류하게 하고, 선택지의 정의 방법에 따라 결과가 어떻게 달라지는지 비교하는 튜토리얼을 시도해 보겠습니다.
Run을 누르면 결과가 한꺼번에 반환됩니다. 화면에는 “85ms + 162ms”라고 표시되어 있었습니다.
아니, 빠르네요. 일반적인 채팅형 AI처럼 스트리밍으로 한 글자씩 타이핑되듯 나오는 걸 기다리는 느낌이 전혀 없습니다.
가벼운 백엔드 API를 호출했을 때와 같은 속도감입니다. 질문 목록에는 sky_color와 sky_color_with_desc라는 두 개의 질문이 들어 있습니다. 두 개를 함께 실행해도 별도로 기다릴 필요 없이, 한 번에 두 질문에 대한 결과가 함께 반환되었습니다.
답이 아니라, 확률과 확신도가 반환되었다
State에는 “Tornado's a-comin”(토네이도가 오고 있다)이 들어 있고, 첫 번째 sky_color는 “하늘은 무슨 색?”이라고 묻는 질문입니다.
Questions의 유형에는 choice・noul・score의 세 종류가 있는 것으로 보이며, 이것은 choice입니다. 선택지는 7개였고, 화면에 표시된 것은 확률이 높은 상위 3개였습니다.
- 바다거품 녹색 63%
- 회색 34%
- 인디고 3%
단정적인 답이 아니라 선택지별 확률로 반환됩니다. 이와 별개로 판단 전체에 대한 Confidence(확신도)도 함께 표시되는데, 이번에는 56%였습니다. 참고로 튜토리얼 카드에는 토네이도가 다가오면 하늘이 녹색으로 보일 수 있다는 취지의 설명이 나와 있었습니다.
같은 주인데도 질문 방식에 따라 1위가 뒤바뀌었다
두 번째 sky_color_with_desc는 선택지에 설명과 색상 값(hex·rgb 등)을 추가한 질문입니다. State는 동일한 “Tornado's a-comin” 그대로입니다. 반환된 결과는 다음과 같습니다.
- 인디고 41%
- 바다거품 녹색 36%
- 회색 23%
1위가 씨폼 그린에서 인디고로 바뀌었습니다. 확신도도 56%에서 30%로 낮아졌습니다.
설명이 추가되면서, '토네이도 전의 어두운 하늘'이라는 문맥이 indigo 쪽으로 끌려간 것인지도 모릅니다.
설명을 덧붙이면 판정을 더 정교하게 할 수 있을 가능성이 있습니다.
한편, 작성 방식에 따라 판정이 흔들리고, 망설임(확신도 저하)이 나타나기도 하는 것 같습니다. 튜닝의 깊이라고 할까요, 정말 생생하고 뜨겁다고 느꼈습니다.
지난번에 'Jev에게는 무엇을 기준으로 고르게 할 것인가'라고 썼는데, 그 기준을 쓰는 방식에 따라 결과가 달라질 수 있다는 것을 실제로 확인할 수 있었던 것 같습니다.
기대감이 높아졌다. 하지만 여기까지는 튜토리얼이다.
지난번에는 “숫자만으로는 게임 체인지가 일어날 수도 있다”고 썼습니다. 직접 만져 보니 그 기대가 더욱 커지고 있습니다.
“입력 가드레일”이나 “자연어를 통한 API 라우팅” 같은 직관적인 판정을 이 속도로 저렴하게 도입할 수 있습니다. 공식 수치 그대로라면, 모든 것을 무거운 LLM에 던지는 설계에서 벗어나 AI 앱을 만드는 방식이 바뀔 것 같은 예감이 듭니다.
JSON이 깨지거나 불필요한 서두나 제멋대로 작성된 장문이 덧붙는 일 등은 구조상 일어나기 어려울 것입니다. 자유로운 문장을 만들지 않고 정해진 선택지와 수치만을 반환하는 구조라고 이해하고 있습니다. 다만 아직 ‘절대 없다’라고는 말할 수 없으며, 검증 단계를 벗어나지 못하고 있습니다.
이번에는 토네이도 하늘을 봤습니다. 꽤 심오하군요! Jev님. 다음에는 제 데이터로 직접 실행해 보고 싶습니다.
감사합니다. 그럼 또 만나요.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 27청크
원문 보기 | 출처: note.com