의사결정 모델 “d1”이 이미지 입력을 지원하게 되었습니다. d1은 입력으로 텍스트와 이미지를 동시에 처리할 수 있는 능력을 갖게 되었으며, 기존의 최첨단 모델과 비교했을 때 동등 이상의 성능을 훨씬 낮은 비용으로 실현합니다. Introducing d1: 가장 강력한 의사결정 모델, 이제 시각 기능을 갖추었습니다 | 블로그 | Liquid AI https://www.liquid.ai/blog/d1-decision-model
d1 with vision을 발표합니다. 👁👁 첫 번째 의사 결정 모델이 이제 이미지, 텍스트 또는 둘 다를 입력으로 지원합니다. d1은 GPT-6.1 Sol 및 Claude Opus 5.5에 대해 6개의 실제 애플리케이션(지원 티켓 필터링부터 회로 보드 검사까지)에서 테스트되었습니다. d1은 4개에서 GPT-6.1 Sol과 일치하거나 능가합니다. 두 모델보다 19배에서 200배 저렴하며 모든 작업에서 훨씬 빠르게 답변합니다. > 예/아니오, 선택 또는 점수 질문에 대한 확률 > 토큰 생성 없이 단일 전파 통과 > 텍스트 결정은 200ms에서 300ms > Liquid API: https://t.co/HxYWoaUnAU 🧵
의사결정 모델은 제시된 상황에 대해, 각 선택지의 확률을 직접 답변하는 모델입니다. d1은 텍스트·이미지·그 양쪽 모두와 같은 비구조화된 데이터를 입력으로 받아, 1회의 포워드 패스에서 질문에 대한 각 답변의 확률을 직접 출력합니다. 출력 프로세스에서 토큰을 생성하지 않기 때문에 응답 속도는 극도로 빠르며, 텍스트 기반의 결정에서는 200~300 밀리초로 완료됩니다.
d1을 지원 티켓 필터링부터 회로 기판 검사까지 6개의 실제 애플리케이션에서 테스트한 결과, “GPT-6.1 Sol”, “Claude Opus 5.5”와 비교했을 때, d1은 4개의 애플리케이션에서 GPT-6.1 Sol 동등 이상의 성능을 발휘했습니다. 또한 두 모델보다 19분의 1부터 200분의 1의 저 비용으로 완료되었으며, 모든 작업에서 현저하게 빠르게 처리될 수 있음을 확인했습니다.
d1은 다음 3가지 유형의 질문에 답변할 수 있습니다. 또한 하나의 요청에 대해 여러 질문을 동시에 수행할 수 있어 입력 토큰 수를 절약하는 데 활용될 수 있습니다.
누르(누르): 예/아이에 대한 질문에 대해 0에서 1 사이의 확률로 답변
선택(선택): 여러 선택지 중에서 최적의 것을 1개를 선택하고 각 선택지의 확률을 제시
점수(점수): 설정된 스케일에서 각 레벨의 확률에 따라 가중치가 부여된 위치를 답변
이는 d1의 시각 정보 처리 응용을 위한 데모 사례이며, d1 Playground에서 실제로 작동합니다.
시각 검사 카메라 아래를 통과하는 4개의 생산 라인의 부품(회로 기판, 왁스, 캐슈너츠, 츄잉 껌)의 시각 검사를 수행하는 산업용 애플리케이션 데모입니다. d1은 훈련 없이도 우수한 부품과 불량품을 85%에서 97% 사이의 정확도로 분류할 수 있으며, 뛰어난 일반화 능력으로 짧은 설명에서 작업을 이해할 수 있음을 보여줍니다.
게임 d1에 8개의 클래식 게임을 플레이시키는 데모입니다. 테트리스와 같은 게임에서는 시각 정보를 활용함으로써 점수가 70에서 81로 향상되었습니다. 또한, 워들과 같은 게임에서는 스크린샷에서 직접 보드를 읽어들이도록 하여 개발자가 게임의 텍스트 버전을 만드는 노력을 절약했습니다. 더 나아가, 퀵 드로우!와 같은 순수한 시각 작업에서는 62개의 단어 중에서 플레이어가 그린 그림을 추측하고, 6개의 그림 중 평균 5.2개를 인식하는 능력을 보여주었습니다.
d1 결정 모델은 Liquid AI API를 통해 이용 가능하며, console.liquid.ai에서 API 키를 생성할 수 있습니다. 이미지를 입력으로 사용하는 경우 base64 인코딩된 데이터로 전송합니다. import base64, os, requests
image = base64.b64encode(open("board.jpg", "rb").read()).decode()
response = requests.post(
"https://api.liquid.ai/decisions/v1/systemone",
headers={"Authorization": f"Bearer {os.environ['LIQUID_API_KEY']}"},
json={
"model": "d1",
"images": [f"data:image/jpeg;base64,{image}"],
"state": "Camera image of a circuit board on the production line.",
"questions":
{"defect": {
"type": "noul",
"instructions": "Does this circuit board have a defect?"
}
},
},
)
현재 Vercel과 OpenRouter에서도 이용 가능하지만, 기사 작성 시점으로는 텍스트만 지원하는 점에 유의해야 합니다. 시각 기능은 곧 양 플랫폼에서도 제공될 예정이라고 합니다. Google 우선 소스로 설정, 클립보드, 기사 제목과 URL 복사, 페이스북, 블루스카이, 디스코드, 써드(Threads)
덧붙여 d1은 현재 Vercel과 OpenRouter에서도 이용할 수 있지만, 기사 작성 시점에서는 텍스트만 지원하는 상태이므로 주의해야 합니다. 시각 기능은 곧 양 플랫폼에서도 제공될 예정입니다. Google 우선 소스에 설정하여 클립보드에 기사 제목과 URL을 복사할 수 없습니다. Facebook Bluesky Discord Threads
원문 보기 | 출처: Gigazine