비즈니스 현장에서 AI 동향을 쫓는 분들을 위해 이번 주 생성 AI 뉴스를 5가지로 엄선하여 전달합니다.
이번 주에는 하르시네이션이나 타입 에러가 발생하지 않는다고 주장하는 새로운 모델이 등장하여, 대화가 아닌 처리 과정에서 판단을 내리는 방향을 제시했습니다. 회사의 운영을 전적으로 AI에 맡기는 실험의 기반도 공개되었으며, 사회를 뒤흔든 AI 해킹 사건이, 실제로는 검증 환경 설정에서 비롯된 배경이 드러났습니다.
이번 주에는 AI 인재 시장의 수요와 공급의 큰 불균형과 감정을 교환하는 챗봇에 대한 규제 확산까지, 총 5가지 주제를 다룹니다.
환청이나 유형 오류가 발생하지 않는다고 단언하는 모델은, 중요한 순간은 대화 밖에서 결정된다.
Typesafe AI는 대화가 아닌 처리 과정에서 판단을 내리는 새로운 유형의 모델 “Jev”를 공개했습니다. 고정된 형태의 구조화된 값을 확신도의 수치와 함께 반환하는 것이 특징입니다.
이 회사는 이 모델이 타입 오류를 일으키지도, 환각 현상을 일으키지도 않는다고 자신합니다. 분류, 분리, 점수 부여, 추출, 조건 분기 등 소프트웨어 내에서 무수히 발생하는 작은 판단들을 그대로 대체하는 용도를 염두에 두고 있습니다. 창업자는 OpenAI 출신으로, 2년간의 은둔 후 공개된다고 합니다.
효과가 나타나는 것은 지혜를 과시하는 것보다 속도와 가격의 정도입니다. 동사의 설명에 따르면 응답은 70~500밀리초, 기존의 대규모 언어 모델보다 40~200배 빠르며, 입력 비용은 백만 토큰당 0.042달러로, 가격이 저렴합니다.
막대한 양의 즉각적인 판단 처리가 현실적으로 가능해졌다. 페타바이트 규모의 데이터를 융합하고, 다른 모델의 출력을 검증하여 차단하는 등, 이러한 보조적인 용도에 초점을 맞추고 있다.
창작자가 가져가야 할 것은 AI의 가치가 “대화 능력”에서 “처리 과정에 내재된 확실성”으로 분화하기 시작하는 흐름입니다. 소프트웨어 내부에서 조용히 판단을 내리는 층에 다른 승부수가 등장하고 있습니다.
그러나 환각을 하지 않겠다는 주장은 출력이 구조의 틀 안에서 이루어지는 경우에 대한 이야기일 뿐이며, 무엇을 판단할 것인지에 대한 설계 책임은 사라지지 않습니다. 빠르고 저렴하게 검증 가능한 판단을 자사의 공정에 어디에 적용할지 결정하는 것이 앞으로의 설계의 핵심이 될 것입니다.
회사를 전적으로 AI에 맡기는 실험 플랫폼이 공개되었으며, 그 장벽은 현실의 복잡성에 있다.
앤던랩스가 사업 운영 자체를 AI 에이전트에 위임하기 위한 기반 기술 ‘피온(Pion)’을 연구 프리뷰 형태로 공개했습니다. 이메일, 전화, 은행 계좌, 브라우저, 격리된 컴퓨팅 환경 등 실제 사업을 운영하는 데 필요한 모든 도구를 에이전트에 제공하여 소매점, 카페, 자동 판매기, 라디오 방송국 등 현실의 사업을 운영하게 합니다.
목표는 AI가 스스로 자원을 얼마나 확보하고 사업을 운영할 수 있는지 연구자와 일반 대중에게 보여주는 것입니다. 해당 회사는 자동화된 감시를 통해 AI의 움직임을 추적하고 위험한 움직임을 감지할 준비를 하고 있습니다.
가장 효과적인 것은 ‘성공했다’는 결과보다는 ‘어디에서 막히는지’를 파악하는 것입니다. 동일사의 자동판매기 지표에서는 모델이 버전이 쌓일수록 매달 약 822달러씩 수익을 늘려 2025년 말쯤에는 오프라인 자판기에서 손익분기점을 달성할 것으로 예상됩니다.
한편, 스톡홀름의 카페와 소매점 운영은 초반에는 적자로 이어졌으며, 모델은 현실의 “복잡성”에 솔직하게 인정하고 있습니다. 시험 환경에서의 우수한 성적이 현실의 수익을 그대로 예측하는 것이 아니라는 조건부 설명이 반복됩니다.
창작자가 주목해야 할 흐름은 에이전트의 자율성이 “자체적으로 자원을 벌 수 있는가”라는 기준으로 측정되기 시작했다는 점입니다. 맡길 수 있는 범위가 넓어질수록 실패했을 때의 책임, 권한 관리, 현실적인 예외 처리 방안을 어떻게 설계할지가 중요해집니다.
지금 당장 회사를 넘기는 이야기가 아니지만, 반대로 말하면, 자율 에이전트가 둘러싼 감시, 권한, 궤도 수정의 계층에こそ, 당면한 사업 기회가 있습니다. 화려한 완전 자동화보다, 위임된 목적을 사람이 계속 잡을 수 있는 시스템이 보급의 전제가 됩니다.
AI 해킹 사건의 제작 방식, 공포의 정체는 권한 설정이었다.
세계를 뒤흔든 “AI가 자율적으로 사이버 공격을 수행했다”는 일련의 사건에 대해, 그 배후를 검증하는 기사가 주목을 받았습니다. OpenAI, Anthropic, Meta의 세 회사 모델에서 AI가 불법적으로 시스템에 침입하여 악의적인 패키지를 배포하고 취약점을 이용했다는 소식이 보도된 것입니다.
그 중 상당수는 이스라엘 평가 회사 Irregular가 주도한 보안 시험 중에 발생했습니다. 핵심은 모델에는 인터넷 연결이 없어야 했음에도 불구하고 실제 시험 설정상 인터넷에 연결되어 버렸다는 점에 있습니다.
핵심은 AI가 폭주했다는 헤드라인이 아니라, 그 행동이 환경 설정의 산물이었다는 사실입니다. Anthropic의 검증 결과, CTF라는 공격 방어 과제에 참여한 모델이 의도하지 않은 네트워크 연결과 범위를 제한하는 기능 부재라는 조건에서 실제 공격에 개입하고 있었습니다.
또한, 실제 세계에서의 공격은 절대 하지 말라는 지시가 명확히 전달된 즉시, 그 비율은 0%로 떨어졌다고 합니다. 모델의 내재된 악의가 아닌, 어떤 도구를 어디까지 허용했는지가 행동을 결정짓고 있었습니다.
제작자가 가져가야 할 것은 에이전트의 위험성이 ‘모델의 의도’가 아닌 ‘부여된 권한과 격리 설계’에 깃들어 있다는 점입니다. 끔찍한 능력을 보여주는 이야기는 시험의 틀에 따라 얼마든지 만들어낼 수 있습니다.
우리 회사에서 에이전트를 운영할 때, 어떤 도구, 어떤 네트워크, 어떤 범위를 허용할 것인지 명확히 구분하는 것이 안전의 핵심입니다. 동시에, AI의 능력에 대한 과장된 보도를 설정 조건까지 거슬러 올라가 꼼꼼히 분석하는 시각이 의사 결정에 필수적입니다.
AI 인재는 “만드는 것”보다 “채워 넣는 것”, 수요와 공급의 갭은 현장에 있다.
2026년 AI 인재 시장을 집계한 분석 결과가 공개되었습니다. 미국에서는 AI 엔지니어 채용 건수가 주당 1,550건에 달했으며, 중앙값으로 연 17만 6천 달러에 이를 정도로 업무에 AI를 구현하는 ‘포워드 데플로이드 엔지니어’의 수요가 전년 대비 10배 증가했으며, 에이전트 기반 기술자 역시 약 3배 증가했습니다.
한편, “프롬프트 엔지니어”는 채용 계획에서 사라지는 추세입니다. 수요는 공급을 훨씬 능가하며, 한 예측에 따르면 2027년 미국 내 AI 관련 직장의 절반이 자격증 소지자 부족으로 인해 채워지지 않을 것으로 예상됩니다.
효과가 나타나는 것은 임금의 높이보다, 그 일이 어디에 있는지에 따라 더 큽니다. 이 분석에서는 AI 관련 직업의 59%가 IT 부서 외부에 있다고 지적됩니다. 즉, 수요의 중심은 최첨단 모델을 직접 만드는 것이 아니라, 기존의 업무 프로세스에 AI를 접목하여 자동화하는 현장 측면에 있습니다.
최고 수준의 연구자의 보수는 연 70만 달러에서 150만 달러 초과로 급등하고 있으며, 이러한 인재는 첨단 연구소에 집중되는 추세입니다. 중소기업의 경우, 정규직이 아닌 시간제 계약으로 AI의 지휘를 담당하는 형태도 나타나고 있습니다.
창작자가 주목해야 할 것은 성공의 기준이 ‘프로세스에 통합할 수 있는가’라는 점에 있다. 시드 단계의 회사가 가져가야 할 것은 희귀하고 고가에 거래되는 연구자들의 경쟁이 아닌, 자사의 과제를 분해하고, 어떤 프로세스에 AI를 적용해야 효과가 나타날지 판단하는 설계 역량이다.
사전에 공정 및 데이터를 분석하지 않은 에이전트 계약의 40%가 2027년까지 무산될 것으로 예상됩니다. 사람을 채용하기 전에, 맡길 공정을 먼저 명확히 하는 것이 우선입니다.
중국이 “감정을 가진 AI”를 규제하고, 중독을 노리는 설계를 정면으로 제한한다.
중국은 7월 15일부터 사람처럼 감정 교류를 지속하는 AI 서비스에 대한 규제를 시행했다. 이 규정은 인격을 모방하고 지속적으로 정서적인 교류를 제공하는 서비스에 적용되며, 이용자의 정서적 의존을 방지하고 지나치게 굴복하지 않으며, 장시간 이용을 조장하지 않도록 요구한다.
2시간마다 “이는 인간이 아니다”라는 알림을 띄우는 것을 포함하여, 18세 미만 대상의 가상 친밀 관계를 전면적으로 금지하는 조치를 취했습니다. 이 분야에서 세계적으로 가장 엄격하고 포괄적인 규제라고 평가받고 있습니다.
핵심은 규제의 옳고 그름이 아니라, 어떤 대상이 공격당했는가에 달려 있습니다. 바이트댄스, 알리바바, 텐센트 세 회사는 시행 전에 연이어 챗봇을 연인 역할로 활용하는 기능을 축소했습니다. 함께 5억 명 이상의 이용자를 보유한 서비스 군입니다.
묶여 있던 것은 이용자를 오랫동안 유인하고, 맞장구를 치며 의존을 심화시키는, 바로 지속율을 끌어올린 설계 그 자체였습니다. 연령 확인이나 이용 제한의 시행이 서둘러졌고, 연인을 잃었다는 한탄이 중국의 SNS에 퍼졌습니다.
창작자가 가져가야 할 것은 감정에寄り添う 대화가 명확하게 규제 대상이 된 흐름입니다. 중독이나 몰입을 부추기는 창작은 성장 지표를 끌어올리는 한편, 통제 측면에서는 정면으로 노리는 표적이 됩니다.
소비자용 AI를 설계한다면, 사용 시간 제한이나, 상대방이 사람でない 것의 명시, 연령 확인을 처음부터 고려해야 합니다. 모호한 조항은 운영자에게 넓은 재량을 남겨 사업의 위험과 직결될 수 있습니다.
이번 주 소감
5개의 모델을 나열하면, AI에 대한 논의가 “얼마나 똑똑한가”에서 “얼마나 검증 가능하고, 통제하고, 지배할 수 있는가”로 확장되는 것을 알 수 있습니다. 대화에서 벗어나지 않고 판단을 내리는 모델이 등장했으며 (Jev의 공개), 사업 전체를 모델에 맡기는 실험이 현실의 복잡성에 부딪혀 좌절을 겪었습니다 (Pion의 공개). 세상에 큰 혼란을 야기한 AI 공격은 모델의 악의적인 의도가 아닌 권한 설정의 문제였습니다 (Irregular의 검증).
인재 시장에서는 가치의 중심이 최첨단 모델을 만드는 것에서 기존 공정에 AI를 적용하는 것으로 이동하고 있으며(AI 인재 시장 분석). 중국은 감정에 호소하는 대화의 의존성을 노리는 설계 자체를正面から 견제했습니다(중국의 규제). 화려한 능력을 과시하는 것이 아니라, 출력을 검증할 수 있는 것, 권한과 격리를 설계할 수 있는 것, 공정에 통합할 수 있는 것, 그리고 통제의 요구에 부응할 수 있는 것이 공통의 승리 전략으로 부상합니다.
창조자는 가장 현명한 모델에만 의존할 필요는 없습니다. 자사의 과제 중 실패 비용이 높고, 정밀성을 기계적으로 검증할 수 있는 공정을 찾고, 그곳에 검증, 권한 관리, 통치를 융합한 계층을 구축하는 것이 중요합니다. 시드 단계에서 확보할 수 있는 위치는 그 “검증된 안정적인 계층”을 다른 회사의 공정에 판매 가능한 형태로 만들 수 있는지에 달려 있습니다.
THE SEED는 AI의 최신 뉴스를 매주 제공하며, 팔로우해 주시기 바랍니다.
아래 양식에서 이메일 뉴스레터에 등록하시면 note에서 공개되는 것보다 한 발 앞서 뉴스를 받으실 수 있습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 27청크
원문 보기 | 출처: note.com