# 최첨단 AI 모델이 출시 후 은밀하게 성능 저하 여부를 감지하기 위한 벤치마크 “livenerf”

> https://bookfactory.kr/board/news/19888
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-03T23:13:11.437Z

---

한 번 출시된 AI 모델의 성능이 영원히 변하지 않는다고 생각하는 사람들도 있을 수 있지만, 과거에는 출시 후 AI 모델의 성능이 저하된 사례가 수시로 보고되었습니다. 그러한 출시 후 AI 모델이 은밀하게 성능이 저하되었는지 감지하기 위한 벤치마크가 “livenerf”입니다. GitHub - ninjahawk/livenerf: 출시 후 모델 능력 추적을 위한 벤치마크. · GitHub https://github.com/ninjahawk/livenerf

AI 모델은 한 번 출시된 후에도 세세한 변경이 적용되는 경우가 있으며, 같은 이름의 AI 모델이라도 시간이 지나면서 성능이나 출력 경향이 변화할 수 있습니다. 실제로 2023년에는 OpenAI의 GPT-4에 3월과 6月にそれぞれ同じ 작업을 주었을 때, 여러 작업에서 6월이 훨씬 더 크게 정확도가 떨어지는 현상이 보고되었습니다. 특히 “17077은 소수ですか?”라는 단순한 질문에 대한 답변 정확도는 3월의 97.6%에서 6월에는 2.4%로 감소한 것으로 나타났습니다. 또한, 2026년 1월에는 Anthropic의 Claude Code Opus 4.5가 저하되고 있다는 보고가 있었으며,同年 4월에는 Anthropic이 “2026년 3월 4일부터 2026년 4월 20일까지 Claude Code, Claude Agent SDK, Claude Cowork의 성능이 저하되었었다”는 조사 결과를 보고했습니다. Claude의 품질이 저하되는 문제에 대해 Anthropic이 조사 결과를 보고, 사용자에게는 이용 제한을 리셋하도록 안내했습니다 - GIGAZINE

AI 사용자로부터 “AI 모델의 성능이 저하되었다”는 지적이 접수되어 실행 부하를 완화하는 양자화, AI 모델의 소형화, 사고량(effort)의 감소, 라우팅의 변경을 고려할 수 있습니다. 반면, 실제로는 AI 모델의 성능에 변화가 없지만, AI를 숙련된 사용자가 부정적인 부분에만 주목하게 되면서 성능이 저하되었다고 오인할 가능성도 있습니다. 이에 대해, 노스캐롤라이나 대학교에서 AI에 대해 연구하고 있는 네이썬 랭글리는 AI 모델이 출시 후 악화되는지 여부를 측정하는 벤치마크로 livenerf를 개발했습니다. 랭글리 교수는 AI 모델의 출시일로부터 지속적으로 깨끗한 테스트 데이터를 수집 및 공개함으로써, 실제로 AI 모델이 저하되었는지 여부를 객관적으로 논의할 수 있다고 주장합니다. livenerf는 영국 AI 보안 연구소(AISI)가 오픈 소스에서 공개하고 있는 평가 프레임워크 Inspect를 기반으로 구축되어 있습니다. 이미 livenerf는 2026년 9월 22일에 출시된 Claude Opus 5.5를 대상으로 실행되고 있으며, 기사 작성 시점에서는 9월 24일부터 30일까지 7일 분의 데이터가 축적되었습니다. 아래 그래프는 livenerf에 포함된 4개의 테스트에서 Claude Opus 5.5의 정답률을 나타낸 것으로, 옅은 회색은 “항상 정답”, 파란색은 “정답일 수도 오답일 수도 있음”, 짙은 회색은 “항상 오답”입니다. 또한, AI 모델에 설정된 안전 장치에 의해 일부 생물학 및 수학 문제에 대한 답변이 거부되었기 때문에, 해당 데이터는 비어 있습니다.

리베너프(Livenerf)는 항상 정답 또는 오답하는 문제에만 집중하는 것이 아니라, 정답하는 경우도 있고 오답하는 경우도 있는 문제에 초점을 맞추어 AI 모델의 성능을 추적합니다. 클로드 오퍼스 5.5의 경우 78문제가 이에 해당하며, 그 답변 정확도는 대략 50% 근처라는 보고입니다. 아래 그래프는 클로드 오퍼스 5.5가 정답하는 경우도 있고 오답하는 경우도 있는 78문제의 정답률을 9월 24일 ~ 9월 30일 기간 동안 보여줍니다. 날짜에 따라 상하하는 모습이지만, 일정한 범위에 묵주(묵주)에 맴돌고 있는 것처럼 보입니다.

livenerf는 출시 후 10일간의 평균을 기준으로, 그 이후 10일간의 평균을 추적하고 있다고 합니다. 또한, livenerf는 구독 서비스를 통해 제공되는 Claude Opus 5.5에서 실행되고 있으며, 원시 API 모델과는 다르다고 합니다. “livenerf”는 소셜 뉴스 사이트인 Hacker News에서도 화제가 되고 있습니다. Livenerf: Has Opus 5.5 been nerfed yet? | Hacker News https://news.ycombinator.com/item?id=49901736 과거에 챗 앱 개발에 참여했던 사용자는 GPU부터 챗 인터페이스까지 모든 요소를 완전히 제어했으며, 아무런 변경도 이루어지지 않았음에도 불구하고 사용자들로부터 “성능이 저하되었다”는 불만이 제기된 적이 있다고 밝혔습니다. “체감 성능은 실제 성능과 기대치의 차이이며, 후자는 시간의 흐름에 따라 지속적으로 향상되고 있는 것입니다.”라고 언급했습니다.

[원문 보기](https://gigazine.net/news/20261001-livenerf-benchmark-ai-capability-after-release/) | 출처: Gigazine