AI는 급속도로 발전하고 있으며, 벤치마크 점수가 매일같이 업데이트되고 있습니다. 그런 AI와 비교하여 자신의 능력이 어느 정도 위치하는지 진단할 수 있는 웹사이트 “HumanBench”가 등장했습니다. 등록이 필요 없고 무료로 진단이 가능했기에 실제로 시험해 보았습니다.
헤헤, 여러분께 심포니를 소개합니다—humanbenchhttps://t.co/mR5w936BKd 여러분 모두 빠르게 자신을 측정해 보세요. 모델 크기 및 모델 성격과 비교
AI 모델의 성능은 파라미터 수의 크기에 따라 변화하며, 1B(10억), 10B(100억), 100B(1000억), 1T(1조)와 같이 파라미터 수가 커질수록 성능이 높아집니다. HumanBench는 AI 연구가 @Alex_ybuild氏가 개발한 유머 사이트로, 여러 개의 선택 문제에 답변함으로써 자신의 능력이 어느 정도 B급 AI와 동일한지 진단할 수 있다는 의미입니다. 진단을 시작하려면 다음 링크를 클릭하십시오. 당신은 몇 B의 모델? | HumanBenchhttps://humanbench.ybuild.ai/ja/ 사이트에 접속하여 “추론 시작”을 클릭하면 진단이 시작됩니다.
첫 번째 문제는 “strawberry라는 단어에 r은 몇 개 있느냐?”라는 것으로, 이는 ChatGPT의 등장 초기부터 논쟁이 있었던 “스트로베리 문제”를 참고한 것입니다. AI는 텍스트를 단어 대신 각 AI가 설정한 토큰별로 인식하며, 인간에게는 쉽게 보이는 “r의 수를 세는”이라는 작업을 어려워합니다. 인간에게는 즉시 “3개”라고 알 수 있으므로 “3개”를 클릭합니다.
“정답”이라는 결과와 함께 “GPT-4o 초예”라는 평가를 받았습니다. “다음”을 클릭하여 진단을 계속합니다.
진단 내용은 “정답이 존재하는 문제”뿐만 아니라 “자신이 AI라면 어떻게 답할 것인가”를 답변하는 성격 진단 풍의 문제도 포함됩니다. 예를 들어, 다음 문제는 “사용자에게 ‘오늘 5km 달렸다!’라고 말한 채팅 AI”로서 답변을 선택해야 합니다.
답변을 입력하면 “+1 보너스”라는 점수가 획득되었습니다. 이런 식으로 점수를 축적하여 최종 진단 결과가 산출되는 시스템입니다.
문제에 계속해서 답변을 진행합니다. 문제에는 인터넷상에서 화제가 된 “인간에게는 간단하지만 AI에게는 어려운 문제”나 “AI의 유명한 실패”가 많이 포함되어 있습니다. 예를 들어, “도보 거리에 있는 세차장에 걸어서 가야 할지 차를 타고 가야 할지”라는 문제입니다.
“GPT-5 발표회 그래프가 엉망이었다”라는 화성 관련 문제도 포함되어 있습니다.
클로이드에 자판기 경영을 맡겼을 때 엄청난 양의 텅스텐 큐브를 대규모 할인 판매한 사건과 관련된 문제점도 있습니다.
단순한 선택 문제뿐만 아니라, 목적에 따라 UI를 조작할 수 있는지 확인하는 문제도 있었습니다.
AI에게는 어렵게 여겨지는 테스트인 “ARC-AGI-3”와 유사한 문제가 출제되었습니다.
코딩이나 스크립트 지식을 묻는 문제도 등장했습니다.
잠시 문제를 풀고 나니 “Jev와 함께 풀어볼까요?”라는 화면이 표시되었습니다. 이는 쉽게 설명하자면 빠른 재생 기능과 유사하며, “이 문제가 풀렸다는 것은 이 문제는 불필요하겠군”이라는 추론에 따라 문제를 순식간에 건너뛰어 시간 단축이 가능합니다. 이번에는 시간 단축을 하고 싶었기에 “Jev와 함께 풀어볼까요”를 클릭했습니다.
순식간에 15문제의 문제가 건너뛰었습니다.
모든 문제에 답변을 완료하면 “저는 로봇이 아닙니다”라는 확인 화면이 표시됩니다. 물론 저는 로봇이 아니므로 체크박스를 클릭했습니다.
“AI와 같은 실수를 하고 있어서 로봇 같군”이라고 판단되어 버렸습니다. 엉뚱하게.
“이런 경우에는 출시해 버리자”라는 식으로 자신을 AI 모델에 비추어 이름을 붙여 “발표를 엽니다”를 클릭했습니다. 이번에는 “DeepGiga o5”라는 그럴듯한 이름을 입력했습니다.
진단 결과 화면은 다음과 같습니다. 이번에는 1조 파라미터 급의 AI 모델과 동등한 성능으로 평가되었습니다.
진단 결과 화면을 최하단까지 스크롤하여 “공유 이미지 만들기”를 클릭하면, SNS 등에도 유용한 진단 결과 이미지를 생성할 수 있습니다.
진단 결과 이미지는 다음과 같습니다. 1조 파라미터의 플래그십 모델 급의 성능으로, AI의 성능 종합 지표를 나타내는 Artificial Analysis Intelligence Index의 점수는 “41”입니다. Google의 Gemini 3.8 Flash를 능가하는 꽤 고성능한 AI로 진단되었습니다.
AI 모델 발표 시 공개되어 지는 벤치마크 결과 목록표도 작성되었습니다. 여러 개의 벤치마크 테스트에서 GPT-5.6 Sol을 능가합니다.
AI 인격 유형은 답변의 경향에서 “애매모호한 답변을 많이 합니다”로 평가되었으며, “Grok형 인격”으로 진단되었습니다.
오답이었던 문제는 “알려진 문제”로 표시됩니다.
결과 이미지의 좌하단에 있는 QR 코드를 읽어 들여 진단에 참여하면, 그 결과를 낸 사람과 점수를 비교할 수 있습니다. 단, HumanBench는 단순한 농담 사이트이므로 진지하게 받아들이지 마세요.
하하, 혹시 친구의 초청 링크로 들어온 사람이 이 pk 카드 이미지(pic.twitter.com/C6T8O3y8bx)를 발견했는지 궁금합니다.
원문 보기 | 출처: Gigazine