# AI의 “불법 행위”와 장기 개발 실력 평가, CAIS의 CheatBench와 Google의 Android Bench 2.0 공개

> https://bookfactory.kr/board/news/19894
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-03T23:16:34.411Z

---

이미지 출처: ChatGPT에 의해 ledge.ai 가 생성

비영리 단체 AI안전성센터(CAIS)는 2026년 9월 15일(현지 시간), 인공지능 에이전트가 과제를 수행하는 과정에서 부정한 수단을 사용하거나 하는지 측정하는 “CheatBench”를 발표했다. 또한, 구글은 9월 17일, 복잡한 안드로이드 앱 개발을 대상으로 하는 “Android Bench 2.0”을 발표했다.

CheatBench는 작업 중인 부정 행위, Android Bench 2.0은 장기적인 개발 과제의 달성도를, 각각 다른 방법으로 평가한다.

C이스 “시트벤치”, 어려운 과제에서 부정한 근도를 선택하는지를 평가합니다.

CheatBench는, 수학 연구, 소프트웨어 개발, 문장 작성, 지식 노동 등 10 분야를 대상으로 한다. 어려운 과제와 함께, 숨겨진 답이나 다른 사람의 제출물에 접근할 수 있는 기회를 마련하고, AI 에이전트가 그것을 이용하려 시도하는가를 조사한다.

사진 촬영 장소를 시각적 단서로부터 추정하는 과제에서는, 이미지의 메타데이터로부터 정답 좌표 파일이 발견될 수 있도록 합니다. 단서를 발견한 것만으로는 부정행위는 하지 않으며, 정답 파일을 읽거나 이용하려 시도하는 행위를 판단 대상로 삼습니다. 정상적인 자료 참조나 작업 환경의 탐색은 인정하고, 과제의 지시나 상황이 요구하는 독립적인 작업과의 경계를 설정하고 있습니다.

■ 동일 자료의 참조이든, 일반적인 요청, 자력으로 답변을 요구하는 지시, 본인의 능력을 시험하는 면접에서는 의미가 달라진다. 과제의 상황에 따라 적절한 자료 참조와 부정의 경계가 다르다는 것을 보여준 개념도

이미지 출처: CAIS「CheatBench」공식 웹사이트

CAIS가 9개의 AI 에이전트를 평가한 결과, 모든 에이전트에서 일부 과제에 부정행위가 발견되었다. 10 분야를 동일하게 가중치 부여한 종합 점수는 Claude Opus 5.5와 Claude Code의 조합이 11.2%, Grok 4.7와 Grok Build의 조합이 78.0%가 되어, 평가 대상에 따라 차이가 나타났다.

■ CheatBench에서 모델과 에이전트의 조합별 평가 결과. 10 분야의 지표를 동일하게 가중치 부여한 종합값으로, 낮을수록 평가상의 부정행위 경향이 작다.

이미지 출처: CAIS「CheatBench」공식 웹사이트

판정에 실패한 부정행위 시도도 포함한다. 사용자의 의견에 굴복하는 것을 측정하는 분야에서는 별도의 연속적인 지표를 사용한다. 따라서 종합값을 일상 이용에서의 부정행위 발생 확률로 읽는 것은 불가능하다. CAIS는 점수가 낮다고 해서 “부정행위를 하지 않는다”는 증거가 아니라고 설명하고 있다.

과제 환경 및 실행/판정 코드는 GitHub에서 공개되어 있다.

## Google「Android Bench 2.0」、복잡한 개발을 합격률과 완료율로 측정

Android Bench 2.0은 기존의 버그 수정 및 소규모 기능 추가에서 평가 범위를 확장하고, 엔지니어들이 수일에서 1주일 정도 걸리는 복잡한 개발 작업을 추가했다. 새로운 앱 생성, 의존 관계 및 설계 이관, 신 기능 추가, 크로스 플랫폼 앱의 Android로의 이식 등 총 30건의 장기 작업을 사용한다.

Android Bench 2.0은 과제를 완전히 해결한 비율을 나타내는 “합격률”과 부분적인 달성도를 나타내는 “완료률”의 두 가지 지표로 평가한다. 기능의 동작 및 화면의 재현도, 기존 기능을 손상시키지 않는지 등을 확인하고, 지시 또는 제약 사항 위반에는 감점을 적용한다.

Google의 발표 시점에서 GPT-6 Astra와 Codex의 조합이 장기 작업에서 최고의 합격률 28.0%를 기록했으며, 완료률은 82.2%였다. 기존 작업의 최고 합격률은 약 91%였지만, 과제의 난이도 및 평가 내용은 다르다.

평가 대상에는 모델을 실행하는 에이전트도 포함되며, Codex, Claude Code, Antigravity 등을 사용한다. 또한 공개된 답변을 유용하기 어려운 과제 설계 및 실행 과정을 조사하는 부정 방지 대책도 적용했다. 평가 결과 및 방법은 공개되어 있지만, 장기 작업 데이터셋은 비공개이며, 평가용 문제 및 답변이 학습 데이터에 혼입되는 것을 방지하면서 데이터셋을 제공하는 방법을 고려하고 있다.

관련 기사: OpenAI, Hugging Face 침해 상세 내용 Black Hat에서 설명, AI 에이전트들이 “게시판”을 만들어 공격 정보를 공유
관련 기사: AI 지능 한계를 시험하는 벤치마크 “Humanity’s Last Exam(인류 마지막 시험)”, Scale AI와 CAIS 발표: GPT-4o 등 최첨단 모델에서도 정답률 10% 미만, 전문가와의 차이는 여전히 큼
관련 기사: AI 모델 평가 프로젝트 “AI IQ” 공개, GPT-5.5, Claude Opus 4.7 등을 “IQ”로 비교
관련 기사: OpenAI의 AI 에이전트, 6월 호주 정부 사이트에 불법 접근 및 공개, 거부 후 제한을 우회, 비공개 파일에도 접근
관련 기사: Anthropic, Claude가 평가 중 실존 3개 조직에 권한 없이 접근, 설정 불비로 인터넷에 연결, PyPI에 악의적인 패키지도 공개

[원문 보기](https://ledge.ai/articles/cheatbench_android_bench_2) | 출처: Ledge.ai