# AI가 사용한 도구를 AI 스스로가 고객 리뷰 평가, Armature가 “agent.reviews”를 공개하여 다른 에이전트 선택에 활용

> https://bookfactory.kr/board/news/20981
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-11T05:52:23.223Z

---

이미지 출처: Armature 공동 창업자 Theo Otz氏가 X에 게시한 소개 영상

Armature는 2026년 10월 6일 (현지 시간), AI 에이전트가 소프트웨어 및 개발 도구 사용 경험을 게시 및 참조할 수 있는 리뷰 사이트 “agent.reviews”를 공개했다고 발표했다. Claude Code 및 Codex와 같은 에이전트는 유용성, 사용 편의성, 신뢰성을 5단계로 평가한다. 다른 에이전트는 도구를 선택할 때 이러한 리뷰를 참고할 수 있다.

Armature의 공동 창업자인 Theo Otz氏에 따르면, 발표 시점에서 6000종 이상에 이르는 도구에 대해 실제 작업 후 에이전트가 작성한 리뷰가 10만 건 이상 모여 있다.

■ agent.reviews의 탑 화면. 도구 이름 또는 카테고리에서 리뷰를 검색할 수 있음

이미지 출처: agent.reviews

AI 스스로가 “사용해 본” 경험을 공유

agent.reviews에서는 AI 에이전트가 작업을 마친 후 사용한 도구, 연결 방법, 작업 내용, 결과를 기록한다. 정상적으로 작동한 점뿐만 아니라, 도입 또는 작동에서 겪었던 문제점, 필요했던 우회 방법 등도 공유한다.

평가 항목은 “유용성”, “사용 편의성”, “신뢰성”의 3가지입니다. 유용성은 작업에 필요한 기능을 수행했는지, 사용 편의성은 설정이나 작동에 얼마나 많은 노력이 필요한지, 신뢰성은 기대했던 대로 작동했는지 보여줍니다. 각각 1～5점으로 평가하고, 평가할 수 없는 항목은 미평가로 처리할 수 있습니다.

리뷰에는 작업이 완료되었는지, 일부만 진행되었는지, 막다른 길에 갇혔는지와 같은 결과도 포함됩니다. 도구의 종합 평가는 각 리뷰의 3개 항목 점수를 평균하여 계산하고, 미평가 항목은 제외합니다. 평가 순서 표시에서는 리뷰가 5개 이상 있는 도구를 우선적으로 표시하고, 소수의 높은 평가로만 상위 순위를 유지하고 있습니다.

## 작동 중 문제점 및 해결책도 기록

예를 들어, Claude Code에 의한 GitHub 리뷰에서는 관련 여러 코드 변경 사항을 순차적으로 통합한 작업을 평가하고 있습니다. 명령어를 사용하여 통합 상태와 변경 파일을 쉽게 확인할 수 있었지만, 다음 변경 사항을 어느 브랜치에 통합할지는 수동으로 다시 설정해야 했습니다. 유용성 5점, 사용 편의성 4점, 신뢰성 5점으로 평가했습니다.

■ GitHub 리뷰 화면. Claude Code와 Codex가 연결 방법, 작업 내용, 편리했던 점, 문제점과 함께 3개 항목 평가를 게시하고 있습니다.

이미지 출처: agent.reviews의 GitHub 리뷰 화면

동일한 도구를 사용하는 에이전트는 무엇이 편리하고, 어디에서 추가적인 조작이 필요한지 구체적으로 파악할 수 있는 형식입니다.

리뷰 대상에는 제품을 직접 작동한 경험 외에, 도입을 고려하기 위해 자료를 읽은 경험도 포함된다. 게시용 스킬에서는 양자를 구분하며, 자료를 읽은 것만으로 제품의 신뢰성을 추정하지 않도록 지정하고 있다.

## 독점적인 도구를 사용하여 참조 및 게시, 자동 리뷰도 설정 가능

에이전트는 리뷰 절차를 요약한 “스킬”과 명령어를 입력하여 작동하는 CLI(명령줄 도구)를 통해 리뷰를 참조하고 게시한다. 사용자가 설정하면 작업 종료 후 사용한 개발 도구를 리뷰하는 운영도 가능하다. 리뷰의 조회 및 게시는 무료로 제공된다.

아머테이는 개발 배경으로, 에이전트가 동일한 도구의 동일한 제약에 반복적으로 직면해도, 그 경험을 다른 에이전트나 소프트웨어 제공 기업에 전달하는 경로가 부족했다고 설명한다. 사용 경험을 공유함으로써, 에이전트의 도구 선택과, 제공 기업에 의한 제품 개선의 양쪽에 활용하려는 목적이다.

공개하는 리뷰에는 비밀 정보, 개인 정보, 고객 데이터, 비공개 코드 등을 포함하지 않도록 요청한다. 게시 전에 규칙에 따른 검사, 정보 유출을 감지하는 분류기, 소규모 언어 모델에 의한 확인의 3단계로 검사한다.

하지만, 리뷰에 언급되는 에이전트 이름이나 모델, 작업 결과는 에이전트 자신의 주장(“Verified”)에 기반합니다. “Verified” 표시가 나타나는 것은 해당 에이전트의 사용자가 로그인했음을 의미합니다. 작업의 수행 및 평가 내용의 정확성을 제3자가 검증한 것을 의미하는 것은 아닙니다.

관련 기사: AI 코딩 에이전트, 개발자의 90%가 주 1회 이상 이용 – Claude Code가 39%로 GitHub Copilot를 역전, 1월 18%에서 급상승

관련 기사: Claude Code는 누가 무엇에 사용하고, 결과는 어디에서 나뉘는가 – Anthropic가 이용 데이터 40만 건을 분석

관련 기사: Claude Code로 AI 에이전트를 어떻게 지시할 것인가 – Anthropic가 CLAUDE.md, 스킬, 서브 에이전트 등 7가지 방법을 설명

관련 기사: Vercel, AI 에이전트용 공통 플러그인 규격 “Agent Plugins” 공개 – Skills와 MCP를 일괄 배포

관련 기사: MCP의 새로운 로드맵 공개 – AI 에이전트의 “ID”, “비동기 처리”, “대량 툴 탐색” 등 5 영역을 우선

[원문 보기](https://ledge.ai/articles/armature_agent_reviews) | 출처: Ledge.ai