# 무료로 AI 에이전트 추적 및 평가, 프롬프트 관리, 운영 환경 모니터링이 가능한 "Opik" 출시, 자가 호스팅 가능

> https://bookfactory.kr/board/news/17861
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-19T23:05:26.638Z

---

AI 앱 개발에서는 LLM이 생성한 답변을 확인하는 것뿐만 아니라, 답변에 도달하기 위해 어떤 과정을 거쳤는지 추적하고 개선된 결과와 비교하는 작업도 필요합니다. 이러한 검증에 필요한 트레이싱, 평가, 프롬프트 관리, 그리고 실시간 모니터링을 하나의 화면에 모은 오픈 소스 “Opik”이 공개되었습니다. Open-Source AI Observability Platform | Opik by Comet https://www.comet.com/site/products/opik/

comet-ml/opik: 디버깅, 평가, 그리고 LLM 애플리케이션, RAG 시스템, 그리고 에이전트 워크플로우를 위한 포괄적인 트레이싱, 자동화된 평가, 그리고 프로덕션 준비된 대시보드와 함께 LLM 애플리케이션, RAG 시스템, 그리고 에이전트 워크플로우를 디버깅, 평가, 그리고 모니터링합니다. https://github.com/comet-ml/opik ◆Opik 사용 방법 추적하려는 AI 앱에서 호출하는 LLM을 Opik으로 래핑함으로써, 입력 프롬프트, 생성 결과, 사용 모델, 토큰 사용량, 처리 시간, 그리고 비용 정보가 Opik 서버에 전송됩니다. Gemini API 라이브러리를 사용하는 경우 다음과 같습니다.

추적하려는 처리에 앞서 “@track”을 추가하면 처리 자체의 추적이 가능해집니다.

이를 개발 중인 AI 앱에 통합 실행하면 Opik에 기록되므로, 확인하려는 실행 기록을 클릭하십시오.

“도쿄 타워와 스카이트리 비교”를 지시한 결과, 결과가 정확하게 반환되지 않았습니다. 이 화면에서는 결과뿐만 아니라 호출된 AI 에이전트가 어떤 툴을 이용하여 답변을 생성했는지의 추적, 그리고 이용 비용 등을 확인할 수 있습니다.

개선한 스크립트의 기록을 클릭하십시오.

기대했던 답변이 반환되었을 뿐만 아니라, 처리 시간도 전 스크립트보다 빨라졌습니다. 하지만 사용된 총 토큰 수는 6배로 늘어났으며, 원인은 프롬프트에 상당한 토큰을 소비했기 때문이라는 것을 알 수 있습니다.

결과뿐만 아니라, 어떤 요인으로 인해 동작이 개선되었거나 악화되었는지 조사할 수 있습니다. ◆AI의 답변을 Test Suites에서 평가하는 것은 AI 앱의 실행 결과를 기록하는 것뿐만 아니라, 미리 준비한 조건에 따라 답변을 평가하는 “Test Suites”를 이용하여, 같은 질문에 대해 수정 전과 수정 후의 AI 에이전트 실행을 수행함으로써, 개선으로 인해 기대하는 답변이 얻어지는지 비교할 수 있습니다. 이번에는 “도쿄 타워와 도쿄 스카이트리 높이 비교하기”라는 질문에 대해 다음과 같은 조건을 설정했습니다. ·도쿄 타워와 도쿄 스카이트리의 높이가 양쪽 모두 기재되어 있는 것 ·도쿄 타워의 높이가 333m로 기재되어 있는 것 ·도쿄 스카이트리의 높이가 634m로 기재되어 있는 것 ·양자의 높이 차이가 301m로 정확하게 설명되어 있는 것

개발 중인 스크립트에 Test Suites에 등록한 질문을 기존의 agent() 함수에 전달하고, 그 답변을 평가 대상으로 반환하는 task를 등록합니다.

이 task를 Test Suites에 대해 실행함으로써, AI 에이전트의 답변이 등록된 조건(조건)을 만족하는지 Opik이 판별합니다.

이 스크립트를 組み込む 경우의 실행 결과입니다. 적절한 답이 돌아오지 않았던 스크립트에서는 조건에 설정한 답변이 얻어지지 않았기 때문에 “FAILED”의 판정이 됩니다.

적절한 답변이 돌아오는 스크립트에서는 “PASSED”의 평가가 됩니다.

◆프롬프트(Prompt)를 프롬프트 라이브러리(Prompt Library)에서 관리 AI 앱에서 이용하는 프롬프트(Prompt)를 “프롬프트 라이브러리(Prompt Library)”에 저장함으로써, 수정 전후의 내용을 비교하거나 특정 버전을 지정하여 재이용하거나 할 수 있습니다.

프롬프트 라이브러리(Prompt Library)에서 프롬프트(Prompt)를 가져오는 시점에 버전을 지정하지 않으면, 항상 최신 버전이 이용됩니다. 따라서 AI 앱의 Python 코드를 변경하지 않고 Opik의 관리 화면에서 프롬프트(Prompt)를 편집하여 새로운 버전을 생성하고 스크립트를 재실행하면 되기만 하면 변경된 동작을 시험해 볼 수 있습니다. 반면에 version="v3"와 같이 지정하면 특정 프롬프트(Prompt)를 고정하여 이용할 수 있기 때문에, 과거의 실행 결과를 재현하는 용도에도 이용할 수 있습니다.

다른 기능들도 제공하며 “Prompt Playground”에서는 여러 개의 프롬프트와 모델을 동시에 실행하여 생성 결과, 토큰 사용량, 처리 시간을 비교할 수 있습니다. 또한 Test Suites와 함께 각 프롬프트를 동일한 조건으로 평가할 수도 있습니다. “Agent Playground”에서는 로컬 AI 에이전트를 Opik에서 실행하고 프롬프트나 파라미터를 변경하면서 Trace를 확인할 수 있습니다. 코드 수정 없이 설정 변경을 시도할 수도 있습니다. “Online Evaluation rules”를 설정하면 실제 환경에서 전송되는 Trace를 LLM-as-a-Judge로 자동 평가할 수 있습니다. 환각, 부적절한 내용, 답변의 관련성 등을 지속적으로 모니터링할 수 있습니다. “Guardrails”를 통해 개인 정보, 특정 토픽, 프롬프트 인젝션 등을 감지하여 AI 앱의 입출력을 제한할 수 있으며, LLM 기반의 자체 규칙 판정이나 커스텀 분류기에도 대응합니다. “Agent Optimizer”를 활용하여 Test Suites나 Dataset으로 평가한 결과를 기준으로 프롬프트를 자동으로 개선할 수 있습니다. 단일 프롬프트뿐만 아니라 여러 프롬프트를 사용하는 AI 에이전트의 최적화에도 대응합니다. MCP 서버를 활용하면 Claude Code, Codex, Cursor와 같은 AI 코딩 클라이언트를 Opik으로 연결하여 Trace 확인, 평가, 실험 실행 등을 대화 형식으로 조작할 수 있습니다.

Opik과 Langfuse의 차이점: AI 앱의 트레이싱, 평가, 프롬프트 관리, 실시간 모니터링을 위한 오픈 소스 도구로서 “Langfuse”도 널리 사용되고 있습니다. Opik과 Langfuse는 많은 기능이 공유되지만, 자체 호스팅 환경에서 두 도구를 비교한 “Opik vs Langfuse: Self-Hosted LLM Observability in 2026”에서는 Opik은 평가, 테스트, CI와의 연계를 중시하는 반면, Langfuse는 트레이싱, 통합 기능, 팀 운영에 강점을 가진다고 정리되어 있습니다.

Opik의 자체 호스팅 환경 구축 방법: Windows에 Docker Desktop과 Python을 준비한 후, Git Bash 프롬프트를 사용하여 구축합니다. 작업 폴더에 리포지토리를 클론하고 opik 폴더로 이동하여 설치 명령을 실행합니다.

브라우저에서 “http://localhost:5173/”에 접속하면 등록 폼이 표시되므로 “Skip and go to Opik”을 클릭합니다.

프로젝트 목록이 표시되면 서버의 구축은 완료입니다.

다음으로 Python용 라이브러리를 설치합니다.

이번에는 로컬 환경에 Opik 서버를 준비하고 있으므로 다음 설정 명령을 실행하여 로컬 환경에서의 사용을 등록합니다.

초기 상태에서 설정되어 있는 프로젝트를 이용하지 않고, 새로 프로젝트를 생성합니다.

Claude Code, Codex, Cursor 등 대응하는 AI 코딩 클라이언트는 설치되어 있어야 하며, Opik용 MCP 서버를 어떤 AI 에이전트에 설치할지 선택하고, 더불어 Skill도 설치하려면 질문에 “Y”를 누르거나 그대로 Enter 키를 눌러 진행합니다.

AI 에이전트를 실행하고 “Opik의 프로젝트 목록을 표시해 주세요”라고 지시하여 프로젝트 목록이 표시되면 Opik 서버 및 MCP 등 각종 환경 구축이 정상적으로 완료된 것을 확인할 수 있습니다.

[원문 보기](https://gigazine.net/news/20260919-opik/) | 출처: Gigazine