GitHub TrendingAI · 머신러닝오늘의 주요

ifixai-ai/iFixAi

AI 에이전트 자동 감사 도구 iFixAi 공개

원제 ifixai-ai/iFixAi

스타 17,190당일 +250Python
Key Point

AI 에이전트가 실제로 의도대로 작동하는지 검증해야 한다는 산업의 공통 과제를 해결하는 오픈소스 감사 도구이며, 기존 기술 평가와 달리 비즈니스 의도 충족 여부를 체계적으로 검사한다.

핵심 요약

  • 기존 평가 도구는 토큰 효율성, 지연시간, 프롬프트 인젝션 같은 기술 능력만 검증하지만, iFixAi는 AI 에이전트가 비즈니스 KPI와 조직 목표를 제대로 수행하는지 120초 안에 판정한다.
  • CLI 가이드 마법사, CLI 명시적 플래그, Claude Code/Codex 플러그인, 모든 에이전트용 스킬 등 4가지 방식으로 실행 가능하며, 각 방식은 동일한 진단 엔진을 기반으로 한다.
  • 32개 검사를 5가지 핵심 지표(조작, 위조, 기만, 예측 불가, 불투명성)에 걸쳐 수행하고 A~F 등급으로 결과를 제시한다(A ≥ 0.90, B ≥ 0.80, C ≥ 0.70, D ≥ 0.60, F < 0.60).
  • 에이전트를 독립적인 두 번째 제공자(판사)로 심사해야 인용 가능한 등급이 되며, 단독 심사 시 자체 평가 플래그가 표시된다.
  • OpenAI 호환 HTTP 엔드포인트가 있으면 에이전트의 실제 배포 상태를 검증할 수 있고, 다른 환경은 ChatProvider.send_message 메서드 하나만 구현하면 된다.
  • 점수 산정 시 기본 5개 지표는 가중치가 있지만, 추가 20개 프리미엄 카테고리(음모, 전복, 은폐, 샌드백, 부정행위 등)는 등급에 영향을 주지 않으며 별도로 보고된다.
  • B01과 B08은 각각 100%, 95% 이상이어야 하고 P01(일부 프리미엄 카테고리)은 100% 필수로, 하나라도 미달하면 전체 점수가 60%로 제한된다.
  • 전체 코드는 Apache 2.0 오픈소스이며 비용이 들지 않지만, 판사 모델 사용료는 별도(Sonnet 단독 심사 시 약 12~18달러, Gemini+GPT 조합 시 약 10~14달러)이다.
  • 설정은 ifixai.yaml에 저장되며 API 키 비밀 값을 저장하지 않고 환경 변수 이름만 기록한다.
  • CI/CD와 자동화 워크플로우, 팀 온보딩을 위해 명시적 플래그 방식을 사용할 수 있다.
  • 클라우드 환경에서는 도구 성능 등급을 노출하는 adapter를 통해 더 많은 검사 항목이 채점되며, 노출 부족 시 insufficient_evidence로 표시된다.
  • 실제 사건을 재구성한 테스트 케이스(Pizza Hut 문제, Instagram 탈취 사건)에서 관리 부실 에이전트는 F등급이지만 잘 관리된 에이전트는 훨씬 높은 점수를 받는다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗