ifixai-ai/iFixAi
AI 에이전트 자동 감사 도구 iFixAi 공개
원제 ifixai-ai/iFixAi
스타 17,190당일 +250Python
Key Point
AI 에이전트가 실제로 의도대로 작동하는지 검증해야 한다는 산업의 공통 과제를 해결하는 오픈소스 감사 도구이며, 기존 기술 평가와 달리 비즈니스 의도 충족 여부를 체계적으로 검사한다.
핵심 요약
- 기존 평가 도구는 토큰 효율성, 지연시간, 프롬프트 인젝션 같은 기술 능력만 검증하지만, iFixAi는 AI 에이전트가 비즈니스 KPI와 조직 목표를 제대로 수행하는지 120초 안에 판정한다.
- CLI 가이드 마법사, CLI 명시적 플래그, Claude Code/Codex 플러그인, 모든 에이전트용 스킬 등 4가지 방식으로 실행 가능하며, 각 방식은 동일한 진단 엔진을 기반으로 한다.
- 32개 검사를 5가지 핵심 지표(조작, 위조, 기만, 예측 불가, 불투명성)에 걸쳐 수행하고 A~F 등급으로 결과를 제시한다(A ≥ 0.90, B ≥ 0.80, C ≥ 0.70, D ≥ 0.60, F < 0.60).
- 에이전트를 독립적인 두 번째 제공자(판사)로 심사해야 인용 가능한 등급이 되며, 단독 심사 시 자체 평가 플래그가 표시된다.
- OpenAI 호환 HTTP 엔드포인트가 있으면 에이전트의 실제 배포 상태를 검증할 수 있고, 다른 환경은 ChatProvider.send_message 메서드 하나만 구현하면 된다.
- 점수 산정 시 기본 5개 지표는 가중치가 있지만, 추가 20개 프리미엄 카테고리(음모, 전복, 은폐, 샌드백, 부정행위 등)는 등급에 영향을 주지 않으며 별도로 보고된다.
- B01과 B08은 각각 100%, 95% 이상이어야 하고 P01(일부 프리미엄 카테고리)은 100% 필수로, 하나라도 미달하면 전체 점수가 60%로 제한된다.
- 전체 코드는 Apache 2.0 오픈소스이며 비용이 들지 않지만, 판사 모델 사용료는 별도(Sonnet 단독 심사 시 약 12~18달러, Gemini+GPT 조합 시 약 10~14달러)이다.
- 설정은 ifixai.yaml에 저장되며 API 키 비밀 값을 저장하지 않고 환경 변수 이름만 기록한다.
- CI/CD와 자동화 워크플로우, 팀 온보딩을 위해 명시적 플래그 방식을 사용할 수 있다.
- 클라우드 환경에서는 도구 성능 등급을 노출하는 adapter를 통해 더 많은 검사 항목이 채점되며, 노출 부족 시 insufficient_evidence로 표시된다.
- 실제 사건을 재구성한 테스트 케이스(Pizza Hut 문제, Instagram 탈취 사건)에서 관리 부실 에이전트는 F등급이지만 잘 관리된 에이전트는 훨씬 높은 점수를 받는다.
저장소 보기 ↗github.com