알리바바가 공개한 AI 코드 리뷰 도구, 정밀성 높이고 비용은 1/9로
Key Point
자체 검증 벤치마크에서 일반 LLM 대비 정밀도는 높이면서 API 비용을 획기적으로 줄인 실용적 코드 리뷰 솔루션이 공개되었기 때문입니다.
핵심 요약
- 알리바바의 내부 코드 리뷰 시스템을 오픈소스화한 OpenCodeReview는 Git diff를 읽어 LLM에 보낸 뒤 라인 단위 정밀한 피드백을 생성한다.
- deterministic 파이프라인과 LLM Agent를 결합한 하이브리드 구조로, 파일 선택·번들링·규칙 매칭을 엔지니어링 로직으로 보장하면서 동적 판단은 Agent에 맡긴다.
- NPE, 스레드 안전성, XSS, SQL 인젝션 등 다국어 룰셋을 내장하고 OpenAI와 Anthropic 모델을 모두 지원한다.
- AACR-Bench 벤치마크(50개 오픈소스, 200개 PR, 10개 언어, 80+ 시니어 엔지니어 검증)에서 Claude Code와 비교해 정밀도와 F1 점수는 더 높으면서 토큰 사용량은 1/9 수준이다.
- 전체 파일 스캔('ocr scan')으로 diff 없이도 코드베이스를 감시할 수 있고, 대규모 변경에서도 안정적으로 모든 파일을 검토한다.
저장소 보기 ↗github.com