microsoft/SkillOpt
마이크로소프트 SkillOpt, 모델 가중치 고정한 채 LLM 에이전트 스킬 자동 개선
원제 microsoft/SkillOpt
스타 17,786당일 +111Python
Key Point
LLM 모델 자체를 수정하지 않고도 자연언어 스킬을 신경망처럼 반복 학습시켜 에이전트 성능을 대폭 개선할 수 있다는 점이 기존 방식과 근본적으로 다르며, 52개 평가 환경 전수에서 최고 성능을 입증했다.
핵심 요약
- 마이크로소프트가 SkillOpt를 오픈소스로 공개했다. 이는 LLM 모델의 가중치를 건드리지 않고 자연어로 작성된 에이전트 스킬 문서를 신경망처럼 학습시키는 텍스트 공간 최적화 도구다.
- 기존 에이전트 스킬은 수작업으로 만들거나 강력한 LLM으로 한 번에 생성하거나 느슨한 자가개선에만 의존했다. SkillOpt는 스킬 문서를 얼린 에이전트의 학습 가능한 상태로 취급하고 신경망 최적화처럼 학습시킨다.
- 동작 방식은 스코어된 롤아웃(실행 결과)을 텍스트 에디트(추가/삭제/변경)로 변환하는 별도의 옵티마이저 모델을 사용한다. 후보 에디트는 검증용 점수를 엄격히 향상시킬 때만 수용되며, 텍스트 학습률 예산과 에포크별 업데이트로 안정성을 보장한다.
- 배포 아티팩트는 간결한 best_skill.md(300~2,000 토큰) 파일이며, 배포 시점에 추가 모델 호출이 전혀 필요 없다.
- 6개 벤치마크, 7개 타겟 모델, 3가지 실행 환경(직접 채팅, Codex CLI, Claude Code CLI)에서 평가한 52개 셀 전수에서 최고 성능을 달성했다. GPT-5.5의 경우 스킬 없을 때 대비 평균 +23.5점(직접 채팅), +24.8점(Codex 루프), +19.1점(Claude Code) 향상을 보였다.
- 최적화된 스킬은 모델 규모 간에, Codex와 Claude Code 환경 간에, 인접 벤치마크로 추가 최적화 없이 전이된다.
- v0.2.0 릴리스(2026년 7월)는 SkillOpt-Sleep이라는 야간 오프라인 자가진화 엔진을 추가했다. 과거 세션을 검토하고 반복 작업을 재생해 검증된 스킬을 통합하는 기능이다.
- Claude Code, Codex, Copilot, Devin 및 OpenClaw 참조 적응을 위한 플러그인/MCP 파일이 포함되었으며, SearchQA 분할 구성, Windows 견고성, JSON 파싱 강화가 추가되었다.
- Python으로 작성되었으며 PyPI에서 `pip install skillopt`로 설치 가능하다. 전체 학습 루프(롤아웃 → 성찰 → 집계 → 선택 → 업데이트 → 평가)와 다중 백엔드 지원(OpenAI/Azure/Claude/Qwen/MiniMax), 6개 내장 벤치마크, WebUI 대시보드를 포함한다.
저장소 보기 ↗github.com