기존 에이전트를 다중 모달로 확장하는 'Omni-IO Skills' 공개
원제 Omni-IO Skills: Harnessing Your Agent Omni-Native
추천 226댓글 2
Key Point
기존 강력한 에이전트 모델들이 특정 모달리티로 제한되는 문제를 추론 능력 손상 없이 해결하는 실질적인 방법론을 제시하여, 대규모 모델 재학습 없이 다중 모달 시스템 구축이 가능함을 입증했다.
핵심 요약
- 일반 목적의 AI 에이전트가 텍스트·이미지·오디오·비디오·문서·3D·코드 등 다양한 형식을 다루도록 설계된 Omni-IO Skills 프레임워크가 제안되었다.
- 기존 모델 업데이트 비용 없이 기존 에이전트(GPT-5.6 Sol, Claude Sonnet 5 등)에 플러그인처럼 장착되는 구조로, 27개의 Skills를 통해 7가지 모달리티와 이해·생성·추론·검색 4가지 능력군을 커버한다.
- Declare Execution Graphs라는 그래프 구조로 다중 에셋 워크플로우를 표현하고, 독립적인 작업을 병렬로 스케줄링하며 중간 결과물을 Persistent Asset Registry에 저장해 재사용한다.
- UniM-90 벤치마크에서 GPT-5.6 Sol의 입력 지원률이 40%에서 100%로, Claude Sonnet 5는 38.89%에서 100%로 상승했다.
- Semantic-Quality Coupled Score는 GPT-5.6 Sol에서 26.99에서 74.94로, Claude Sonnet 5에서 27.82에서 77.78로 증가했고, Strict Structure Score는 100.00과 99.78에 도달했다.
- 에이전트의 추론 코어를 건드리지 않고 오케스트레이션 계층의 능력 조합으로 광범위하고 확장 가능한 다중 모달 시스템을 구축할 수 있음을 보여준다.