이미지 한 장에서 3D 장면을 프로그래밍 코드로 복원
원제 LEGO-Anything: Coding Agents for 3D Scene Reconstruction
추천 17댓글 1
Key Point
단일 이미지에서 편집·조회 가능한 3D 장면 코드 재구성이라는 새로운 접근법과 그 한계를 명확히 보여주며, 코딩 에이전트의 구체적 실패 원인과 개선 방법을 제시한다.
핵심 요약
- 단일 이미지로부터 3D 장면을 고정된 렌더링이 아닌 실행 가능한 Blender 코드 형태로 복원하는 LEGO-Anything 프레임워크를 제시했다.
- 코딩 에이전트가 반복적으로 Blender 코드를 작성·실행하면서 장면을 검사하고 프로그램을 수정하는 방식으로 동작한다.
- 평가를 위해 104개 실내외 장면의 208개 이미지를 포함한 LEGO-Bench 벤치마크를 구축했으며, 산출물 유효성·표면 기하학·렌더링 외형을 별도로 채점한다.
- GPT-6-astra가 실내 53.4%, 실외 39.6%의 점수로 최고 성능을 보였으나 기하학 및 외형 복원에는 여전히 큰 격차가 있다.
- 에이전트 구성 과정 분석 결과 약한 장면 초기화, 반복 과정 중 퇴행적 편집, 신뢰할 수 없는 자체 평가가 반복되는 세 가지 문제를 발견했다.
- 이를 개선하기 위해 훈련 없이 적용 가능한 LEGO-Plugin 플러그인을 개발했고, 모든 여섯 모델에서 개선되었으며 최대 62.7%의 상대적 성능 향상을 달성했다.
- 복원된 장면의 자연 이미지 표현 능력을 검증하기 위해 GPT-6-astra 출력에서 객체 탐지, 인스턴스 마스크, 상대 깊이를 결정론적 쿼리로 도출했다.
- 이 세 작업 모두 비자명한 성능을 보였으나 특화된 비전 모델에는 미치지 못했으며, 현재 코딩 에이전트가 생성한 장면은 유망하지만 아직 자연 이미지의 정확한 표현으로는 부족함을 시사한다.