Hugging Face 논문AI · 머신러닝

이미지 한 장에서 3D 장면을 프로그래밍 코드로 복원

원제 LEGO-Anything: Coding Agents for 3D Scene Reconstruction

추천 17댓글 1Xirui Li, Peng Shi, Mingwen Dong 외
Key Point

단일 이미지에서 편집·조회 가능한 3D 장면 코드 재구성이라는 새로운 접근법과 그 한계를 명확히 보여주며, 코딩 에이전트의 구체적 실패 원인과 개선 방법을 제시한다.

핵심 요약

  • 단일 이미지로부터 3D 장면을 고정된 렌더링이 아닌 실행 가능한 Blender 코드 형태로 복원하는 LEGO-Anything 프레임워크를 제시했다.
  • 코딩 에이전트가 반복적으로 Blender 코드를 작성·실행하면서 장면을 검사하고 프로그램을 수정하는 방식으로 동작한다.
  • 평가를 위해 104개 실내외 장면의 208개 이미지를 포함한 LEGO-Bench 벤치마크를 구축했으며, 산출물 유효성·표면 기하학·렌더링 외형을 별도로 채점한다.
  • GPT-6-astra가 실내 53.4%, 실외 39.6%의 점수로 최고 성능을 보였으나 기하학 및 외형 복원에는 여전히 큰 격차가 있다.
  • 에이전트 구성 과정 분석 결과 약한 장면 초기화, 반복 과정 중 퇴행적 편집, 신뢰할 수 없는 자체 평가가 반복되는 세 가지 문제를 발견했다.
  • 이를 개선하기 위해 훈련 없이 적용 가능한 LEGO-Plugin 플러그인을 개발했고, 모든 여섯 모델에서 개선되었으며 최대 62.7%의 상대적 성능 향상을 달성했다.
  • 복원된 장면의 자연 이미지 표현 능력을 검증하기 위해 GPT-6-astra 출력에서 객체 탐지, 인스턴스 마스크, 상대 깊이를 결정론적 쿼리로 도출했다.
  • 이 세 작업 모두 비자명한 성능을 보였으나 특화된 비전 모델에는 미치지 못했으며, 현재 코딩 에이전트가 생성한 장면은 유망하지만 아직 자연 이미지의 정확한 표현으로는 부족함을 시사한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗