쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 3일 (토)까지1628건
5건 · "월드 모델"조건 지우기 ×
001▲ 22 · 댓글 2비디오 생성 모델을 3D 기하학으로 정밀 제어하는 4Director비디오 프로덕션에서 카메라와 물체의 동작을 정확히 제어하기 위해 4Director라는 비디오 월드 모델을 제안한다.AI · 머신러닝 · 4Director: Controlling Video World Models with Rigid 3D Geometry
비디오 생성 모델을 3D 기하학으로 정밀 제어하는 4Director

Key Point3D 기하학 기반 명시적 제어 방식으로 비디오 생성에서 카메라·물체 움직임의 정확도를 근본적으로 높였으며, 신규 데이터셋과 평가 지표까지 공개해 후속 연구의 기초가 될 수 있다.
핵심 요약
- 비디오 프로덕션에서 카메라와 물체의 동작을 정확히 제어하기 위해 4Director라는 비디오 월드 모델을 제안한다.
- 기존 방식은 깊이와 회전이 모호한 이미지 평면 신호나 기하학이 불완전한 3D 트랙으로만 제어했지만, 4Director는 명시적 4D 장면 표현을 사용한다.
- 각 객체를 입력 이미지에서 정준 메시(canonical mesh)로 한 번 재구성한 후 매 프레임마다 정해진 강체 변환(rigid transformation) 하나로 움직인다.
전체 요약 7문장 읽기 → 002▲ 50 · 댓글 2프로그래밍 가능한 영상 생성 모델의 정확성을 테스트하는 벤치마크프로그래밍 가능한 월드 모델은 시뮬레이션 엔진에서 실행되는 동작과 시각적 생성을 분리해 차세대 게임 엔진의 기반을 제시한다.AI · 머신러닝 · ROWBench: Do Video Models Render What the Program Specifies?
프로그래밍 가능한 영상 생성 모델의 정확성을 테스트하는 벤치마크

Key Point프로그래밍 가능한 월드 모델이 실제로 프로그램의 명령을 정확히 시각화하는지 검증하는 첫 체계적 벤치마크로, 차세대 게임 엔진과 시뮬레이션 환경의 신뢰성 기준을 제시한다.
핵심 요약
- 프로그래밍 가능한 월드 모델은 시뮬레이션 엔진에서 실행되는 동작과 시각적 생성을 분리해 차세대 게임 엔진의 기반을 제시한다.
- 기존 벤치마크는 시각 품질, 제어 가능성, 명령어·물리 준수만 평가했으나 프로그램이 지정한 세부 이벤트에 대한 시각적 충실성은 거의 검증하지 않았다.
- 연구팀은 170개의 프로그래매틱 에피소드와 600개의 대리 영상으로 구성한 PROWBench를 제안했으며, 다양한 장면과 상호작용을 다룬다.
전체 요약 7문장 읽기 → 003▲ 10 · 댓글 0물리 법칙 지키는 비디오 생성 AI, 언어로 학습 시키다비디오 월드 모델들이 물리적으로 타당한 영상을 생성하지 못하는 문제를 언어 기반으로 해결하는 Physis-Lang을 제시했다.AI · 머신러닝 · Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
물리 법칙 지키는 비디오 생성 AI, 언어로 학습 시키다

Key Point물리 법칙을 지키는 비디오 생성이 멀티모달 AI의 핵심 과제인데, 순수 언어 표현만으로 상용 모델 수준의 성능을 달성했다는 점이 경향을 바꾼다.
핵심 요약
- 비디오 월드 모델들이 물리적으로 타당한 영상을 생성하지 못하는 문제를 언어 기반으로 해결하는 Physis-Lang을 제시했다.
- 물리 현상을 관련 개체, 원인, 상호작용, 지배 원리, 시간 진화, 영향 등을 언어로 표현하여 학습한다.
- PhysCapBench를 구축하여 물리 설명을 원자 단위 명제로 분해하고 재현율과 정확도로 평가한다.
전체 요약 7문장 읽기 → 004▲ 30 · 댓글 1AI 에이전트 위한 합성형 환경 생성 기법 공개AI 에이전트 학습을 위해 자동으로 생성되는 환경이 확대되고 있지만, 기존 방식은 단일 환경 내 작업만 생성했다.AI · 머신러닝 · CompoWorld: Compositional Environment Scaling for General Agents
AI 에이전트 위한 합성형 환경 생성 기법 공개

Key Point다중 서비스 환경에서 작동하는 AI 에이전트를 더 효율적으로 훈련하는 새로운 방법론이 나왔으며, 동급 모델 대비 실제 자동화 작업에서 뛰어난 성능을 입증했다.
핵심 요약
- AI 에이전트 학습을 위해 자동으로 생성되는 환경이 확대되고 있지만, 기존 방식은 단일 환경 내 작업만 생성했다.
- CompoWorld는 재사용 가능한 서비스들을 조합해 작업 공간을 확장하는 기법으로, 현실의 다중 서비스 워크플로우를 반영한다.
- 코딩 에이전트가 도구 명세를 타입 지정 상태와 공유 인터페이스로 검증된 서비스로 전환하고, 신뢰도 낮은 도구는 월드 모델이 담당한다.
전체 요약 8문장 읽기 → 005▲ 123 · 댓글 39AI가 인간처럼 생각하게 하려면, 빠르고 느린 시스템을 함께 써야 한다현대 AI는 이미지 분석, 자연어 처리 등 특정 영역에서 뛰어나지만, 인간의 일반적 지능에 비해 여전히 좁은 범위의 능력만 가지고 있다.AI · 머신러닝 · Thinking fast and slow in AI: The role of metacognition (2021)
AI가 인간처럼 생각하게 하려면, 빠르고 느린 시스템을 함께 써야 한다

Key Point인간의 인지 구조를 AI에 적용하는 구체적인 아키텍처를 제시해 현재 좁은 AI의 한계를 어떻게 극복할 수 있을지 보여준다.
핵심 요약
- 현대 AI는 이미지 분석, 자연어 처리 등 특정 영역에서 뛰어나지만, 인간의 일반적 지능에 비해 여전히 좁은 범위의 능력만 가지고 있다.
- 인간의 사고 메커니즘을 더 잘 이해하면 AI에 더 폭넓은 능력을 부여할 수 있다고 논문은 주장한다.
- 카네만의 '빠르고 느린 생각' 이론을 바탕으로, 연구팀은 두 종류의 에이전트로 구성된 다중 에이전트 AI 아키텍처를 제시했다.
전체 요약 5문장 읽기 →