쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 30일 (수)까지1383건
4건 · "표현 학습"조건 지우기 ×
001▲ 10 · 댓글 1계층적 표현 학습으로 이미지 재구성 품질 향상사전학습된 시각 표현은 이미지 생성에는 유용하지만 충실한 복원에 필요한 세부 사항을 완전히 보존하지 못한다.AI · 머신러닝 · HiRAE: Hierarchical Representation Autoencoding with Residual Budgets
계층적 표현 학습으로 이미지 재구성 품질 향상

Key Point인코더 계층의 다중 정보를 효율적으로 활용해 이미지 복원 품질을 크게 높인 방법론으로, 복잡한 튜닝 없이 생성 모델과의 호환성을 유지하는 점이 실무적 가치가 있다.
핵심 요약
- 사전학습된 시각 표현은 이미지 생성에는 유용하지만 충실한 복원에 필요한 세부 사항을 완전히 보존하지 못한다.
- 인코더의 중간 계층들은 보완적인 시각 정보를 가지고 있으나 이들을 효과적으로 융합하면 모델링이 어려운 잠재 분포가 생성된다.
- 기존 융합 방식은 계층 선택의 경험적 튜닝이나 단계별 최적화가 필요해 설정 비용과 학습 복잡도가 높다.
전체 요약 8문장 읽기 → 002▲ 19 · 댓글 1세계 모델의 표현 기하학을 다시 설계하다JEPA 계열 잠재 세계 모델은 행동 조건 역학을 표현 공간에서 학습하며, 보통 유클리드 거리로 목표까지의 거리를 계산해 행동 후보를 평가한다.AI · 머신러닝 · Anisotropic Representations Improve Planning in JEPA World Models
세계 모델의 표현 기하학을 다시 설계하다

Key Point표현 정규화 방식의 변경이 세계 모델 기반 계획에 미치는 영향을 실증적으로 보여주므로, 이를 따르는 연구나 실제 모델 개발에 참고할 수 있다.
핵심 요약
- JEPA 계열 잠재 세계 모델은 행동 조건 역학을 표현 공간에서 학습하며, 보통 유클리드 거리로 목표까지의 거리를 계산해 행동 후보를 평가한다.
- 기존 동적 모델은 표현 붕괴를 막기 위해 등방 가우시안 정규화를 사용했는데, 이것이 예측은 정확하더라도 작업의 실제 비용과 다른 기하학을 만들 수 있다.
- 연구팀은 이 불일치를 해결하기 위해 AnisoWM을 제안했으며, 고정된 추적과 비등방성 제약 하에서 학습 가능한 대각 공분산을 사용한다.
전체 요약 6문장 읽기 → 003▲ 13 · 댓글 3동작 중심 영상 학습, 시간축 분리로 효율성 확보영상 자가학습에서 아키텍처와 목적함수, 데이터, 학습 일정 등 여러 요소가 동시에 변해 동작 우선 표현 학습의 효과를 명확히 파악하기 어려운 점을 지적한다.AI · 머신러닝 · TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining
동작 중심 영상 학습, 시간축 분리로 효율성 확보

Key Point시간과 공간을 분리해 동작 학습을 효율화하는 새로운 방식이 기존 방법보다 훨씬 빠르면서 동시에 여러 벤치마크에서 큰 폭의 성능 향상을 달성했기 때문이다.
핵심 요약
- 영상 자가학습에서 아키텍처와 목적함수, 데이터, 학습 일정 등 여러 요소가 동시에 변해 동작 우선 표현 학습의 효과를 명확히 파악하기 어려운 점을 지적한다.
- 이를 해결하기 위해 약 170M~190M 인코더 규모로 24가지 아키텍처-목적함수 조합을 통제된 조건에서 비교했다.
- TT-VidT는 DINOv3으로 초기화한 ViT-B/16 공간 경로와 컴팩트 Temporal Transfer Layer를 조합하고, Diff Compression 목적함수로 첫 프레임 외형 정보와 프레임별 동작 토큰으로부터 타겟 프레임을 재구성하도록 학습한다.
전체 요약 7문장 읽기 → 004▲ 198 · 댓글 3음악 생성 AI의 상징과 음향 통합한 YuE2 등장Hugging Face와 arXiv 논문으로 공개된 YuE2는 악보 기반 계획을 통해 기호 음악과 오디오 음악 생성을 단일 모델로 통합했다.AI · 머신러닝 · YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality
음악 생성 AI의 상징과 음향 통합한 YuE2 등장

Key Point악보라는 명시적 중간 단계를 통해 AI 음악 생성의 투명성과 편집 가능성을 확보하면서도 상용 서비스와 경쟁할 수 있는 품질을 달성했기 때문이다.
핵심 요약
- Hugging Face와 arXiv 논문으로 공개된 YuE2는 악보 기반 계획을 통해 기호 음악과 오디오 음악 생성을 단일 모델로 통합했다.
- AR-NAR Mixture-of-Transformers(MoT) 아키텍처를 사용하며, 악보로 멜로디와 화성을 지정한 뒤 의미론적 음악 토큰으로 확장해 전곡 오디오를 생성한다.
- 전문가 평가에서 악보 기반 계획이 49.3%의 선호도를 기록해 계획 없는 생성의 34.6%를 앞질렀으며, 음악성과 전체 품질에서 우수했다.
전체 요약 9문장 읽기 →