쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 3일 (토)까지1629건
2건 · "LLM 정렬"조건 지우기 ×
001▲ 31 · 댓글 1동영상 생성 모델의 정렬 문제, 첫 종합 가이드동영상 생성 기술이 저해상도 단편에서 고해상도 장시간 시퀀스로 급속도 발전했으나, 사전학습된 모델은 인간 의도 따르기·시간적 일관성 유지·물리법칙 준수에 실패하는 경우가 많다.AI · 머신러닝 · Video Generation Models: A Survey of Post-Training and Alignment
동영상 생성 모델의 정렬 문제, 첫 종합 가이드

Key Point동영상 생성 모델이 인간 의도를 제대로 따르지 못하는 근본적인 정렬 문제를 체계화한 첫 종합 가이드로, 앞으로의 동영상 생성 기술 개발 방향을 정리해준다.
핵심 요약
- 동영상 생성 기술이 저해상도 단편에서 고해상도 장시간 시퀀스로 급속도 발전했으나, 사전학습된 모델은 인간 의도 따르기·시간적 일관성 유지·물리법칙 준수에 실패하는 경우가 많다.
- 동영상 생성의 정렬(alignment)은 이미지·텍스트 생성보다 난제가 많은데, 누적 오차·움직임-외형 결합·다목적 트레이드오프·시간적 속성의 제한된 감독이 주요 과제다.
- 이 논문은 동영상 모델의 사후학습(post-training)과 정렬을 다룬 첫 종합 리뷰로, 정렬 신호 적용 방식에 따라 암묵적 정렬과 명시적 정렬로 구분한다.
전체 요약 6문장 읽기 → 002▲ 23 · 댓글 1LLM 정렬을 위한 확산 기반 보상 모델 등장기존 보상 모델은 각 프롬프트-응답 쌍을 단일 점 추정값이나 고정된 분포로 축소하지만, 인간 선호도는 본질적으로 다중모달이다—같은 응답이 여러 방식으로 합리적으로 평가될 수 있다.AI · 머신러닝 · Diffusion Reward Models
LLM 정렬을 위한 확산 기반 보상 모델 등장

Key Point인간의 다양한 판단 방식을 반영하는 새로운 보상 모델이 RLHF 학습에서 성능 개선을 직접 입증했기 때문에, LLM 정렬 연구에 실질적 영향을 미칠 수 있다.
핵심 요약
- 기존 보상 모델은 각 프롬프트-응답 쌍을 단일 점 추정값이나 고정된 분포로 축소하지만, 인간 선호도는 본질적으로 다중모달이다—같은 응답이 여러 방식으로 합리적으로 평가될 수 있다.
- 이를 해결하기 위해 Diffusion Reward Model(DRM)을 제안하며, 이는 보상 모델링을 조건부 밀도 추정 문제 p(r|x,y)로 재구성한다.
- DRM은 동결된 LLM 인코더를 기반으로 경량 Diffusion Transformer가 가우시안 노이즈를 보상 벡터로 제거(denoising)하며, 출력 분포에 대한 매개변수 가정 없이 자연스럽게 다중모달 구조를 표현한다.
전체 요약 8문장 읽기 →