쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 3일 (토)까지1629건
3건 · "다중 보상"조건 지우기 ×
001▲ 18 · 댓글 2다중 보상 학습 최적화하는 CorrGRPO 알고리즘Group Relative Policy Optimization(GRPO)은 추론 언어 모델 학습에 널리 쓰이며, 동일 프롬프트 롤아웃에서 보상을 중심화·정규화해 이점을 계산한다.AI · 머신러닝 · CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
다중 보상 학습 최적화하는 CorrGRPO 알고리즘

Key Point여러 목표를 동시에 최적화해야 하는 언어 모델 학습에서 각 보상의 영향력을 균형 있게 조절하는 새로운 방법을 제시하므로, 추론 모델과 에이전트 개발자에게 실질적인 개선 기회를 제공한다.
핵심 요약
- Group Relative Policy Optimization(GRPO)은 추론 언어 모델 학습에 널리 쓰이며, 동일 프롬프트 롤아웃에서 보상을 중심화·정규화해 이점을 계산한다.
- 다중 보상 처리 시 기존 GRPO는 보상 성분을 합산한 뒤 그룹 내 표준편차로 정규화하는데, 분산이 모든 보상 공분산의 합이 된다.
- 중심화된 보상이 고정될 때 공분산이 클수록 이점이 작아지므로, 보상 간 상관성에 따라 업데이트 크기가 적응하지만 대규모 보상이 정규화를 지배해 소규모 보상 신호를 억제한다.
전체 요약 8문장 읽기 → 002▲ 43 · 댓글 2다중 보상 RL에서 희소 신호까지 균등하게 학습시키는 방법다중 보상 강화학습은 LLM이 여러 행동 목표를 동시에 만족하도록 훈련하는데, GDPO의 보상별 정규화 방식도 목표마다 학습 진도가 불균형하다는 문제가 있다.AI · 머신러닝 · Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
다중 보상 RL에서 희소 신호까지 균등하게 학습시키는 방법

Key Point다중 보상 학습에서 일부 목표만 우선 학습되는 문제를 밀도 기반의 수학적 분석으로 해결하고, 훈련 효율을 크게 개선한 방법론이다.
핵심 요약
- 다중 보상 강화학습은 LLM이 여러 행동 목표를 동시에 만족하도록 훈련하는데, GDPO의 보상별 정규화 방식도 목표마다 학습 진도가 불균형하다는 문제가 있다.
- 연구팀은 '장점 에너지(advantage energy)'—배치 내 보상의 제곱된 장점의 합—를 분석하여, 이 에너지가 '활동 밀도'(보상이 0이 아닌 상대적 장점을 제공하는 롤아웃 그룹의 비율)에 비례함을 증명했다.
- 이는 배치 단위의 신호 불균형을 드러내고, 보상 기여도 보정의 근거를 제공한다.
전체 요약 7문장 읽기 → 003당일 +120중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다.AI · 머신러닝 · meituan-longcat/LongCat-Video · Python
중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화

Key Point기존 영상 생성 모델의 색감 저하·품질 감소 문제를 장시간 생성으로 해결하고, 음성 기반 인물 애니메이션까지 확장한 첫 번째 오픈소스 통합 모델이기 때문에 영상 생성 분야의 기술 진화를 보여준다.
핵심 요약
- 미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다.
- 텍스트-투-비디오, 이미지-투-비디오, 비디오 연속 생성을 하나의 모델로 처리한다.
- 분단위 장시간 영상을 색감 저하나 품질 손실 없이 생성하며, 720p 30fps 영상을 분 단위로 생성할 수 있다.
전체 요약 6문장 읽기 →