쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 2일 (금)까지1537건
2건 · "온정책 증류"조건 지우기 ×
001▲ 11 · 댓글 1학생 모델의 정답 여부에 따라 선별한 교사 피드백으로 성능 향상기존 온정책 증류(OPD)는 강력한 교사 모델의 토큰 수준 피드백으로 학생을 훈련하지만, 학생이 이미 정확히 푼 질문에 교사가 실패하거나 과제별로 성공률이 다른 점을 무시한다.AI · 머신러닝 · DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation
학생 모델의 정답 여부에 따라 선별한 교사 피드백으로 성능 향상

Key Point학생과 교사의 성공 여부 조합에 따라 피드백을 다르게 적용하는 간단한 규칙으로 다중 과제에서 일관되게 성능을 높이는 새로운 증류 방식이기 때문에, 모델 경량화 실무에 직접 도입할 수 있는 기법으로 주목할 만하다.
핵심 요약
- 기존 온정책 증류(OPD)는 강력한 교사 모델의 토큰 수준 피드백으로 학생을 훈련하지만, 학생이 이미 정확히 푼 질문에 교사가 실패하거나 과제별로 성공률이 다른 점을 무시한다.
- 이 논문은 DuoOPD를 제안하며, 학생의 정답 여부가 피드백 방향을 결정하고 교사-학생 결과 조합이 교사의 지원 방식을 정한다.
- 교사만 성공한 경우 교사의 검증된 답변이 학생의 실패 응답 평가 맥락이 되고, 학생만 성공한 경우 과제별 가중치가 전체 응답을 강화한다.
전체 요약 7문장 읽기 → 002▲ 25 · 댓글 1학생 모델이 만든 문장을 선생 모델이 계속쓰며 학습OLIVE(온라인 인터벤션)라는 온라인 언어 모델 증류 방법을 제시한다.AI · 머신러닝 · Learning from Teacher Continuations at Student States
학생 모델이 만든 문장을 선생 모델이 계속쓰며 학습

Key Point온라인 학습과 오프라인 증류의 한계를 동시에 해결하는 새로운 증류 방식이 기존 방법 대비 더 나은 성능을 달성하는 방법론을 제시하기 때문이다.
핵심 요약
- OLIVE(온라인 인터벤션)라는 온라인 언어 모델 증류 방법을 제시한다.
- 각 반복 단계에서 학생 모델이 프리픽스를 생성하고, 선생 모델이 자동회귀로 이를 이어쓰며, 선생이 생성한 토큰에 대해 교차 엔트로피로 학생을 업데이트한다.
- 기존 증류 방법의 세 가지 제약을 해결한다: 고정된 선생 궤적으로 학습할 때의 순차적 공변량 시프트, 프리픽스 실패 시 단편적 감독, 선생의 토큰 확률값 접근 필요성.
전체 요약 8문장 읽기 →