쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 24일 (목)까지932건
2건 · "증류학습"조건 지우기 ×
001▲ 12 · 댓글 21% 토큰으로 충분할 수도, 그래디언트 추정의 효율성학생 모델 학습 시 교사 모델의 감독을 소수 토큰에만 할당하는 희소 온폴리시 증류(OPD) 기법의 그래디언트 추정 문제를 분석했다.AI · 머신러닝 · 1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation
1% 토큰으로 충분할 수도, 그래디언트 추정의 효율성

Key Point효율적인 모델 학습을 위해 어떤 토큰에 교사 감독을 할당할지 결정하는 문제에서, 단순한 유용성 평가뿐 아니라 그래디언트 추정 안정성도 고려해야 한다는 실질적 통찰을 제시한다.
핵심 요약
- 학생 모델 학습 시 교사 모델의 감독을 소수 토큰에만 할당하는 희소 온폴리시 증류(OPD) 기법의 그래디언트 추정 문제를 분석했다.
- 다음 토큰 샘플링으로부터 계산한 그래디언트가 노이즈를 많이 포함할 수 있으며, 신호 대 잡음 분해를 기반으로 정보 효율성 비율(IER)을 제안했다.
- IER은 토큰 선택 과정에서 유용성 점수와 결합되어 기존 방식보다 그래디언트 추정 신뢰성을 높인다.
- 수학·의료 추론 작업에서 0.1%~1%의 토큰 예산으로 전체 OPD와 동등하거나 초과하는 성능을 달성했다.
002▲ 13 · 댓글 2AI 에이전트 성능 향상 노하우를 모델에 담는 기법 제안에이전트 성능을 높이는 최적화된 '하네스'(외부 시스템)를 모델 가중치에 증류하는 Harness-Zero 기법을 발표했다.AI · 머신러닝 · Harness-Zero: Harness Distillation via Agent-as-Harness
AI 에이전트 성능 향상 노하우를 모델에 담는 기법 제안

Key Point특화된 외부 시스템 없이도 에이전트 성능을 크게 높일 수 있는 새로운 학습 방식이므로, 복잡한 작업을 자동화하려는 개발자에게 즉시 활용 가능한 기법이다.
핵심 요약
- 에이전트 성능을 높이는 최적화된 '하네스'(외부 시스템)를 모델 가중치에 증류하는 Harness-Zero 기법을 발표했다.
- 문제는 최적 하네스와 배포 환경의 하네스가 액션 스페이스와 정보 구조가 다르다는 점인데, 에이전트가 최적 하네스의 지도 하에 학생 응답을 교정해 훈련 데이터로 전환한다.
- 기존 코드 기반 접근법보다 에이전트 기반 하네스가 우수했으며, 배포 시 특화 하네스를 제거해도 기본 모델의 성공률이 23.3%에서 44.3%로 상승했다.
- 지식업무·도구 사용·과학 분야 실험에서 28개 행동 패턴 중 82.3%를 평균적으로 복구했다.