쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 3일 (토)까지1629건
2건 · "자기증류"조건 지우기 ×
001▲ 10 · 댓글 2수학 문제 풀이 AI, 근처 파라미터로 학습 더 정확해진다수학 추론 모델을 학습시키는 온정책 자기증류(OPSD)는 기준 해답을 보는 특권화된 교사가 학생이 샘플한 중간 단계를 감독한다.AI · 머신러닝 · Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation
수학 문제 풀이 AI, 근처 파라미터로 학습 더 정확해진다

Key Point기존 자기증류 방식의 고정된 감독 전략을 파라미터 근처 탐색으로 개선해 AIME 수학 올림피아드 벤치마크에서 2~3포인트 일관된 성능 향상을 달성했으므로, 수학 문제 풀이 AI의 정확도 향상이 어떻게 이루어지는지 실제로 확인할 수 있다.
핵심 요약
- 수학 추론 모델을 학습시키는 온정책 자기증류(OPSD)는 기준 해답을 보는 특권화된 교사가 학생이 샘플한 중간 단계를 감독한다.
- 기존 OPSD는 매 상태마다 고정된 파라미터 설정 하나만 사용했으나, 근처의 파라미터 변동이 같은 기준 맥락에서 추가 감독을 제공한다.
- 지역 파라미터 섭동은 기준과 정렬된 상이한 정정(correction)을 드러내며, 다양한 전문가들이 기준 위치의 여러 지점에서 이를 제공한다.
전체 요약 9문장 읽기 → 002▲ 12 · 댓글 2에이전트의 다단계 학습 시 능력 저하를 막는 ACLArena 프레임워크산업 배포용 범용 에이전트는 여러 단계의 학습에서 각각 다른 능력을 습득해야 하는데, 이들을 통합할 때의 트레이드오프에 대한 표준 방법론이 부재했다.AI · 머신러닝 · ACLArena: Agent Continue Learning in Multi-stage Post-training
에이전트의 다단계 학습 시 능력 저하를 막는 ACLArena 프레임워크

Key Point에이전트가 여러 능력을 순차적으로 학습할 때 이전 기술을 잊는 문제를 해결하는 실질적 기법을 제시하므로, 멀티태스크 학습이 필요한 AI 시스템 개발에 참고할 수 있다.
핵심 요약
- 산업 배포용 범용 에이전트는 여러 단계의 학습에서 각각 다른 능력을 습득해야 하는데, 이들을 통합할 때의 트레이드오프에 대한 표준 방법론이 부재했다.
- ACLArena는 에이전트 지속 학습(ACL)을 ���합적으로 연구·분석·평가하는 프레임워크로, 순차 학습 파이프라인을 구축하고 모델 수준과 토큰 수준에서 망각(catastrophic forgetting)과 일반화 메커니즘을 분석했다.
- 다중 교사 온-폴리시 증류, 자기증류 미세 조정, 모델 병합 등 세 가지 통합 패러다임을 체계적으로 비교하여 이전 학습 능력 복구와 새 능력 보존의 균형을 평가했다.
전체 요약 5문장 읽기 →