쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 6일 (화)까지1768건
3건 · "다중 교사"조건 지우기 ×
001▲ 15 · 댓글 1여러 전문 모델의 내부 표현까지 활용하는 학생 모델 증류법온폴리시 증류(OPD)는 학생 모델이 생성한 응답으로 스스로를 학습시키는 기법인데, 기존 다중 교사 방식은 교사 모델의 출력 분포만 전달한다.AI · 머신러닝 · Latent-MOPD: Latent Multi-Teacher On-Policy Distillation

Key Point여러 작은 전문 모델의 능력을 한 학생 모델에 집약할 때 숨겨진 상태라는 새로운 정보 채널을 활용하면 더 효과적인 학습이 가능하며, 이는 효율적인 언어 모델 설계에 새로운 방향을 제시한다.
핵심 요약
- 온폴리시 증류(OPD)는 학생 모델이 생성한 응답으로 스스로를 학습시키는 기법인데, 기존 다중 교사 방식은 교사 모델의 출력 분포만 전달한다.
- Latent-MOPD는 표현 수준의 첫 다중 교사 증류법으로, 교사의 예측뿐 아니라 예측을 계산하는 데 사용된 숨겨진 상태도 함께 활용한다.
- 추가 교사 학습 없이 기존 전문 모델을 통합하며, 여러 교사로부터의 표현 감독을 조정하기 위해 후층 타겟을 선택하고, 숨겨진 너비 차이를 공유 투영으로 해소하고, 도메인별로 업데이트를 그룹화한다.
전체 요약 9문장 읽기 → 002▲ 12 · 댓글 2에이전트의 다단계 학습 시 능력 저하를 막는 ACLArena 프레임워크산업 배포용 범용 에이전트는 여러 단계의 학습에서 각각 다른 능력을 습득해야 하는데, 이들을 통합할 때의 트레이드오프에 대한 표준 방법론이 부재했다.AI · 머신러닝 · ACLArena: Agent Continue Learning in Multi-stage Post-training

Key Point에이전트가 여러 능력을 순차적으로 학습할 때 이전 기술을 잊는 문제를 해결하는 실질적 기법을 제시하므로, 멀티태스크 학습이 필요한 AI 시스템 개발에 참고할 수 있다.
핵심 요약
- 산업 배포용 범용 에이전트는 여러 단계의 학습에서 각각 다른 능력을 습득해야 하는데, 이들을 통합할 때의 트레이드오프에 대한 표준 방법론이 부재했다.
- ACLArena는 에이전트 지속 학습(ACL)을 ���합적으로 연구·분석·평가하는 프레임워크로, 순차 학습 파이프라인을 구축하고 모델 수준과 토큰 수준에서 망각(catastrophic forgetting)과 일반화 메커니즘을 분석했다.
- 다중 교사 온-폴리시 증류, 자기증류 미세 조정, 모델 병합 등 세 가지 통합 패러다임을 체계적으로 비교하여 이전 학습 능력 복구와 새 능력 보존의 균형을 평가했다.
전체 요약 5문장 읽기 → 003▲ 46 · 댓글 4소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다.AI · 머신러닝 · One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents

Key Point소프트웨어 개발 작업의 다양한 유형별 난제를 동시에 해결하는 새로운 멀티에이전트 학습 방식이 기존보다 눈에 띄게 성능을 개선했습니다.
핵심 요약
- 저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다.
- 연구팀은 카테고리별 전문 에이전트를 학습하고 이를 하나의 모델로 통합하는 프레임워크를 개발했다.
- 각 카테고리 전문가는 강화학습과 자기 검증 궤적 재활용, 작업 재선택을 반복하는 RRE(Refresh-Repair-Expand) 방식을 사용한다.
전체 요약 5문장 읽기 →