쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 30일 (수)까지1383건
5건 · "RLVR"조건 지우기 ×
001▲ 13 · 댓글 1컴퓨터 작업 에이전트, GUI와 CLI 결합으로 성능 대폭 향상기존 컴퓨터 사용 에이전트(CUA)는 GUI에만 의존하거나 특정 애플리케이션 API로 보완하는데, 전자는 비효율적이고 오류가 많고 후자는 확장성이 낮다.AI · 머신러닝 · HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents
컴퓨터 작업 에이전트, GUI와 CLI 결합으로 성능 대폭 향상

Key PointGUI와 CLI를 선택적으로 조합하는 기법으로 컴퓨터 작업 에이전트의 성능이 14.8포인트 개선되어, 더 효율적이고 일반화된 자동화 도구 개발의 새로운 방향을 제시한다.
핵심 요약
- 기존 컴퓨터 사용 에이전트(CUA)는 GUI에만 의존하거나 특정 애플리케이션 API로 보완하는데, 전자는 비효율적이고 오류가 많고 후자는 확장성이 낮다.
- 연구팀은 GUI의 일반성과 셸 명령어의 효율성을 결합한 하이브리드 접근 방식을 제시했다.
- 핵심 문제는 현재 모델들이 작업 실행 중 CLI를 언제·어떻게 사용할지 모른다는 점이다.
전체 요약 8문장 읽기 → 002▲ 24 · 댓글 1수학 추론 모델, 동료 모델과 궤적 교환으로 성능 향상RLVR(검증 가능한 보상 강화학습) 방식인 GRPO는 자가생성 궤적에 의존하지만 제한된 롤아웃 예산으로 인해 모두 실패한 그룹이 발생해 정책 기울기 신호를 얻지 못하는 문제가 있다.AI · 머신러닝 · Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
수학 추론 모델, 동료 모델과 궤적 교환으로 성능 향상

Key Point이질적 모델들 사이의 상호 보완성을 활용해 동일 예산으로 수학 추론 성능을 크게 향상시키는 새로운 강화학습 방식을 제시하고 있으며, 실제 벤치마크에서 GRPO 대비 일관된 성능 개선을 입증했다.
핵심 요약
- RLVR(검증 가능한 보상 강화학습) 방식인 GRPO는 자가생성 궤적에 의존하지만 제한된 롤아웃 예산으로 인해 모두 실패한 그룹이 발생해 정책 기울기 신호를 얻지 못하는 문제가 있다.
- 연구진은 서로 다른 모델들이 상호 보완적인 문제들에서 성공하는 패턴을 발견했으며, 이를 통해 강한 교사 모델 없이도 상호 학습이 가능함을 확인했다.
- 이를 바탕으로 GRAFT(Gated Replacement of Answer-Failed groups with peer Trajectories)를 제안했으며, 이는 모두 실패한 그룹을 정보량 많은 동료 그룹으로 교체하는 오프정책 인식 프레임워크다.
전체 요약 6문장 읽기 → 003▲ 111 · 댓글 47테스트할 사람 없는 시스템들, AI의 신무기가 되다저자는 2020년 팬데믹 당시 브라질 연방 정부 시스템에서 2억 명 이상의 국민 개인정보(신분증, CPF, 여권, 주소, 전화번호, 증인보호 여부 등)에 접근 가능한 취약점을 발견했다.보안 · The systems that no one will test
테스트할 사람 없는 시스템들, AI의 신무기가 되다
Key Point정부 시스템부터 민간 인프라까지 AI 에이전트가 대규모로 취약점을 자동 탐사할 수 있는 시대가 도래했으며, 보안 테스트를 받지 못한 시스템들의 위험성이 급증하고 있다.
핵심 요약
- 저자는 2020년 팬데믹 당시 브라질 연방 정부 시스템에서 2억 명 이상의 국민 개인정보(신분증, CPF, 여권, 주소, 전화번호, 증인보호 여부 등)에 접근 가능한 취약점을 발견했다.
- 해당 기관에 신고하자 담당자들은 처음엔 믿지 않았으나 설명 후 심각성을 인식하고 빠르게 수정했으며, 저자는 데이터를 유출하지 않았다.
- 2020~2026년 사이 ML 기술이 급속도로 발전했고, 최근 OpenAI의 기술 보고서 등에서 모델 관련 사이버보안 사건들이 보도되고 있다.
전체 요약 9문장 읽기 → 004▲ 28 · 댓글 1불확실한 성공은 강화, 확실한 실패는 교정하는 LLM 추론 방식LLM의 추론 능력을 강화하는 검증 가능한 보상 기반 강화학습(RLVR)에서 기존 신용 할당 방식들은 보조 모델이나 추가 샘플링, 특권 정보가 필요했다.AI · 머신러닝 · Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
불확실한 성공은 강화, 확실한 실패는 교정하는 LLM 추론 방식

Key PointLLM이 복잡한 추론 과제를 풀 때 필요한 신용 할당에서 추가 모델 없이도 작동하는 더 효율적인 방법이 제시되어, 강화학습 기반 LLM 개선의 실용성을 높인다.
핵심 요약
- LLM의 추론 능력을 강화하는 검증 가능한 보상 기반 강화학습(RLVR)에서 기존 신용 할당 방식들은 보조 모델이나 추가 샘플링, 특권 정보가 필요했다.
- 이 논문은 정책 엔트로피를 신호로 활용하되 성공과 실패를 비대칭으로 처리하는 Entropic Advantage Policy Optimization(EAPO)을 제안한다.
- EAPO의 핵심 아이디어는 불확실한 상황에서의 성공은 반복성이 낮고 확실한 실패는 되풀이되는 경향에서 비롯되었다.
전체 요약 7문장 읽기 → 005▲ 37 · 댓글 3강화학습으로 LLM의 추론능력 높이는 BPO 알고리즘 제안검증 가능한 보상을 활용한 강화학습(RLVR)으로 LLM의 추론 성능을 향상시키는 Bellman Policy Optimization(BPO)을 제안했다.AI · 머신러닝 · Bellman Policy Optimization
강화학습으로 LLM의 추론능력 높이는 BPO 알고리즘 제안

Key PointLLM의 수학 추론 같은 복잡한 작업 개선에 필요한 새로운 학습 알고리즘으로, 기존보다 계산 효율적인 방법을 제시한다.
핵심 요약
- 검증 가능한 보상을 활용한 강화학습(RLVR)으로 LLM의 추론 성능을 향상시키는 Bellman Policy Optimization(BPO)을 제안했다.
- Policy Mirror Descent(PMD)에서 유도한 비평가 불필요(critic-free) 방식으로, 벨만 방정식을 이용해 중간 상태의 값 추정을 피한다.
- 원래 PMD 목적함수와 동일한 유일한 최적해를 갖도록 증명했고, 손실함수는 보완적 토큰 확률의 평활 비율을 가중치로 사용한다.
전체 요약 4문장 읽기 →