쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 26일 (토)까지1085건
5건 · "SWE-bench"조건 지우기 ×
001▲ 16 · 댓글 2LLM 코딩 벤치마크, 실제 실력 평가 아닌 암기 성공 가능성SWE-bench 등 저장소 수준 코딩 벤치마크는 학습 데이터에 반복 사용된 인기 오픈소스 저장소 기반이라 데이터 유출 문제를 안고 있다.AI · 머신러닝 · Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?
LLM 코딩 벤치마크, 실제 실력 평가 아닌 암기 성공 가능성

Key PointLLM 코딩 평가 벤치마크가 실제 실력이 아닌 암기된 패턴 재인식을 측정하고 있을 가능성을 실증적으로 보여, SWE-bench 성능 신뢰도 문제를 제기한다.
핵심 요약
- SWE-bench 등 저장소 수준 코딩 벤치마크는 학습 데이터에 반복 사용된 인기 오픈소스 저장소 기반이라 데이터 유출 문제를 안고 있다.
- 강한 성능이 실제 저장소 추론 능력이 아니라 표준화된 저장소 단서 암기를 반영할 가능성이 있다.
- SchrodingerRepo 평가 프레임워크를 제안하며, 정적 저장소 표현 대신 평가 시점에 동적으로 인스턴스화된 저장소를 사용한다.
전체 요약 7문장 읽기 → 002▲ 16 · 댓글 3토큰 단위 신용할당 원리로 LLM 강화학습 개선강화학습 기반 LLM 후처리 훈련에서 토큰 단위 신용할당(credit assignment)의 수학적 정의가 명확하지 않아, 기존 훈련 신호들과의 관계가 불분명했다.AI · 머신러닝 · PACT: From Credit Assignment to Critic Alignment
토큰 단위 신용할당 원리로 LLM 강화학습 개선

Key Point토큰 단위 신용할당의 수학적 정의를 처음 엄밀하게 규정하고, 이를 바탕으로 LLM 강화학습의 핵심 알고리즘들을 통일된 틀에서 설명하며, 실제 수학·소프트웨어 문제에서 기존 방법들을 크게 능가하는 구체적 성과를 냈다.
핵심 요약
- 강화학습 기반 LLM 후처리 훈련에서 토큰 단위 신용할당(credit assignment)의 수학적 정의가 명확하지 않아, 기존 훈련 신호들과의 관계가 불분명했다.
- Completeness, Prefix Consistency, Neutrality 세 가지 정칙성 조건을 제시하면 토큰 단위 신용할당이 유일하게 결정됨을 증명했다.
- 이 특성화를 통해 On-Policy Distillation(OPD)의 이상적 교사가 암묵적 비평가 역할을 하며, Response-level REINFORCE Leave-One-Out(RLOO)이 토큰 단위 신용할당과 일치하는 정책 기울기를 낸다는 것을 확인했다.
전체 요약 7문장 읽기 → 003▲ 135 · 댓글 6LLM 에이전트의 '안목' 측정 벤치마크 공개장시간 작업에서 LLM 에이전트가 어느 방향으로 나아갈지 결정하는 능력을 '안목'(taste)이라 정의하고, 이를 평가하는 Taste-Bench 벤치마크를 개발했다.AI · 머신러닝 · The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
LLM 에이전트의 '안목' 측정 벤치마크 공개

Key Point장시간 작업을 수행하는 AI 에이전트의 핵심 약점인 '의사결정 능력'을 체계적으로 측정할 수 있는 첫 벤치마크이며, 어떤 조건에서 의사결정이 어려워지는지 파악할 수 있다.
핵심 요약
- 장시간 작업에서 LLM 에이전트가 어느 방향으로 나아갈지 결정하는 능력을 '안목'(taste)이라 정의하고, 이를 평가하는 Taste-Bench 벤치마크를 개발했다.
- 병렬 시도나 궤적 내 우회를 분석해 자동으로 결정 지점(decision fork)을 추출하고, 각 지점에서 여러 선택지 중 더 나은 결과로 이어진 것을 찾도록 모델을 평가한다.
- 최고 성능 모델도 정확히 59.7%의 질문에만 답했으며, 결정 근거가 뒤에 나타날수록 모든 모델의 정확도가 급격히 떨어진다.
전체 요약 5문장 읽기 → 004▲ 46 · 댓글 4소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다.AI · 머신러닝 · One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상

Key Point소프트웨어 개발 작업의 다양한 유형별 난제를 동시에 해결하는 새로운 멀티에이전트 학습 방식이 기존보다 눈에 띄게 성능을 개선했습니다.
핵심 요약
- 저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다.
- 연구팀은 카테고리별 전문 에이전트를 학습하고 이를 하나의 모델로 통합하는 프레임워크를 개발했다.
- 각 카테고리 전문가는 강화학습과 자기 검증 궤적 재활용, 작업 재선택을 반복하는 RRE(Refresh-Repair-Expand) 방식을 사용한다.
전체 요약 5문장 읽기 → 005▲ 15 · 댓글 3알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다.AI · 머신러닝 · Qwen 3.8 27B is out: open weights, best local dense model yet
알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능

Key Point로컬에서 구동 가능한 고성능 오픈소스 모델로, Hacker News 커뮤니티에서 배포 용이성과 벤치마크 성과에 주목받고 있다.
핵심 요약
- Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다.
- 27B 매개변수 모델로 코딩, 에이전트 작업, 멀티모달 이해 능력을 갖추고 262K 네이티브 컨텍스트를 지원한다.
- 터미널 코딩 벤치마크 73.0점, SWE-bench Pro 61.7점 등 기존 모델을 능가하는 성능을 보인다.