쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 24일 (목)까지 985건
9건 · "SWE"조건 지우기 ×
001 15:11 ▲ 14 · 댓글 2 LLM 강화학습의 신용 할당 문제, 수학적으로 정의하다 강화학습 기반 LLM 학습에서 토큰 수준의 신용 할당이 명확한 수학적 정의가 없다는 문제를 지적했다. AI · 머신러닝 · PACT: From Credit Assignment to Critic Alignment
LLM 강화학습의 신용 할당 문제, 수학적으로 정의하다 Key Point LLM 강화학습의 핵심인 신용 할당을 수학적으로 정의함으로써 기존 알고리즘들의 동작 원리를 통일된 관점에서 설명할 수 있게 되었고, 이를 기반으로 한 PACT 방법론이 주요 벤치마크에서 현저한 성능 향상을 보여준다.
핵심 요약
강화학습 기반 LLM 학습에서 토큰 수준의 신용 할당이 명확한 수학적 정의가 없다는 문제를 지적했다. 완전성·접두사 일관성·중립성이라는 세 가지 규칙 조건으로 토큰 수준 신용을 유일하게 결정할 수 있음을 증명했다. 이 정의를 바탕으로 On-Policy Distillation의 교사는 암시적 비평가 역할을 한다는 점과 Response-level RLOO가 토큰 수준 신용과 동일한 정책 그래디언트를 만든다는 점을 보였다. 이를 토대로 Policy Aligned Critic Training(PACT)을 제안했으며, 액터 먼저 업데이트 후 비평가를 업데이트하고 중요도 샘플링 보정을 적용한다. 수학 추론 벤치마크에서 PACT는 평균 72.87% 정확도로 GRPO보다 8.8p, PPO보다 13.16p 높았고, SWE-bench에서 67.4% 통과율로 PPO·GRPO·SAO를 각각 2.4~3.8p 앞섰다. 002 12:10 ▲ 12 · 댓글 1 LLM이 코드를 학습했을까, 암기했을까? 저장소 레벨 코딩 벤치마크는 훈련에 사용된 오픈소스 저장소를 반복 사용해 데이터 누수가 발생하고, 성능이 실제 추론 능력보다 암기를 반영할 수 있다. AI · 머신러닝 · Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?
LLM이 코드를 학습했을까, 암기했을까? Key Point 코딩 벤치마크의 신뢰성 문제를 실증적으로 검증한 연구로, LLM 기반 소프트웨어 엔지니어링 도구의 실제 능력이 얼마나 과대평가되고 있는지 보여준다.
핵심 요약
저장소 레벨 코딩 벤치마크는 훈련에 사용된 오픈소스 저장소를 반복 사용해 데이터 누수가 발생하고, 성능이 실제 추론 능력보다 암기를 반영할 수 있다. SchrodingerRepo 평가 프레임워크는 테스트 시점에 저장소를 동적으로 변환해 이름 규칙·파일 구조·구현 패턴 같은 익숙한 단서를 제거한다. SWE-bench Verified와 SWE-QA에서 저장소 단서를 제거하면 모든 LLM의 성능이 일관되게 저하되고, 상호작용 비용은 크게 증가한다. 추가 비용의 주원인은 저장소 탐색과 위치 파악의 어려움이며, 현재 코딩 에이전트가 저장소 단서에 부분적으로 의존하고 있음을 시사한다. 003 18:11 ▲ 115 · 댓글 6 LLM 에이전트의 '안목' 측정 벤치마크 공개 장시간 작업에서 LLM 에이전트가 어느 방향으로 나아갈지 결정하는 능력을 '안목'(taste)이라 정의하고, 이를 평가하는 Taste-Bench 벤치마크를 개발했다. AI · 머신러닝 · The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
LLM 에이전트의 '안목' 측정 벤치마크 공개 Key Point 장시간 작업을 수행하는 AI 에이전트의 핵심 약점인 '의사결정 능력'을 체계적으로 측정할 수 있는 첫 벤치마크이며, 어떤 조건에서 의사결정이 어려워지는지 파악할 수 있다.
핵심 요약
장시간 작업에서 LLM 에이전트가 어느 방향으로 나아갈지 결정하는 능력을 '안목'(taste)이라 정의하고, 이를 평가하는 Taste-Bench 벤치마크를 개발했다. 병렬 시도나 궤적 내 우회를 분석해 자동으로 결정 지점(decision fork)을 추출하고, 각 지점에서 여러 선택지 중 더 나은 결과로 이어진 것을 찾도록 모델을 평가한다. 최고 성능 모델도 정확히 59.7%의 질문에만 답했으며, 결정 근거가 뒤에 나타날수록 모든 모델의 정확도가 급격히 떨어진다. 추론에 더 많은 예산을 쓰더라도 정확도는 개선되지 않았다. 교사 모델의 판단을 학생 모델로 증류해 훈련하면 학생이 보지 못한 작업에서 더 나은 결정을 내리고 SWE-bench Pro 작업의 최종 성공률을 향상시킨다. 004 00:11 당일 +105 27개 정보원을 실시간 통합한 개인용 인텔리전스 대시보드 Crucix는 위성 화재 감지, 비행 추적, 방사능 모니터링, 위성 궤도 추적, 경제 지표, 실시간 시장 가격, 분쟁 데이터 등 27개의 오픈소스 정보원을 15분 주기로 병렬 수집해 단일 대시보드에 표시한다. 오픈소스 · 도구 · calesthio/Crucix · JavaScript
27개 정보원을 실시간 통합한 개인용 인텔리전스 대시보드 Key Point 27개 정보원의 분산된 오픈데이터를 로컬에서 직접 수집·집계해 중앙 플랫폼 의존성 없이 실시간 글로벌 상황을 추적할 수 있게 한다.
핵심 요약
Crucix는 위성 화재 감지, 비행 추적, 방사능 모니터링, 위성 궤도 추적, 경제 지표, 실시간 시장 가격, 분쟁 데이터 등 27개의 오픈소스 정보원을 15분 주기로 병렬 수집해 단일 대시보드에 표시한다. 3D WebGL 지구본, 9가지 마커 타입, 비행 경로 아크 애니메이션, 지역별 필터, 실시간 시장 데이터, VIX·신용스프레드·공급망 지표 등을 포함한다. LLM 연결 시 양방향 인텔리전스 어시스턴트로 작동하며, Telegram·Discord로 다계층 알림을 보내거나 휴대폰에서 /brief, /sweep 같은 명령에 응답한다. 클라우드, 텔레메트리, 구독료 없이 로컬에서 실행되며, Node.js 22+만 있으면 `node server.mjs` 한 줄로 시작된다. VISUALS LITE 모드에서는 배경 효과와 애니메이션을 비활성화해 성능을 높이지만, 데이터 수집 범위는 그대로 유지된다. 005 16:18 ▲ 35 · 댓글 4 소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상 저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다. AI · 머신러닝 · One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상 Key Point 소프트웨어 개발 작업의 다양한 유형별 난제를 동시에 해결하는 새로운 멀티에이전트 학습 방식이 기존보다 눈에 띄게 성능을 개선했습니다.
핵심 요약
저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다. 연구팀은 카테고리별 전문 에이전트를 학습하고 이를 하나의 모델로 통합하는 프레임워크를 개발했다. 각 카테고리 전문가는 강화학습과 자기 검증 궤적 재활용, 작업 재선택을 반복하는 RRE(Refresh-Repair-Expand) 방식을 사용한다. 여러 전문가 모델을 다중 교사 지식 증류로 하나의 학생 모델로 통합하며, ReLU 게이트를 통해 각 교사의 개선 방향만 선택적으로 학습한다. 최종 모델은 Pro-618 벤치에서 58.04%, SWE-bench Multilingual에서 59.00% 해결률을 달성해 기본 모델 대비 각각 5.39, 2.78 포인트 향상했다. 006 16:18 ▲ 127 · 댓글 3 소스코드만으로 강화학습 환경 자동 구축하는 CodeMidas CodeMidas는 오픈소스 저장소의 소스코드만을 이용해 5,545개 강화학습 환경을 자동 구축했다. AI · 머신러닝 · CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
소스코드만으로 강화학습 환경 자동 구축하는 CodeMidas Key Point 소스코드 자체만으로 대규모 RL 환경을 자동 구축해 코딩 에이전트 훈련의 확장성 문제를 해결했으며, 실제 벤치마크에서 10~17%의 성능 향상을 달성했기 때문이다.
핵심 요약
CodeMidas는 오픈소스 저장소의 소스코드만을 이용해 5,545개 강화학습 환경을 자동 구축했다. 에이전트가 코드베이스의 기능을 탐색하여 명세를 작성하고, 실행 기반 테스트를 생성한 뒤 검증하는 3단계 파이프라인을 거친다. 23개 프로그래밍 언어와 15개 기술 도메인의 3,185개 코드베이스에서 수집되었다. GRPO로 학습한 MiMo-V2.5는 버그 수정(DeepSWE +11.7%), 전체 프로그램 작성(ProgramBench +17%), 터미널 작업(+8.5%) 등 5개 벤치마크에서 모두 성능을 향상시켰다. 고품질 학습 데이터가 많을수록 성능이 개선되며, RL 훈련 에이전트는 코드베이스 탐색과 자체 검증이 더 다양해진다. 007 12:10 ▲ 142 · 댓글 70 실제 기업 코드베이스로 AI 코딩 능력 평가하는 벤치마크 공개 실제 운영 중인 기업의 프라이빗 코드베이스에서 추출한 과제로 AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 'Real-SWE' 벤치마크를 발표했다. AI · 머신러닝 · Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
실제 기업 코드베이스로 AI 코딩 능력 평가하는 벤치마크 공개 Key Point 기존의 합성 또는 공개 데이터셋 기반 벤치마크와 달리, 실제 프로덕션 코드베이스의 복잡성과 비즈니스 규칙이 포함된 평가 기준을 제시해 AI 코딩 에이전트의 현실적 능력을 가늠할 수 있다.
핵심 요약
실제 운영 중인 기업의 프라이빗 코드베이스에서 추출한 과제로 AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 'Real-SWE' 벤치마크를 발표했다. 세금 계산, 청구 시스템, 고객 마이그레이션 등 실제 비즈니스 영향을 미치는 작업을 포함하며, 회사별 고유한 코딩 관례와 레거시 시스템을 이해해야 한다. Fable 5.1이 38.8% 해결율로 1위, GPT-6 Astra가 33.8%, Gemini 3.8이 31.2%로 뒤를 이었다. 참고 해결책은 평균 11개 파일에 걸쳐 수정하며, 작업 지시사항은 평균 1,742자로 의도적으로 과소 정의되어 있다. NestJS, PostgreSQL, Kubernetes, Docker 등 실제 엔터프라이즈 개발 환경을 시뮬레이션하고, 각 모델-하네스 조합을 별도로 평가한다. 008 03:10 ▲ 136 · 댓글 67 Cognition, 코딩 AI 모델 SWE-2 공개 Cognition이 최신 소프트웨어 엔지니어링 모델 SWE-2를 발표했다. AI · 머신러닝 · Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra
Cognition, 코딩 AI 모델 SWE-2 공개 Key Point 소프트웨어 엔지니어링 AI의 성능-비용 경계가 어떻게 달라졌는지, 그리고 이전 모델의 과잉 탐색 문제를 어떻게 해결했는지 알 수 있다.
핵심 요약
Cognition이 최신 소프트웨어 엔지니어링 모델 SWE-2를 발표했다. FrontierCode 1.1 Main에서 50.0% 점수를 기록해 Fable 5.1과 1포인트 차이나며, 비용은 64% 더 저렴하다. 다중 삼조 파라미터 규모에서 강화학습을 처음 적용해 모든 성능-비용 트레이드오프를 최적화했다. Kimi K33(2.8T 파라미터) 기반으로 선형 비용 페널티와 개선된 RL 보상 베이스라인을 적용했다. SWE-2는 SWE-1.7 대비 같은 작업을 58% 적은 스텝으로 81% 낮은 비용에 수행하며, Devin Desktop·CLI·Web·Fusion에서 즉시 이용 가능하다. 009 00:10 ▲ 15 · 댓글 3 알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능 Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다. AI · 머신러닝 · Qwen 3.8 27B is out: open weights, best local dense model yet
알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능 Key Point 로컬에서 구동 가능한 고성능 오픈소스 모델로, Hacker News 커뮤니티에서 배포 용이성과 벤치마크 성과에 주목받고 있다.
핵심 요약
Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다. 27B 매개변수 모델로 코딩, 에이전트 작업, 멀티모달 이해 능력을 갖추고 262K 네이티브 컨텍스트를 지원한다. 터미널 코딩 벤치마크 73.0점, SWE-bench Pro 61.7점 등 기존 모델을 능가하는 성능을 보인다.