쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 24일 (목)까지985건
2건 · "코딩 벤치마크"조건 지우기 ×
001▲ 12 · 댓글 1LLM이 코드를 학습했을까, 암기했을까?저장소 레벨 코딩 벤치마크는 훈련에 사용된 오픈소스 저장소를 반복 사용해 데이터 누수가 발생하고, 성능이 실제 추론 능력보다 암기를 반영할 수 있다.AI · 머신러닝 · Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?
LLM이 코드를 학습했을까, 암기했을까?

Key Point코딩 벤치마크의 신뢰성 문제를 실증적으로 검증한 연구로, LLM 기반 소프트웨어 엔지니어링 도구의 실제 능력이 얼마나 과대평가되고 있는지 보여준다.
핵심 요약
- 저장소 레벨 코딩 벤치마크는 훈련에 사용된 오픈소스 저장소를 반복 사용해 데이터 누수가 발생하고, 성능이 실제 추론 능력보다 암기를 반영할 수 있다.
- SchrodingerRepo 평가 프레임워크는 테스트 시점에 저장소를 동적으로 변환해 이름 규칙·파일 구조·구현 패턴 같은 익숙한 단서를 제거한다.
- SWE-bench Verified와 SWE-QA에서 저장소 단서를 제거하면 모든 LLM의 성능이 일관되게 저하되고, 상호작용 비용은 크게 증가한다.
- 추가 비용의 주원인은 저장소 탐색과 위치 파악의 어려움이며, 현재 코딩 에이전트가 저장소 단서에 부분적으로 의존하고 있음을 시사한다.
002▲ 15 · 댓글 3알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다.AI · 머신러닝 · Qwen 3.8 27B is out: open weights, best local dense model yet
알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능

Key Point로컬에서 구동 가능한 고성능 오픈소스 모델로, Hacker News 커뮤니티에서 배포 용이성과 벤치마크 성과에 주목받고 있다.
핵심 요약
- Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다.
- 27B 매개변수 모델로 코딩, 에이전트 작업, 멀티모달 이해 능력을 갖추고 262K 네이티브 컨텍스트를 지원한다.
- 터미널 코딩 벤치마크 73.0점, SWE-bench Pro 61.7점 등 기존 모델을 능가하는 성능을 보인다.