쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 30일 (수)까지 1314건
23건 · "증류"조건 지우기 ×
001 21:11 ▲ 26 · 댓글 1 로봇이 실패를 스스로 극복하게 해주는 '수첩' 기법 로보틱스의 핵심 과제는 다양한 작업과 환경에서 조작 능력을 발휘하는 것인데, 비전-언어-행동(VLA) 모델은 실행 중 실패를 진단하고 행동을 적응시켜야 할 때 어려움을 겪는다. AI · 머신러닝 · Recursive Harness Distillation across Agents for Robot Manipulation
로봇이 실패를 스스로 극복하게 해주는 '수첩' 기법 Key Point 로봇 조작의 실패 대응을 자동화하는 방법론이 제시되어, 다양한 환경의 로봇 작업 신뢰도를 크게 높일 수 있는 경로를 보여준다.
핵심 요약
로보틱스의 핵심 과제는 다양한 작업과 환경에서 조작 능력을 발휘하는 것인데, 비전-언어-행동(VLA) 모델은 실행 중 실패를 진단하고 행동을 적응시켜야 할 때 어려움을 겪는다. 연구팀은 강한 에이전트가 약한 에이전트를 위해 경험을 '플레이북'으로 정제하고, 약한 에이전트의 실행 피드백으로 이를 반복 개선하는 '재귀적 하네스 증류(Recursive Harness Distillation)' 기법을 제안했다. 이 플레이북은 모델 파라미터를 업데이트하지 않고도 새로운 작업에서 누적된 개입 지식을 재사용하게 해준다. 전체 요약 6문장 읽기 → 002 18:11 ▲ 22 · 댓글 1 실시간 응답하면서 긴 시간 일관성 유지하는 세계 모델 공개 실시간 대응과 장기간 일관성을 동시에 달성해야 하는 인터랙티브 월드모델에서, 다양한 제어 신호 처리와 맥락 폭증, 불안정한 증류가 핵심 과제였다. AI · 머신러닝 · WorldPlay2: Extending Real-Time Interactive World Models in Control and Horizon
실시간 응답하면서 긴 시간 일관성 유지하는 세계 모델 공개 Key Point 대규모 언어 모델 기반 세계 모델이 실시간 제어 응답과 장시간 예측의 두 가지 모순된 요구를 동시에 만족시켜야 하는 상황에서, 기술적 혁신을 통해 두 가지 성능을 모두 달성하는 방법론을 제시하기 때문이다.
핵심 요약
실시간 대응과 장기간 일관성을 동시에 달성해야 하는 인터랙티브 월드모델에서, 다양한 제어 신호 처리와 맥락 폭증, 불안정한 증류가 핵심 과제였다. WorldPlay2는 분해된 하이브리드 제어 인터페이스와 압축 메모리·안정적 증류의 결합을 통해 이 문제를 해결한다. 제어 인터페이스는 프레임 정렬 액션 제어와 구조화된 의미적 제어를 통합해 장면 모양, 캐릭터 정체성, 동적 의미 이벤트를 명시적으로 분리함으로써 효과적 학습을 지원한다. 전체 요약 7문장 읽기 → 003 15:11 ▲ 15 · 댓글 1 온폴리시 증류 붕괴 문제, 마지막 레이어 신호로 해결 온폴리시 증류(OPD)는 학생 모델이 생성한 응답을 교사 모델의 다음 토큰 분포로만 보정하기 때문에, 교사가 어떻게 생각하는지(잠재 상태)는 학습하지 못한다. AI · 머신러닝 · LastOPD: Taming Collapse in Latent On-Policy Distillation
온폴리시 증류 붕괴 문제, 마지막 레이어 신호로 해결 Key Point 온폴리시 증류의 근본적인 붕괴 문제를 진단하고 해결한 방법론으로, 작은 모델의 효율적 학습에 직접 적용할 수 있는 실용적 개선안을 제시한다.
핵심 요약
온폴리시 증류(OPD)는 학생 모델이 생성한 응답을 교사 모델의 다음 토큰 분포로만 보정하기 때문에, 교사가 어떻게 생각하는지(잠재 상태)는 학습하지 못한다. 최신 방법인 OPRD는 학생의 잠재 상태를 교사의 잠재 상태에 정렬하는 신호를 추가하지만, 실제 실험에서 심각한 문제가 발생한다. Qwen3 모델 증류 시 초기 성능은 높았지만(MATH-500에서 25에서 46으로 올라감) 이후 10단계 후 성능이 11까지 급락하며 회복되지 않는 '조기 이득, 후기 붕괴' 현상이 나타났다. 전체 요약 7문장 읽기 → 004 15:11 ▲ 126 · 댓글 1 다중 전문가 모델 통합, 피드백 균형이 결정한다 강화학습으로 한 언어모델을 수학, 코딩, 지시 따르기 등 단일 분야에 특화된 여러 전문가 모델로 나눌 수 있지만, 사용자는 모든 능력을 갖춘 하나의 모델이 필요하다. AI · 머신러닝 · Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation
다중 전문가 모델 통합, 피드백 균형이 결정한다 Key Point 여러 전문 분야의 언어모델을 하나로 통합할 때 단순 라우팅만으로는 부족하며, 도메인별 피드백의 강도를 정규화해야 모든 능력을 균형 있게 갖춘 학생 모델을 만들 수 있다는 실증적 발견을 제시한다.
핵심 요약
강화학습으로 한 언어모델을 수학, 코딩, 지시 따르기 등 단일 분야에 특화된 여러 전문가 모델로 나눌 수 있지만, 사용자는 모든 능력을 갖춘 하나의 모델이 필요하다. 기존 다중교사 정책 내 증류(MOPD) 방식은 학생 모델이 각 프롬프트에 답하면 해당 분야의 전문가가 모든 토큰에 대해 피드백을 주도록 라우팅하는 방식으로 통합한다. Qwen 3.5 세 가지 크기에서 실험한 결과, MOPD 학생 모델은 최고의 단일 전문가 모델을 이기지 못했으며 수학 전문가의 장점을 거의 얻지 못했다. 전체 요약 8문장 읽기 → 005 12:11 ▲ 16 · 댓글 1 복합 질의를 위한 문서 집합 재순위화, 적응형 튜터링으로 개선 RAG와 깊이 있는 연구에서 문서 재순위화는 하류 모델이 받는 증거를 결정하는데, 기존 재순위화기는 관련성 매칭으로만 선택해 복잡한 정보 요구에 필요한 보완적·비중복 문서 집합을 구성하지 못했다. AI · 머신러닝 · AdaTutoRank: Learning to Rerank Document Sets via Adaptive Tutoring Optimization for RAG and Deep Research
복합 질의를 위한 문서 집합 재순위화, 적응형 튜터링으로 개선 Key Point 복잡한 정보 검색에서 단순한 관련성 매칭을 넘어 보완적이고 비중복적인 문서 집합을 구성해야 한다는 새로운 접근이 RAG 성능 개선에 직결된다.
핵심 요약
RAG와 깊이 있는 연구에서 문서 재순위화는 하류 모델이 받는 증거를 결정하는데, 기존 재순위화기는 관련성 매칭으로만 선택해 복잡한 정보 요구에 필요한 보완적·비중복 문서 집합을 구성하지 못했다. 기존 방식은 문서 집합을 평가할 때 하나의 스칼라 점수로 모든 문서를 동등하게 보상하므로 감독 신호가 희박해, 중복 문서도 집합이 잘 나오면 보상받고 결정적 문서도 집합이 못 나오면 페널티를 받아 신용 할당이 불명확했다. AdaTutoRank는 적응형 튜터링 최적화(ATO) 기법으로 훈련되는 집합 단위 재순위화기로, 9개 평가 기준을 3단계 계층 구조로 조직해 콜드 스타트용 은레이블·강화학습용 보상·증류용 힌트를 제공한다. 전체 요약 6문장 읽기 → 006 06:11 ▲ 412 · 댓글 276 Claude Sonnet 5.5 공개, Sonnet 5 대비 30% 빠르고 저렴 Anthropic이 Claude Sonnet 5.5를 발표했으며, Sonnet 5보다 30% 이상 빠르고 대부분의 작업에서 최대 30% 저렴하다. AI · 머신러닝 · Sonnet 5.5
Claude Sonnet 5.5 공개, Sonnet 5 대비 30% 빠르고 저렴 Key Point Sonnet 5.5는 코딩과 일상적 지식 작업에서 이전 세대보다 대폭 개선되면서도 비용을 크게 낮춰 개발자의 생산성과 경제성을 동시에 높일 수 있는 새로운 기준을 제시한다.
핵심 요약
Anthropic이 Claude Sonnet 5.5를 발표했으며, Sonnet 5보다 30% 이상 빠르고 대부분의 작업에서 최대 30% 저렴하다. Sonnet 5.5는 Opus 5.5의 보완재로, 일상적인 작업·버그 수정·문서/슬라이드/스프레드시트 작성에 최적화되어 있고 디자인 감각이 뛰어나다. 기술 성능에서 코딩 작업의 agentic 평가인 Terminal-Bench 4.0에서 70.6%를 기록해 Sonnet 5의 10.3%에서 대폭 상승했고, GDPval-AA 테스트에서는 Opus 5.5에 2점 차이로 근접했다. 전체 요약 12문장 읽기 → 007 15:11 ▲ 18 · 댓글 1 로봇 조작을 위한 통합 세계 행동 모델 InternW0-Δ 공개 로봇 조작 태스크를 위해 시각 동역학과 행동 생성을 함께 모델링하는 World Action Models(WAMs)를 개발했으며, 대규모 사전학습 모델의 지식을 통합하는 것이 핵심 과제다. AI · 머신러닝 · InternW0-Δ: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data
로봇 조작을 위한 통합 세계 행동 모델 InternW0-Δ 공개 Key Point 로봇 조작 분야에서 대규모 오픈 데이터와 통합 프레임워크를 통해 실용적인 성능을 달성한 방법론이 공개되는 만큼, 로봇 학습과 시뮬-투-리얼 연구에 직접 활용할 수 있는 자료다.
핵심 요약
로봇 조작 태스크를 위해 시각 동역학과 행동 생성을 함께 모델링하는 World Action Models(WAMs)를 개발했으며, 대규모 사전학습 모델의 지식을 통합하는 것이 핵심 과제다. InternW0-Δ는 Mixture-of-Transformers 프레임워크로 설계되었고, 사전학습된 비디오 전문가와 행동 전문가가 고정된 VLM의 의미 지도 아래에서 상호작용한다. 사전학습된 4D 파운데이션 모델이 기하학적, 모션 사전 정보를 훈련 전용 증류로 주입하며, Causal Imprint 방식은 미래 감독 신호에서 미래 관련 장면 변화를 학습한다. 전체 요약 6문장 읽기 → 008 00:11 ▲ 17 · 댓글 3 오픈소스로 공개된 GLM 초거대 모델 학습법 Rufus-Air는 GLM-4.5-Air-Base(106B-A12B) 모델의 오픈 소스 포스트트레이닝 레시피로, SFT·Reasoning RL·Coding RL·Instruction-Following RL·General Agent·Coding Agent·Search Agent·RLHF 8단계 파이프라인으로 구성된다. AI · 머신러닝 · Rufus-Air: An Open LLM Post-Training Recipe
오픈소스로 공개된 GLM 초거대 모델 학습법 Key Point 106B급 거대 언어모델의 전체 학습 파이프라인을 완벽히 공개한 첫 사례로, 독립적인 모델 개발을 시도하는 연구팀과 기업들이 직접 참고할 수 있는 실증적 설계서다.
핵심 요약
Rufus-Air는 GLM-4.5-Air-Base(106B-A12B) 모델의 오픈 소스 포스트트레이닝 레시피로, SFT·Reasoning RL·Coding RL·Instruction-Following RL·General Agent·Coding Agent·Search Agent·RLHF 8단계 파이프라인으로 구성된다. 데이터·보상 설계·인프라·단계 순서·단계별 결과를 공개하여 누구나 재현할 수 있도록 했으며, 새로운 인간 주석이나 자체 증류 교사 없이 공개 데이터와 오픈소스 컴포넌트를 그대로 사용했다. 기초 능력부터 고급 능력으로 진행되며, 검증 가능한 보상에서 판사 기반 신호로 점진적으로 전환된다. 전체 요약 5문장 읽기 → 009 09:11 ▲ 104 · 댓글 44 메타 뮤즈, 내부에서 OpenAI 모델 사용 흔적 발견 메타의 AI 에이전트 뮤즈에서 Avocado라는 메타 내부 모델 외에 azure/muse-special이라는 라벨의 OpenAI 모델이 사용되는 것을 발견했다. AI · 머신러닝 · Meta's Muse appears to use an OpenAI model labeled muse-special
메타 뮤즈, 내부에서 OpenAI 모델 사용 흔적 발견 Key Point 메타 뮤즈가 공개적으로 공개하지 않은 OpenAI 모델을 백엔드에서 사용하고 있으며, 메타가 외부 모델의 암호화된 응답을 수집하는 방식이 모델 개발 전략과 사용자 데이터 취급에 대한 기술적 통찰을 제공한다.
핵심 요약
메타의 AI 에이전트 뮤즈에서 Avocado라는 메타 내부 모델 외에 azure/muse-special이라는 라벨의 OpenAI 모델이 사용되는 것을 발견했다. muse-special 세션의 서명에는 gpt_responses_v1 태그와 OpenAI가 사용하는 gAAAAA로 시작하는 암호화 페이로드가 포함되어 있으며, 도구 호출 ID가 OpenAI 형식(call_ 뒤 24자)을 따른다. 뮤즈의 에이전트 데몬에는 Claude Opus/Sonnet/Haiku, GPT-5.5/5.6 변형들, Kimi K3 등 약 15개의 Avocado 버전과 함께 다양한 모델이 탑재되어 있다. 전체 요약 8문장 읽기 → 010 22:45 당일 +276 NVIDIA Model Optimizer, 양자화·가지치기·증류 등 최적화 기법 통합 라이브러리 오픈소스화 NVIDIA Model Optimizer는 양자화, 가지치기(pruning), 신경망 구조 탐색(NAS), 증류, 추측 디코딩, 희소성 등 최신 모델 최적화 기법을 통합한 라이브러리다. AI · 머신러닝 · NVIDIA/Model-Optimizer · Python
NVIDIA Model Optimizer, 양자화·가지치기·증류 등 최적화 기법 통합 라이브러리 오픈소스화 Key Point DL 인퍼런스 배포 시 성능과 메모리 효율을 동시에 높이려는 개발자들에게 양자화, 가지치기, 증류 등을 통합 관리할 수 있는 공식 도구가 생겼고, 오픈소스로 누구나 기여 가능해졌다.
핵심 요약
NVIDIA Model Optimizer는 양자화, 가지치기(pruning), 신경망 구조 탐색(NAS), 증류, 추측 디코딩, 희소성 등 최신 모델 최적화 기법을 통합한 라이브러리다. Hugging Face, PyTorch, ONNX 모델을 입력받아 Python API로 최적화 기법들을 조합해 적용하고, 최적화된 양자화 체크포인트를 생성한다. 생성된 체크포인트는 TensorRT-LLM, vLLM, SGLang 등 인퍼런스 프레임워크에 바로 배포 가능하며, Megatron-Bridge 및 Hugging Face Accelerate와 통합돼 있다. 전체 요약 12문장 읽기 → 011 22:26 ▲ 12 · 댓글 2 에이전트의 다단계 학습 시 능력 저하를 막는 ACLArena 프레임워크 산업 배포용 범용 에이전트는 여러 단계의 학습에서 각각 다른 능력을 습득해야 하는데, 이들을 통합할 때의 트레이드오프에 대한 표준 방법론이 부재했다. AI · 머신러닝 · ACLArena: Agent Continue Learning in Multi-stage Post-training
에이전트의 다단계 학습 시 능력 저하를 막는 ACLArena 프레임워크 Key Point 에이전트가 여러 능력을 순차적으로 학습할 때 이전 기술을 잊는 문제를 해결하는 실질적 기법을 제시하므로, 멀티태스크 학습이 필요한 AI 시스템 개발에 참고할 수 있다.
핵심 요약
산업 배포용 범용 에이전트는 여러 단계의 학습에서 각각 다른 능력을 습득해야 하는데, 이들을 통합할 때의 트레이드오프에 대한 표준 방법론이 부재했다. ACLArena는 에이전트 지속 학습(ACL)을 ���합적으로 연구·분석·평가하는 프레임워크로, 순차 학습 파이프라인을 구축하고 모델 수준과 토큰 수준에서 망각(catastrophic forgetting)과 일반화 메커니즘을 분석했다. 다중 교사 온-폴리시 증류, 자기증류 미세 조정, 모델 병합 등 세 가지 통합 패러다임을 체계적으로 비교하여 이전 학습 능력 복구와 새 능력 보존의 균형을 평가했다. 전체 요약 5문장 읽기 → 012 22:29 ▲ 108 · 댓글 45 중국, 오픈 AI 모델 시장 완전 장악…미국과의 격차 심화 오픈 가중치 모델(공개 가중치)은 가중치가 공개된 AI 모델이며, 진정한 오픈소스는 여기에 학습 코드와 데이터까지 포함한다. AI · 머신러닝 · The current balance of power in open models
중국, 오픈 AI 모델 시장 완전 장악…미국과의 격차 심화 Key Point 중국 AI 기업들이 오픈 모델 생태계에서 완전히 주도권을 장악했고, 이것이 학계와 산업에 얼마나 광범위하게 퍼져 있는지 구체적인 지표로 확인되기 때문입니다.
핵심 요약
오픈 가중치 모델(공개 가중치)은 가중치가 공개된 AI 모델이며, 진정한 오픈소스는 여기에 학습 코드와 데이터까지 포함한다. 중국은 2025년 7월부터 오픈 가중치 모델 다운로드에서 미국을 앞질렀으며, 현재 누적 다운로드 32억 건 중 16억 건을 차지해 2배 이상의 격차를 벌렸다. 인공지능 지수(AAII) 벤치마크에서 상위 3개 중국 모델의 점수는 42~45점인 반면, 미국 최고 모델은 23~26점으로 큰 차이가 난다. 전체 요약 13문장 읽기 → 013 18:11 ▲ 135 · 댓글 6 LLM 에이전트의 '안목' 측정 벤치마크 공개 장시간 작업에서 LLM 에이전트가 어느 방향으로 나아갈지 결정하는 능력을 '안목'(taste)이라 정의하고, 이를 평가하는 Taste-Bench 벤치마크를 개발했다. AI · 머신러닝 · The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
LLM 에이전트의 '안목' 측정 벤치마크 공개 Key Point 장시간 작업을 수행하는 AI 에이전트의 핵심 약점인 '의사결정 능력'을 체계적으로 측정할 수 있는 첫 벤치마크이며, 어떤 조건에서 의사결정이 어려워지는지 파악할 수 있다.
핵심 요약
장시간 작업에서 LLM 에이전트가 어느 방향으로 나아갈지 결정하는 능력을 '안목'(taste)이라 정의하고, 이를 평가하는 Taste-Bench 벤치마크를 개발했다. 병렬 시도나 궤적 내 우회를 분석해 자동으로 결정 지점(decision fork)을 추출하고, 각 지점에서 여러 선택지 중 더 나은 결과로 이어진 것을 찾도록 모델을 평가한다. 최고 성능 모델도 정확히 59.7%의 질문에만 답했으며, 결정 근거가 뒤에 나타날수록 모든 모델의 정확도가 급격히 떨어진다. 전체 요약 5문장 읽기 → 014 18:11 ▲ 12 · 댓글 2 교사 모델의 편차를 걸러내는 증류 기법 제안 On-policy distillation은 강한 교사 모델과 학생 모델의 토큰 수준 차이를 학습해 추론 성능을 높이지만, 이 차이에는 교사 모델 자체의 편차가 섞여 있다. AI · 머신러닝 · Calibrating Teacher--Student Discrepancy for On-Policy Distillation
교사 모델의 편차를 걸러내는 증류 기법 제안 Key Point 학생 모델의 추론 능력을 효율적으로 높이는 데 불필요한 학습 신호를 제거하는 방식이 기존 기법보다 더 효과적임을 보여주기 때문입니다.
핵심 요약
On-policy distillation은 강한 교사 모델과 학생 모델의 토큰 수준 차이를 학습해 추론 성능을 높이지만, 이 차이에는 교사 모델 자체의 편차가 섞여 있다. 교사 모델의 자체 편차까지 학습하면 학생 모델의 성능이 저하되는데, 특히 특권 정보를 활용하는 경우 이 문제가 더 심해진다. 연구팀은 Cal-OPD 기법을 제안해 긍정·부정 개입을 통해 교사의 편차 영역을 추정하고, 이를 제외한 진정한 역량 차이만 학습하도록 한다. 전체 요약 4문장 읽기 → 015 15:11 ▲ 46 · 댓글 2 텍스트·이미지·영상·음성을 하나로 이해하는 멀티모달 임베딩 모델 공개 Hugging Face 연구팀이 텍스트, 이미지, 영상, 음성을 통합으로 처리하는 Ovis-Embedding을 발표했다. AI · 머신러닝 · Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
텍스트·이미지·영상·음성을 하나로 이해하는 멀티모달 임베딩 모델 공개 Key Point 단일 모달리티 검색의 한계를 극복하고 텍스트-영상, 음성-텍스트 등 크로스 모달 검색이 필요한 개발자와 연구자에게 새로운 기술 선택지를 제공한다.
핵심 요약
Hugging Face 연구팀이 텍스트, 이미지, 영상, 음성을 통합으로 처리하는 Ovis-Embedding을 발표했다. 기존의 분리된 모달리티 타워 대신 공유 멀티모달 백본을 사용해 모든 데이터를 공통 표현 공간으로 인코딩한다. Qwen-omni 사전학습 모델을 기반으로 대조 학습과 저랭크 초기화를 통해 학습했다. 전체 요약 5문장 읽기 → 016 12:11 ▲ 15 · 댓글 2 1% 토큰으로 충분할 수도, 그래디언트 추정의 효율성 학생 모델 학습 시 교사 모델의 감독을 소수 토큰에만 할당하는 희소 온폴리시 증류(OPD) 기법의 그래디언트 추정 문제를 분석했다. AI · 머신러닝 · 1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation
1% 토큰으로 충분할 수도, 그래디언트 추정의 효율성 Key Point 효율적인 모델 학습을 위해 어떤 토큰에 교사 감독을 할당할지 결정하는 문제에서, 단순한 유용성 평가뿐 아니라 그래디언트 추정 안정성도 고려해야 한다는 실질적 통찰을 제시한다.
핵심 요약
학생 모델 학습 시 교사 모델의 감독을 소수 토큰에만 할당하는 희소 온폴리시 증류(OPD) 기법의 그래디언트 추정 문제를 분석했다. 다음 토큰 샘플링으로부터 계산한 그래디언트가 노이즈를 많이 포함할 수 있으며, 신호 대 잡음 분해를 기반으로 정보 효율성 비율(IER)을 제안했다. IER은 토큰 선택 과정에서 유용성 점수와 결합되어 기존 방식보다 그래디언트 추정 신뢰성을 높인다. 전체 요약 4문장 읽기 → 017 18:11 ▲ 32 · 댓글 3 AI 에이전트 성능 향상 노하우를 모델에 담는 기법 제안 에이전트 성능을 높이는 최적화된 '하네스'(외부 시스템)를 모델 가중치에 증류하는 Harness-Zero 기법을 발표했다. AI · 머신러닝 · Harness-Zero: Harness Distillation via Agent-as-Harness
AI 에이전트 성능 향상 노하우를 모델에 담는 기법 제안 Key Point 특화된 외부 시스템 없이도 에이전트 성능을 크게 높일 수 있는 새로운 학습 방식이므로, 복잡한 작업을 자동화하려는 개발자에게 즉시 활용 가능한 기법이다.
핵심 요약
에이전트 성능을 높이는 최적화된 '하네스'(외부 시스템)를 모델 가중치에 증류하는 Harness-Zero 기법을 발표했다. 문제는 최적 하네스와 배포 환경의 하네스가 액션 스페이스와 정보 구조가 다르다는 점인데, 에이전트가 최적 하네스의 지도 하에 학생 응답을 교정해 훈련 데이터로 전환한다. 기존 코드 기반 접근법보다 에이전트 기반 하네스가 우수했으며, 배포 시 특화 하네스를 제거해도 기본 모델의 성공률이 23.3%에서 44.3%로 상승했다. 전체 요약 4문장 읽기 → 018 16:18 ▲ 46 · 댓글 4 소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상 저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다. AI · 머신러닝 · One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상 Key Point 소프트웨어 개발 작업의 다양한 유형별 난제를 동시에 해결하는 새로운 멀티에이전트 학습 방식이 기존보다 눈에 띄게 성능을 개선했습니다.
핵심 요약
저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다. 연구팀은 카테고리별 전문 에이전트를 학습하고 이를 하나의 모델로 통합하는 프레임워크를 개발했다. 각 카테고리 전문가는 강화학습과 자기 검증 궤적 재활용, 작업 재선택을 반복하는 RRE(Refresh-Repair-Expand) 방식을 사용한다. 전체 요약 5문장 읽기 → 019 21:11 당일 +120 중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화 미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다. AI · 머신러닝 · meituan-longcat/LongCat-Video · Python
중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화 Key Point 기존 영상 생성 모델의 색감 저하·품질 감소 문제를 장시간 생성으로 해결하고, 음성 기반 인물 애니메이션까지 확장한 첫 번째 오픈소스 통합 모델이기 때문에 영상 생성 분야의 기술 진화를 보여준다.
핵심 요약
미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다. 텍스트-투-비디오, 이미지-투-비디오, 비디오 연속 생성을 하나의 모델로 처리한다. 분단위 장시간 영상을 색감 저하나 품질 손실 없이 생성하며, 720p 30fps 영상을 분 단위로 생성할 수 있다. 전체 요약 6문장 읽기 → 020 03:10 ▲ 152 · 댓글 69 Y Combinator 탄, 미국도 중국처럼 모델 증류 허용해야 Y Combinator CEO 개리 탄은 중국 AI 랩의 모델 증류 행위에 규제 대신 미국도 같은 방식을 취해야 한다고 주장했다. AI · 머신러닝 · Garry Tan wants US open-weight AI labs to 'distill' frontier models, too
Y Combinator 탄, 미국도 중국처럼 모델 증류 허용해야 Key Point 중국의 모델 증류를 둘러싼 규제 요구 속에서 실리콘밸리 정상이 다른 입장을 공개한 만큼, 미국 AI 정책과 경쟁 구도의 향후 방향에 영향을 미칠 주요 논쟁이다.
핵심 요약
Y Combinator CEO 개리 탄은 중국 AI 랩의 모델 증류 행위에 규제 대신 미국도 같은 방식을 취해야 한다고 주장했다. Anthropic이 중국 랩의 무단 증류 공격을 적발했고 규제자들의 단속을 요구한 것과 달리, 탄은 소규모 미국 오픈웨이트 랩이 미국 프론티어 랩을 증류할 자유를 가져야 한다고 본다. 탄은 AI 랩이 고객이 API를 통해 얻은 정보를 어떻게 쓸지 통제하는 것이 과도하며, 프론티어 랩 역시 학습 시 저작권 자료를 무단 수집했다고 지적했다. 전체 요약 4문장 읽기 → 021 21:11 ▲ 111 · 댓글 77 AI 안전 규제론의 역설, 누가 정말 통제하나 Dario Amodei의 'AI 발전 속도 조절'(pacing the frontier) 주장에 대한 비판적 성찰이다. AI · 머신러닝 · P(doom)
AI 안전 규제론의 역설, 누가 정말 통제하나 Key Point AI 안전과 규제 논의가 누구의 이익을 대변하는지, 진정한 해결책이 무엇인지를 근본적으로 묻는 논문으로, 업계 주도의 규제론의 한계를 명확히 한다.
핵심 요약
Dario Amodei의 'AI 발전 속도 조절'(pacing the frontier) 주장에 대한 비판적 성찰이다. 저자는 폐쇄형 가중치 모델이 사이버 공격과 보안 위협을 만들고 있으며, OpenAI와 Anthropic이라는 두 기업이 사실상 AI 개발을 독점하고 있다고 본다. 규제 추진을 위해 제시된 METR 같은 제3의 평가기관도 결국 같은 기업들과 긴밀한 관계를 맺고 있다고 지적한다. 전체 요약 5문장 읽기 → 022 09:10 ▲ 100 · 댓글 7 90억 DNA 변이 분석하는 AI 지도 공개 Google DeepMind의 AlphaGenome 모델이 인간 게놈의 모든 90억 개 단일 문자 변이에 대한 예측을 미리 계산해 'AlphaGenome Atlas'라는 온라인 저장소로 공개했다. AI · 머신러닝 · AlphaGenome maps 9B DNA variants
90억 DNA 변이 분석하는 AI 지도 공개 Key Point DNA 변이가 유전자 조절에 미치는 영향을 대규모로 분석할 수 있게 되어 기초 생물학 연구와 질병 치료 개발을 크게 가속할 수 있다.
핵심 요약
Google DeepMind의 AlphaGenome 모델이 인간 게놈의 모든 90억 개 단일 문자 변이에 대한 예측을 미리 계산해 'AlphaGenome Atlas'라는 온라인 저장소로 공개했다. 이 아틀라스는 DNA 변이가 유전자 발현과 조절 활동에 미치는 영향을 예측하며, 과학자들이 코드를 작성하거나 모델을 직접 실행할 필요 없이 웹 인터페이스에서 조회할 수 있다. 팀은 모델 증류, GPU 커널 최적화, 중복 계산 제거 등으로 계산 속도를 80배 개선해 1페타바이트 규모의 데이터셋을 완성했다. 전체 요약 6문장 읽기 → 023 15:10 ▲ 110 · 댓글 181 Anthropic, AI 악용 사건 8건 공개…사이버 공격부터 사기까지 Anthropic 위협 인텔리전스팀이 2025년 12월부터 2026년 8월 사이 Claude를 악용한 위협 행위자들의 작전 8가지를 적발·차단했다. 보안 · Detecting and countering misuse of AI: September 2026
Anthropic, AI 악용 사건 8건 공개…사이버 공격부터 사기까지 Key Point AI 모델의 악용이 단순한 위협이 아니라 실제 대규모 작전에서 진행 중이며, 기술 진입장벽이 무너져 국가 수준의 공격이 개인도 수행 가능해진 현실을 보여주기 때문입니다.
핵심 요약
Anthropic 위협 인텔리전스팀이 2025년 12월부터 2026년 8월 사이 Claude를 악용한 위협 행위자들의 작전 8가지를 적발·차단했다. 사이버 작전, 영향력 작전, 감시, 사기, 생물무기 개발, 재래식 무기 개발, 불법 모델 증류 등 7개 해악 영역을 다룬다. 국가후원 집단, 사이버 범죄자, 상용 스파이웨어 업체, 정치활동가 등 다양한 위협 행위자가 Claude Haiku, Sonnet, Opus 모델을 사용했다. 전체 요약 5문장 읽기 →