쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 24일 (목)까지985건
14건 · "데이터셋"조건 지우기 ×
001▲ 22 · 댓글 2VLM의 공간 추론 능력, 상호작용 학습으로 강화시각-언어 모델(VLM)이 동적 환경에서 물체 움직임과 시점 변화에 따른 상태 변화를 인식하고 추적하는 공간 추론 능력이 부족한 상태다.AI · 머신러닝 · Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World
VLM의 공간 추론 능력, 상호작용 학습으로 강화

Key PointVLM이 현실 세계의 물체 움직임과 공간 변화를 정확히 이해해야 로봇, AR, 자율 시스템 등에 실제 적용되는데, 이 논문이 그 핵심 약점을 구체적인 학습 방식으로 해결하는 방법을 제시합니다.
핵심 요약
- 시각-언어 모델(VLM)이 동적 환경에서 물체 움직임과 시점 변화에 따른 상태 변화를 인식하고 추적하는 공간 추론 능력이 부족한 상태다.
- 연구팀은 상호작용 궤적(선행 관찰-행동-후속 관찰)을 감독 신호로 삼아 VLM을 훈련하는 Spatial-Interactor 프레임워크를 제안했다.
- L1(수동적 상태 전이) → L2(능동적 자기 상태 전이) → L3(장기 상호작용 궤적)의 3단계 커리큘럼으로 구성했다.
- LSI-108K 데이터셋을 시뮬레이션과 실제 상호작용에서 구성했으며, SFT와 자기-증류(OPD) 두 단계로 훈련한다.
- 여러 VLM과 공간 벤치마크에서 테스트한 결과 국소 전이 모델링과 장기 통합 능력 모두 일관되게 향상했다.
002▲ 20 · 댓글 1동영상 생성 AI 학습, 평가기준 정해서 최적화동영상 생성 모델을 강화학습으로 최적화할 때 필요한 보상 모델이 불안정한 문제를 해결합니다.AI · 머신러닝 · RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling
동영상 생성 AI 학습, 평가기준 정해서 최적화

Key Point동영상 생성 모델의 품질 평가 방식을 개선함으로써 강화학습 기반의 동영상 생성 최적화 성능을 크게 향상시킬 수 있습니다.
핵심 요약
- 동영상 생성 모델을 강화학습으로 최적화할 때 필요한 보상 모델이 불안정한 문제를 해결합니다.
- 기존 방식은 동영상 품질을 숫자 하나로 바로 매겨서 평가기준이 명확하지 않았고, 프롬프트마다 점수 척도가 뒤흔들리는 '스칼라 드리프트' 문제가 있었습니다.
- RewardVerse는 인간 평가 방식을 모방해 먼저 평가기준(루브릭)을 명시적으로 생성한 뒤, 그 기준에 따라 점수를 매기는 방식으로 안정성을 높입니다.
- RGPO(루브릭 기반 정책 최적화)라는 2단계 훈련 알고리즘으로 루브릭 생성기와 평가기를 함께 최적화하며, 인간 평가와 계속 맞춰갑니다.
- EvalVerse 벤치마크와 외부 데이터셋 실험에서 스칼라 드리프트를 완화하고 최고 성능을 달성했으며, 동영상 생성 강화학습에 신뢰할 수 있는 보상 신호를 제공합니다.
003▲ 37 · 댓글 3다국어 텍스트 인식에 최적화된 MoE 아키텍처다국어 OCR의 문제점을 해결하기 위해 script-aware Mixture-of-Experts(ScriptMoE) 아키텍처를 제안했다.AI · 머신러닝 · All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts
다국어 텍스트 인식에 최적화된 MoE 아키텍처

Key Point언어별 별도 모델 배포 비용과 복잡성 없이 실무 OCR 성능을 크게 개선하는 실용적 기술로, 다국어 텍스트 인식이 필요한 개발자들이 주목할 만하다.
핵심 요약
- 다국어 OCR의 문제점을 해결하기 위해 script-aware Mixture-of-Experts(ScriptMoE) 아키텍처를 제안했다.
- TextMuSS-10M이라는 10개 문자 체계와 229개 언어를 포함한 대규모 합성 텍스트 데이터셋을 구축했다.
- ScriptMoE는 단일 비전 인코더와 이미지별 라우터가 상위 2개의 문자 체계 전문 모듈로 분배하는 희소 MoE 블록으로 구성된다.
- TextMuSS-Bench에서 82.06% 정확도를 달성해 기존 STR 방법을 1.31% 상회했다.
- PP-OCRv5의 인식기만 교체해도 F1 스코어가 65.71%에서 80.89%로 올라 최고 성능 VLM과 동등하면서도 파라미터는 훨씬 적다.
004▲ 16 · 댓글 3정신 건강 돕는 LLM, 3단계 진화 과정 정리LLM의 정신 건강 분야 활용이 세 단계로 진화하고 있다는 논문이 발표됐다.AI · 머신러닝 · From Pattern Recognizers to Personalized Companions: A Survey of Large Language Models in Mental Health
정신 건강 돕는 LLM, 3단계 진화 과정 정리

Key Point정신 건강 AI의 발전 방향을 체계적으로 정리한 첫 종합 분석이므로, 이 분야 동향을 파악해야 하는 개발자와 의료 기술 종사자에게 필요하다.
핵심 요약
- LLM의 정신 건강 분야 활용이 세 단계로 진화하고 있다는 논문이 발표됐다.
- 1단계는 정보 제공과 패턴 인식 도구, 2단계는 공감하는 대화 상대, 3단계는 개인 맞춤형 AI 동반자로 고도화된다.
- 메모리, 추론, 계획 등 에이전트 구조와 학습 데이터셋, 평가 지표 발전이 이 진화를 가능하게 했다.
- 전통 의료의 자원 부족, 높은 비용, 접근성 문제를 AI가 해결할 수 있는 가능성을 제시한다.
005▲ 62 · 댓글 4SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다.AI · 머신러닝 · RULER: Instance-aware Rubric Rewards for SVG Generation
SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안

Key Point평가 기준이 없는 개방형 생성 작업에서 인공지능이 보상을 제대로 학습할 수 있는 방법을 제시하며, 이는 코드 생성·이미지 생성 등 다른 창의적 작업의 강화학습에도 적용 가능한 접근방식이다.
핵심 요약
- 자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다.
- RULER는 각 지시문을 6개 항목의 인스턴스별 채점 기준표로 변환하고, 비전-언어 모델이 생성된 SVG를 의미·시각·스타일 축으로 항목별 점수를 매겨 보상을 계산한다.
- 텍스트만으로 채점 기준표를 도출해 SVG 정답 데이터셋이나 인간 선호도 라벨이 필요 없다.
- MMSVG-Illustration와 MMSVG-Icon 데이터셋에서 성능을 0.432/0.395에서 0.693/0.683으로 향상시켰으며, 전문 SVG 생성 모델을 넘어 더 큰 DeepSeek-V3 수준을 달성했다.
006▲ 15 · 댓글 3로봇 조작 실패 복구하는 AI 정책 프레임워크 공개로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다.AI · 머신러닝 · CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies
로봇 조작 실패 복구하는 AI 정책 프레임워크 공개

Key Point로봇 조작 작업의 안정성을 현저히 높이는 새로운 기법으로, 산업용 로봇이나 자동화 시스템의 신뢰도 문제를 실질적으로 개선할 수 있다.
핵심 요약
- 로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다.
- 실제 실패 사례를 수집해 그 패턴을 학습하고, 이를 바탕으로 대표적 실패 상황과 복구 방법을 합성해 훈련시킨다.
- 추론 시 3D 모니터링으로 실패를 감지하면 작업 진행도를 유지하면서 단계별로 미세 조정하거나 다시 시도한다.
- 새로운 실패 복구 벤치마크(FSR-Bench)를 공개했으며, 시뮬레이션과 실제 로봇 환경 모두에서 성공률이 평균 14~16%p 상승했다.
- 코드와 학습 모델, 데이터셋을 깃허브에 공개했다.
007▲ 41 · 댓글 4토큰 단위 수정으로 LLM 학습 데이터 만드는 onPandaonPanda는 대형언어모델의 정렬 데이터와 에이전트 궤적을 효율적으로 주석하는 대화형 도구다.AI · 머신러닝 · onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
토큰 단위 수정으로 LLM 학습 데이터 만드는 onPanda

Key PointLLM 기반 시스템의 학습 데이터 효율이 개선되면서 모델 정렬에 소요되는 비용이 대폭 줄어들 가능성이 생겼습니다.
핵심 요약
- onPanda는 대형언어모델의 정렬 데이터와 에이전트 궤적을 효율적으로 주석하는 대화형 도구다.
- 모델 응답을 읽으면서 부적절한 첫 토큰을 찾아 후보 토큰에서 대체하거나 자유로운 편집으로 수정한 후, 수정된 지점부터 계속 생성하는 방식으로 작동한다.
- 수동 후편집 대비 주석 작업 시간을 중앙값 기준 52% 단축하고, 최종 응답의 대부분이 모델 자체에서 생성되어 온-정책 학습 데이터로 적합하다.
- 토큰 단위 수정 기록은 정확한 위치와 함께 명확한 감독을 제공하며 긍정·부정 샘플이 자연스럽게 쌍을 이룬다.
- 외부 도구와 연결되어 실제 환경에서 대화형 궤적 주석이 가능하며, 논문은 Panda-CVL 데이터셋과 벤치마크를 공개한다.
008▲ 32 · 댓글 2영상 생성 모델 평가용 대규모 벤치마크 'OmniVBench' 공개참조 영상 기반 비디오 생성(R2V)의 평가와 학습을 위한 'OmniVBench' 벤치마크와 34만 개 샘플의 Omni-R2V 데이터셋을 공개했다.AI · 머신러닝 · OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation
영상 생성 모델 평가용 대규모 벤치마크 'OmniVBench' 공개

Key Point참조 기반 영상 생성의 평가 기준과 학습 자료가 부족한 상황에서, 34만 개 규모의 산업 수준 데이터셋과 체계적 벤치마크를 제공해 R2V 모델 개발의 표준을 제시한다.
핵심 요약
- 참조 영상 기반 비디오 생성(R2V)의 평가와 학습을 위한 'OmniVBench' 벤치마크와 34만 개 샘플의 Omni-R2V 데이터셋을 공개했다.
- 콘텐츠, 모션, 스타일, 구조, 내러티브 등 7개 태스크 패밀리와 18개 세부 과제를 포함하며, 기존 벤치마크보다 다양한 참조 유형과 조합을 다룬다.
- 12,172개의 체크리스트 항목으로 구성된 '요소 기반 평가'를 도입해 참조 요소의 보존, 분리, 실현 여부를 세밀하게 검증한다.
- 학습 데이터는 전문 영상 자료를 기반으로 하며, 다양한 참조 유형과 다중 참조 조합을 지원하는 작업별 파이프라인을 제공한다.
- 기존 오픈소스·폐쇄소스 R2V 모델들의 광범위한 평가 결과, 태스크 계열과 평가 차원별로 상당한 성능 편차가 드러났다.
009▲ 47 · 댓글 4AI 이미지 생성·편집에 16진수 색상값으로 정확한 색상 제어 가능하게Paint-Anything은 생성과 편집 모두에서 24비트 16진수 값으로 객체의 정확한 색상을 지정할 수 있는 통합 인터페이스를 개발했다.AI · 머신러닝 · Paint-Anything: Unified Any-Color Control for Image Generation and Editing
AI 이미지 생성·편집에 16진수 색상값으로 정확한 색상 제어 가능하게

Key Point이미지 생성·편집에서 실무 디자이너 수준의 색상 제어가 가능해짐으로써 AI 콘텐츠 제작의 정밀도가 대폭 높아진다.
핵심 요약
- Paint-Anything은 생성과 편집 모두에서 24비트 16진수 값으로 객체의 정확한 색상을 지정할 수 있는 통합 인터페이스를 개발했다.
- 실제 이미지의 객체 그라운딩과 지각적 색상 레이블링을 통해 Paint-500K 데이터셋을 구축하고, 그림자로 인한 오류를 보정하기 위해 순수 색상 앵커(정확히 일치하는 픽셀)를 고노이즈 단계에서만 학습에 사용했다.
- Any Color Benchmark(ACBench)를 새로 만들어 text-to-image와 편집 작업 모두에서 객체별 색상 충실도를 측정한다.
- FLUX.2-4B 모델에서 Paint-Anything은 ACBench-T2I 점수를 85.3%, ACBench-Edit 점수를 28.3% 향상시켰으며 기존 방법 대비 최고의 CompColor 점수를 달성했다.
010▲ 109 · 댓글 75인터넷 검열 측정하는 OONI Probe, 공개 데이터셋 구축OONI Probe를 실행해 자국에서 차단된 웹사이트를 파악할 수 있습니다.오픈소스 · 도구 · Measure internet censorship. Contribute to the largest open dataset
인터넷 검열 측정하는 OONI Probe, 공개 데이터셋 구축
Key Point정부 검열이 심한 국가의 개발자들이 네트워크 자유도를 객관적으로 파악하고, 글로벌 투명성 데이터 구축에 참여할 수 있는 도구입니다.
핵심 요약
- OONI Probe를 실행해 자국에서 차단된 웹사이트를 파악할 수 있습니다.
- M-Lab과 협력해 개발한 NDT 테스트로 네트워크 속도와 성능을 측정합니다.
- WhatsApp, Facebook Messenger, Telegram 등 메신저 서비스 차단 여부와 우회 도구 작동성을 검사합니다.
- 실행 후 결과는 실시간으로 자동 공개되어 인터넷 검열의 투명성 증대에 기여합니다.
011당일 +195컴퓨터 비전 개발을 빠르게, Supervision 라이브러리Roboflow가 제공하는 Python 기반 오픈소스 라이브러리로, 모델 불가지론적 설계로 모든 분류·탐지·분할 모델을 연결할 수 있다.오픈소스 · 도구 · roboflow/supervision · Python
컴퓨터 비전 개발을 빠르게, Supervision 라이브러리

Key Point컴퓨터 비전 프로젝트의 반복적인 작업을 표준화된 도구로 통일할 수 있어, 모델 선택에 관계없이 동일한 코드로 여러 프레임워크를 활용할 수 있다.
핵심 요약
- Roboflow가 제공하는 Python 기반 오픈소스 라이브러리로, 모델 불가지론적 설계로 모든 분류·탐지·분할 모델을 연결할 수 있다.
- Ultralytics, Transformers, MMDetection 등 인기 라이브러리와 기본 통합되며, 커스텀 모델도 손쉽게 연결할 수 있다.
- 데이터 로딩부터 실시간 구역 카운팅까지 컴퓨터 비전 작업의 전체 파이프라인을 지원한다.
- 고도로 커스터마이징 가능한 Annotators로 시각화를 자유롭게 구성할 수 있고, 데이터셋 로드·분할·병합·저장 유틸리티를 제공한다.
- 객체 탐지 후 추적, 속도 추정, 체류 시간 분석 등 실전 예제와 튜토리얼을 포함한다.
012▲ 142 · 댓글 70실제 기업 코드베이스로 AI 코딩 능력 평가하는 벤치마크 공개실제 운영 중인 기업의 프라이빗 코드베이스에서 추출한 과제로 AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 'Real-SWE' 벤치마크를 발표했다.AI · 머신러닝 · Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
실제 기업 코드베이스로 AI 코딩 능력 평가하는 벤치마크 공개
Key Point기존의 합성 또는 공개 데이터셋 기반 벤치마크와 달리, 실제 프로덕션 코드베이스의 복잡성과 비즈니스 규칙이 포함된 평가 기준을 제시해 AI 코딩 에이전트의 현실적 능력을 가늠할 수 있다.
핵심 요약
- 실제 운영 중인 기업의 프라이빗 코드베이스에서 추출한 과제로 AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 'Real-SWE' 벤치마크를 발표했다.
- 세금 계산, 청구 시스템, 고객 마이그레이션 등 실제 비즈니스 영향을 미치는 작업을 포함하며, 회사별 고유한 코딩 관례와 레거시 시스템을 이해해야 한다.
- Fable 5.1이 38.8% 해결율로 1위, GPT-6 Astra가 33.8%, Gemini 3.8이 31.2%로 뒤를 이었다.
- 참고 해결책은 평균 11개 파일에 걸쳐 수정하며, 작업 지시사항은 평균 1,742자로 의도적으로 과소 정의되어 있다.
- NestJS, PostgreSQL, Kubernetes, Docker 등 실제 엔터프라이즈 개발 환경을 시뮬레이션하고, 각 모델-하네스 조합을 별도로 평가한다.
013▲ 100 · 댓글 790억 DNA 변이 분석하는 AI 지도 공개Google DeepMind의 AlphaGenome 모델이 인간 게놈의 모든 90억 개 단일 문자 변이에 대한 예측을 미리 계산해 'AlphaGenome Atlas'라는 온라인 저장소로 공개했다.AI · 머신러닝 · AlphaGenome maps 9B DNA variants
90억 DNA 변이 분석하는 AI 지도 공개

Key PointDNA 변이가 유전자 조절에 미치는 영향을 대규모로 분석할 수 있게 되어 기초 생물학 연구와 질병 치료 개발을 크게 가속할 수 있다.
핵심 요약
- Google DeepMind의 AlphaGenome 모델이 인간 게놈의 모든 90억 개 단일 문자 변이에 대한 예측을 미리 계산해 'AlphaGenome Atlas'라는 온라인 저장소로 공개했다.
- 이 아틀라스는 DNA 변이가 유전자 발현과 조절 활동에 미치는 영향을 예측하며, 과학자들이 코드를 작성하거나 모델을 직접 실행할 필요 없이 웹 인터페이스에서 조회할 수 있다.
- 팀은 모델 증류, GPU 커널 최적화, 중복 계산 제거 등으로 계산 속도를 80배 개선해 1페타바이트 규모의 데이터셋을 완성했다.
- 아틀라스는 각 변이마다 11가지 상세 출력값을 제공하며, 한눈에 변이의 의미를 판단하는 단일 영향 점수도 포함한다.
- 다만 많은 질병이 복수의 유전 변이와 관련되어 있고, 일부 인핸서는 모델의 100만 염기쌍 범위를 벗어난 먼 거리에서 유전자를 조절하기 때문에 예측의 한계가 있다.
- 비상업적 연구는 무료로 이용 가능하며 상업적 라이선싱도 검토 중이다.
014▲ 108 · 댓글 1738억 파라미터 LLM을 998달러에 학습시키다3.8B 파라미터 언어 모델을 65B 토큰으로 43시간 동안 학습해 CORE 벤치마크 0.384점을 달성했다.AI · 머신러닝 · Training a 3.8B LLM to 0.384 CORE for $998
38억 파라미터 LLM을 998달러에 학습시키다
Key Point개인 개발자가 수천 달러 규모로 의미 있는 규모의 언어 모델을 학습할 수 있는 현실적인 경로와 구체적 최적화 기법을 보여주며, AI 인프라 설계의 중요성을 강조하는 사례입니다.
핵심 요약
- 3.8B 파라미터 언어 모델을 65B 토큰으로 43시간 동안 학습해 CORE 벤치마크 0.384점을 달성했다.
- B200 GPU 8개 렌탈 비용 $998로 GPT-2 대비 훨씬 나은 성능을 구현했으며, 같은 비용대의 nanochat d32보다 의미 있게 우수하다.
- Trapezoidal LR 스케줄, Muon 옵티마이저, ClimbMix 데이터셋, FP8 학습, 1024 토큰 컨텍스트 등 다섯 가지 최적화로 858M 모델의 실패 사례에서 개선했다.
- YAML 기반 설정 프레임워크를 구축해 코드 수정 없이 옵티마이저나 데이터셋을 한 줄로 교체할 수 있게 하는 등 인프라 설계에 중점을 뒀다.
- 초기 시행착오에서 FineWeb-Edu와 높은 학습률 설정 문제를 발견했고, 학습 후반부까지 손실이 감소하는 trapezoidal 스케줄로 해결했다.