쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 2일 (금)까지1549건
4건 · "평가 모델"조건 지우기 ×
001▲ 51 · 댓글 3LLM 직결정 모델의 '중간값 선호 편향' 발견GPT-4V와 오픈소스 KEV 모델들이 제공받은 서수형(ordinal) 척도를 제대로 사용하지 못하는 문제를 분석했다.AI · 머신러닝 · More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision Models
LLM 직결정 모델의 '중간값 선호 편향' 발견

Key PointLLM 기반 자동 평가와 분류 모델이 실제로는 제한된 선택지만 사용하고 있다는 점이 중요하므로, 이들을 프로덕션에 도입할 때 신뢰성을 검증해야 한다.
핵심 요약
- GPT-4V와 오픈소스 KEV 모델들이 제공받은 서수형(ordinal) 척도를 제대로 사용하지 못하는 문제를 분석했다.
- ANLI 데이터셋에서 GPT-4V는 74.95% 정확도를 보이면서도 전체 예측의 38.8%, 오류의 51.3%를 'Neutral' 중간값에 할당했다.
- 36개의 서수형 데이터셋 전반에서 모델들은 각 척도의 유효 범위 중 67~76%만 활용했지만, 명목형(nominal) 과제 4개에서는 87~102%를 활용했다.
전체 요약 6문장 읽기 → 002▲ 10 · 댓글 2확산 모델의 생성 과정으로 이미지 품질 평가하기Reference-based 이미지 품질 평가(IQA) 지표는 인간이 인식하는 이미지 쌍 간의 지각적 거리를 반영하려 한다.AI · 머신러닝 · FoMo: Forking Moment in Generative Trajectory as a Perceptual Distance
확산 모델의 생성 과정으로 이미지 품질 평가하기

Key Pointdiffusion 모델의 생성 과정이 인간 시각 인식과 일치한다는 발견으로, 비용 많이 드는 인간 주석 없이도 이미지 품질 평가 모델을 학습할 수 있는 새로운 방식을 제시한다.
핵심 요약
- Reference-based 이미지 품질 평가(IQA) 지표는 인간이 인식하는 이미지 쌍 간의 지각적 거리를 반영하려 한다.
- 기존 방식은 인간이 주석을 단 Mean Opinion Score(MOS) 데이터에 의존하는데, 대규모 수집이 비용이 크고 인간 판단의 불일치로 인해 노이즈가 많다.
- 2AFC(2-alternative forced choice) 쌍비교 라벨은 신뢰도가 높지만 상대적 비교만 포착한다.
전체 요약 9문장 읽기 → 003▲ 11 · 댓글 2AI가 AI 만든다...알리바바 '칭원' 플래너 에이전트 공개알리바바의 Qwen-Planner-Agent는 AI가 자신의 개발에 참여하는 'AI-for-AI' 폐쇄 루프 프레임워크를 구현했다.AI · 머신러닝 · Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents
AI가 AI 만든다...알리바바 '칭원' 플래너 에이전트 공개

Key Point자율 에이전트 개발의 병목인 학습 데이터 생성과 실제 기기 비용 문제를 AI 자체가 해결하는 새로운 개발 패러다임을 제시하기 때문입니다.
핵심 요약
- 알리바바의 Qwen-Planner-Agent는 AI가 자신의 개발에 참여하는 'AI-for-AI' 폐쇄 루프 프레임워크를 구현했다.
- 모바일 플래닝이라는 복잡하고 장시간의 작업에서 에이전트의 신뢰성을 높이면서도 실제 기기 상호작용 비용을 줄이는 방식을 제시한다.
- 데이터 생성, 모델 학습, 배포를 통합하는 액션-피드백-검증 계약으로 세 단계를 연결한다.
전체 요약 8문장 읽기 → 004▲ 24 · 댓글 2영상 생성 AI의 보상 신호 불안정성, 기준 기반 평가로 해결영상 생성 모델 강화학습에서 핵심인 보상 모델이 복잡한 영상 품질을 단일 점수로 직접 변환하면서 점수 기준이 프롬프트마다 붕괴되거나 이동하는 '스칼라 드리프트' 문제가 발생한다.AI · 머신러닝 · RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling
영상 생성 AI의 보상 신호 불안정성, 기준 기반 평가로 해결

Key Point영상 생성 AI를 강화학습으로 최적화할 때 보상 신호의 불안정성은 학습 효율을 크게 떨어뜨리는데, 명시적 평가 기준을 도입하는 이 접근법이 문제 해결에 새로운 방향을 제시한다.
핵심 요약
- 영상 생성 모델 강화학습에서 핵심인 보상 모델이 복잡한 영상 품질을 단일 점수로 직접 변환하면서 점수 기준이 프롬프트마다 붕괴되거나 이동하는 '스칼라 드리프트' 문제가 발생한다.
- RewardVerse는 평가 기준을 동적으로 생성한 후 그에 맞춰 점수를 매기는 방식으로, 명시적 평가 기준을 중간 표현으로 삽입해 점수의 안정성을 높인다.
- 이를 효율적으로 최적화하기 위해 제안된 Rubric-Guided Policy Optimization(RGPO)는 자기진화 초기 기준으로 평가 모델을 먼저 준비한 후, 기준 생성기와 평가기를 함께 최적화하면서 인간 평가와 정렬하는 2단계 학습 알고리즘이다.
전체 요약 4문장 읽기 →