쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 24일 (목)까지981건
6건 · "자동회귀"조건 지우기 ×
001▲ 27 · 댓글 1자동회귀 비디오 생성 모델의 메모리 메커니즘 체계화자동회귀 방식의 비디오 생성에서 맥락 윈도우 제약으로 인해 과거 정보가 손실되는 문제를 메모리 관점에서 분석했다.AI · 머신러닝 · The Past Frames the Future: Memory for Autoregressive Video Generation
자동회귀 비디오 생성 모델의 메모리 메커니즘 체계화

Key Point장시간 비디오 생성과 대화형 세계 모델링에서 과거 맥락 손실이 모델 성능을 제한하는 근본적 문제인데, 이를 체계적으로 정리한 첫 시도라 메모리 설계 방향을 모색하는 연구자에게 참고가 된다.
핵심 요약
- 자동회귀 방식의 비디오 생성에서 맥락 윈도우 제약으로 인해 과거 정보가 손실되는 문제를 메모리 관점에서 분석했다.
- 지속적인 역사 정보를 유지하면서도 미래 생성에 영향을 주는 메모리 메커니즘을 표현 형식, 기능, 동작, 학습, 평가 5가지 관점에서 분류했다.
- 개체 정체성, 동적 상태, 인과 관계 변화 같은 임계적 정보가 생성 과정에서 손실되는 것을 극복하는 것이 핵심 과제임을 제시했다.
- 구성 가능한 메모리 아키텍처, 신뢰할 수 있는 상태 업데이트, 자동 롤아웃 학습, 표준화된 평가 기준의 개발을 향후 과제로 제안했다.
002▲ 20 · 댓글 2이미지 생성 모델의 벡터 양자화 학습 안정성 개선 방법자동회귀 및 마스킹 이미지 생성 모델의 기초가 되는 벡터 양자화(VQ) 토크나이저는 학습 과정이 불안정하다는 문제를 지적했다.AI · 머신러닝 · StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training
이미지 생성 모델의 벡터 양자화 학습 안정성 개선 방법

Key Point이미지 생성 모델의 핵심 컴포넌트인 벡터 양자화의 학습 불안정성을 해결하는 실무적 방법론을 제시하므로, 생성형 AI 모델 개발자와 연구자에게 즉시 적용 가능한 지침을 제공한다.
핵심 요약
- 자동회귀 및 마스킹 이미지 생성 모델의 기초가 되는 벡터 양자화(VQ) 토크나이저는 학습 과정이 불안정하다는 문제를 지적했다.
- 인코더-디코더와 코드북 학습이 얽혀 있어 두 모듈이 협력할 때만 작동하므로, 학습이 가중될수록 붕괴되는 취약함이 있다.
- StableVQ는 동적 STE를 통해 인코더의 학습 목표를 안정화하고, 리전 VQ 손실로 코드북이 독립적으로 전체 추적을 보장하며, 분리된 스케줄로 각 모듈이 별도의 학습률을 갖도록 한다.
- 새로운 학습 가능 파라미터를 추가하지 않으면서 공유 투영 코드북 위에 적용 가능하다.
- ImageNet 실험 결과 다양한 코드북 크기와 초기화 설정에서 학습 안정성, 코드북 활용도, 재구성 품질이 일관되게 개선되었다.
003▲ 14 · 댓글 2확산 LLM의 메모리와 속도 문제를 푸는 Flash-dLLM비자동회귀 텍스트 생성이 가능한 확산 LLM(dLLM)이 등장했으나 추론 단계에서 KV 캐싱 부재와 병렬 디코딩 메커니즘 부족으로 인해 배포가 제한적이다.AI · 머신러닝 · Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs
확산 LLM의 메모리와 속도 문제를 푸는 Flash-dLLM

Key Point자동회귀 방식 LLM의 느린 추론이 산업 문제인 가운데, 비자동회귀 생성의 실무 적용을 가로막는 메모리 효율성 문제를 근본적으로 해결하는 기법이다.
핵심 요약
- 비자동회귀 텍스트 생성이 가능한 확산 LLM(dLLM)이 등장했으나 추론 단계에서 KV 캐싱 부재와 병렬 디코딩 메커니즘 부족으로 인해 배포가 제한적이다.
- Flash-dLLM은 학습 없이 적용 가능한 추론 가속화 프레임워크로, GPU 메모리 I/O 병목을 식별하고 최적화된 KV 캐시 커널로 메모리 이동을 줄인다.
- 별도 모델 없이 dLLM 자체가 드래프터와 검증자 역할을 하는 효율적인 draft-and-verify 디코딩 전략을 제안한다.
- 수학 추론과 코드 생성 벤치마크에서 기존 최고 성능 방식(Elastic-Cache)보다 GSM8K에서 5.1배, HumanEval에서 11.0배 빠른 속도를 달성한다.
004▲ 354 · 댓글 72System 1 의사결정 모델 Laya 오픈소스 공개LLM 기반 구조화된 의사결정 모델 Jev의 폐쇄성에 대응해, 같은 개념을 완전 오픈소스로 구현한 Laya를 공개했다.AI · 머신러닝 · Laya the open source version of Jev
System 1 의사결정 모델 Laya 오픈소스 공개
Key PointLLM으로 단순 분류 작업을 처리하는 비효율을 해결하는 새로운 모델 아키텍처가 공개됐으며, Jev의 폐쇄성 대비 완전 오픈소스 대안이 필요한 상황이다.
핵심 요약
- LLM 기반 구조화된 의사결정 모델 Jev의 폐쇄성에 대응해, 같은 개념을 완전 오픈소스로 구현한 Laya를 공개했다.
- 자동회귀 생성 방식 대신 순방향 한 번의 추론으로 확률분포를 반환하며, 30~35ms의 초저지연 응답을 제공한다.
- choice(선택지 선택), score(순서척도), noul(참거짓 판정) 세 가지 기본 연산만으로 동작하여 환각이나 JSON 파싱 오류가 불가능하다.
- ModernBERT 기반 영문, 다국어, 고도형 의사결정 세 가지 체크포인트를 단일 저장소에 번들로 제공하며, 선택적 다운로드로 2.5GB 중 필요한 부분만 받을 수 있다.
- Jev 대비 6~8배 빠른 속도, Apache 2.0 오픈소스, 구독료 없음, 100개 언어 지원을 제공한다.
- 영문 모델의 BPE 어휘집이 크메르어(0% 정확도), 아르메니아어(5%)같은 비라틴문자 언어에서 심각히 실패해, 언어별 라우팅의 필요성을 보여준다.
005당일 +230금융 시장 전문 AI 모델 Kronos 오픈소스 공개금융 캔들차트(K-line) 데이터 분석에 특화된 오픈소스 기초 모델 Kronos를 공개했습니다. 전 세계 45개 이상의 거래소 데이터로 사전 학습되었습니다.AI · 머신러닝 · shiyu-coder/Kronos · Python
금융 시장 전문 AI 모델 Kronos 오픈소스 공개

Key Point금융 시계열 분석에 특화된 첫 오픈소스 기초 모델로, 일반 시계열 모델과 달리 K-line 데이터의 독특한 특성을 처리하도록 설계되어 개인 트레이더와 정량 분석가들이 직접 활용할 수 있습니다.
핵심 요약
- 금융 캔들차트(K-line) 데이터 분석에 특화된 오픈소스 기초 모델 Kronos를 공개했습니다. 전 세계 45개 이상의 거래소 데이터로 사전 학습되었습니다.
- OHLCV 데이터를 계층적 이산 토큰으로 변환하는 전문화된 토크나이저와 자동회귀 트랜스포머로 구성되어 금융 데이터의 높은 노이즈 특성을 처리합니다.
- Kronos-mini(4.1M), Kronos-small(24.7M), Kronos-base(102.3M), Kronos-large(499.2M) 등 다양한 크기의 모델을 Hugging Face Hub에서 무료로 제공합니다.
- KronosPredictor 클래스로 몇 줄의 코드만으로 주가 예측을 수행할 수 있으며, 개별 또는 배치 예측 모두 지원합니다.
- 컨텍스트 길이는 Kronos-mini는 2048, 다른 모델들은 512로 설정되어 있습니다.
006▲ 143 · 댓글 53vLLM이 AMD GPU에서 추측 디코딩 지원vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다.AI · 머신러닝 · Speculative Decoding in vLLM on AMD GPUs
vLLM이 AMD GPU에서 추측 디코딩 지원

Key PointLLM 추론 성능 최적화를 위한 주요 기법이 AMD GPU에서 실제 구현되어, 장기 생성 작업의 처리량 개선 가능성을 보여준다.
핵심 요약
- vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다.
- 추측 디코딩은 경량 드래프트 모듈이 여러 토큰을 먼저 제안하고 타겟 모델이 한 번에 검증하는 방식으로, 기존 자동회귀 디코딩보다 모델 통과 횟수를 줄인다.
- 표준 방식은 토큰 하나당 모델 실행 1회가 필요하지만, 추측 디코딩은 여러 드래프트 토큰이 검증을 통과하면 단일 모델 실행으로 여러 토큰을 커밋할 수 있다.
- Native MTP, Gemma 4 MTP, EAGLE-3, DFlash, DSpark 등 5가지 드래프팅 방식을 검토했으며, 방식·제안 길이·모델 종류·수용 동작 등에 따라 처리량 개선 효과가 달라진다.
- 드래프트 토큰이 거부되면 거부 지점 이후의 토큰들은 폐기되고 타겟 모델의 결과로 생성을 계속한다.