쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 30일 (수)까지1325건
2건 · "스케일링 법칙"조건 지우기 ×
001▲ 59 · 댓글 1CoWindow: 주의 메커니즘의 중복 계산을 줄인 구조화된 어텐션기존 Full Attention 방식은 모든 어텐션 헤드가 전체 인과 히스토리를 반복 처리하면서 중복 계산과 메모리 오버헤드가 발생한다.AI · 머신러닝 · CoWindow Attention: Full Causal Coverage Is a Collective Property
CoWindow: 주의 메커니즘의 중복 계산을 줄인 구조화된 어텐션

Key Point효율적인 장문맥 처리가 필수인 생성형 AI에서 Full Attention의 중복 계산을 제거하면서도 성능을 유지하는 방법이 제시되었으므로, 스케일링 효율성을 개선하려는 팀들의 관심을 받을 만합니다.
핵심 요약
- 기존 Full Attention 방식은 모든 어텐션 헤드가 전체 인과 히스토리를 반복 처리하면서 중복 계산과 메모리 오버헤드가 발생한다.
- 연구팀이 제안한 CoWindow Attention(CoWA)은 KV 헤드 간에 인과 히스토리 접근을 분산시키는 구조화된 어텐션이다.
- 모든 헤드는 근거리 대각 윈도우와 접두사-싱크 윈도우를 공유하며, 나머지 먼 과거는 보완적 장거리 윈도우로 분할되어 전체 인과 커버리지를 달성한다.
전체 요약 10문장 읽기 → 002▲ 54 · 댓글 1비전 인코더 제거해도 될까, 스케일링 법칙으로 본 멀티모달 학습기존 멀티모달 대규모 언어모델(MLLM)은 사전학습된 비전 인코더를 기반으로 하지만, 인코더가 없는 모델은 원본 픽셀에서 직접 시각 표현을 학습한다.AI · 머신러닝 · How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining
비전 인코더 제거해도 될까, 스케일링 법칙으로 본 멀티모달 학습

Key Point현재 멀티모달 모델의 구조적 선택지가 스케일에 따라 어떻게 바뀌는지 정량적으로 보여주는 논문으로, 미래 모델 아키텍처 설계의 방향성을 결정하는 근거가 된다.
핵심 요약
- 기존 멀티모달 대규모 언어모델(MLLM)은 사전학습된 비전 인코더를 기반으로 하지만, 인코더가 없는 모델은 원본 픽셀에서 직접 시각 표현을 학습한다.
- 인코더 제거 시 멀티모달 목표의 최적 계산 할당이 더 큰 모델 쪽으로 이동하는 반면, 텍스트 목표는 변화가 거의 없다.
- 두 구조는 텍스트 손실에서는 겹치는 손실-계산 경계를 보이지만, 멀티모달 목표에서는 분산된다.
전체 요약 6문장 읽기 →