쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 30일 (수)까지 1314건
5건 · "장문맥"조건 지우기 ×
001 21:11 ▲ 59 · 댓글 1 CoWindow: 주의 메커니즘의 중복 계산을 줄인 구조화된 어텐션 기존 Full Attention 방식은 모든 어텐션 헤드가 전체 인과 히스토리를 반복 처리하면서 중복 계산과 메모리 오버헤드가 발생한다. AI · 머신러닝 · CoWindow Attention: Full Causal Coverage Is a Collective Property
CoWindow: 주의 메커니즘의 중복 계산을 줄인 구조화된 어텐션 Key Point 효율적인 장문맥 처리가 필수인 생성형 AI에서 Full Attention의 중복 계산을 제거하면서도 성능을 유지하는 방법이 제시되었으므로, 스케일링 효율성을 개선하려는 팀들의 관심을 받을 만합니다.
핵심 요약
기존 Full Attention 방식은 모든 어텐션 헤드가 전체 인과 히스토리를 반복 처리하면서 중복 계산과 메모리 오버헤드가 발생한다. 연구팀이 제안한 CoWindow Attention(CoWA)은 KV 헤드 간에 인과 히스토리 접근을 분산시키는 구조화된 어텐션이다. 모든 헤드는 근거리 대각 윈도우와 접두사-싱크 윈도우를 공유하며, 나머지 먼 과거는 보완적 장거리 윈도우로 분할되어 전체 인과 커버리지를 달성한다. 전체 요약 10문장 읽기 → 002 18:11 ▲ 63 · 댓글 1 어텐션의 계산 효율을 높이는 MALA 메커니즘 제안 기존 Full Attention은 QK 타일 계산 후 전체 후속 경로를 실행하지만 정규화 가중치에서 대부분의 값이 무시할 수준으로 작아 비효율적이다. AI · 머신러닝 · MassAlloc Attention: Let Attention Allocate Its Own Compute
어텐션의 계산 효율을 높이는 MALA 메커니즘 제안 Key Point Full Attention의 비효율적 계산 패턴을 식별하고 실제 기여도 기반 할당으로 2~3배 속도 향상을 달성하면서도 모델 성능을 유지하는 방법으로, 대규모 언어 모델의 추론·학습 효율을 개선하는 데 직결된다.
핵심 요약
기존 Full Attention은 QK 타일 계산 후 전체 후속 경로를 실행하지만 정규화 가중치에서 대부분의 값이 무시할 수준으로 작아 비효율적이다. MALA(MassAlloc Attention)는 정규화된 기여도에 따라 후속 계산을 선택적으로 할당하는 퓨즈드 어텐션 프리미티브로, 순전파는 온라인 소프트맥스 정규화기를, 역전파는 최종 정규화기를 재사용한다. 하나의 공통 임계값으로 학습과 추론에서 적응적 유지(retention)가 가능하며, 8K 토큰 비교에서 생략된 질량은 0.0188%로 기준 오라클의 0.0182%에 근접한다. 전체 요약 7문장 읽기 → 003 15:11 ▲ 20 · 댓글 2 장문맥 처리의 병목 풀다…로그 선형 복잡도 블록 스파스 어텐션 언어모델을 긴 문맥에 맞추려면 셀프 어텐션의 이차 비용이 제약이 된다. AI · 머신러닝 · Block Sparse Attention with Log-Linear Complexity
장문맥 처리의 병목 풀다…로그 선형 복잡도 블록 스파스 어텐션 Key Point 장문맥 처리가 핵심인 LLM 개발에서 어텐션 계산량을 획기적으로 줄이는 알고리즘이 나왔기 때문에, 모델 확장성과 추론 속도에 영향을 받는 엔지니어와 연구자들이 눈여겨봐야 한다.
핵심 요약
언어모델을 긴 문맥에 맞추려면 셀프 어텐션의 이차 비용이 제약이 된다. 블록 스파스 어텐션은 효율적 대안이지만, 유지할 블록을 선택하는 과정이 여전히 이차 복잡도다. 논문은 PISA라는 피라미드 Top-K 선택 전략을 제안해 후보를 단계적으로 좁혀나간다. 전체 요약 7문장 읽기 → 004 18:10 ▲ 114 · 댓글 8 디ープ시크, KV 캐시 압축으로 추론 속도 420 토큰/초 달성 DeepSeek-V4.1 Flash는 KV 캐시 압축을 극대화해 장문맥 에이전트 워크플로우를 효율화한 모델이다. AI · 머신러닝 · DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression
디ープ시크, KV 캐시 압축으로 추론 속도 420 토큰/초 달성 Key Point 장문맥 처리가 필요한 에이전트 작업에서 메모리와 통신 병목을 근본적으로 해결하는 아키텍처 혁신이므로, 대규모 언어모델의 실제 배포 환경에서의 효율성 기준을 바꾼다.
핵심 요약
DeepSeek-V4.1 Flash는 KV 캐시 압축을 극대화해 장문맥 에이전트 워크플로우를 효율화한 모델이다. Prefill 단계에서 8B 파라미터만 활성화하고 Decoding 단계에서 16B를 활성화해, 기존 V4-Flash 대비 약 420 토큰/초의 추론 속도를 달성했다. 런타임 KV 캐시 저장량은 V4-Flash의 1/4 수준으로, 지속 저장(persistent storage)은 1/8 수준으로 줄였다. 전체 요약 6문장 읽기 → 005 09:10 ▲ 108 · 댓글 61 매직, 1조 파라미터 모델을 10배 저비용으로 학습하는 기법 공개 Magic은 계산 효율을 10배 이상 개선한 사전학습 방법론을 발표했으며, DeepSeek V4 Pro Base와 동등한 성능을 GPT-3 학습량의 약 절반인 약 50배 적은 연산으로 달성했다. AI · 머신러닝 · Compute-efficient pretraining and scaling to trillion-parameter models
매직, 1조 파라미터 모델을 10배 저비용으로 학습하는 기법 공개 Key Point 알고리즘 효율성으로 대규모 모델을 저비용에 훈련하는 것이 가능함을 입증한 첫 구체적 사례로, 개발 리소스가 제한된 팀의 모델 개발 전략을 바꿀 수 있다.
핵심 요약
Magic은 계산 효율을 10배 이상 개선한 사전학습 방법론을 발표했으며, DeepSeek V4 Pro Base와 동등한 성능을 GPT-3 학습량의 약 절반인 약 50배 적은 연산으로 달성했다. 추가로 10배 규모로 확장한 모델(약 $4M 비용)은 퍼플렉시티 평가에서 공개된 모든 오픈 기본 모델을 능가했으며, 동일 성능을 DeepSeek의 방식으로 훈련하려면 $100M 이상이 소요된다. 모델 아키텍처, 최적화기, 학습 목표, 데이터 큐레이션 등 수십 가지 변경 사항이 누적되어 효율성을 달성했으며, 작은 모델에서 효과 있는 기법이 대규모 모델에서는 작동하지 않는 경우도 발견했다. 전체 요약 5문장 읽기 →