003▲ 12 · 댓글 2대문자와 소문자를 구분해 읽는 메모리, 문맥에 따라 다른 의미 포착LLM 효율성을 높이기 위해 Mixture of Memory Embeddings(MoME)를 제안했습니다. 기존 메모리 임베딩은 토큰을 고정된 하나의 항목으로만 매핑하는데, MoME는 각 토큰마다 M개의 슬롯 중 문맥에 맞게 선택해 읽습니다.
AI · 머신러닝 · MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
대문자와 소문자를 구분해 읽는 메모리, 문맥에 따라 다른 의미 포착
Key Point
토큰의 다중 의미를 문맥으로 구분해 메모리 효율성과 정확도를 동시에 높이는 기법으로, 소형 언어모델 최적화와 임베딩 기술 발전에 직결됩니다.
핵심 요약
LLM 효율성을 높이기 위해 Mixture of Memory Embeddings(MoME)를 제안했습니다. 기존 메모리 임베딩은 토큰을 고정된 하나의 항목으로만 매핑하는데, MoME는 각 토큰마다 M개의 슬롯 중 문맥에 맞게 선택해 읽습니다.
예를 들어 'python'은 프로그래밍 언어와 동물이라는 서로 다른 의미를 같은 토큰이지만 별도의 메모리 슬롯으로 저장 및 구분합니다.
Llama-3, Qwen3, MobileLLM 등 여러 모델 아키텍처에서 기존 Value Embedding, Bigram, STEM 방식보다 성능이 우수했습니다.
006▲ 108 · 댓글 61매직, 1조 파라미터 모델을 10배 저비용으로 학습하는 기법 공개Magic은 계산 효율을 10배 이상 개선한 사전학습 방법론을 발표했으며, DeepSeek V4 Pro Base와 동등한 성능을 GPT-3 학습량의 약 절반인 약 50배 적은 연산으로 달성했다.
AI · 머신러닝 · Compute-efficient pretraining and scaling to trillion-parameter models
매직, 1조 파라미터 모델을 10배 저비용으로 학습하는 기법 공개
Key Point
알고리즘 효율성으로 대규모 모델을 저비용에 훈련하는 것이 가능함을 입증한 첫 구체적 사례로, 개발 리소스가 제한된 팀의 모델 개발 전략을 바꿀 수 있다.
핵심 요약
Magic은 계산 효율을 10배 이상 개선한 사전학습 방법론을 발표했으며, DeepSeek V4 Pro Base와 동등한 성능을 GPT-3 학습량의 약 절반인 약 50배 적은 연산으로 달성했다.
추가로 10배 규모로 확장한 모델(약 $4M 비용)은 퍼플렉시티 평가에서 공개된 모든 오픈 기본 모델을 능가했으며, 동일 성능을 DeepSeek의 방식으로 훈련하려면 $100M 이상이 소요된다.
모델 아키텍처, 최적화기, 학습 목표, 데이터 큐레이션 등 수십 가지 변경 사항이 누적되어 효율성을 달성했으며, 작은 모델에서 효과 있는 기법이 대규모 모델에서는 작동하지 않는 경우도 발견했다.