대문자와 소문자를 구분해 읽는 메모리, 문맥에 따라 다른 의미 포착
원제 MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
추천 12댓글 2
Key Point
토큰의 다중 의미를 문맥으로 구분해 메모리 효율성과 정확도를 동시에 높이는 기법으로, 소형 언어모델 최적화와 임베딩 기술 발전에 직결됩니다.
핵심 요약
- LLM 효율성을 높이기 위해 Mixture of Memory Embeddings(MoME)를 제안했습니다. 기존 메모리 임베딩은 토큰을 고정된 하나의 항목으로만 매핑하는데, MoME는 각 토큰마다 M개의 슬롯 중 문맥에 맞게 선택해 읽습니다.
- 예를 들어 'python'은 프로그래밍 언어와 동물이라는 서로 다른 의미를 같은 토큰이지만 별도의 메모리 슬롯으로 저장 및 구분합니다.
- Llama-3, Qwen3, MobileLLM 등 여러 모델 아키텍처에서 기존 Value Embedding, Bigram, STEM 방식보다 성능이 우수했습니다.
- 동일한 파라미터 수와 학습량으로 비교해도 MoME가 앞섰으며, 특히 10억 미만 규모에서 메모리 스케일링이 더 유리합니다.
- 학습과 추론 속도도 효율적으로 유지하면서 다의어 분석을 통해 학습된 라우팅이 의미론적 해석 가능성을 보여줍니다.