독일 Aleph Alpha, 주권형 언어모델 Kolibri 공개
원제 Kolibri Has Landed: A Sovereign Open-Weight Model
107 포인트댓글 19

Key Point
EU 규제에 맞춘 독일 기업의 오픈소스 모델이 소규모 활성 파라미터로 대형 모델을 능가하는 성능을 달성했으며, 투명한 공급망과 온프레미스 배포로 정부·산업 고객의 데이터 주권을 보장하는 새로운 접근 방식을 보여준다.
핵심 요약
- Aleph Alpha가 78B 총 파라미터(3B 활성화)의 영-독일 이중언어 Mixture-of-Experts 모델 Kolibri를 공개했으며, 최대 1M 토큰의 컨텍스트 윈도우를 지원하고 Apache 2.0 라이선스로 Hugging Face에서 다운로드 가능하다.
- Kolibri는 정부·산업·항공우주 등 규제 대상 영역의 임무 수행을 위해 독일어, 추론, 수학, 에이전트 행동에 최적화되었으며, 개별 고객의 사용 사례에 맞춘 성능을 제공한다.
- 모델은 공급망 투명성, 독일 및 핀란드 인프라 기반 운영, 완전한 배포 자유도를 제공하여 주권성을 확보했으며, EU AI법과 GDPR 준수를 설계 초기부터 반영했다.
- 벤치마크에서 활성 파라미터 3B인 Kolibri는 활성 파라미터 12B의 Nemotron이나 6B의 Mistral Small 4보다 우수한 성능을 보이며, 영어와 독일어 모두에서 비용 대비 성능의 파레토 프론티어에 위치한다.
- Aleph Alpha는 Model Factory라는 자동화된 파이프라인 구축으로 Kolibri Origin(6월 완성)에서 Kolibri(9월 완성)까지 3개월 만에 30B→78B 파라미터로 확장했으며, 총 21일의 학습 중 자동으로 처리한 38건의 하드웨어 장애를 기록했다.
- 총 20T 토큰으로 학습되었으며, 200T 토큰의 원본 데이터를 필터링·중복제거·큐레이션했고, 독일어 비중을 21.3%로 설정하기 위해 4T개 독일어 토큰이 필요했다.
- 독일 공개 데이터셋 390B 토큰만으로는 부족해, Common Crawl에서 1.3T, 문서 재표현으로 1T, 번역으로 일부를 추가했으며, 독일 행정 문서의 긴 단어 문제로 필터링 파라미터를 재조정했다.
- UniBPE라는 새로운 토크나이저 학습 방식을 개발하여 독일어의 복합어 구조를 더 잘 표현했으며, Kolibri 토크나이저는 독일 웹 데이터에서 4.90 bytes/token으로 다른 최신 모델보다 효율적이다.
- 모델은 768개 B200 GPU에서 16k 시퀀스 길이 20T 토큰(21일), 64k 길이 3.44T 토큰(중간 학습), 256k 길이 200B 토큰(장문맥 적응)의 3단계로 학습되었으며, 50개 층 중 10개만 전체 컨텍스트를 처리하고 40개는 512 토큰 윈도우를 사용하여 효율성을 확보했다.
- 추론 후 174B 토큰의 합성 데이터 생성과 필터링으로 268B 토큰의 고품질 미세조정 데이터를 만들었으며, 120만 개 이상의 작업을 포함한 강화학습으로 '없음, 낮음, 중간, 높음' 4단계의 추론 모드를 학습했다.
- 모델은 주어진 문맥에 답변이 없을 때 'I don't know'라고 응답하도록 Merlin-Arthur 프로토콜과 추상화 학습 데이터로 훈련되어 할루시네이션을 줄였으며, 이는 규제 대상 고객의 파일럿에서 실제 배포로의 전환을 가능하게 한다.
- Kolibri는 온프레미스 배포로 내부 데이터를 제3자 추론 서비스로 보내지 않으며, 고객 특화 벤치마크에서 자동차 부품공급(0.72→0.99), 반도체(0.35→0.80), 독일 공공부문(0.54→0.75) 등으로 실제 성능 향상을 입증했다.
- 기술보고서에서 Model Factory의 재현성, 파이프라인 기반 개발의 이점, 에러 발견 후 재학습 사례 등을 공개했으며, 팀의 반복 학습 능력이 모델 자체보다 더 오래 지속될 자산임을 강조했다.