Hugging Face 논문AI · 머신러닝

80B 파라미터지만 13B만 쓰는 혼연 AI, 오픈소스 공개

원제 Hunyuan-A13B Technical Report

추천 10댓글 1Tencent Hunyuan Team, Ao Liu, Botong Zhou 외
Key Point

MoE 구조로 큰 모델의 성능을 유지하면서 추론 비용을 대폭 줄였으므로, 제한된 리소스 환경에서 강력한 LLM을 배포하려는 개발자와 조직에 직접적인 대안이 된다.

핵심 요약

  • 혼연(Hunyuan)이 80억 개 파라미터 중 추론 시 13억 개만 활성화하는 혼합 전문가(MoE) 구조의 대규모 언어모델 Hunyuan-A13B를 오픈소스로 공개했다.
  • 모델은 20조 개 토큰으로 사전학습되었으며, STEM 데이터를 강화해 사실 정확성과 추론 능력을 개선했다.
  • 고품질 지도학습 미세조정과 대규모 강화학습으로 성능을 더욱 끌어올렸다.
  • 복잡도에 따라 추론 깊이를 조절하는 이중 모드 사고의 사슬(Chain-of-Thought) 프레임워크를 도입했다: 간단한 질문엔 빠른 추론, 복잡한 다단계 문제엔 느린 추론을 수행한다.
  • 수학, 과학, 프로그래밍, 일반 언어 이해, 에이전트 작업 전반에서 훨씬 큰 모델에 가까운 성능을 보였다.
  • 높은 추론 처리량으로 낮은 지연시간이 필요한 애플리케이션에 적합하다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗