양자 회로로 언어모델 성능 끌어올린다
Key Point
양자컴퓨팅의 이론적 우월성을 실제 언어모델 작업에 구현하면서 계산 효율성을 확보한 새로운 아키텍처로, 고비용 양자 회로를 대규모 신경망에 통합하는 방법론을 제시한다.
핵심 요약
- 언어모델의 각 트랜스포머 블록에 양자 회로 모듈을 덧붙이는 HyperQ 기법을 제안했다.
- 토큰의 숨겨진 상태를 읽어 양자 회로의 좌표를 생성하고 실행한 후 결과를 잔차 연결로 더한다.
- 회로 하이퍼네트워크가 토큰별로 회전각과 결합력, 측정축을 생성하되 공유 희소 회로 구조를 사용한다.
- 필요한 기댓값의 계산 비용이 큐비트 수에 선형으로 증가해 16~64 큐비트 회로를 학습할 수 있다.
- 64 큐비트에서 기존 모델 대비 4.71점 높은 벤치마크 점수를 기록했으며, 필요한 학습 데이터는 1/10 수준이다.