Mixture of Experts전문가 혼합
Mixture of Experts는 입력마다 일부 전문가 네트워크만 활성화해 큰 AI 모델의 연산량을 줄이는 신경망 구조다.
기사 3편
최근 언급 Mixture of Experts(MoE)는 입력 token(텍스트를 처리하는 단위)마다 라우터가 여러 전문가 하위 네트워크 중 일부를 골라 실행하는 AI 모델 구조다. 모든 token에 전체 매개변수를 사용하는 밀집형 모델과 달리, 전체 매개변수 수에 비해 token당 연산량이 적다. 다만 활성화되지 않는 전문가의 가중치도 메모리에 올려 두어야 한다.
1991년 제안된 개념으로, 대규모 언어 모델에서는 Mixtral, DeepSeek-V3 등이 이 구조를 쓴다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.
이 항목을 다룬 기사
26B(26B-A4B) mixture-of-experts GPU 한 장
MoE는 큰 모델을 빠르게 돌리는 구조입니다