Mixture of Experts混合エキスパート
Mixture of Expertsは、入力ごとに一部の専門家ネットワークだけを動かし、計算量を抑えるニューラルネットワーク構造である。
記事2本
最終言及 Mixture of Experts(MoE)は、入力されたトークンごとにルーターが複数の専門家サブネットワークから一部を選んで実行するAIモデルの構造である。各トークンに全パラメーターを使う密なモデルとは異なり、総パラメーター数に比べてトークン当たりの計算量が少ない。ただし、選ばれない専門家の重みもメモリー上に置いておく必要がある。
1991年に提案された考え方で、大規模言語モデルではMixtralやDeepSeek-V3などが採用している。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
もう一つ知っておきたいモデルの設計がMixture of Experts(MoE)です。