模型架構
Mixture of Experts (MoE)
一類透過路由組合專家子網路的架構。現代稀疏變體只為每個輸入啟用部分專家,從而擴大模型容量,而無須讓每個詞元都呼叫全部參數。
關鍵術語
- experts
- router
- sparse activation
- load balancing
專案內關聯
第一手來源
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。
模型架構
一類透過路由組合專家子網路的架構。現代稀疏變體只為每個輸入啟用部分專家,從而擴大模型容量,而無須讓每個詞元都呼叫全部參數。
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。