繁體中文
← 返回首頁

模型架構

決定模型如何表示與轉換資訊的結構。

3 個詞條

框架與表示

建立、訓練和執行模型所用的軟體與資料介面。

3 個詞條

訓練與後訓練

塑造模型能力與行為的規模化、適配和偏好方法。

4 個詞條

推論與部署

為模型提供服務所用的記憶體、排程、壓縮與執行環境技術。

5 個詞條

APPLICATION LAYER

應用架構

模型透過工作流程、工具、上下文交換、安全邊界與評估成為可用產品。現有 MCP 和工具欄目負責這一應用層,避免在此重複內容。

開放模型案例

從程式碼、權重、訓練揭露與授權四個面向審視模型家族。

9 個詞條
2023

Llama

Meta 的可下載權重模型家族推動了本機推論與下游微調。其發布採用 Llama 專用條款,因此稱為開放權重比直接認定為 OSI 定義的開源更準確。

  • open weights
  • community license
  • model family
2023

Qwen

阿里巴巴的 Qwen 家族涵蓋稠密、專家路由、多語言與多模態模型。許多檢查點可公開下載,但授權與揭露情況應以具體模型卡為準。

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

Mistral AI 的家族同時包含稠密 Mistral 模型和專家路由 Mixtral 模型。部分版本採用寬鬆授權,另一些並非如此,因此開放性需逐項判斷。

  • dense models
  • MoE
  • open weights
2023

DeepSeek

DeepSeek 的可下載版本推動了對 MoE 設計、推理後訓練與高效服務的廣泛研究。程式碼與權重可能採用不同授權,訓練資料揭露又是獨立面向。

  • MoE
  • reasoning
  • open weights
2024

Gemma

Google 的可下載權重模型家族將源自 Gemini 的研究連結到本機、邊緣與託管部署。Google 稱其為開放模型,但使用仍受 Gemma 專用條款約束。

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

Ai2 發布的 OLMo 家族在權重之外,同時公開預訓練資料、訓練程式碼、中間檢查點與訓練紀錄。首個 OLMo 發布於2024年2月,OLMo 2 於同年11月發布,Olmo 3 於2025年11月發布,包含 7B 與 32B 的 Base、Instruct 和 Think 變體,採用 Apache 2.0 授權。它是程式碼、權重、訓練揭露與授權條款這四項真正全部公開的案例,因而可以作為參照,用來衡量那些只發布權重的模型家族。

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

OpenAI 的 gpt-oss-120b 與 20b 是可下載的 MoE 推理模型,面向本機與託管推論。Apache 2.0 權重與參考實作擴大了部署選擇,但預訓練資料集本身並未發布。

  • open weights
  • reasoning
  • MoE
2026

GLM-5

智譜的 GLM-5 系列是面向推理、程式設計與長程智慧體任務的大型 MoE 語言模型家族。GLM-5 於2026年2月發布,5.1 在4月,5.2 在6月以 7530 億參數提供 100 萬詞元上下文視窗,5.3 在8月於同一基座上做後訓練改進;更小的 GLM-5.3-Flash 隨後發布,總參數 3200 億、啟用 180 億。較大成員的規模使自主部署需要較多運算資源。

  • open weights
  • MoE
  • long context
2026

Kimi K3

月之暗面於2026年7月發布 Kimi K3:一個開放權重、原生多模態的 MoE 語言模型,擁有 2.8 兆總參數、1,040 億啟用參數和 100 萬詞元上下文視窗。它面向長程程式設計、知識工作與工具調用智慧體,但其規模使本機部署要求較高。

  • open weights
  • MoE
  • long context

這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。