TECHNOLOGY GRAPH
AI 技術體系
從模型架構與訓練,到推論、部署和開放權重模型案例
一份連結研究思想、可訓練模型與可用系統的技術圖譜。每個詞條都會關聯論文、歷史時代、模型案例、工具與第一手來源。
模型架構
決定模型如何表示與轉換資訊的結構。
Transformer
一種以注意力機制為核心、可平行處理序列位置的神經網路架構。它成為許多現代語言模型與多模態模型的基礎。
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
一類透過路由組合專家子網路的架構。現代稀疏變體只為每個輸入啟用部分專家,從而擴大模型容量,而無須讓每個詞元都呼叫全部參數。
- experts
- router
- sparse activation
Diffusion Model
一種學習逆轉逐步加噪過程的生成模型。反覆去噪已成為圖像、音訊、影片與多模態生成的重要方法。
- forward noise
- denoising
- score matching
框架與表示
建立、訓練和執行模型所用的軟體與資料介面。
訓練與後訓練
塑造模型能力與行為的規模化、適配和偏好方法。
Distributed Training
將資料、參數、啟用值或計算拆分到多台裝置與節點的技術。它讓大型模型訓練成為可能,同時引入通訊、同步與容錯取捨。
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
一組用於訓練指令遵循與偏好對齊行為的後訓練方法。SFT 學習示範資料;RLHF 與 DPO 以不同最佳化過程利用偏好比較。
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
一類後訓練方法:讓模型在作答前先產生較長的推理軌跡,並在問題更難時於推論階段投入更多算力。可驗證獎勵的強化學習——由可核對的答案提供訓練訊號——使這條路線得以在封閉實驗室之外被重現。其代價值得直說:準確率來自生成長度而非更大的模型,代價是延遲與服務成本。
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
在凍結基礎權重時僅訓練小型低秩適配器的參數高效微調方法。QLoRA 再結合量化基礎模型,進一步降低記憶體需求。
- low-rank adapters
- frozen base model
- 4-bit training
推論與部署
為模型提供服務所用的記憶體、排程、壓縮與執行環境技術。
Quantization
以較低數值精度表示權重、啟用值或快取。它可以降低記憶體、頻寬與計算成本,但需權衡精度和硬體支援。
- precision
- INT8
- INT4
KV Cache
自回歸生成過程中保存先前詞元注意力鍵和值的快取。它避免重複計算完整前綴,但往往成為主要記憶體消耗項。
- keys
- values
- prefill
Continuous Batching / PagedAttention
在持續接納與移出請求的同時,以分頁方式管理 KV 快取的服務技術。兩者結合可提高變長工作負載下的利用率與吞吐量。
- request scheduling
- memory paging
- throughput
Speculative Decoding
由更快的草稿模型提出多個詞元,再由目標模型平行驗證的推論方法。它可在不改變目標分布的前提下降低生成延遲。
- draft model
- verification
- latency
Open-model Inference Ecosystem
vLLM、llama.cpp 等引擎與執行環境將可下載模型權重轉化為本機或伺服器端推論能力。它們在吞吐量、硬體可攜性、模型格式與維運複雜度上的側重不同。
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
應用架構
模型透過工作流程、工具、上下文交換、安全邊界與評估成為可用產品。現有 MCP 和工具欄目負責這一應用層,避免在此重複內容。
開放模型案例
從程式碼、權重、訓練揭露與授權四個面向審視模型家族。
Llama
Meta 的可下載權重模型家族推動了本機推論與下游微調。其發布採用 Llama 專用條款,因此稱為「開放權重」比直接認定為 OSI 定義的開源更準確。
- open weights
- community license
- model family
Qwen
阿里巴巴的 Qwen 家族涵蓋稠密、專家路由、多語言與多模態模型。許多檢查點可公開下載,但授權與揭露情況應以具體模型卡為準。
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
Mistral AI 的家族同時包含稠密 Mistral 模型和專家路由 Mixtral 模型。部分版本採用寬鬆授權,另一些並非如此,因此開放性需逐項判斷。
- dense models
- MoE
- open weights
DeepSeek
DeepSeek 的可下載版本推動了對 MoE 設計、推理後訓練與高效服務的廣泛研究。程式碼與權重可能採用不同授權,訓練資料揭露又是獨立面向。
- MoE
- reasoning
- open weights
Gemma
Google 的可下載權重模型家族將源自 Gemini 的研究連結到本機、邊緣與託管部署。Google 稱其為開放模型,但使用仍受 Gemma 專用條款約束。
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 發布的 OLMo 家族在權重之外,同時公開預訓練資料、訓練程式碼、中間檢查點與訓練紀錄。首個 OLMo 發布於2024年2月,OLMo 2 於同年11月發布,Olmo 3 於2025年11月發布,包含 7B 與 32B 的 Base、Instruct 和 Think 變體,採用 Apache 2.0 授權。它是程式碼、權重、訓練揭露與授權條款這四項真正全部公開的案例,因而可以作為參照,用來衡量那些只發布權重的模型家族。
- fully open
- open training data
- intermediate checkpoints
gpt-oss
OpenAI 的 gpt-oss-120b 與 20b 是可下載的 MoE 推理模型,面向本機與託管推論。Apache 2.0 權重與參考實作擴大了部署選擇,但預訓練資料集本身並未發布。
- open weights
- reasoning
- MoE
GLM-5
智譜的 GLM-5 系列是面向推理、程式設計與長程智慧體任務的大型 MoE 語言模型家族。GLM-5 於2026年2月發布,5.1 在4月,5.2 在6月以 7530 億參數提供 100 萬詞元上下文視窗,5.3 在8月於同一基座上做後訓練改進;更小的 GLM-5.3-Flash 隨後發布,總參數 3200 億、啟用 180 億。較大成員的規模使自主部署需要較多運算資源。
- open weights
- MoE
- long context
Kimi K3
月之暗面於2026年7月發布 Kimi K3:一個開放權重、原生多模態的 MoE 語言模型,擁有 2.8 兆總參數、1,040 億啟用參數和 100 萬詞元上下文視窗。它面向長程程式設計、知識工作與工具調用智慧體,但其規模使本機部署要求較高。
- open weights
- MoE
- long context
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。