TECHNOLOGY GRAPH
AI 技术体系
从模型架构与训练,到推理、部署和开放权重模型案例
一份连接研究思想、可训练模型与可用系统的技术图谱。每个词条都会关联论文、历史时代、模型案例、工具与一手来源。
模型架构
决定模型如何表示与转换信息的结构。
Transformer
一种以注意力机制为核心、可并行处理序列位置的神经网络架构。它成为许多现代语言模型与多模态模型的基础。
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
一类通过路由组合专家子网络的架构。现代稀疏变体只为每个输入激活部分专家,从而扩大模型容量,而无须让每个词元都调用全部参数。
- experts
- router
- sparse activation
Diffusion Model
一种学习逆转逐步加噪过程的生成模型。迭代去噪已成为图像、音频、视频与多模态生成的重要方法。
- forward noise
- denoising
- score matching
框架与表示
构建、训练和运行模型所用的软件与数据接口。
训练与后训练
塑造模型能力与行为的规模化、适配和偏好方法。
Distributed Training
将数据、参数、激活值或计算拆分到多台设备和节点的技术。它让大模型训练成为可能,同时引入通信、同步与容错权衡。
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
一组用于训练指令遵循与偏好对齐行为的后训练方法。SFT 学习示范数据;RLHF 与 DPO 以不同优化过程利用偏好比较。
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
一类后训练方法:让模型在作答前先生成较长的推理轨迹,并在问题更难时于推理阶段投入更多算力。可验证奖励的强化学习——由可核对的答案提供训练信号——使这条路线得以在封闭实验室之外被复现。其代价值得直说:准确率来自生成长度而非更大的模型,代价是延迟与服务成本。
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
在冻结基础权重时仅训练小型低秩适配器的参数高效微调方法。QLoRA 再结合量化基础模型,进一步降低显存需求。
- low-rank adapters
- frozen base model
- 4-bit training
推理与部署
为模型提供服务所用的内存、调度、压缩与运行时技术。
Quantization
以较低数值精度表示权重、激活值或缓存。它可以降低内存、带宽与计算成本,但需权衡精度和硬件支持。
- precision
- INT8
- INT4
KV Cache
自回归生成过程中保存先前词元注意力键和值的缓存。它避免重复计算完整前缀,但往往成为主要内存消耗项。
- keys
- values
- prefill
Continuous Batching / PagedAttention
在连续接纳与移出请求的同时,以分页方式管理 KV 缓存的服务技术。二者结合可提高变长工作负载下的利用率和吞吐量。
- request scheduling
- memory paging
- throughput
Speculative Decoding
由更快的草稿模型提出多个词元,再由目标模型并行验证的推理方法。它可在不改变目标分布的前提下降低生成延迟。
- draft model
- verification
- latency
Open-model Inference Ecosystem
vLLM、llama.cpp 等引擎与运行时将可下载模型权重转化为本地或服务端推理能力。它们在吞吐量、硬件可移植性、模型格式与运维复杂度上的侧重点不同。
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
应用架构
模型通过工作流、工具、上下文交换、安全边界与评估成为可用产品。现有 MCP 和工具栏目负责这一应用层,避免在这里重复内容。
开放模型案例
从代码、权重、训练披露与许可证四个维度审视模型家族。
Llama
Meta 的可下载权重模型家族推动了本地推理与下游微调。其发布采用 Llama 专用条款,因此称为“开放权重”比直接认定为 OSI 定义的开源更准确。
- open weights
- community license
- model family
Qwen
阿里巴巴的 Qwen 家族涵盖稠密、专家路由、多语言与多模态模型。许多检查点可公开下载,但许可证和披露情况应以具体模型卡为准。
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
Mistral AI 的家族同时包含稠密 Mistral 模型和专家路由 Mixtral 模型。部分版本采用宽松许可证,另一些并非如此,因此开放性需逐项判断。
- dense models
- MoE
- open weights
DeepSeek
DeepSeek 的可下载版本推动了对 MoE 设计、推理后训练与高效服务的广泛研究。代码与权重可能采用不同许可证,训练数据披露又是独立维度。
- MoE
- reasoning
- open weights
Gemma
Google 的可下载权重模型家族将源自 Gemini 的研究连接到本地、边缘与托管部署。Google 称其为开放模型,但使用仍受 Gemma 专用条款约束。
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 发布的 OLMo 家族在权重之外,同时公开预训练数据、训练代码、中间检查点与训练日志。首个 OLMo 发布于2024年2月,OLMo 2 于同年11月发布,Olmo 3 于2025年11月发布,包含 7B 与 32B 的 Base、Instruct 和 Think 变体,采用 Apache 2.0 许可。它是代码、权重、训练披露与许可证这四项真正全部公开的案例,因而可以作为参照,用来衡量那些只发布权重的模型家族。
- fully open
- open training data
- intermediate checkpoints
gpt-oss
OpenAI 的 gpt-oss-120b 与 20b 是可下载的 MoE 推理模型,面向本地和托管推理。Apache 2.0 权重与参考实现扩大了部署选择,但预训练数据集本身并未发布。
- open weights
- reasoning
- MoE
GLM-5
智谱的 GLM-5 系列是面向推理、编程与长程智能体任务的大型 MoE 语言模型家族。GLM-5 于2026年2月发布,5.1 在4月,5.2 在6月以 7530 亿参数提供 100 万词元上下文窗口,5.3 在8月于同一基座上做后训练改进;更小的 GLM-5.3-Flash 随后发布,总参数 3200 亿、激活 180 亿。较大成员的规模使自主部署需要较多计算资源。
- open weights
- MoE
- long context
Kimi K3
月之暗面于2026年7月发布 Kimi K3:一个开放权重、原生多模态的 MoE 语言模型,拥有 2.8 万亿总参数、1040 亿激活参数和 100 万词元上下文窗口。它面向长程编程、知识工作与工具调用智能体,但其规模使本地部署要求较高。
- open weights
- MoE
- long context
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。