简体中文
← 返回首页

模型架构

决定模型如何表示与转换信息的结构。

3 个词条

框架与表示

构建、训练和运行模型所用的软件与数据接口。

3 个词条

训练与后训练

塑造模型能力与行为的规模化、适配和偏好方法。

4 个词条

推理与部署

为模型提供服务所用的内存、调度、压缩与运行时技术。

5 个词条

APPLICATION LAYER

应用架构

模型通过工作流、工具、上下文交换、安全边界与评估成为可用产品。现有 MCP 和工具栏目负责这一应用层,避免在这里重复内容。

开放模型案例

从代码、权重、训练披露与许可证四个维度审视模型家族。

9 个词条
2023

Llama

Meta 的可下载权重模型家族推动了本地推理与下游微调。其发布采用 Llama 专用条款,因此称为开放权重比直接认定为 OSI 定义的开源更准确。

  • open weights
  • community license
  • model family
2023

Qwen

阿里巴巴的 Qwen 家族涵盖稠密、专家路由、多语言与多模态模型。许多检查点可公开下载,但许可证和披露情况应以具体模型卡为准。

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

Mistral AI 的家族同时包含稠密 Mistral 模型和专家路由 Mixtral 模型。部分版本采用宽松许可证,另一些并非如此,因此开放性需逐项判断。

  • dense models
  • MoE
  • open weights
2023

DeepSeek

DeepSeek 的可下载版本推动了对 MoE 设计、推理后训练与高效服务的广泛研究。代码与权重可能采用不同许可证,训练数据披露又是独立维度。

  • MoE
  • reasoning
  • open weights
2024

Gemma

Google 的可下载权重模型家族将源自 Gemini 的研究连接到本地、边缘与托管部署。Google 称其为开放模型,但使用仍受 Gemma 专用条款约束。

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

Ai2 发布的 OLMo 家族在权重之外,同时公开预训练数据、训练代码、中间检查点与训练日志。首个 OLMo 发布于2024年2月,OLMo 2 于同年11月发布,Olmo 3 于2025年11月发布,包含 7B 与 32B 的 Base、Instruct 和 Think 变体,采用 Apache 2.0 许可。它是代码、权重、训练披露与许可证这四项真正全部公开的案例,因而可以作为参照,用来衡量那些只发布权重的模型家族。

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

OpenAI 的 gpt-oss-120b 与 20b 是可下载的 MoE 推理模型,面向本地和托管推理。Apache 2.0 权重与参考实现扩大了部署选择,但预训练数据集本身并未发布。

  • open weights
  • reasoning
  • MoE
2026

GLM-5

智谱的 GLM-5 系列是面向推理、编程与长程智能体任务的大型 MoE 语言模型家族。GLM-5 于2026年2月发布,5.1 在4月,5.2 在6月以 7530 亿参数提供 100 万词元上下文窗口,5.3 在8月于同一基座上做后训练改进;更小的 GLM-5.3-Flash 随后发布,总参数 3200 亿、激活 180 亿。较大成员的规模使自主部署需要较多计算资源。

  • open weights
  • MoE
  • long context
2026

Kimi K3

月之暗面于2026年7月发布 Kimi K3:一个开放权重、原生多模态的 MoE 语言模型,拥有 2.8 万亿总参数、1040 亿激活参数和 100 万词元上下文窗口。它面向长程编程、知识工作与工具调用智能体,但其规模使本地部署要求较高。

  • open weights
  • MoE
  • long context

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。