大模型时代
2020年代—现在 · 大语言模型与代理系统
2020年以来,GPT、Claude 等大语言模型(LLM)快速发展,AI Agent、MCP 等技术也陆续出现。这些进展扩大了 AI 在内容生成、软件开发和工具使用方面的应用范围。
Claude Code、Agent 与 MCP 等技术,让模型能在授权范围内参与文件编辑、命令执行和外部工具连接。它们的能力与风险取决于模型、宿主环境、权限设置和具体版本。
这一时期的代表性特征包括模型规模扩大、多模态输入输出、代理式工作流,以及连接 AI 与外部系统的标准协议。相关能力仍在快速变化,应以可验证的产品文档和研究资料为准。
重要里程碑
GPT-3 发布
OpenAI 发布了 GPT-3,这是一个拥有1750亿参数的大型语言模型。GPT-3 展示了令人惊讶的语言生成能力,能够进行对话、写作、编程等复杂任务,引发了对通用人工智能可能性的广泛讨论。
OpenAI
Codex 与 GitHub Copilot
OpenAI 发布了 Codex,这是一个能够理解和生成代码的 AI 模型。基于 Codex 的 GitHub Copilot 成为第一个大规模使用的 AI 编程助手,标志着 AI 辅助开发时代的到来。
OpenAI Codex
ChatGPT 发布
2022年11月,OpenAI 发布了 ChatGPT,这是第一个面向大众市场的生成式 AI 对话助手。ChatGPT 在两个月内突破1亿用户,成为历史上增长最快的消费产品,彻底改变了人们对 AI 的认知。
OpenAI ChatGPT
Stable Diffusion 开源
Stability AI 发布了 Stable Diffusion,这是一个开源的图像生成模型。开源社区的活跃使得图像生成技术迅速普及。
Stability AI
LLaMA 开源
Meta 发布了 LLaMA(Large Language Model Meta AI),这是一个采用非商业研究许可的大语言模型。LLaMA 的参数规模相对较小但性能优秀,推动了开源大模型的发展。
Meta
Gemini 1.5 与长上下文
2024年2月,Google 发布 Gemini 1.5,采用混合专家架构,并在研究预览中提供最长 100 万 token 的上下文窗口,展示了跨长文档、代码和视频进行信息检索与推理的能力。
Google DeepMind
Claude 3 系列
Anthropic 发布了 Claude 3 系列,包括 Opus、Sonnet 和 Haiku 三个版本。Claude 3 Opus 在包括 MMLU 和 GPQA 在内的多个基准上与 GPT-4 表现相当,在其他一些基准上略逊于 GPT-4。
Anthropic
Llama 3 开源
Meta 发布了 Llama 3 系列开放权重模型,包括80亿和700亿参数版本。后来的 Llama 3.1 405B 是首个在常见基准上与前沿闭源模型相匹配的开源权重模型。
Meta
Claude 计算机使用公开测试
2024年10月,Anthropic 为升级版 Claude 3.5 Sonnet 推出计算机使用公开测试。开发者可以让 Claude 查看屏幕、移动光标、点击和输入,使其成为首批公开提供通用图形界面操作能力的前沿模型之一。
Anthropic Claude
智能体生态成熟
到2025年,AI 智能体从研究演示走向生产工具。编程智能体、浏览器智能体、多步任务智能体成为标准产品,OpenAI、Anthropic、Google 以及开源项目均推出了能力成熟的系统。
AI 行业
DeepSeek R1 发布
中国 AI 实验室 DeepSeek 发布了 R1——一个性能可与 OpenAI o1 比肩的开源推理模型。这次发布证明,前沿能力可以在美国 AI 体系之外实现,引发了全球对 AI 竞争格局的重新评估。
DeepSeek
Stargate 计划启动
OpenAI、Oracle、SoftBank 与阿联酋 MGX 联合宣布投入 5000 亿美元在美国建设 AI 基础设施。该项目计划在未来四年内建设多座大型数据中心,是 AI 史上规模最大的私营部门投资。
OpenAI / Oracle / SoftBank
Claude 3.7 Sonnet 发布
Anthropic 发布 Claude 3.7 Sonnet——这是首个支持“混合推理”的模型,用户可在同一个模型中切换即时回答与深度思考两种模式。Claude 3.7 标志着 AI 推理产品形态开始整合。
Anthropic
Anthropic 完成 35 亿美元融资
Anthropic 在2025年3月宣布完成 35 亿美元融资,估值达 615 亿美元。这轮融资使 Anthropic 成为全球估值最高的 AI 初创公司之一,反映了 AI 行业的资本进一步集中。
Anthropic
Llama 4 开源发布
Meta 发布原生多模态的开放权重模型 Llama 4 Scout 与 Maverick,并预览仍在训练的教师模型 Behemoth。Scout 和 Maverick 采用混合专家架构;Behemoth 当时并未发布。
Meta
Claude 4 发布
Anthropic 发布 Claude 4 系列模型(Opus 4 与 Sonnet 4),引入了“扩展思考”(Extended Thinking)能力,在编程、推理与长任务上大幅提升。Claude 4 巩固了 Anthropic 在企业 AI 市场的地位。
Anthropic
欧盟 AI 法案 GPAI 义务开始适用
2025年8月2日,《欧盟人工智能法案》中针对通用人工智能模型提供者的治理规则与部分义务开始适用。法案的其他条款依照不同时间表分阶段适用,不能把该日期笼统称为“全面执法启动”。
欧盟 AI 办公室
OpenAI 完成资本重组
OpenAI 完成公司资本重组。营利业务转为公益公司,名为 OpenAI Group PBC;非营利的 OpenAI Foundation 继续控制该业务,二者使命一致。OpenAI 表示,此次重组是在与加州和特拉华州总检察长办公室历时近一年的沟通之后完成的。
OpenAI
Nature 发表 Co-Scientist 多智能体系统
Nature 发表了 Co-Scientist,一套基于 Gemini 的多智能体系统,能够提出可供实验验证的新研究假设。论文报告了三个生物医学场景下的验证:药物重定位、新靶点发现,以及抗微生物耐药机制的解释。作者将其定位为研究者的助手而非替代者。这使它成为经同行评审的证据,说明 AI 已参与假设生成,而不只是数据分析。
科学界
Meta 开始拆分 Manus 收购整合
据2026年6月11日的报道,Meta 开始解除与 AI 智能体公司 Manus 的收购整合,停止双方数据共享并拆分运营。报道将此举与中国监管要求联系起来;交易的后续法律与运营状态仍应以更新披露为准。
Meta / Manus
Claude Fable 5 与 Mythos 5 暂停后恢复提供
Anthropic 于2026年6月9日发布面向普通用户、带安全防护的 Claude Fable 5,并向 Project Glasswing 的少数受审查机构提供限制更少的 Mythos 5。6月12日,美国政府实施出口管制,要求限制外国人士访问;由于无法即时核验国籍,Anthropic 暂停了两款模型的全球访问。管制于6月30日解除,Fable 5 于7月1日恢复全球提供,Mythos 5 则先向获批的美国机构恢复。
Anthropic
OpenAI 遭美国州检察长联合调查
2026年6月13日,由纽约州检察长牵头的美国多州检察长联盟对 OpenAI 发起调查,并向其发出传票。传票要求提供与广告投放、用户参与度与留存、模型谄媚倾向、消费者与健康数据处理、以及对未成年人和老年人保护相关的文件。OpenAI 表示将配合各州检察长的工作,并强调 ChatGPT 已为未成年人构建更严格的保护机制。这是美国州级执法机构首次针对头部 AI 公司发起的系统性调查。
美国州检察长联盟
GPT-5.6 按政府要求先行有限预览
2026年6月26日,OpenAI 应美国政府要求向少数可信合作伙伴开放 GPT-5.6 Sol、Terra 与 Luna 的有限预览;7月9日,GPT-5.6 系列转为全面可用。OpenAI 表示这种受限流程不应成为长期默认方式。
OpenAI
三星与 SK 海力士公布大规模多年期内存投资计划
2026年6月29日,三星与 SK 海力士公布合计 800 万亿韩元的多年期半导体投资计划,涉及韩国西南部的四座内存晶圆厂。美元换算会随汇率变化,项目范围、审批和执行进度仍需持续核验。
三星 / SK 海力士
Gemini Spark 桌面代理助手上线 Mac
Google 全天候代理助手 Gemini Spark 正式登陆 macOS,支持实时追踪与更多应用接入。Gemini Spark 可在数字生活的多个方面为用户提供持续代理服务,标志着 Google 把代理 AI 推向了消费者桌面端。
Google DeepMind
Moonshot 发布 Kimi K3 开放权重
2026年7月,Moonshot AI 在 Hugging Face 发布了 Kimi K3 的开放权重。模型卡记载总参数 2.8 万亿、激活参数 1040 亿,上下文窗口 1,048,576 个 token,授权条款为 Kimi K3 License。这是迄今公开可下载的最大语言模型,也表明亚洲实验室已进入开放权重发布的前沿。
Moonshot AI
Cloudflare 将 AI 爬虫按用途分类管理
2026年7月1日,Cloudflare 宣布按 Search、Agent 和 Training 三类用途管理 AI 流量。自9月15日起,新加入 Cloudflare 的域名将在带广告的页面上默认阻止 Training 和 Agent 类爬虫,同时默认允许 Search 类爬虫;站点所有者可以调整设置,多用途爬虫按最严格的适用规则处理。
Cloudflare
微软成立 25 亿美元 AI 部署公司
2026年7月2日,微软宣布成立新业务部“Microsoft Frontier Company”,专注企业 AI 部署。该项目将获得微软 25 亿美元投资,并由 6000 名产业与工程专家组成。这是继 Amazon、OpenAI 之后,又一主要厂商成立专门 AI 部署组织。
Microsoft
欧盟 AI 法案全面适用
2026年8月2日,欧盟 AI 法案进入全面适用阶段,AI 办公室与成员国主管机关开始承担实施、监督与执法职责。同一次修订推迟了负担最重的高风险义务:附件三所列独立系统自2027年12月2日适用,嵌入受监管产品的 AI 自2028年8月2日适用。禁止性条款自2025年2月2日起已经适用,通用模型义务自2025年8月2日起适用。
OECD / G7
Agent 进入企业产品交付
2026年上半年,Agent 能力从演示走向企业产品交付:编程、客服与办公自动化 Agent 成为有文档记载的功能,工具调用与多 Agent 协作的基础设施也随之成熟。但采用程度究竟到了哪一步并无定论。各家调查对“什么算一个 Agent”口径不一,得出的投产比例差异很大,因此本条只记录方向,不给出水平。
AI 行业
开放权重模型达到前沿规模
2026年上半年,DeepSeek、阿里 Qwen、Moonshot、智谱与 Meta 的开放权重发布达到了此前只见于闭源系统的规模,权重与模型卡可直接下载,而非仅有描述。它们是否已经追平闭源前沿,取决于采用哪一套基准指数以及如何加权,因此本条只记录发布了什么、以何种许可发布,不给出排名。
DeepSeek / Meta / 阿里
重要人物
山姆·奥尔特曼
OpenAI 首席执行官
奥尔特曼领导 OpenAI 推动了大语言模型的发展。ChatGPT 的发布让他成为 AI 时代最具影响力的人物之一。他正在推动通用人工智能(AGI)的发展,同时也在思考 AI 对社会的影响。
达里奥·阿莫代伊
Anthropic 首席执行官
阿莫代伊曾是 OpenAI 的研究副总裁(2016—2021年),后来创立了 Anthropic。他强调 AI 安全性和有益性,Claude 的设计理念体现了这一价值观——AI 应该是有帮助、无害、诚实的。
马克·扎克伯格
Meta 首席执行官
扎克伯格决定开源 LLaMA 模型,推动了 AI 技术的民主化。他认为开源有利于 AI 的安全和发展,这一决策对 AI 生态系统产生了深远影响。
伊利亚·苏茨凯弗
OpenAI 联合创始人、Safe Superintelligence Inc. 创始人
苏茨凯弗联合创立了 OpenAI 并担任首席科学家。他领导了 GPT-4 时代的模型团队,是2023年后规模化范式的主要架构师。2024年他创立了 Safe Superintelligence Inc.——一家专注于安全超级智能的研究实验室。
戴密斯·哈萨比斯
DeepMind 联合创始人兼 CEO,2024年诺贝尔化学奖得主
哈萨比斯联合创立了 DeepMind,并领导团队在 AlphaGo、AlphaFold 以及前沿 AI 研究上取得突破。2024年,他因 AlphaFold 在蛋白质结构预测上的贡献与他人共同获得诺贝尔化学奖。他持续主张,AI 最深的贡献将是在科学发现上。
艾米莉·本德
计算语言学家
本德是华盛顿大学语言学教授,也是2021年 FAccT 会议论文《On the Dangers of Stochastic Parrots》的第一作者。该文提出语言模型只是把语言形式的序列缝合起来,并不指向意义,同时指出不断做大模型在环境、数据与问责上的代价。它至今仍是这个时代被引用最多的批评性论述,也是对能力叙事的持续制衡。
梁文锋
DeepSeek 创始人
梁文锋毕业于浙江大学,早年将机器学习方法用于量化投资,并于2015年创办对冲基金幻方量化。那里建起的算力基础设施后来支撑了他在2023年创办的 DeepSeek。2025年以 MIT 协议发布的 R1,是首个展现前沿级推理能力的开放权重系统,改变了人们对西方头部公司之外的实验室能够发布什么的预设。
经典语录
我们现在有信心知道如何按照传统理解的方式构建通用人工智能。
我认为在五年内,它很可能能够比我们推理得更好。
我相信开源对于一个积极的人工智能未来是必要的。
我认为它可能在2026年就到来,尽管也有可能需要更长的时间。
这些 AI 模型最为突出的能力可能带来严重乃至灾难性的危害,无论这种危害是蓄意造成还是无意造成。