AI 竞速图鉴:从 ChatGPT 到 2026 年的四条轨道

· Toby · 7 min read

把四家实验室画成四条地铁线:站点是发布,横穿所有线路的枢纽站是行业公共设施(协议、生态)。看完这张图,你就知道这场比赛跑到哪了,以及轨道接下来会往哪儿分岔。

OpenAI Google Anthropic DeepSeek 枢纽站(生态 / 协议)

第一部分 · 时间线

从 ChatGPT 发令枪响,到 2026 年 7 月的今天。

2022发令枪
11.30OpenAI

ChatGPT 上线

5 天 100 万用户,2 个月 1 亿。全世界第一次和 AI「聊上了」,比赛正式开始。

2023追赶与第一波 agent 幻觉
02Google

Bard 仓促应战

演示时答错一道天文题,母公司市值一天蒸发上千亿美元。起了个大早,赶了个晚集。

03.14OpenAI

GPT-4 发布

能过律师资格考试。同月上线「插件」——第一次正式给模型递工具。

03.14Anthropic

Claude 1 发布

OpenAI 前研究副总裁们创办,主打一张「安全」牌。和 GPT-4 同一天出场。

03–04生态

AutoGPT / BabyAGI 爆火 —— 第一波 agent 热

思路:让 GPT 自己给自己派任务、循环执行。结果:多数在原地打转烧 token。方向对了,模型还不够格。

07DeepSeek

DeepSeek 成立

量化基金「幻方」孵化,梁文锋创办。此时没人把这家杭州公司当回事。

11OpenAI

DevDay:GPTs + Assistants API;月底宫斗

人人可捏自己的 GPT。三周后 Altman 被董事会开除,五天后回归——全球围观了一场硅谷宫廷剧。

12.06Google

Gemini 1.0 发布

正规军终于到场,原生多模态。

2024推理范式 + 递出鼠标键盘
02.15Google

Gemini 1.5:100 万 token 上下文

一口气读完一部小说。长上下文军备赛开跑。

03.04Anthropic

Claude 3 家族

Opus 首次在公开基准上超过 GPT-4。「安全公司也能做第一名的模型」。

05.13OpenAI

GPT-4o:实时语音对话

电影《Her》照进现实。

06.20Anthropic

Claude 3.5 Sonnet + Artifacts

程序员开始集体转会 Claude 写代码。

09.12OpenAI

o1 —— 「推理模型」范式诞生

让模型先打草稿再回答,答题时间换答题质量。此后所有实验室都跟进了这条路线。

10.22Anthropic

Computer Use:模型第一次拿到鼠标键盘

AI 从「说」走向「做」的标志性一步。

11.25枢纽

Anthropic 开源 MCP 协议

给 AI 接工具的「USB-C」:任何模型 ↔ 任何工具,一个插口。当时没多少人注意,后来成了全行业地基。

12.11Google

Gemini 2.0:为 agent 而生

Google 第一次把「agentic」写进主打卖点。九天后 OpenAI 预告 o3 回应。

12.26DeepSeek

V3 发布:开源 + 白菜价

性能对标闭源旗舰,API 价格约为对手几十分之一。暴风雨前的预告片。

2025DeepSeek 时刻 + agent 元年
01.20DeepSeek

R1 发布 —— 「DeepSeek 时刻」

开源推理模型追平 o1,训练成本传说仅数百万美元。一周后英伟达单日市值蒸发约 6000 亿美元,创美股纪录。硅谷第一次认真看向杭州。

02.24Anthropic

Claude Code 问世

命令行里的编程 agent:给它终端和文件系统,自己读代码、改代码、跑测试。

03.25Google

Gemini 2.5 Pro 登顶多项基准

Google 完成从追赶者到并跑者的转身。

03.26枢纽

OpenAI 宣布支持 MCP —— 协议统一

最大的对手采纳了 Anthropic 的标准(同月还发了自家 Agents SDK)。工具协议之争就此终结。

04.09枢纽

Google 发布 A2A 协议

MCP 管「agent 连工具」,A2A 管「agent 之间对话」。6 月捐给 Linux 基金会,成为中立标准。

05.22Anthropic

Claude 4(Opus / Sonnet)

可连续自主工作数小时。同月 OpenAI 推出云端编程 agent「Codex」。

08.07OpenAI

GPT-5 发布

自动路由「快答」和「深想」,不再让用户挑模型。

09.29Anthropic

Claude Agent SDK 开放

把 Claude Code 的「身体」(工具、循环、上下文管理)打包给所有开发者造自己的 agent。

11.18Google

Gemini 3 + Antigravity

模型登顶,还送了个 agent 优先的编程环境。六天后 Anthropic 用 Opus 4.5 回应。

2026发布节奏进入「月更」
02OpenAI

Codex 桌面应用

普通人也能同时指挥好几个编程 agent 干活了。

03.05OpenAI

GPT-5.4:推理 + 编程 + 办公合体

表格、幻灯片、文档一起做。4 月又发 5.5,节奏拉满。

04.24DeepSeek

V4 发布:1.6T 参数、100 万上下文、MIT 开源

全行业被迫重新定价。而 R2 至今难产:华为芯片训练失败、转回英伟达,梁文锋对性能不满意压着不发。

06.09Anthropic

Claude Fable 5 / Mythos 5 —— 首个「Mythos 级」模型

史上第一次:模型强到发布三天后被美国商务部出口管制叫停(6.12),加装安全分类器后 7.1 复活。政府第一次亲手按了 AI 的暂停键。

06.27OpenAI

GPT-5.6 三兄弟限量预览

Sol(最强)/ Terra(均衡)/ Luna(快而便宜),同样带着管制条款上线。

07.09OpenAI

ChatGPT Work:交付成品的 agent

跨应用收集上下文、拆解目标,直接交回做完的表格、PPT、文档和网页应用。

07.21Google

Gemini 3.6 Flash 家族

不卷最强,卷最便宜:token 省 17%,专为「企业大规模跑 agent」降本。

07.24Anthropic

Opus 5 —— 两个月内第 4 个 Claude 5 系模型

三天前的事。比赛没有终点线,只有补给站。

第二部分 · 2026 年 7 月:谁在引领什么

四家没有在跑同一条赛道——各自占住了一个山头。

Consumer + Universal Agent

OpenAI:用户和产品

最大的用户盘子 + 最快的产品化(ChatGPT Work、Codex)。策略是让 AI 替你「把活干完交回来」,占住普通人的入口。

Distribution + Cost

Google:分发和算力

自研 TPU、搜索/安卓/Workspace 的分发管道。最新打法是给企业跑 agent「降电费」——Flash 系列专攻便宜和快。

Agent Infra + Safety

Anthropic:agent 基建和安全

编程 agent 事实标准(Claude Code)+ 行业协议(MCP)+ Agent SDK,再加一张「Mythos 级」探顶牌。开发者的默认选项。

Open Weights + Price Floor

DeepSeek:开源和价格地板

每次发布 = 全行业重新定价。MIT 开源权重让「模型本身」越来越难收上钱,是闭源三家最不舒服的存在。

第三部分 · 现在人类怎么造 agent

2023 年是「让 GPT 自己转圈」,2026 年已经长成了五层的标准工程栈——从下往上读。

agent = 模型 + 工具 + 循环 一个会推理的模型,一套能碰真实世界的工具,加一句「没做完就继续」。整个行业都在给这个公式添砖加瓦。
L5编排层

多 agent 分工协作:子 agent、并行流水线、执行者 + 审查者互相盯梢。企业岗位表里开始出现「agent 编排师」。

L4框架层

LangGraph(企业采用最广,月下载 3450 万)、Claude Agent SDKOpenAI Agents SDKCrewAIGoogle ADK。选一个,不用自己造轮子。

L3协议层

MCP:agent ↔ 工具,超 10,000 个服务器,ChatGPT / Gemini / Cursor / Copilot 全接入。A2A:agent ↔ agent,归 Linux 基金会。相当于这个时代的 HTTP。

L2执行层

给模型一台「电脑」:终端、浏览器、文件系统。Claude Code、Codex、Antigravity 都是这一层的产品——harness(挽具)决定了模型能不能干活。

L1模型层

会推理、会用工具、能连续工作数小时的大模型。上面四条地铁线卷的就是这一层。

第四部分 · 轨道往哪儿分岔

站在 2026 年 7 月往前看,四条可能的走向。它们不互斥——最可能的未来是混合体。

◉ 2026.07 你在这里
分岔 A

寡头断层

顶级模型(Mythos 级)与其余拉开代差,算力 + 政府许可成为入场券,前沿 AI 变成少数「获批组织」的特权。

观察信号:下一代旗舰是否只对审批过的机构开放;GPU 与模型出口管制是否加码。

分岔 B

开源追平

DeepSeek R2 / V5 追平闭源旗舰,模型沦为水电煤,按度计费。钱从「卖模型」转移到「卖应用和 harness」。

观察信号:R2 发布后与闭源旗舰的基准差距;API 价格战是否再来一轮。

分岔 C

Agent 经济

agent 取代「操作软件的人」成为默认劳动力,MCP/A2A 像 HTTP 一样隐形,agent 之间互相雇佣、结算。

观察信号:支付协议接入 A2A;招聘描述里出现「管理 agent 团队」。

分岔 D

撞墙回调

可靠性瓶颈 + 大型 agent 事故 + 监管收紧(Fable 5 停摆已是预演),行业进入冷静期,估值挤水分。

观察信号:agent 重大事故上头条;各国立法从「讨论」进入「执行」。

最可能的剧本是混合:顶部封闭(A)与底部开源(B)同时发生——最强的模型锁在许可后面,够用的模型免费如空气;agent 经济(C)在编程、办公这些「可验证的活」上先落地,再慢慢外溢;而 D 不是终局,是间歇性发作的震荡。真正确定的只有一件事:竞争的重心已经从「谁的模型聪明」移向「谁的 agent 能把活干完」。

← All posts on Chesto