AI 竞速图鉴:从 ChatGPT 到 2026 年的四条轨道
· Toby · 7 min read
把四家实验室画成四条地铁线:站点是发布,横穿所有线路的枢纽站是行业公共设施(协议、生态)。看完这张图,你就知道这场比赛跑到哪了,以及轨道接下来会往哪儿分岔。
第一部分 · 时间线
从 ChatGPT 发令枪响,到 2026 年 7 月的今天。
ChatGPT 上线
5 天 100 万用户,2 个月 1 亿。全世界第一次和 AI「聊上了」,比赛正式开始。
Bard 仓促应战
演示时答错一道天文题,母公司市值一天蒸发上千亿美元。起了个大早,赶了个晚集。
GPT-4 发布
能过律师资格考试。同月上线「插件」——第一次正式给模型递工具。
Claude 1 发布
OpenAI 前研究副总裁们创办,主打一张「安全」牌。和 GPT-4 同一天出场。
AutoGPT / BabyAGI 爆火 —— 第一波 agent 热
思路:让 GPT 自己给自己派任务、循环执行。结果:多数在原地打转烧 token。方向对了,模型还不够格。
DeepSeek 成立
量化基金「幻方」孵化,梁文锋创办。此时没人把这家杭州公司当回事。
DevDay:GPTs + Assistants API;月底宫斗
人人可捏自己的 GPT。三周后 Altman 被董事会开除,五天后回归——全球围观了一场硅谷宫廷剧。
Gemini 1.0 发布
正规军终于到场,原生多模态。
Gemini 1.5:100 万 token 上下文
一口气读完一部小说。长上下文军备赛开跑。
Claude 3 家族
Opus 首次在公开基准上超过 GPT-4。「安全公司也能做第一名的模型」。
GPT-4o:实时语音对话
电影《Her》照进现实。
Claude 3.5 Sonnet + Artifacts
程序员开始集体转会 Claude 写代码。
o1 —— 「推理模型」范式诞生
让模型先打草稿再回答,答题时间换答题质量。此后所有实验室都跟进了这条路线。
Computer Use:模型第一次拿到鼠标键盘
AI 从「说」走向「做」的标志性一步。
Anthropic 开源 MCP 协议
给 AI 接工具的「USB-C」:任何模型 ↔ 任何工具,一个插口。当时没多少人注意,后来成了全行业地基。
Gemini 2.0:为 agent 而生
Google 第一次把「agentic」写进主打卖点。九天后 OpenAI 预告 o3 回应。
V3 发布:开源 + 白菜价
性能对标闭源旗舰,API 价格约为对手几十分之一。暴风雨前的预告片。
R1 发布 —— 「DeepSeek 时刻」
开源推理模型追平 o1,训练成本传说仅数百万美元。一周后英伟达单日市值蒸发约 6000 亿美元,创美股纪录。硅谷第一次认真看向杭州。
Claude Code 问世
命令行里的编程 agent:给它终端和文件系统,自己读代码、改代码、跑测试。
Gemini 2.5 Pro 登顶多项基准
Google 完成从追赶者到并跑者的转身。
OpenAI 宣布支持 MCP —— 协议统一
最大的对手采纳了 Anthropic 的标准(同月还发了自家 Agents SDK)。工具协议之争就此终结。
Google 发布 A2A 协议
MCP 管「agent 连工具」,A2A 管「agent 之间对话」。6 月捐给 Linux 基金会,成为中立标准。
Claude 4(Opus / Sonnet)
可连续自主工作数小时。同月 OpenAI 推出云端编程 agent「Codex」。
GPT-5 发布
自动路由「快答」和「深想」,不再让用户挑模型。
Claude Agent SDK 开放
把 Claude Code 的「身体」(工具、循环、上下文管理)打包给所有开发者造自己的 agent。
Gemini 3 + Antigravity
模型登顶,还送了个 agent 优先的编程环境。六天后 Anthropic 用 Opus 4.5 回应。
Codex 桌面应用
普通人也能同时指挥好几个编程 agent 干活了。
GPT-5.4:推理 + 编程 + 办公合体
表格、幻灯片、文档一起做。4 月又发 5.5,节奏拉满。
V4 发布:1.6T 参数、100 万上下文、MIT 开源
全行业被迫重新定价。而 R2 至今难产:华为芯片训练失败、转回英伟达,梁文锋对性能不满意压着不发。
Claude Fable 5 / Mythos 5 —— 首个「Mythos 级」模型
史上第一次:模型强到发布三天后被美国商务部出口管制叫停(6.12),加装安全分类器后 7.1 复活。政府第一次亲手按了 AI 的暂停键。
GPT-5.6 三兄弟限量预览
Sol(最强)/ Terra(均衡)/ Luna(快而便宜),同样带着管制条款上线。
ChatGPT Work:交付成品的 agent
跨应用收集上下文、拆解目标,直接交回做完的表格、PPT、文档和网页应用。
Gemini 3.6 Flash 家族
不卷最强,卷最便宜:token 省 17%,专为「企业大规模跑 agent」降本。
Opus 5 —— 两个月内第 4 个 Claude 5 系模型
三天前的事。比赛没有终点线,只有补给站。
第二部分 · 2026 年 7 月:谁在引领什么
四家没有在跑同一条赛道——各自占住了一个山头。
OpenAI:用户和产品
最大的用户盘子 + 最快的产品化(ChatGPT Work、Codex)。策略是让 AI 替你「把活干完交回来」,占住普通人的入口。
Google:分发和算力
自研 TPU、搜索/安卓/Workspace 的分发管道。最新打法是给企业跑 agent「降电费」——Flash 系列专攻便宜和快。
Anthropic:agent 基建和安全
编程 agent 事实标准(Claude Code)+ 行业协议(MCP)+ Agent SDK,再加一张「Mythos 级」探顶牌。开发者的默认选项。
DeepSeek:开源和价格地板
每次发布 = 全行业重新定价。MIT 开源权重让「模型本身」越来越难收上钱,是闭源三家最不舒服的存在。
第三部分 · 现在人类怎么造 agent
2023 年是「让 GPT 自己转圈」,2026 年已经长成了五层的标准工程栈——从下往上读。
多 agent 分工协作:子 agent、并行流水线、执行者 + 审查者互相盯梢。企业岗位表里开始出现「agent 编排师」。
LangGraph(企业采用最广,月下载 3450 万)、Claude Agent SDK、OpenAI Agents SDK、CrewAI、Google ADK。选一个,不用自己造轮子。
MCP:agent ↔ 工具,超 10,000 个服务器,ChatGPT / Gemini / Cursor / Copilot 全接入。A2A:agent ↔ agent,归 Linux 基金会。相当于这个时代的 HTTP。
给模型一台「电脑」:终端、浏览器、文件系统。Claude Code、Codex、Antigravity 都是这一层的产品——harness(挽具)决定了模型能不能干活。
会推理、会用工具、能连续工作数小时的大模型。上面四条地铁线卷的就是这一层。
第四部分 · 轨道往哪儿分岔
站在 2026 年 7 月往前看,四条可能的走向。它们不互斥——最可能的未来是混合体。
寡头断层
顶级模型(Mythos 级)与其余拉开代差,算力 + 政府许可成为入场券,前沿 AI 变成少数「获批组织」的特权。
观察信号:下一代旗舰是否只对审批过的机构开放;GPU 与模型出口管制是否加码。
开源追平
DeepSeek R2 / V5 追平闭源旗舰,模型沦为水电煤,按度计费。钱从「卖模型」转移到「卖应用和 harness」。
观察信号:R2 发布后与闭源旗舰的基准差距;API 价格战是否再来一轮。
Agent 经济
agent 取代「操作软件的人」成为默认劳动力,MCP/A2A 像 HTTP 一样隐形,agent 之间互相雇佣、结算。
观察信号:支付协议接入 A2A;招聘描述里出现「管理 agent 团队」。
撞墙回调
可靠性瓶颈 + 大型 agent 事故 + 监管收紧(Fable 5 停摆已是预演),行业进入冷静期,估值挤水分。
观察信号:agent 重大事故上头条;各国立法从「讨论」进入「执行」。