AI 不必先成为完整的人,就足以重写完整的工作。它先跨过回答门槛,再跨过行动门槛;可靠闭环决定它能真正接管哪一段流程。
2026 年判断 AI,最容易犯的错误,是把峰值能力当成平均能力,把一次成功当成可靠能力。
METR 对公开前沿模型的独立评估 给出了一个有用的切面:在以软件工程、机器学习和网络安全为主、目标清晰且可自动评分的任务中,50% 成功率对应约 12 小时的人类等价任务跨度,80% 成功率对应约 1.5 小时。这里的“12 小时”是人类专家完成同类任务所需的工时,不是 AI 的连续运行时间或无人值守时间。
更贴近办公现实的 OSWorld 2.0 也揭示了同一道裂缝。它包含 108 个跨应用、会动态变化的端到端流程,熟练人类完成一个任务的中位时间约为 1.6 小时。初始论文中,最佳系统可以取得 54.8% 的部分得分,严格完整完成率却只有 20.6%。OpenAI 之后披露 GPT‑5.6 Sol 的部分得分升至 62.6%,但没有提供可直接对照的严格完整完成率。
这些指标来自不同任务集,不能拼成一张简单排行榜。它们指向同一个边界:模型已经很会完成局部动作,真正困难的是在数百步中维持整体任务状态,记住约束,处理新信息,发现错误,并确认结果真的交付了。
另一组证据来自斯坦福 《2026 AI Index》技术能力章节:Google 的 Gemini Deep Think 在 2025 年国际数学奥林匹克竞赛题上拿到 35 分,达到金牌线;结构化电脑操作基准 OSWorld 上的 Agent 成功率达到 66.3%;在模拟家庭环境中、任务更长的 BEHAVIOR‑1K 留出测试集上,最佳系统完整完成率只有 12.4%。这些不是可直接横比的同一测试,不能据此拟合一条定量下降曲线;它们共同提示,短而结构化的任务与长周期、开放任务之间存在显著能力落差。
当前 AI 已经很难用一个榜单、一句“达到 AGI”,或者一句“仍然只是概率鹦鹉”概括。它的演化路径已经清楚起来:回答、行动、可靠闭环。2026 年,前沿 AI 已经跨过回答门槛,正在跨过行动门槛;在目标明确、环境数字化、结果可验证的任务中,它已经开始成为可以批量调用的数字劳动力。
这意味着,AI 不需要先复制一个完整的人,便足以拆解一份完整的工作。下一轮竞争也不会只围绕“谁的一次回答更聪明”,而是谁能把峰值能力封装成稳定、可验收、可追责的任务完成。底层模型、推理预算、工具、组织上下文、执行环境、验证器、权限系统和产品反馈,正在共同取代“裸模型”,成为真正的竞争单位。
PART I · 能力边界从会回答,到会行动,再到可靠闭环
一、先画边界,再谈水平
FIG 01
领跑者在换,但能力曲线没有停
三张图共享时间方向,不共享分数口径。点只记录同一评测内刷新公开纪录的模型;误差棒为官方 95% 置信区间。
从 2025 年初到 2026 年夏,前沿不是一家公司直线垄断,而是 OpenAI、Google、Anthropic 反复换手;真正持续上升的是整个前沿。
上方只表示各期指数的领先者。由于 Artificial Analysis 更换过指数版本,刻意不把分数连成一条连续曲线。
Humanity’s Last Exam
固定 2,500 题;Scale 统一温度、judge 与公开全量集。纵轴:准确率 %
Terminal-Bench
固定 Terminus 2 scaffold;2.1 修订 28 / 89 项任务。纵轴:准确率 %
ARC-AGI-2
ARC Prize 验证的静态抽象推理前沿;首个空心点为预览。纵轴:准确率 %
来源:Scale HLE · Terminal-Bench 2.0 / 2.1 · ARC Prize · Artificial Analysis 历史快照。数据截至 2026-08-02。
展开精确数据与版本口径
| 评测 | 日期 | 公司 | 模型 | 分数 | 95% CI | 口径注记 |
|---|---|---|---|---|---|---|
| HLE | 2025-01-24 | OpenAI | o1 Pro | 8.12% | ±1.07 | Scale 统一 harness |
| HLE | 2025-03-25 | Gemini 2.5 Pro Exp | 18.16% | ±1.51 | Scale 统一 harness | |
| HLE | 2025-04-16 | OpenAI | o3 high | 20.32% | ±1.58 | Scale 统一 harness |
| HLE | 2025-06-05 | Gemini 2.5 Pro Preview | 21.64% | ±1.61 | Scale 统一 harness | |
| HLE | 2025-08-07 | OpenAI | GPT-5 | 25.32% | ±1.7 | Scale 统一 harness |
| HLE | 2025-10-06 | OpenAI | GPT-5 Pro | 31.64% | ±1.82 | Scale 统一 harness |
| HLE | 2025-11-18 | Gemini 3 Pro | 37.52% | ±1.9 | Scale 统一 harness | |
| HLE | 2026-02-19 | Gemini 3.1 Pro Preview | 46.44% | ±1.96 | Scale 统一 harness | |
| Terminal-Bench 2.0 | 2025-10-31 | OpenAI | GPT-5-Codex | 43.4% | ±2.9 | Terminus 2 |
| Terminal-Bench 2.0 | 2025-11-16 | OpenAI | GPT-5.1 | 47.6% | ±2.8 | Terminus 2 |
| Terminal-Bench 2.0 | 2025-11-21 | Gemini 3 Pro | 56.9% | ±2.5 | Terminus 2 | |
| Terminal-Bench 2.0 | 2025-11-22 | Anthropic | Opus 4.5 | 57.8% | ±2.5 | 与 Google 置信区间重叠 |
| Terminal-Bench 2.0 | 2026-02-05 | OpenAI | GPT-5.3-Codex | 64.7% | ±2.7 | Terminus 2 |
| Terminal-Bench 2.1 | 2026-05-01 | OpenAI | GPT-5.5 | 78% | ±1.2 | Terminus 2 |
| Terminal-Bench 2.1 | 2026-06-05 | Anthropic | Fable 5 | 80.4% | ±1.2 | 置信区间边界接触 |
| ARC-AGI-2 | 2025-03-24 | OpenAI | o3-preview-low | 4% | 未提供 | 进行中预览 |
| ARC-AGI-2 | 2025-11-13 | OpenAI | GPT-5.1 | 17.6% | 未提供 | ARC Prize 验证 |
| ARC-AGI-2 | 2025-11-24 | Anthropic | Claude Opus 4.5 | 37.6% | 未提供 | ARC Prize 验证 |
| ARC-AGI-2 | 2025-12-11 | OpenAI | GPT-5.2 Pro | 54.2% | 未提供 | ARC Prize 验证 |
| ARC-AGI-2 | 2026-02-05 | Anthropic | Opus 4.6 High | 69.2% | 未提供 | ARC Prize 验证 |
| ARC-AGI-2 | 2026-02-19 | Gemini 3.1 Pro | 77.1% | 未提供 | ARC Prize 验证 | |
| ARC-AGI-2 | 2026-04-22 | OpenAI | GPT-5.5 xHigh | 85% | 未提供 | ARC Prize 验证 |
| ARC-AGI-2 | 2026-07-09 | OpenAI | GPT-5.6 Sol Max | 92.5% | 未提供 | ARC Prize 验证 |
过去两年,人们习惯用考试分数理解模型:数学多少分、代码修复率多少、竞技场排第几。这个方法越来越不够用。
斯坦福 AI Index 统计,前沿模型在 Humanity’s Last Exam 上一年提高约 30 个百分点;与此同时,头部公司的竞技场评分已经挤在很窄的区间内。基准本身也在老化:部分常用题集的无效问题比例高达 42%,模型针对题库和评测环境优化,也会让榜单成绩偏离真实通用能力。
判断 AI 到了什么水平,至少需要五把尺子:
| 尺子 | 它回答的问题 | 2026 年的现实 |
|---|---|---|
| 峰值能力 | 最难能做什么 | 数学、代码、科学问答和部分专业任务已达到或超过很强的人类基线 |
| 人类等价任务跨度 | 在给定成功率下,模型能解决相当于人类专家多大工时的任务 | 特定软件任务的 50% 跨度约 12 小时,80% 跨度约 1.5 小时;这不是 Agent 的运行时长 |
| 环境开放度 | 能否应对模糊目标、变化界面和隐藏状态 | 短而结构化的电脑任务进步很快,真实长流程的严格完成率仍很低 |
| 可验证性与可逆性 | 错误能否被发现、拦截和追回 | 代码、数学等有验证器的任务最先落地;付款、医疗和开放网络操作仍需审批与隔离 |
| 验收后总成本 | 一个通过验收的结果需要多少模型、工具、重试和人工 | 单次调用越来越便宜,验证、重试、集成和治理仍然昂贵 |
峰值能力回答“它偶尔能做到什么”,中间三项决定“它能否进入生产”,验收后总成本决定“它能否规模化”。能力上限决定产品想象,人类等价任务跨度决定自动化半径,环境开放度与可验证性决定行业落地顺序,验收后总成本决定商业模式能否成立。
由这五把尺子,可以把当前部署边界分成三个区域:
| 区域 | 典型条件 | 2026 年更合理的用法 |
|---|---|---|
| 可委派区 | 目标明确、全程数字化、结果可自动验证、失败可回滚 | 让 Agent 完成有边界的代码、数据、检索和内容交付,人类验收结果 |
| 协作区 | 需要跨来源判断、过程会变化、部分结果只能人工评估 | 让 Agent 推进流程,在关键节点请求确认,由人处理例外 |
| 责任保留区 | 后果重大或不可逆、权限高、涉及身体与复杂社会关系 | AI 提供分析和候选方案,授权、决定与责任继续由人承担 |
这不是按职业名称切割。写代码也可能进入责任保留区,例如直接修改生产数据库;医疗工作也可能有可委派环节,例如整理已脱敏、可复核的文献。边界取决于任务结构,不取决于岗位听起来多“高级”。
2026 年的 AI 更像一张起伏剧烈的地形图:有些山峰已经高过人类,有些谷地还停留在新手水平。所谓“智能水平”,取决于你站在哪一块地形上。
FIG 02
五把尺子,不伪造一条总分
前三项保留各自的公开原值;后两项是部署条件,只呈现证据状态。单位不同、问题不同,因此不共享坐标轴。
峰值能力已经越过许多人类基线;开放环境、验收与总成本 才是进入生产的收缩阀。
封闭、静态抽象推理的公开前沿;回答“最难能做到什么”。
人类专家完成同类任务所需工时;不是模型连续运行时间。
跨应用动态流程的二元完整完成率;部分得分不能替代它。
测试、沙箱与回滚让失败可被发现和追回;这是结构条件,不是 72 分。
重试、工具、人工复核、治理与失败损失,决定一个合格结果的真实成本。
前 3 行是不同单位的公开观测,后 2 行是部署门槛;五行回答不同问题,不合成雷达图、成熟度分或总排名。
来源:本文分析框架;原始证据分别见后续图版与正文来源。
二、能力地图:它已经能做什么,又在哪里掉链子
1. 推理:会解难题,但“会解题”不等于“会研究”
当前前沿模型可以处理竞赛数学、博士级科学问答、复杂图表和多约束分析。斯坦福 AI Index 汇总的若干税务、按揭、公司金融和法律推理测试中,头部模型的表现已落在 60%—90% 区间;不少过去被认为能维持数年的难基准,几个月内就接近饱和。
2026 年 7 月的 ARC Prize 验证结果 把新边界展示得更清楚:GPT‑5.6 Sol(max)在静态抽象推理基准 ARC‑AGI‑2 上达到 92.5%,在要求自行探索未知规则、持续行动的 ARC‑AGI‑3 半私有集上却只有 7.78%。它已经能在其中一个公开环境取得 87.1%,却还不能把成功稳定迁移到整组新环境。前沿正在从“解一道没见过的题”推进到“进入一个没见过的世界并学会行动”,后者远未解决。
这些成绩表明模型在多类封闭推理任务上表现很强,但不能仅凭基准排除数据污染、题型适配,也不能由此证明现实研究能力。封闭题目的答案通常已被预先定义,现实研究则要求提出问题、辨别数据质量、发现反例、承认不知道,并为结论承担后果。模型能给出一条漂亮推导,仍可能引用不存在的论文,或者把相关性写成因果关系。
推理模型还有一项重要变化:它们可以按任务难度分配“思考预算”。OpenAI 从 o1 开始公开展示 test-time compute 的能力曲线;如今 OpenAI、Anthropic、Google、阿里等产品普遍提供不同 reasoning effort。更长的思考、多次采样、并行代理和结果筛选,能用成本与延迟换取准确率。这个规律并非无限成立:模型也会过度思考、在错误方向上坚持,或者利用评分规则的漏洞。
FIG 03
同一个模型:会解陌生题,还不会闯陌生世界
ARC-AGI-2 与 ARC-AGI-3 属于相邻评测家族,却衡量不同能力;并排展示用于画边界,不用于计算“退化倍数”。
静态抽象推理达到 92.5%,持续探索未知交互规则只有 7.78%。
ANSWER · STATIC
ARC-AGI-2
从样例中抽取抽象规则,给出确定答案。
ACT · INTERACTIVE
ARC-AGI-3
进入未知环境,自主探索并持续采取动作。
来源:ARC Prize:OpenAI GPT-5.6 results,2026-07-09。
展开精确数据与比较边界
| 模型 | 评测 | 分数 | 任务性质 | 可比边界 |
|---|---|---|---|---|
| GPT-5.6 Sol Max | ARC-AGI-2 | 92.5% | 静态抽象推理 | ARC Prize 验证 |
| GPT-5.6 Sol | ARC-AGI-3 半私有集 | 7.78% | 未知规则下持续交互 | 不可与 ARC-AGI-2 拟合下降率 |
2. 编程:第一个真正跑通的 Agent 场景
代码最先成为 AI 深入专业工作的突破口,关键在于软件工程拥有罕见的反馈条件:代码能编译,测试能运行,页面能截图,性能能测量,版本能回滚。模型每走一步,都可能获得相对清晰的“对或错”。
Epoch AI 与 METR 的 MirrorCode 初步结果 已经把人类等价任务跨度推到“周”级:Claude Opus 4.6 在没有中途人工指导的情况下,把约 1.69 万行 Go 的生物信息工具包 gotree 重实现为 Rust;四名研究者和工程师估计,熟练工程师完成同一任务需要 2—17 周。但 Agent 拿到了可执行的参考程序、文档、可见测试和大量隐藏端到端测试,相当于拥有一份可以反复查询的精确规格。面对约 6.15 万行的 Pkl,它在 10 亿 token 预算下仍未完成。
Anthropic 还称,Opus 4.8 的研究预览可以以现有测试套件为验收标准,执行跨数十万行代码库、从启动持续到合并的迁移;OpenAI、Google、阿里、Kimi、智谱等厂商也把长周期编码与工具调用放在核心位置。两类证据合在一起,结论已经相当激进:AI 可以独立完成过去按“周”估算的专业任务,但前提是世界向它提供清晰、密集、机器可读的反馈。模型的耐心正在变廉价,可计算的完成条件才稀缺。AI 交付的单位正在从一段答案变成一个可运行的工件。
FIG 04
“周级任务”成立,但规格必须足够精确
MirrorCode 允许 Agent 反复查询可执行参考程序,并用可见与隐藏测试验收;它测的是可验证软件迁移,不是开放式产品开发。
AI 的耐心正在变廉价;可执行规格与机器验收 才是把耐心变成交付的关键。
gotree · Go → Rust
- 原项目规模
- 约 16.9K LOC
- 人类估时
- 2—17 周
- 中途指导
- 无
- 验收
- 隐藏端到端测试
Pkl · Kotlin → Rust
- 原项目规模
- 约 61.5K LOC
- 预算
- 1B tokens
- 结果
- 未完成
- 边界
- 规模仍会击穿
3. 多模态:从“能看图”走向边看、边说、边操作
多模态已经成为成熟的产品接口,还不是成熟、统一的世界理解。前沿产品可以接收文字、图片、音频、视频和屏幕状态,再通过模型路由与工具链输出文字、语音、图像、代码或网页。斯坦福 AI Index 技术章节 汇总的 Video‑MMMU 中,最佳总体准确率为 66.0%,低于人类的 74.4%;观看视频带来的知识增益,最佳模型为 15.6 个百分点,人类为 33.1 个百分点,约三分之一模型看完视频后反而退步。输入通道变多,并不自动带来稳定的跨模态学习。
生成系统也从静态图像跨向带声音的视频和可交互环境。Google 的 Genie 3 可以在 720p、24 fps 下生成可实时导航并维持数分钟一致性的环境;字节的 Seedance 2.0 使用文本、图像、音频和视频共同驱动视听生成。Genie 3 目前通过 Project Genie,以实验性研究原型的形式向部分国家和地区的 Google One Ultra 订阅者开放;直接动作空间、多主体互动和真实地点仍受限制,连续交互只能维持数分钟而非数小时。即便如此,这类系统已经足以重写广告、短片、游戏原型和教育内容的生产流程:商业价值不必等待世界模型先变得完美。
FIG 05
通道变多,不等于理解变稳
每条哑铃都在同一评测、同一百分比尺度内比较 AI 与人类;三条之间不合成总分。
AI 已经能看、听、生成和复现实验;从输入中学到新知识、完成端到端研究 仍明显落后。
VIDEO-MMMU
视频总体准确率
看视频后的知识增益
PAPERARENA
论文级端到端复现
强问答能力尚未自动变成提出问题、搭实验、复现结果的完整研究能力。
来源:Stanford 2026 AI Index · Technical Performance 与 Science。
4. 电脑与现实世界:数字界面在前,物理世界在后
电脑操作是连接模型与真实工作的桥。AI Index 记录的是较短、结构化的 OSWorld 1.0:Agent 成功率从约 12% 升至 66.3%。OSWorld 2.0 则包含 108 个跨应用长流程,单项任务由熟练人类完成的中位时间约 1.6 小时;Claude Opus 4.7(max thinking)平均需要约 318 次工具调用。初始论文在最多 500 步下,Claude Opus 4.8(max thinking、batched tools)的二元完整完成率为 20.6%,部分得分为 54.8%。OpenAI 随后公司自报 GPT‑5.6 Sol 的部分得分升至 62.6%,但没有披露二元完整完成率。62.6% 不能解释为“完成了六成工作流”:它只证明部分得分提高;GPT‑5.6 Sol 的严格端到端完成率目前无法由公开数据判断。
物理世界不能压缩成一个行业统一成功率。自动驾驶已经在地理围栏、精细地图和远程支持条件下大规模运营:AI Index 统计,Waymo 在 2025 年达到约每周 45 万次出行,百度 Apollo Go 累计完成 1,100 万次全无人驾驶订单。机器人评测的跨度则极大:受控模拟、短周期的 RLBench 18 项操作成功率已达 89.4%,长周期的 BEHAVIOR‑1K 模拟家庭环境完整任务成功率只有 12.4%。
这些结果揭示了产业扩散的基本顺序:环境越可控,反馈越清晰,失败越容易回滚,AI 越快变成生产力。开放世界、身体交互和不可逆后果不会阻止 AI 进入,只会决定它先以辅助系统、受限自治还是完全自动化的形态进入。
FIG 06
部分得分很好看,完整交付仍会掉下去
OSWorld 2.0 包含 108 个跨应用动态工作流。部分得分与二元完整完成率是两种指标,不能互相替代。
最佳初始系统拿到 54.8% 部分得分,严格完整完成只有 20.6%。
初始论文最佳系统
GPT-5.6 Sol 公司披露
来源:OSWorld 2.0 paper;GPT-5.6 Sol 数值为 OpenAI 公司披露。
展开精确数据与指标定义
| 系统 / 口径 | 部分得分 | 二元完整完成率 | 说明 |
|---|---|---|---|
| OSWorld 2.0 初始论文最佳 | 54.8% | 20.6% | 最多 500 步 |
| GPT-5.6 Sol | 62.6% | 未披露 | 不能解释为完成了 62.6% 的工作流 |
5. 科学与医学:强大的研究工具,还不是独立科学家或医生
AI 已深入蛋白质、基因组、天气、化学和临床记录等专业流程。它的锯齿特征在这里尤其明显:斯坦福 AI Index 科学章节 显示,头部模型在 ChemBench 的化学问答中超过人类专家平均水平,在论文级复现实验中却低于 20%;端到端科学研究基准 PaperArena 上,最佳 Agent 为 38.8%,博士专家基线为 83.5%。医学中的虚拟细胞模型、诊断编排和自动病历正在加快研发与行政流程,但 AI Index 医学章节 同样强调实验验证、临床证据和治理缺口。
现阶段,AI 更适合扩展检索、候选生成、模拟和分析能力。实验能否重复、治疗是否适合具体患者、风险由谁承担,仍需专业人员与现实证据闭环。
把这些领域放在一起,产业落地已经出现清晰排序:代码和结构化办公流程最先进入 Agent 化,多模态内容快速进入规模生产,科学与医学首先表现为研究协作,开放物理世界则最慢。这个顺序由验证器密度、环境可控性、失败可逆性和责任成本决定,与行业听起来需要多高“智商”没有直接关系。
三、Agent 能接下多大的任务,不等于它能独立工作多久
聊天模型只需生成下一段话。Agent 要自己拆解目标、选择工具、保存状态、判断是否完成,并在环境变化时调整策略。它把模型的优点转化为行动,也把每一个小错误串成一条长链。
METR 的“任务时间跨度”先估算任务若由人类专家完成需要多少工时,再拟合 Agent 在这组任务上的成功概率;它不是模型自身运行了多久。2026 年 2—3 月的公开前沿快照,在以软件工程、机器学习和网络安全为主的可自动评分任务上,50% 人类等价任务跨度约为 12 小时,95% 置信区间为 5—61 小时;80% 跨度约为 1.5 小时,区间为 50 分钟—2 小时 40 分。16 小时以上已经超出当前题库的可靠测量范围,杂乱任务明显更差。
这组数字展示的是一条陡峭的可靠性曲线:把成功概率从一半提高到八成,自动化半径会从约 12 小时收缩到约 1.5 小时。企业购买的是给定失败成本下的可靠时长,峰值时长主要负责制造演示。
截至 8 月,更新模型也没有给出一个干净得多的新上限。METR 对 GPT‑5.6 Sol 的预部署评估 中,按标准方法把利用评测漏洞的尝试记为失败,50% 点估计为 11.3 小时;若把这些行为算作正常成功,点估计会超过 270 小时,远超题库的可靠测量范围;删去相关样本后则约为 71 小时,且置信区间极宽。三种样本处理口径给出截然不同的结果,METR 明确认为三者都不能作为 GPT‑5.6 Sol 能力的稳健测量。这说明前沿模型正在撞击评测本身:接下来要升级的不只模型,还有任务设计、防作弊和验收系统。
长流程的难点可以用一个简化直觉说明:假设每一步都有 99% 的独立正确率,连续 100 步全部正确的概率也只有 0.99^100 ≈ 36.6%。现实错误并不独立,模型也会检查和恢复,这个数字不能当作实际预测;它说明为什么单步动作看起来惊艳,完整交付仍可能在最后一公里崩塌。
强 Agent 还可能误解用户意图、利用奖励漏洞,或被网页、邮件和文档中的恶意指令劫持。Anthropic 在 浏览器提示注入研究 中直言,没有浏览器 Agent 对 prompt injection 免疫。模型能操作的工具越多,一次错误或攻击能够放大的后果也越大。
成熟的 Agent 产品首先是一套控制系统:最小权限、沙箱执行、关键步骤确认、完整日志、结果验证、可回滚状态和异常停止。自治是权限、验证器和流程共同制造的产品属性。缺少这些控制,再强的 Agent 也只是一个拿到生产权限的不确定进程。
FIG 07
可靠性一提高,自动化半径就骤缩
横轴为对数人类等价工时。点为估计值,横条为 95% 置信区间;任务集中在软件工程、机器学习与网络安全。
从 50% 成功率提高到 80%,任务跨度从约 12 小时 收缩到约 1.5 小时。
“12 小时”指人类专家完成同类任务所需工时,不是模型连续运行或无人值守 12 小时。16 小时以上超出题库的可靠测量范围。
PART II · 系统与产业从裸模型,到学习、执行与验收系统
四、为什么进步这么快:真正变化的是整套“学习与执行系统”
主流大模型仍以 Transformer 为骨架。DeepSeek、Qwen、Llama 等公开技术报告显示,行业大量采用稀疏 MoE、注意力压缩、路由和低精度计算,让模型以更少激活参数处理更多能力。也有 Mamba 等状态空间路线进入混合架构。公开证据支持“Transformer 主干阶段性收敛”,并不支持“架构已经停止创新”。OpenAI、Anthropic 等闭源公司没有披露足够细节,外界更无法断言其内部结构多年未变。
能力跃迁来自一条逐渐工业化的链条:
预训练 → 数据筛选与合成 → 后训练与强化学习 → 推理时计算 → 工具与上下文 → Agent 循环 → 产品反馈
这里的每一层都在变化。
预训练仍提供世界知识和基础能力。 数据规模重要,去重、质量评分、领域配比、长文本组织和污染控制同样重要。合成数据开始填补稀缺领域,但它必须由真实数据、规则或验证器锚定;无差别地让模型反复学习模型生成内容,会损失分布尾部并造成所谓 model collapse。
强化学习把“会生成”推向“会寻找解法”。 OpenAI o1 与 DeepSeek‑R1 都展示了大规模 RL 对数学和代码推理的放大作用。数学答案、编译结果、单元测试可以充当可验证奖励,模型由此学会尝试、检查和修正。开放写作、战略判断和复杂管理没有同样明确的评分器,所以进展不如代码稳定。
推理时计算成为新的扩展轴。 以前,绝大部分算力在训练阶段一次性花掉;现在,难任务可以在回答时调用更多 token、搜索、代码执行或并行代理。Meta 在 Muse Spark 中把预训练、强化学习和 test-time reasoning 明确列为三条扩展轴。模型“想多久、查什么、调用谁”,开始像参数量一样影响结果。
工具把语言能力接入现实。 搜索提供新鲜信息,代码解释器提供计算,浏览器和终端提供行动,组织文档提供上下文。Agent 再把这些能力串成“计划—行动—观察—修正”的循环。2026 年 7 月发布的 GPT‑5.6 已把 Programmatic Tool Calling 和多 Agent 协作放进 API:模型可以临时编写小程序过滤工具返回、保存中间状态、协调并行任务。模型开始为自己编排软件,而不只是被软件调用。
所以,2026 年更合适的能力公式是:
有效能力 ≈ 底层模型 × 任务上下文 × 推理预算 × 工具 × 验证 × 反馈
这个近似式表达了一条产品规律:任何一项接近零,最终交付都可能失败。一个较小模型配上准确上下文、可靠工具和严格验证,有时会胜过裸奔的旗舰模型;一个再强的模型拿到错误数据、过大权限和含糊目标,也会把错误执行得更快。
FIG 08
架构没有停,竞争单位却已经变成闭环
Transformer 仍是主干,但产品能力由数据、后训练、推理预算、工具、验证和反馈共同放大;这是因果结构,不是能力占比。
数据当然重要,但下一场战争不是“只拼数据”:谁能把学习、执行与验收闭成回路,谁才能把峰值能力变成生产力。
Transformer / MoE、世界知识与基础表征
筛选、合成、RL、偏好与可验证奖励
reasoning effort、搜索、并行采样与路由
组织状态、检索、代码、浏览器与执行环境
测试、审批、沙箱、日志、回滚与停止条件
接受、退回、例外与失败归因进入下一轮改进
来源:本文综合 DeepSeek-R1、Nature · model collapse、Meta · Muse Spark 与前沿 Agent 产品路线。
五、商业化已经发生,但“买了 AI”与“重做了工作”仍是两回事
AI 已进入大多数受访组织的常规工具栈。斯坦福 《2026 AI Index》经济章节 汇总的调查显示,2025 年有 88% 的组织在至少一种形式上使用 AI,70% 在至少一个业务职能中使用生成式 AI;但各职能的 Agent 部署率几乎都还停留在个位数。
这两个数字并不矛盾。商业革命往往早于完全自治:助手先占据入口,企业随后补齐上下文、权限和验收,最后才把一段流程交给 Agent。席位是分发,流程才是结果。
企业付费也不再只是试用。微软在 FY2026 第四季度财报电话会 上披露,Microsoft 365 Copilot 付费席位超过 3,000 万,季度净增席位数环比翻倍以上;Alphabet 在 2025 年第四季度财报电话会 上披露,Gemini Enterprise 已售出超过 800 万个付费席位,覆盖 2,800 多家公司。Anthropic 在 2026 年 2 月融资披露 中称 Claude Code 的年化收入运行率超过 25 亿美元——这是公司口径的 run-rate,不等于已确认全年收入,但足以说明编码 Agent 已经形成独立商业品类。中国一侧,阿里在 2026 年 5 月财报 中披露,AI 相关产品已占阿里云外部收入的 30%,年化收入约 358 亿元人民币;这同样是公司定义和年化口径。
生产率证据则更细碎。AI Index 汇总的研究在客服、软件开发和营销产出中分别观察到约 14%—15%、26% 和 50% 的提升;收益通常集中在结构化、可监控的任务,也受到员工经验、流程设计、模型质量和统计口径影响。一次实验的平均提升,不能直接外推为整个公司的利润增长。
真正进入生产后,企业购买的是一整套能力,而不止“一个更聪明的聊天框”:
- 组织上下文:文档、代码、客户记录、权限和实时业务状态;
- 工作入口:Office、搜索、IDE、客服台、浏览器和内部系统;
- 验收机制:测试、审批、引用、审计和异常处理;
- 责任边界:谁能授权,谁来复核,失败如何追回。
这解释了为什么模型性能越来越接近,产品体验和商业价值仍可能相差很大。公开网络知识已不再是少数公司的独占资源,企业内部最新、准确、获授权的任务上下文却不会自动进入模型。比文档更稀缺的是判断痕迹:什么结果被接受,什么被退回,例外如何处理,谁有权签字。谁掌握工作入口、验收规则和这条反馈回路,谁就更可能把通用模型变成持续改进的业务系统。
FIG 09
AI 已经普及,流程重构还没有
使用率、付费席位、收入运行率与云收入占比不是同一指标,因此分别呈现,不做加总或横向排名。
88% 使用 AI 不等于 88% 的工作已经自动化;席位解决分发,验收系统才决定结果。
至少一种形式使用 AI受访组织 · 2025
至少一个职能使用生成式 AI受访组织 · 2025
各职能 Agent 部署率多数仍为个位数
MICROSOFT 365 COPILOT
>30M 席位FY2026 Q4 公司披露
GEMINI ENTERPRISE
>8M 席位覆盖 2,800+ 公司
CLAUDE CODE
>$2.5B年化收入运行率,非全年确认收入
阿里云 AI 产品
30% / ¥35.8B外部收入占比 / 年化口径
来源:Stanford 2026 AI Index · Economy;Microsoft、Alphabet、Anthropic、阿里巴巴公司披露,详见正文。
六、调用越来越便宜,可靠交付仍然昂贵
AI 经济呈现出一个鲜明的杠铃结构。
靠近用户的一端,公开 API 的名义单价跨度显著,部分新一代模型还在降价。截至 2026 年 8 月 2 日,几种代表性 API 的公开标价如下:
| 模型 | 标准输入或缓存未命中 / 100 万 token | 输出 / 100 万 token |
|---|---|---|
| OpenAI GPT‑5.6 Sol | 5 美元 | 30 美元 |
| Google Gemini 3.6 Flash | 1.5 美元 | 7.5 美元 |
| Anthropic Claude Sonnet 5(促销至 2026-08-31) | 2 美元 | 10 美元 |
| DeepSeek V4 Flash | 0.14 美元 | 0.28 美元 |
价格来源:OpenAI 模型文档、Google Gemini 模型文档、Anthropic Sonnet 5 发布页、DeepSeek API 定价。DeepSeek 官方已预告未来峰时价格为表中两倍,生效日待公告。价格是 2026 年 8 月 2 日快照,随时可能调整。
价格跨度达到一至两个数量级,但这张表不能直接当性价比排名。不同模型的能力、速度、上下文、推理 token、缓存、工具费、SLA 和重试率都不同。token 会越来越像基础原料,通过验收的结果才是产品。企业真正应该比较的是“完成一个合格任务需要多少钱”,而非单纯比较每百万 token。
基础设施一端则越来越昂贵。国际能源署称,五家大型科技公司的资本开支在 2025 年超过 4,000 亿美元,2026 年预计再增长约 75%;数据中心用电在 2025 年增长 17%。Alphabet 在 2026 年第二季度财报电话会 上把全年资本开支指引上调至 1,950 亿—2,050 亿美元,主要用于服务器、数据中心和网络等技术基础设施。
于是出现看似矛盾的局面:调用智能越来越便宜,制造最前沿智能越来越贵。应用开发门槛下降,芯片、能源、数据中心和前沿训练的门槛上升。中间那层没有独特上下文、分发或工作流的通用模型 API,最容易被价格竞争挤压。
未来的利润不会简单地沿着“模型最强者通吃”分配。芯片与云掌握稀缺产能,头部实验室制造前沿能力,拥有入口的平台控制触达,垂直产品掌握业务上下文与验收规则。每一层都可能赚钱,也都可能被上下游抽走价值。
FIG 10
Token 变成原料,验收通过的结果才是产品
公开 API 标价快照,横轴为每百万 token 美元的对数尺度。空心点为输入,实心橙点为输出;不代表综合性价比。
名义调用价已跨越两个数量级;工具费、推理 token、重试率、验证和 SLA 决定真实交付成本。
Anthropic 为截至 2026-08-31 的促销价;DeepSeek 已预告未来峰时价格翻倍,生效日待公告。价格随时可能调整。
展开价格快照
| 模型 | 输入 / 1M token | 输出 / 1M token | 口径 |
|---|---|---|---|
| OpenAI GPT-5.6 Sol | $5 | $30 | 标准输入 / 输出 |
| Google Gemini 3.6 Flash | $1.50 | $7.50 | 标准输入 / 输出 |
| Anthropic Claude Sonnet 5 | $2 | $10 | 促销至 2026-08-31 |
| DeepSeek V4 Flash | $0.14 | $0.28 | 未来峰时价预告为 2× |
七、全球格局:模型分数趋近,竞争转向完整系统
截至 2026 年夏天,前沿玩家的路线已经明显分化。产业竞争可以先看三层:底部争芯片、能源与训练能力,中部争模型、推理成本和开发者生态,顶部争入口、组织上下文和工作流。下面列出主要代表路线,不是实时排行榜,也不是完整名录;xAI、Mistral 等同样是重要参与者。
| 阵营 | 主要路线 | 当前优势与约束 |
|---|---|---|
| OpenAI | ChatGPT、Codex、API 与多 Agent 组成通用工作平台 | 产品覆盖广、通用能力强;前沿成本与安全治理压力同样高 |
| Anthropic | Claude Code、长周期执行、工具使用与可信 Agent | 编码和复杂工作流突出;高风险能力采取更严格的分级开放策略 |
| Gemini、Search、Workspace、Android、Cloud、TPU 与世界模型全栈 | 分发和基础设施最完整;庞大产品体系也带来整合复杂度 | |
| Microsoft | Azure/Foundry、Microsoft 365、GitHub Copilot 与 Agent 治理 | 企业分发与商业化强;与 OpenAI 深度绑定,同时推进多模型平台和自研模型 |
| Meta | Muse 多模态模型、Meta AI、社交应用与眼镜 | 拥有巨量消费入口和个人情境;长周期 Agent 与编码仍被官方列为当前缺口 |
| 阿里、字节、腾讯 | 云、消费应用、办公、电商、内容和社交场景提供落地与反馈 | 高频业务场景与本土分发支撑产品部署、评测和迭代;各家公司路线差异很大 |
| DeepSeek、Kimi、智谱等 | 算法效率、开放权重、长上下文与 Agent 工程 | 价格和工程创新活跃;资金、算力、生态与商业持续性仍需分别观察 |
OpenAI 的 GPT‑5.6、Anthropic 的 Claude Fable 5 / Mythos 5、Google 的 Gemini 3.5/3.6、Meta 的 Muse Spark 1.1 都把 Agent、工具使用、电脑操作和推理效率放到发布核心。命名各异,方向高度一致:模型正在成为行动系统的引擎。
中国前沿路线至少有两类:阿里、字节、腾讯把模型接入云和高频业务场景;DeepSeek、Kimi、智谱等在稀疏架构、开放权重、长上下文和 Agent 工程上竞争。阿里同时把 Qwen3.7‑Max、Qwen 开放权重家族、云与 Agent 平台 连接起来。各家公司资源与商业模式差异很大,不宜用一条“中国路线”概括。
斯坦福 AI Index 的口径是:截至 2026 年 3 月,在其采用的模型表现排名中,美国头部模型领先中国头部模型 2.7%;2025 年美国私人 AI 投资约为中国的 23 倍。前者只说明选定评测上的头部成绩趋近,后者也只覆盖私人投资。它们不能分别外推为“整体技术已追平”或“一国 AI 总投入相差 23 倍”。
榜单第一会轮换,三层能否彼此咬合,决定一家公司能否把能力变成长期价值。高频产品还会形成“任务出现—结果验收—失败归因—产品迭代”的反馈回路;它不等于把用户对话直接拿去训练,数据授权、隐私隔离和跨客户边界仍是硬约束。开放权重降低了本地部署、定制和研究门槛,闭源平台通常提供更完整的前沿模型与托管工具,企业很可能长期采用混合方案。
下一代平台不会只是一个更大的聊天窗口,而是工作的操作系统:它知道组织上下文,调度不同模型与工具,控制权限,保存状态,并对结果验收。模型提供智力,平台决定这份智力能进入多少真实流程。谁占据这个控制面,谁就可能掌握 AI 时代最厚的一层价值。
截至 2026 年 8 月 2 日,没有一家实验室同时、稳定地统治所有关键评测。Artificial Analysis 当前 v4.1 快照中,Anthropic Fable 5 的综合指数为 60,OpenAI GPT‑5.6 Sol 为 59;在该机构单列的 Coding Agent Index 上,OpenAI 为 80,Anthropic 为 77。分差很窄,而且指数版本已经多次变化。这些数字更适合说明“前沿拥挤”,不适合制造一个永久总冠军。真正重要的领先正在从单点分数转向:模型、算力、入口、组织上下文与验收系统能否合成一个可持续的工作平台。
PART III · 人类窗口从替代动作,到重写岗位、责任与成长路径
八、工作会怎样变化:先变的是任务组合与入门路径
目前还没有证据证明宏观层面的“大规模 AI 失业”已经发生。与此同时,变化开始集中出现在招聘入口和高暴露岗位。AI Index 经济章节 记录,美国 22—25 岁软件开发者就业人数较 2024 年下降近 20%;三分之一受访组织预计未来一年因 AI 减少员工,但接近一半预计人员规模几乎不变。就业变化受利率、行业周期、招聘结构等多重因素影响,不能把相关性直接写成 AI 因果。
只盯着“一个职业会不会消失”,会错过更快发生的变化。企业不会等待 AI 自动完成整份工作,才开始重组岗位;它们会先把工作拆成任务,把隐性经验写成规范、模板、测试和审批逻辑,再把可验证的部分交给 Agent。岗位还在,岗位内部的价值分配已经改变。
未来两年,一批数字化工作会把默认流程倒过来:不再是人完成、AI 辅助,而是 AI 先执行,人处理异常、补充判断并承担签字责任。初稿、检索、样板代码、基础分析和格式转换会被快速压缩;问题定义、证据判断、例外处理、组织协调与最终授权会变得更贵。
这也会削薄传统的成长阶梯。年轻人过去通过大量低风险基础任务学习行业,如今这些任务恰好最容易被自动化。真正的挑战不只是少了多少岗位,而是组织能否重新设计学徒制:让新人学习如何定义任务、审查模型、处理例外,而不是在没有练习机会的情况下直接承担最终判断。
九、AI 越能行动,责任越不能含糊
AI 的风险有两层。第一层很直观:它会失败。第二层更容易被忽略:当它成功执行了一个错误、越权或有害的目标,能力本身会放大后果。
事实与记忆仍不稳定。 当前训练与生成机制并不保证输出为真。检索、引用和外部数据库能减少错误,却无法保证来源可靠或因果判断正确。百万 token 已成为多家产品规格,能装进去也不代表能在任意位置稳定找回、比较并正确使用;长期工作仍需状态管理、压缩、检索和遗忘机制。
开放任务缺少验证器。 代码和数学进步快,因为答案容易检查。战略、管理、创意和社会判断没有同样清晰的评分器,反馈周期又很长。没有可信验收,强化学习和 Agent 会把模糊目标优化到错误方向。
物理与社会常识仍不稳。 视频可以生成得逼真,机器人却要处理摩擦、遮挡、损耗和突发事件;组织工作还包含默认规则、权力关系和含蓄意图。互联网文本无法完整覆盖身体经验与制度语境。
行动能力放大了安全与滥用风险。 能发邮件、付款、删文件和部署代码的 Agent,一次提示注入或权限误判就可能造成真实事故。网络安全和生物研究还具有明显的双重用途,OpenAI、Anthropic 等实验室已把相关能力作为独立的发布门槛和分级访问对象。能力与权限必须分开增长。
隐私、版权和数据边界没有随能力自动解决。 Agent 为了完成任务需要读取邮件、代码、客户记录和个人资料;这些上下文是否获授权、能否跨用途使用、生成内容是否侵权,都需要产品与制度给出明确答案。更强的个性化通常意味着更深的数据访问,两者之间不存在免费的平衡。
算力与入口会带来新的集中。 模型调用价格下降,不会自动消除对先进芯片、云、能源和分发平台的依赖。少数公司能够同时控制基础设施、模型和用户入口,既可能提高整合效率,也会扩大议价权、单点风险和治理难度。
责任仍属于人和组织。 模型可以提出建议并执行动作,却不能承担法律、职业与伦理责任。谁授权、谁验收、谁能按下停止键,必须在部署前写进流程。斯坦福 AI Index 责任 AI 章节 记录的 AI 事件从 2024 年的 233 起增至 2025 年的 362 起,而头部实验室的安全评测披露仍不完整。技术部署速度已经超过了测量和治理能力的建设速度。
这些问题不是等待 AI “更成熟”以后再处理的外围风险,它们就是下一代 AI 产品栈。记忆、验证、安全、权限和责任设计,会像模型能力本身一样决定产品上限,也会成为新的商业壁垒。
FIG 11
能力增长快于测量与治理建设
AI 事件数据库的年度记录量受报告覆盖与定义影响,不能直接等同为总体事故率;它至少显示已知事件在增加。
公开记录的 AI 事件从 2024 年的 233 起增至 2025 年的 362 起,同比增加约 55%。
这是离散年度比较,不画连续趋势线;记录增加可能同时来自部署扩张、真实事件增加与报告覆盖改善。
来源:Stanford 2026 AI Index · Responsible AI。
十、别押 AGI 日期,盯住五个真正的拐点
回到开头的五把尺子,未来一两年最值得跟踪的是五个可测信号。它们比“某模型是否自称 AGI”更有价值:
- 80% 人类等价任务跨度是否持续增长。 50% 成功率能制造惊艳演示,80% 才开始形成可部署的自动化半径;高风险任务还需要更高标准。
- 杂乱工作流是否追上结构化基准。 如果 OSWorld 2.0 一类长流程测试明显提升,说明 Agent 开始跨过演示与生产之间的鸿沟。
- 每个通过验收的任务成本是否下降。 这同时包含 token、工具、重试、人审和失败损失,比 API 标价更接近真实经济性。
- 权限系统能否支持可逆自治。 Agent 是否能在最小权限下工作、遇到歧义主动暂停、保留可审计轨迹,并让高风险动作可撤回。
- 企业 Agent 在各职能中的部署率能否走出个位数,并进入主流程。 席位增长证明有人买,流程渗透和持续使用才证明工作真的改变。
如果这些信号同时改善,AI 会从“帮人完成某一步”逐渐走向“接管一段有明确边界的流程”。如果模型分数继续上涨,而可靠性、权限和验收停滞,行业就会拥有越来越惊艳的演示,以及越来越昂贵的人工兜底。
结语:AI 不必成为人,就能重写人的工作
截至 2026 年 8 月,AI 输出的基本单位正在从“一段回答”变成“一个工件”和“一段流程”。代码、报告、演示文稿、研究材料和跨应用操作,都开始成为模型可以规划、执行和验收的对象。这比榜单上再多几个百分点更接近产业转折。
这给出一个比“谁先实现 AGI”更现实的产业判断:榜单冠军会轮换,模型单价会继续下降,长期价值更可能沉淀在验证器、组织上下文、工具权限、执行环境和分发入口。谁能把偶发的峰值能力变成可重复、可验收、可回滚的流程,谁才真正把模型能力变成生产力。
AI 也不会整齐地替代一个个职业。它会先替代职业内部的一段段动作,再迫使组织重新定义剩下的人类工作。可标准化、易验收的中间产出会迅速贬值,问题定义、例外处理、验收和责任会升值;原本藏在员工经验里的判断,会被不断抽取成规范、数据和软件。
判断下一次跃迁,只需要追问三个问题:它能以多高成功率完成多大的人类等价任务?失败能否被及时发现、停止和追回?一个通过验收的结果,总成本是多少?
AI 革命不会从模型终于“像一个完整的人”那天开始。它从组织开始围绕非人智能重写工作流程时开始——而这件事已经发生。AI 尚未获得责任,却已经在获得生产权限;这才是 2026 年真正的转折。
主要资料与口径说明
本文资料截至 2026 年 8 月 2 日。独立或综合资料用于判断总体趋势;公司发布页用于说明产品路线、用户数、价格和公司自报评测,不据此宣布跨平台“总冠军”。不同榜单的工具权限、推理预算、题集版本和评分方法不同,分数不可直接横比。
独立与综合资料
Stanford HAI, The 2026 AI Index Report
Stanford HAI, Technical Performance;Technical Performance full chapter
Stanford HAI, Economy
Stanford HAI, Responsible AI
ARC Prize, GPT‑5.6 verified ARC‑AGI results
Epoch AI and METR, MirrorCode preliminary results
X-Lang Lab et al., OSWorld 2.0
Artificial Analysis:2025 Q2 State of AI、2025 Q3 State of AI、Gemini 3 Pro、GPT-5.5 与 2026 年 6 月前沿密集发布
公司一手资料
- OpenAI, GPT‑5.6;API models
- Anthropic, Claude Fable 5 / Mythos 5;Claude Opus 4.8;Trustworthy agents in practice
- Google DeepMind, Gemini models;Genie;Project Genie availability
- Meta, Muse Spark;Muse Spark 1.1
- Microsoft, FY2026 Q4 Earnings Call
- Alphabet, 2025 Q4 Earnings Call;2026 Q2 Earnings Call
- Alibaba Cloud, Qwen3.7 and agentic AI ecosystem
- Alibaba Group, FY2026 Results
- ByteDance Seed, Seed2.0
- Tencent, Hy3
- DeepSeek, Transparency Center;API pricing
- Moonshot AI, Kimi K3