AI 不必先成为完整的人,就足以重写完整的工作。它先跨过回答门槛,再跨过行动门槛;可靠闭环决定它能真正接管哪一段流程。

2026 年判断 AI,最容易犯的错误,是把峰值能力当成平均能力,把一次成功当成可靠能力。

METR 对公开前沿模型的独立评估 给出了一个有用的切面:在以软件工程、机器学习和网络安全为主、目标清晰且可自动评分的任务中,50% 成功率对应约 12 小时的人类等价任务跨度,80% 成功率对应约 1.5 小时。这里的“12 小时”是人类专家完成同类任务所需的工时,不是 AI 的连续运行时间或无人值守时间。

更贴近办公现实的 OSWorld 2.0 也揭示了同一道裂缝。它包含 108 个跨应用、会动态变化的端到端流程,熟练人类完成一个任务的中位时间约为 1.6 小时。初始论文中,最佳系统可以取得 54.8% 的部分得分,严格完整完成率却只有 20.6%。OpenAI 之后披露 GPT‑5.6 Sol 的部分得分升至 62.6%,但没有提供可直接对照的严格完整完成率。

这些指标来自不同任务集,不能拼成一张简单排行榜。它们指向同一个边界:模型已经很会完成局部动作,真正困难的是在数百步中维持整体任务状态,记住约束,处理新信息,发现错误,并确认结果真的交付了。

另一组证据来自斯坦福 《2026 AI Index》技术能力章节:Google 的 Gemini Deep Think 在 2025 年国际数学奥林匹克竞赛题上拿到 35 分,达到金牌线;结构化电脑操作基准 OSWorld 上的 Agent 成功率达到 66.3%;在模拟家庭环境中、任务更长的 BEHAVIOR‑1K 留出测试集上,最佳系统完整完成率只有 12.4%。这些不是可直接横比的同一测试,不能据此拟合一条定量下降曲线;它们共同提示,短而结构化的任务与长周期、开放任务之间存在显著能力落差。

当前 AI 已经很难用一个榜单、一句“达到 AGI”,或者一句“仍然只是概率鹦鹉”概括。它的演化路径已经清楚起来:回答、行动、可靠闭环。2026 年,前沿 AI 已经跨过回答门槛,正在跨过行动门槛;在目标明确、环境数字化、结果可验证的任务中,它已经开始成为可以批量调用的数字劳动力。

这意味着,AI 不需要先复制一个完整的人,便足以拆解一份完整的工作。下一轮竞争也不会只围绕“谁的一次回答更聪明”,而是谁能把峰值能力封装成稳定、可验收、可追责的任务完成。底层模型、推理预算、工具、组织上下文、执行环境、验证器、权限系统和产品反馈,正在共同取代“裸模型”,成为真正的竞争单位。

PART I · 能力边界从会回答,到会行动,再到可靠闭环

一、先画边界,再谈水平

FIG 01

领跑者在换,但能力曲线没有停

三张图共享时间方向,不共享分数口径。点只记录同一评测内刷新公开纪录的模型;误差棒为官方 95% 置信区间。

从 2025 年初到 2026 年夏,前沿不是一家公司直线垄断,而是 OpenAI、Google、Anthropic 反复换手;真正持续上升的是整个前沿。

xAIGrok 4 阶段领先AA INDEX v2
OpenAIGPT-5 阶段领先AA INDEX v3
GoogleGemini 3 Pro 阶段领先AA INDEX v3
OpenAIGPT-5.5 阶段领先AA INDEX v4
AnthropicFable 5 阶段领先AA INDEX v4.1

上方只表示各期指数的领先者。由于 Artificial Analysis 更换过指数版本,刻意不把分数连成一条连续曲线。

Humanity’s Last Exam

固定 2,500 题;Scale 统一温度、judge 与公开全量集。纵轴:准确率 %

Humanity’s Last Exam,领先纪录随时间变化 固定 2,500 题;Scale 统一温度、judge 与公开全量集。纵轴:准确率 %。折线只连接同一评测版本内刷新公开纪录的点;公司同时通过颜色与点形状区分。 0 10 20 30 40 50 8.12 18.16 20.32 21.64 25.32 31.64 37.52 46.44 2025.01 2025.08 2026.03
横向滑动查看完整时间轴 ↔

Terminal-Bench

固定 Terminus 2 scaffold;2.1 修订 28 / 89 项任务。纵轴:准确率 %

Terminal-Bench,领先纪录随时间变化 固定 Terminus 2 scaffold;2.1 修订 28 / 89 项任务。纵轴:准确率 %。折线只连接同一评测版本内刷新公开纪录的点;公司同时通过颜色与点形状区分。 0 20 40 60 80 2.0 → 2.1 / 28 TASKS REVISED 43.4 47.6 56.9 57.8 64.7 78 80.4 2025.10 2026.02 2026.07
横向滑动查看完整时间轴 ↔

ARC-AGI-2

ARC Prize 验证的静态抽象推理前沿;首个空心点为预览。纵轴:准确率 %

ARC-AGI-2,领先纪录随时间变化 ARC Prize 验证的静态抽象推理前沿;首个空心点为预览。纵轴:准确率 %。折线只连接同一评测版本内刷新公开纪录的点;公司同时通过颜色与点形状区分。 0 20 40 60 80 100 4 17.6 37.6 54.2 69.2 77.1 85 92.5 2025.03 2025.11 2026.08
横向滑动查看完整时间轴 ↔
OpenAI Google Anthropic xAI 颜色 + 形状双编码;误差棒为 95% CI;键盘聚焦数据点可读精确值

来源:Scale HLE · Terminal-Bench 2.0 / 2.1 · ARC Prize · Artificial Analysis 历史快照。数据截至 2026-08-02。

展开精确数据与版本口径
评测日期公司模型分数95% CI口径注记
HLE2025-01-24OpenAIo1 Pro8.12%±1.07Scale 统一 harness
HLE2025-03-25GoogleGemini 2.5 Pro Exp18.16%±1.51Scale 统一 harness
HLE2025-04-16OpenAIo3 high20.32%±1.58Scale 统一 harness
HLE2025-06-05GoogleGemini 2.5 Pro Preview21.64%±1.61Scale 统一 harness
HLE2025-08-07OpenAIGPT-525.32%±1.7Scale 统一 harness
HLE2025-10-06OpenAIGPT-5 Pro31.64%±1.82Scale 统一 harness
HLE2025-11-18GoogleGemini 3 Pro37.52%±1.9Scale 统一 harness
HLE2026-02-19GoogleGemini 3.1 Pro Preview46.44%±1.96Scale 统一 harness
Terminal-Bench 2.02025-10-31OpenAIGPT-5-Codex43.4%±2.9Terminus 2
Terminal-Bench 2.02025-11-16OpenAIGPT-5.147.6%±2.8Terminus 2
Terminal-Bench 2.02025-11-21GoogleGemini 3 Pro56.9%±2.5Terminus 2
Terminal-Bench 2.02025-11-22AnthropicOpus 4.557.8%±2.5与 Google 置信区间重叠
Terminal-Bench 2.02026-02-05OpenAIGPT-5.3-Codex64.7%±2.7Terminus 2
Terminal-Bench 2.12026-05-01OpenAIGPT-5.578%±1.2Terminus 2
Terminal-Bench 2.12026-06-05AnthropicFable 580.4%±1.2置信区间边界接触
ARC-AGI-22025-03-24OpenAIo3-preview-low4%未提供进行中预览
ARC-AGI-22025-11-13OpenAIGPT-5.117.6%未提供ARC Prize 验证
ARC-AGI-22025-11-24AnthropicClaude Opus 4.537.6%未提供ARC Prize 验证
ARC-AGI-22025-12-11OpenAIGPT-5.2 Pro54.2%未提供ARC Prize 验证
ARC-AGI-22026-02-05AnthropicOpus 4.6 High69.2%未提供ARC Prize 验证
ARC-AGI-22026-02-19GoogleGemini 3.1 Pro77.1%未提供ARC Prize 验证
ARC-AGI-22026-04-22OpenAIGPT-5.5 xHigh85%未提供ARC Prize 验证
ARC-AGI-22026-07-09OpenAIGPT-5.6 Sol Max92.5%未提供ARC Prize 验证

过去两年,人们习惯用考试分数理解模型:数学多少分、代码修复率多少、竞技场排第几。这个方法越来越不够用。

斯坦福 AI Index 统计,前沿模型在 Humanity’s Last Exam 上一年提高约 30 个百分点;与此同时,头部公司的竞技场评分已经挤在很窄的区间内。基准本身也在老化:部分常用题集的无效问题比例高达 42%,模型针对题库和评测环境优化,也会让榜单成绩偏离真实通用能力。

判断 AI 到了什么水平,至少需要五把尺子:

尺子 它回答的问题 2026 年的现实
峰值能力 最难能做什么 数学、代码、科学问答和部分专业任务已达到或超过很强的人类基线
人类等价任务跨度 在给定成功率下,模型能解决相当于人类专家多大工时的任务 特定软件任务的 50% 跨度约 12 小时,80% 跨度约 1.5 小时;这不是 Agent 的运行时长
环境开放度 能否应对模糊目标、变化界面和隐藏状态 短而结构化的电脑任务进步很快,真实长流程的严格完成率仍很低
可验证性与可逆性 错误能否被发现、拦截和追回 代码、数学等有验证器的任务最先落地;付款、医疗和开放网络操作仍需审批与隔离
验收后总成本 一个通过验收的结果需要多少模型、工具、重试和人工 单次调用越来越便宜,验证、重试、集成和治理仍然昂贵

峰值能力回答“它偶尔能做到什么”,中间三项决定“它能否进入生产”,验收后总成本决定“它能否规模化”。能力上限决定产品想象,人类等价任务跨度决定自动化半径,环境开放度与可验证性决定行业落地顺序,验收后总成本决定商业模式能否成立。

由这五把尺子,可以把当前部署边界分成三个区域:

区域 典型条件 2026 年更合理的用法
可委派区 目标明确、全程数字化、结果可自动验证、失败可回滚 让 Agent 完成有边界的代码、数据、检索和内容交付,人类验收结果
协作区 需要跨来源判断、过程会变化、部分结果只能人工评估 让 Agent 推进流程,在关键节点请求确认,由人处理例外
责任保留区 后果重大或不可逆、权限高、涉及身体与复杂社会关系 AI 提供分析和候选方案,授权、决定与责任继续由人承担

这不是按职业名称切割。写代码也可能进入责任保留区,例如直接修改生产数据库;医疗工作也可能有可委派环节,例如整理已脱敏、可复核的文献。边界取决于任务结构,不取决于岗位听起来多“高级”。

2026 年的 AI 更像一张起伏剧烈的地形图:有些山峰已经高过人类,有些谷地还停留在新手水平。所谓“智能水平”,取决于你站在哪一块地形上。

FIG 02

五把尺子,不伪造一条总分

前三项保留各自的公开原值;后两项是部署条件,只呈现证据状态。单位不同、问题不同,因此不共享坐标轴。

峰值能力已经越过许多人类基线;开放环境、验收与总成本 才是进入生产的收缩阀。

01
MEASURED · ANSWER峰值能力
92.5%ARC-AGI-2

封闭、静态抽象推理的公开前沿;回答“最难能做到什么”。

02
MEASURED · ACT任务跨度
12h / 1.5h50% / 80% 成功率

人类专家完成同类任务所需工时;不是模型连续运行时间。

03
MEASURED · CLOSE LOOP环境开放度
20.6%OSWorld 2.0 严格完成

跨应用动态流程的二元完整完成率;部分得分不能替代它。

04
DEPLOYMENT GATE可验证 / 可逆
高验证密度代码最先落地

测试、沙箱与回滚让失败可被发现和追回;这是结构条件,不是 72 分。

05
ECONOMIC GATE验收后总成本
仍是瓶颈调用价 ≠ 交付价

重试、工具、人工复核、治理与失败损失,决定一个合格结果的真实成本。

前 3 行是不同单位的公开观测,后 2 行是部署门槛;五行回答不同问题,不合成雷达图、成熟度分或总排名。

来源:本文分析框架;原始证据分别见后续图版与正文来源。

二、能力地图:它已经能做什么,又在哪里掉链子

1. 推理:会解难题,但“会解题”不等于“会研究”

当前前沿模型可以处理竞赛数学、博士级科学问答、复杂图表和多约束分析。斯坦福 AI Index 汇总的若干税务、按揭、公司金融和法律推理测试中,头部模型的表现已落在 60%—90% 区间;不少过去被认为能维持数年的难基准,几个月内就接近饱和。

2026 年 7 月的 ARC Prize 验证结果 把新边界展示得更清楚:GPT‑5.6 Sol(max)在静态抽象推理基准 ARC‑AGI‑2 上达到 92.5%,在要求自行探索未知规则、持续行动的 ARC‑AGI‑3 半私有集上却只有 7.78%。它已经能在其中一个公开环境取得 87.1%,却还不能把成功稳定迁移到整组新环境。前沿正在从“解一道没见过的题”推进到“进入一个没见过的世界并学会行动”,后者远未解决。

这些成绩表明模型在多类封闭推理任务上表现很强,但不能仅凭基准排除数据污染、题型适配,也不能由此证明现实研究能力。封闭题目的答案通常已被预先定义,现实研究则要求提出问题、辨别数据质量、发现反例、承认不知道,并为结论承担后果。模型能给出一条漂亮推导,仍可能引用不存在的论文,或者把相关性写成因果关系。

推理模型还有一项重要变化:它们可以按任务难度分配“思考预算”。OpenAI 从 o1 开始公开展示 test-time compute 的能力曲线;如今 OpenAI、Anthropic、Google、阿里等产品普遍提供不同 reasoning effort。更长的思考、多次采样、并行代理和结果筛选,能用成本与延迟换取准确率。这个规律并非无限成立:模型也会过度思考、在错误方向上坚持,或者利用评分规则的漏洞。

FIG 03

同一个模型:会解陌生题,还不会闯陌生世界

ARC-AGI-2 与 ARC-AGI-3 属于相邻评测家族,却衡量不同能力;并排展示用于画边界,不用于计算“退化倍数”。

静态抽象推理达到 92.5%,持续探索未知交互规则只有 7.78%

ANSWER · STATIC

ARC-AGI-2

GPT-5.6 Sol Max
92.5%

从样例中抽取抽象规则,给出确定答案。

ACT · INTERACTIVE

ARC-AGI-3

GPT-5.6 Sol
7.78%

进入未知环境,自主探索并持续采取动作。

来源:ARC Prize:OpenAI GPT-5.6 results,2026-07-09。

展开精确数据与比较边界
模型评测分数任务性质可比边界
GPT-5.6 Sol MaxARC-AGI-292.5%静态抽象推理ARC Prize 验证
GPT-5.6 SolARC-AGI-3 半私有集7.78%未知规则下持续交互不可与 ARC-AGI-2 拟合下降率

2. 编程:第一个真正跑通的 Agent 场景

代码最先成为 AI 深入专业工作的突破口,关键在于软件工程拥有罕见的反馈条件:代码能编译,测试能运行,页面能截图,性能能测量,版本能回滚。模型每走一步,都可能获得相对清晰的“对或错”。

Epoch AI 与 METR 的 MirrorCode 初步结果 已经把人类等价任务跨度推到“周”级:Claude Opus 4.6 在没有中途人工指导的情况下,把约 1.69 万行 Go 的生物信息工具包 gotree 重实现为 Rust;四名研究者和工程师估计,熟练工程师完成同一任务需要 2—17 周。但 Agent 拿到了可执行的参考程序、文档、可见测试和大量隐藏端到端测试,相当于拥有一份可以反复查询的精确规格。面对约 6.15 万行的 Pkl,它在 10 亿 token 预算下仍未完成。

Anthropic 还称,Opus 4.8 的研究预览可以以现有测试套件为验收标准,执行跨数十万行代码库、从启动持续到合并的迁移;OpenAI、Google、阿里、Kimi、智谱等厂商也把长周期编码与工具调用放在核心位置。两类证据合在一起,结论已经相当激进:AI 可以独立完成过去按“周”估算的专业任务,但前提是世界向它提供清晰、密集、机器可读的反馈。模型的耐心正在变廉价,可计算的完成条件才稀缺。AI 交付的单位正在从一段答案变成一个可运行的工件。

FIG 04

“周级任务”成立,但规格必须足够精确

MirrorCode 允许 Agent 反复查询可执行参考程序,并用可见与隐藏测试验收;它测的是可验证软件迁移,不是开放式产品开发。

AI 的耐心正在变廉价;可执行规格与机器验收 才是把耐心变成交付的关键。

COMPLETED

gotree · Go → Rust

原项目规模
约 16.9K LOC
人类估时
2—17 周
中途指导
验收
隐藏端到端测试
NOT COMPLETED

Pkl · Kotlin → Rust

原项目规模
约 61.5K LOC
预算
1B tokens
结果
未完成
边界
规模仍会击穿

来源:Epoch AI × METR:MirrorCode preliminary results

3. 多模态:从“能看图”走向边看、边说、边操作

多模态已经成为成熟的产品接口,还不是成熟、统一的世界理解。前沿产品可以接收文字、图片、音频、视频和屏幕状态,再通过模型路由与工具链输出文字、语音、图像、代码或网页。斯坦福 AI Index 技术章节 汇总的 Video‑MMMU 中,最佳总体准确率为 66.0%,低于人类的 74.4%;观看视频带来的知识增益,最佳模型为 15.6 个百分点,人类为 33.1 个百分点,约三分之一模型看完视频后反而退步。输入通道变多,并不自动带来稳定的跨模态学习。

生成系统也从静态图像跨向带声音的视频和可交互环境。Google 的 Genie 3 可以在 720p、24 fps 下生成可实时导航并维持数分钟一致性的环境;字节的 Seedance 2.0 使用文本、图像、音频和视频共同驱动视听生成。Genie 3 目前通过 Project Genie,以实验性研究原型的形式向部分国家和地区的 Google One Ultra 订阅者开放;直接动作空间、多主体互动和真实地点仍受限制,连续交互只能维持数分钟而非数小时。即便如此,这类系统已经足以重写广告、短片、游戏原型和教育内容的生产流程:商业价值不必等待世界模型先变得完美。

FIG 05

通道变多,不等于理解变稳

每条哑铃都在同一评测、同一百分比尺度内比较 AI 与人类;三条之间不合成总分。

AI 已经能看、听、生成和复现实验;从输入中学到新知识、完成端到端研究 仍明显落后。

VIDEO-MMMU

视频总体准确率

AI 66.0%人类 74.4%

看视频后的知识增益

AI 15.6pp人类 33.1pp

PAPERARENA

论文级端到端复现

最佳 Agent 38.8%博士专家 83.5%

强问答能力尚未自动变成提出问题、搭实验、复现结果的完整研究能力。

来源:Stanford 2026 AI Index · Technical PerformanceScience

4. 电脑与现实世界:数字界面在前,物理世界在后

电脑操作是连接模型与真实工作的桥。AI Index 记录的是较短、结构化的 OSWorld 1.0:Agent 成功率从约 12% 升至 66.3%。OSWorld 2.0 则包含 108 个跨应用长流程,单项任务由熟练人类完成的中位时间约 1.6 小时;Claude Opus 4.7(max thinking)平均需要约 318 次工具调用。初始论文在最多 500 步下,Claude Opus 4.8(max thinking、batched tools)的二元完整完成率为 20.6%,部分得分为 54.8%。OpenAI 随后公司自报 GPT‑5.6 Sol 的部分得分升至 62.6%,但没有披露二元完整完成率。62.6% 不能解释为“完成了六成工作流”:它只证明部分得分提高;GPT‑5.6 Sol 的严格端到端完成率目前无法由公开数据判断。

物理世界不能压缩成一个行业统一成功率。自动驾驶已经在地理围栏、精细地图和远程支持条件下大规模运营:AI Index 统计,Waymo 在 2025 年达到约每周 45 万次出行,百度 Apollo Go 累计完成 1,100 万次全无人驾驶订单。机器人评测的跨度则极大:受控模拟、短周期的 RLBench 18 项操作成功率已达 89.4%,长周期的 BEHAVIOR‑1K 模拟家庭环境完整任务成功率只有 12.4%。

这些结果揭示了产业扩散的基本顺序:环境越可控,反馈越清晰,失败越容易回滚,AI 越快变成生产力。开放世界、身体交互和不可逆后果不会阻止 AI 进入,只会决定它先以辅助系统、受限自治还是完全自动化的形态进入。

FIG 06

部分得分很好看,完整交付仍会掉下去

OSWorld 2.0 包含 108 个跨应用动态工作流。部分得分与二元完整完成率是两种指标,不能互相替代。

最佳初始系统拿到 54.8% 部分得分,严格完整完成只有 20.6%

108跨应用动态任务
1.6h熟练人类单任务中位时间
≈318Opus 4.7 平均工具调用
≤500初始论文最大步骤

初始论文最佳系统

部分得分
54.8%
严格完整完成
20.6%

GPT-5.6 Sol 公司披露

部分得分
62.6%
严格完整完成
NO DATA
未披露

来源:OSWorld 2.0 paper;GPT-5.6 Sol 数值为 OpenAI 公司披露

展开精确数据与指标定义
系统 / 口径部分得分二元完整完成率说明
OSWorld 2.0 初始论文最佳54.8%20.6%最多 500 步
GPT-5.6 Sol62.6%未披露不能解释为完成了 62.6% 的工作流

5. 科学与医学:强大的研究工具,还不是独立科学家或医生

AI 已深入蛋白质、基因组、天气、化学和临床记录等专业流程。它的锯齿特征在这里尤其明显:斯坦福 AI Index 科学章节 显示,头部模型在 ChemBench 的化学问答中超过人类专家平均水平,在论文级复现实验中却低于 20%;端到端科学研究基准 PaperArena 上,最佳 Agent 为 38.8%,博士专家基线为 83.5%。医学中的虚拟细胞模型、诊断编排和自动病历正在加快研发与行政流程,但 AI Index 医学章节 同样强调实验验证、临床证据和治理缺口。

现阶段,AI 更适合扩展检索、候选生成、模拟和分析能力。实验能否重复、治疗是否适合具体患者、风险由谁承担,仍需专业人员与现实证据闭环。

把这些领域放在一起,产业落地已经出现清晰排序:代码和结构化办公流程最先进入 Agent 化,多模态内容快速进入规模生产,科学与医学首先表现为研究协作,开放物理世界则最慢。这个顺序由验证器密度、环境可控性、失败可逆性和责任成本决定,与行业听起来需要多高“智商”没有直接关系。

三、Agent 能接下多大的任务,不等于它能独立工作多久

聊天模型只需生成下一段话。Agent 要自己拆解目标、选择工具、保存状态、判断是否完成,并在环境变化时调整策略。它把模型的优点转化为行动,也把每一个小错误串成一条长链。

METR 的“任务时间跨度”先估算任务若由人类专家完成需要多少工时,再拟合 Agent 在这组任务上的成功概率;它不是模型自身运行了多久。2026 年 2—3 月的公开前沿快照,在以软件工程、机器学习和网络安全为主的可自动评分任务上,50% 人类等价任务跨度约为 12 小时,95% 置信区间为 5—61 小时;80% 跨度约为 1.5 小时,区间为 50 分钟—2 小时 40 分。16 小时以上已经超出当前题库的可靠测量范围,杂乱任务明显更差。

这组数字展示的是一条陡峭的可靠性曲线:把成功概率从一半提高到八成,自动化半径会从约 12 小时收缩到约 1.5 小时。企业购买的是给定失败成本下的可靠时长,峰值时长主要负责制造演示。

截至 8 月,更新模型也没有给出一个干净得多的新上限。METR 对 GPT‑5.6 Sol 的预部署评估 中,按标准方法把利用评测漏洞的尝试记为失败,50% 点估计为 11.3 小时;若把这些行为算作正常成功,点估计会超过 270 小时,远超题库的可靠测量范围;删去相关样本后则约为 71 小时,且置信区间极宽。三种样本处理口径给出截然不同的结果,METR 明确认为三者都不能作为 GPT‑5.6 Sol 能力的稳健测量。这说明前沿模型正在撞击评测本身:接下来要升级的不只模型,还有任务设计、防作弊和验收系统。

长流程的难点可以用一个简化直觉说明:假设每一步都有 99% 的独立正确率,连续 100 步全部正确的概率也只有 0.99^100 ≈ 36.6%。现实错误并不独立,模型也会检查和恢复,这个数字不能当作实际预测;它说明为什么单步动作看起来惊艳,完整交付仍可能在最后一公里崩塌。

强 Agent 还可能误解用户意图、利用奖励漏洞,或被网页、邮件和文档中的恶意指令劫持。Anthropic 在 浏览器提示注入研究 中直言,没有浏览器 Agent 对 prompt injection 免疫。模型能操作的工具越多,一次错误或攻击能够放大的后果也越大。

成熟的 Agent 产品首先是一套控制系统:最小权限、沙箱执行、关键步骤确认、完整日志、结果验证、可回滚状态和异常停止。自治是权限、验证器和流程共同制造的产品属性。缺少这些控制,再强的 Agent 也只是一个拿到生产权限的不确定进程。

FIG 07

可靠性一提高,自动化半径就骤缩

横轴为对数人类等价工时。点为估计值,横条为 95% 置信区间;任务集中在软件工程、机器学习与网络安全。

从 50% 成功率提高到 80%,任务跨度从约 12 小时 收缩到约 1.5 小时

50% 成功率FRONTIER SNAPSHOT
12h95% CI · 5—61h
80% 成功率PRODUCTION-LIKE BAR
1.5h95% CI · 50m—2h40m

“12 小时”指人类专家完成同类任务所需工时,不是模型连续运行或无人值守 12 小时。16 小时以上超出题库的可靠测量范围。

来源:METR Frontier Risk Report

PART II · 系统与产业从裸模型,到学习、执行与验收系统

四、为什么进步这么快:真正变化的是整套“学习与执行系统”

主流大模型仍以 Transformer 为骨架。DeepSeek、Qwen、Llama 等公开技术报告显示,行业大量采用稀疏 MoE、注意力压缩、路由和低精度计算,让模型以更少激活参数处理更多能力。也有 Mamba 等状态空间路线进入混合架构。公开证据支持“Transformer 主干阶段性收敛”,并不支持“架构已经停止创新”。OpenAI、Anthropic 等闭源公司没有披露足够细节,外界更无法断言其内部结构多年未变。

能力跃迁来自一条逐渐工业化的链条:

预训练 → 数据筛选与合成 → 后训练与强化学习 → 推理时计算 → 工具与上下文 → Agent 循环 → 产品反馈

这里的每一层都在变化。

预训练仍提供世界知识和基础能力。 数据规模重要,去重、质量评分、领域配比、长文本组织和污染控制同样重要。合成数据开始填补稀缺领域,但它必须由真实数据、规则或验证器锚定;无差别地让模型反复学习模型生成内容,会损失分布尾部并造成所谓 model collapse

强化学习把“会生成”推向“会寻找解法”。 OpenAI o1 与 DeepSeek‑R1 都展示了大规模 RL 对数学和代码推理的放大作用。数学答案、编译结果、单元测试可以充当可验证奖励,模型由此学会尝试、检查和修正。开放写作、战略判断和复杂管理没有同样明确的评分器,所以进展不如代码稳定。

推理时计算成为新的扩展轴。 以前,绝大部分算力在训练阶段一次性花掉;现在,难任务可以在回答时调用更多 token、搜索、代码执行或并行代理。Meta 在 Muse Spark 中把预训练、强化学习和 test-time reasoning 明确列为三条扩展轴。模型“想多久、查什么、调用谁”,开始像参数量一样影响结果。

工具把语言能力接入现实。 搜索提供新鲜信息,代码解释器提供计算,浏览器和终端提供行动,组织文档提供上下文。Agent 再把这些能力串成“计划—行动—观察—修正”的循环。2026 年 7 月发布的 GPT‑5.6 已把 Programmatic Tool Calling 和多 Agent 协作放进 API:模型可以临时编写小程序过滤工具返回、保存中间状态、协调并行任务。模型开始为自己编排软件,而不只是被软件调用。

所以,2026 年更合适的能力公式是:

有效能力 ≈ 底层模型 × 任务上下文 × 推理预算 × 工具 × 验证 × 反馈

这个近似式表达了一条产品规律:任何一项接近零,最终交付都可能失败。一个较小模型配上准确上下文、可靠工具和严格验证,有时会胜过裸奔的旗舰模型;一个再强的模型拿到错误数据、过大权限和含糊目标,也会把错误执行得更快。

FIG 08

架构没有停,竞争单位却已经变成闭环

Transformer 仍是主干,但产品能力由数据、后训练、推理预算、工具、验证和反馈共同放大;这是因果结构,不是能力占比。

数据当然重要,但下一场战争不是“只拼数据”:谁能把学习、执行与验收闭成回路,谁才能把峰值能力变成生产力。

01 · MODEL架构与预训练

Transformer / MoE、世界知识与基础表征

02 · LEARNING数据与后训练

筛选、合成、RL、偏好与可验证奖励

03 · INFERENCE推理时计算

reasoning effort、搜索、并行采样与路由

04 · CONTEXT上下文与工具

组织状态、检索、代码、浏览器与执行环境

05 · CONTROL验证与权限

测试、审批、沙箱、日志、回滚与停止条件

06 · FEEDBACK产品反馈

接受、退回、例外与失败归因进入下一轮改进

来源:本文综合 DeepSeek-R1Nature · model collapseMeta · Muse Spark 与前沿 Agent 产品路线。

五、商业化已经发生,但“买了 AI”与“重做了工作”仍是两回事

AI 已进入大多数受访组织的常规工具栈。斯坦福 《2026 AI Index》经济章节 汇总的调查显示,2025 年有 88% 的组织在至少一种形式上使用 AI,70% 在至少一个业务职能中使用生成式 AI;但各职能的 Agent 部署率几乎都还停留在个位数。

这两个数字并不矛盾。商业革命往往早于完全自治:助手先占据入口,企业随后补齐上下文、权限和验收,最后才把一段流程交给 Agent。席位是分发,流程才是结果。

企业付费也不再只是试用。微软在 FY2026 第四季度财报电话会 上披露,Microsoft 365 Copilot 付费席位超过 3,000 万,季度净增席位数环比翻倍以上;Alphabet 在 2025 年第四季度财报电话会 上披露,Gemini Enterprise 已售出超过 800 万个付费席位,覆盖 2,800 多家公司。Anthropic 在 2026 年 2 月融资披露 中称 Claude Code 的年化收入运行率超过 25 亿美元——这是公司口径的 run-rate,不等于已确认全年收入,但足以说明编码 Agent 已经形成独立商业品类。中国一侧,阿里在 2026 年 5 月财报 中披露,AI 相关产品已占阿里云外部收入的 30%,年化收入约 358 亿元人民币;这同样是公司定义和年化口径。

生产率证据则更细碎。AI Index 汇总的研究在客服、软件开发和营销产出中分别观察到约 14%—15%、26% 和 50% 的提升;收益通常集中在结构化、可监控的任务,也受到员工经验、流程设计、模型质量和统计口径影响。一次实验的平均提升,不能直接外推为整个公司的利润增长。

真正进入生产后,企业购买的是一整套能力,而不止“一个更聪明的聊天框”:

  • 组织上下文:文档、代码、客户记录、权限和实时业务状态;
  • 工作入口:Office、搜索、IDE、客服台、浏览器和内部系统;
  • 验收机制:测试、审批、引用、审计和异常处理;
  • 责任边界:谁能授权,谁来复核,失败如何追回。

这解释了为什么模型性能越来越接近,产品体验和商业价值仍可能相差很大。公开网络知识已不再是少数公司的独占资源,企业内部最新、准确、获授权的任务上下文却不会自动进入模型。比文档更稀缺的是判断痕迹:什么结果被接受,什么被退回,例外如何处理,谁有权签字。谁掌握工作入口、验收规则和这条反馈回路,谁就更可能把通用模型变成持续改进的业务系统。

FIG 09

AI 已经普及,流程重构还没有

使用率、付费席位、收入运行率与云收入占比不是同一指标,因此分别呈现,不做加总或横向排名。

88% 使用 AI 不等于 88% 的工作已经自动化;席位解决分发,验收系统才决定结果。

至少一种形式使用 AI受访组织 · 2025

88%

至少一个职能使用生成式 AI受访组织 · 2025

70%

各职能 Agent 部署率多数仍为个位数

<10%

MICROSOFT 365 COPILOT

>30M 席位

FY2026 Q4 公司披露

GEMINI ENTERPRISE

>8M 席位

覆盖 2,800+ 公司

CLAUDE CODE

>$2.5B

年化收入运行率,非全年确认收入

阿里云 AI 产品

30% / ¥35.8B

外部收入占比 / 年化口径

来源:Stanford 2026 AI Index · Economy;Microsoft、Alphabet、Anthropic、阿里巴巴公司披露,详见正文。

六、调用越来越便宜,可靠交付仍然昂贵

AI 经济呈现出一个鲜明的杠铃结构。

靠近用户的一端,公开 API 的名义单价跨度显著,部分新一代模型还在降价。截至 2026 年 8 月 2 日,几种代表性 API 的公开标价如下:

模型 标准输入或缓存未命中 / 100 万 token 输出 / 100 万 token
OpenAI GPT‑5.6 Sol 5 美元 30 美元
Google Gemini 3.6 Flash 1.5 美元 7.5 美元
Anthropic Claude Sonnet 5(促销至 2026-08-31) 2 美元 10 美元
DeepSeek V4 Flash 0.14 美元 0.28 美元

价格来源:OpenAI 模型文档Google Gemini 模型文档Anthropic Sonnet 5 发布页DeepSeek API 定价。DeepSeek 官方已预告未来峰时价格为表中两倍,生效日待公告。价格是 2026 年 8 月 2 日快照,随时可能调整。

价格跨度达到一至两个数量级,但这张表不能直接当性价比排名。不同模型的能力、速度、上下文、推理 token、缓存、工具费、SLA 和重试率都不同。token 会越来越像基础原料,通过验收的结果才是产品。企业真正应该比较的是“完成一个合格任务需要多少钱”,而非单纯比较每百万 token。

基础设施一端则越来越昂贵。国际能源署称,五家大型科技公司的资本开支在 2025 年超过 4,000 亿美元,2026 年预计再增长约 75%;数据中心用电在 2025 年增长 17%。Alphabet 在 2026 年第二季度财报电话会 上把全年资本开支指引上调至 1,950 亿—2,050 亿美元,主要用于服务器、数据中心和网络等技术基础设施。

于是出现看似矛盾的局面:调用智能越来越便宜,制造最前沿智能越来越贵。应用开发门槛下降,芯片、能源、数据中心和前沿训练的门槛上升。中间那层没有独特上下文、分发或工作流的通用模型 API,最容易被价格竞争挤压。

未来的利润不会简单地沿着“模型最强者通吃”分配。芯片与云掌握稀缺产能,头部实验室制造前沿能力,拥有入口的平台控制触达,垂直产品掌握业务上下文与验收规则。每一层都可能赚钱,也都可能被上下游抽走价值。

FIG 10

Token 变成原料,验收通过的结果才是产品

公开 API 标价快照,横轴为每百万 token 美元的对数尺度。空心点为输入,实心橙点为输出;不代表综合性价比。

名义调用价已跨越两个数量级;工具费、推理 token、重试率、验证和 SLA 决定真实交付成本。

DeepSeek V4 Flash
Gemini 3.6 Flash
Claude Sonnet 5 · promo
GPT-5.6 Sol
$0.1$1$10$100
输入 / cache miss输出单位:USD / 1M tokens

Anthropic 为截至 2026-08-31 的促销价;DeepSeek 已预告未来峰时价格翻倍,生效日待公告。价格随时可能调整。

来源:OpenAI · Google · Anthropic · DeepSeek。快照:2026-08-02。

展开价格快照
模型输入 / 1M token输出 / 1M token口径
OpenAI GPT-5.6 Sol$5$30标准输入 / 输出
Google Gemini 3.6 Flash$1.50$7.50标准输入 / 输出
Anthropic Claude Sonnet 5$2$10促销至 2026-08-31
DeepSeek V4 Flash$0.14$0.28未来峰时价预告为 2×

七、全球格局:模型分数趋近,竞争转向完整系统

截至 2026 年夏天,前沿玩家的路线已经明显分化。产业竞争可以先看三层:底部争芯片、能源与训练能力,中部争模型、推理成本和开发者生态,顶部争入口、组织上下文和工作流。下面列出主要代表路线,不是实时排行榜,也不是完整名录;xAI、Mistral 等同样是重要参与者。

阵营 主要路线 当前优势与约束
OpenAI ChatGPT、Codex、API 与多 Agent 组成通用工作平台 产品覆盖广、通用能力强;前沿成本与安全治理压力同样高
Anthropic Claude Code、长周期执行、工具使用与可信 Agent 编码和复杂工作流突出;高风险能力采取更严格的分级开放策略
Google Gemini、Search、Workspace、Android、Cloud、TPU 与世界模型全栈 分发和基础设施最完整;庞大产品体系也带来整合复杂度
Microsoft Azure/Foundry、Microsoft 365、GitHub Copilot 与 Agent 治理 企业分发与商业化强;与 OpenAI 深度绑定,同时推进多模型平台和自研模型
Meta Muse 多模态模型、Meta AI、社交应用与眼镜 拥有巨量消费入口和个人情境;长周期 Agent 与编码仍被官方列为当前缺口
阿里、字节、腾讯 云、消费应用、办公、电商、内容和社交场景提供落地与反馈 高频业务场景与本土分发支撑产品部署、评测和迭代;各家公司路线差异很大
DeepSeek、Kimi、智谱等 算法效率、开放权重、长上下文与 Agent 工程 价格和工程创新活跃;资金、算力、生态与商业持续性仍需分别观察

OpenAI 的 GPT‑5.6、Anthropic 的 Claude Fable 5 / Mythos 5、Google 的 Gemini 3.5/3.6、Meta 的 Muse Spark 1.1 都把 Agent、工具使用、电脑操作和推理效率放到发布核心。命名各异,方向高度一致:模型正在成为行动系统的引擎。

中国前沿路线至少有两类:阿里、字节、腾讯把模型接入云和高频业务场景;DeepSeek、Kimi、智谱等在稀疏架构、开放权重、长上下文和 Agent 工程上竞争。阿里同时把 Qwen3.7‑Max、Qwen 开放权重家族、云与 Agent 平台 连接起来。各家公司资源与商业模式差异很大,不宜用一条“中国路线”概括。

斯坦福 AI Index 的口径是:截至 2026 年 3 月,在其采用的模型表现排名中,美国头部模型领先中国头部模型 2.7%;2025 年美国私人 AI 投资约为中国的 23 倍。前者只说明选定评测上的头部成绩趋近,后者也只覆盖私人投资。它们不能分别外推为“整体技术已追平”或“一国 AI 总投入相差 23 倍”。

榜单第一会轮换,三层能否彼此咬合,决定一家公司能否把能力变成长期价值。高频产品还会形成“任务出现—结果验收—失败归因—产品迭代”的反馈回路;它不等于把用户对话直接拿去训练,数据授权、隐私隔离和跨客户边界仍是硬约束。开放权重降低了本地部署、定制和研究门槛,闭源平台通常提供更完整的前沿模型与托管工具,企业很可能长期采用混合方案。

下一代平台不会只是一个更大的聊天窗口,而是工作的操作系统:它知道组织上下文,调度不同模型与工具,控制权限,保存状态,并对结果验收。模型提供智力,平台决定这份智力能进入多少真实流程。谁占据这个控制面,谁就可能掌握 AI 时代最厚的一层价值。

截至 2026 年 8 月 2 日,没有一家实验室同时、稳定地统治所有关键评测。Artificial Analysis 当前 v4.1 快照中,Anthropic Fable 5 的综合指数为 60,OpenAI GPT‑5.6 Sol 为 59;在该机构单列的 Coding Agent Index 上,OpenAI 为 80,Anthropic 为 77。分差很窄,而且指数版本已经多次变化。这些数字更适合说明“前沿拥挤”,不适合制造一个永久总冠军。真正重要的领先正在从单点分数转向:模型、算力、入口、组织上下文与验收系统能否合成一个可持续的工作平台。

PART III · 人类窗口从替代动作,到重写岗位、责任与成长路径

八、工作会怎样变化:先变的是任务组合与入门路径

目前还没有证据证明宏观层面的“大规模 AI 失业”已经发生。与此同时,变化开始集中出现在招聘入口和高暴露岗位。AI Index 经济章节 记录,美国 22—25 岁软件开发者就业人数较 2024 年下降近 20%;三分之一受访组织预计未来一年因 AI 减少员工,但接近一半预计人员规模几乎不变。就业变化受利率、行业周期、招聘结构等多重因素影响,不能把相关性直接写成 AI 因果。

只盯着“一个职业会不会消失”,会错过更快发生的变化。企业不会等待 AI 自动完成整份工作,才开始重组岗位;它们会先把工作拆成任务,把隐性经验写成规范、模板、测试和审批逻辑,再把可验证的部分交给 Agent。岗位还在,岗位内部的价值分配已经改变。

未来两年,一批数字化工作会把默认流程倒过来:不再是人完成、AI 辅助,而是 AI 先执行,人处理异常、补充判断并承担签字责任。初稿、检索、样板代码、基础分析和格式转换会被快速压缩;问题定义、证据判断、例外处理、组织协调与最终授权会变得更贵。

这也会削薄传统的成长阶梯。年轻人过去通过大量低风险基础任务学习行业,如今这些任务恰好最容易被自动化。真正的挑战不只是少了多少岗位,而是组织能否重新设计学徒制:让新人学习如何定义任务、审查模型、处理例外,而不是在没有练习机会的情况下直接承担最终判断。

九、AI 越能行动,责任越不能含糊

AI 的风险有两层。第一层很直观:它会失败。第二层更容易被忽略:当它成功执行了一个错误、越权或有害的目标,能力本身会放大后果。

事实与记忆仍不稳定。 当前训练与生成机制并不保证输出为真。检索、引用和外部数据库能减少错误,却无法保证来源可靠或因果判断正确。百万 token 已成为多家产品规格,能装进去也不代表能在任意位置稳定找回、比较并正确使用;长期工作仍需状态管理、压缩、检索和遗忘机制。

开放任务缺少验证器。 代码和数学进步快,因为答案容易检查。战略、管理、创意和社会判断没有同样清晰的评分器,反馈周期又很长。没有可信验收,强化学习和 Agent 会把模糊目标优化到错误方向。

物理与社会常识仍不稳。 视频可以生成得逼真,机器人却要处理摩擦、遮挡、损耗和突发事件;组织工作还包含默认规则、权力关系和含蓄意图。互联网文本无法完整覆盖身体经验与制度语境。

行动能力放大了安全与滥用风险。 能发邮件、付款、删文件和部署代码的 Agent,一次提示注入或权限误判就可能造成真实事故。网络安全和生物研究还具有明显的双重用途,OpenAI、Anthropic 等实验室已把相关能力作为独立的发布门槛和分级访问对象。能力与权限必须分开增长。

隐私、版权和数据边界没有随能力自动解决。 Agent 为了完成任务需要读取邮件、代码、客户记录和个人资料;这些上下文是否获授权、能否跨用途使用、生成内容是否侵权,都需要产品与制度给出明确答案。更强的个性化通常意味着更深的数据访问,两者之间不存在免费的平衡。

算力与入口会带来新的集中。 模型调用价格下降,不会自动消除对先进芯片、云、能源和分发平台的依赖。少数公司能够同时控制基础设施、模型和用户入口,既可能提高整合效率,也会扩大议价权、单点风险和治理难度。

责任仍属于人和组织。 模型可以提出建议并执行动作,却不能承担法律、职业与伦理责任。谁授权、谁验收、谁能按下停止键,必须在部署前写进流程。斯坦福 AI Index 责任 AI 章节 记录的 AI 事件从 2024 年的 233 起增至 2025 年的 362 起,而头部实验室的安全评测披露仍不完整。技术部署速度已经超过了测量和治理能力的建设速度。

这些问题不是等待 AI “更成熟”以后再处理的外围风险,它们就是下一代 AI 产品栈。记忆、验证、安全、权限和责任设计,会像模型能力本身一样决定产品上限,也会成为新的商业壁垒。

FIG 11

能力增长快于测量与治理建设

AI 事件数据库的年度记录量受报告覆盖与定义影响,不能直接等同为总体事故率;它至少显示已知事件在增加。

公开记录的 AI 事件从 2024 年的 233 起增至 2025 年的 362 起,同比增加约 55%

2024233
+55%记录量
2025362

这是离散年度比较,不画连续趋势线;记录增加可能同时来自部署扩张、真实事件增加与报告覆盖改善。

来源:Stanford 2026 AI Index · Responsible AI

十、别押 AGI 日期,盯住五个真正的拐点

回到开头的五把尺子,未来一两年最值得跟踪的是五个可测信号。它们比“某模型是否自称 AGI”更有价值:

  1. 80% 人类等价任务跨度是否持续增长。 50% 成功率能制造惊艳演示,80% 才开始形成可部署的自动化半径;高风险任务还需要更高标准。
  2. 杂乱工作流是否追上结构化基准。 如果 OSWorld 2.0 一类长流程测试明显提升,说明 Agent 开始跨过演示与生产之间的鸿沟。
  3. 每个通过验收的任务成本是否下降。 这同时包含 token、工具、重试、人审和失败损失,比 API 标价更接近真实经济性。
  4. 权限系统能否支持可逆自治。 Agent 是否能在最小权限下工作、遇到歧义主动暂停、保留可审计轨迹,并让高风险动作可撤回。
  5. 企业 Agent 在各职能中的部署率能否走出个位数,并进入主流程。 席位增长证明有人买,流程渗透和持续使用才证明工作真的改变。

如果这些信号同时改善,AI 会从“帮人完成某一步”逐渐走向“接管一段有明确边界的流程”。如果模型分数继续上涨,而可靠性、权限和验收停滞,行业就会拥有越来越惊艳的演示,以及越来越昂贵的人工兜底。

结语:AI 不必成为人,就能重写人的工作

截至 2026 年 8 月,AI 输出的基本单位正在从“一段回答”变成“一个工件”和“一段流程”。代码、报告、演示文稿、研究材料和跨应用操作,都开始成为模型可以规划、执行和验收的对象。这比榜单上再多几个百分点更接近产业转折。

这给出一个比“谁先实现 AGI”更现实的产业判断:榜单冠军会轮换,模型单价会继续下降,长期价值更可能沉淀在验证器、组织上下文、工具权限、执行环境和分发入口。谁能把偶发的峰值能力变成可重复、可验收、可回滚的流程,谁才真正把模型能力变成生产力。

AI 也不会整齐地替代一个个职业。它会先替代职业内部的一段段动作,再迫使组织重新定义剩下的人类工作。可标准化、易验收的中间产出会迅速贬值,问题定义、例外处理、验收和责任会升值;原本藏在员工经验里的判断,会被不断抽取成规范、数据和软件。

判断下一次跃迁,只需要追问三个问题:它能以多高成功率完成多大的人类等价任务?失败能否被及时发现、停止和追回?一个通过验收的结果,总成本是多少?

AI 革命不会从模型终于“像一个完整的人”那天开始。它从组织开始围绕非人智能重写工作流程时开始——而这件事已经发生。AI 尚未获得责任,却已经在获得生产权限;这才是 2026 年真正的转折。


主要资料与口径说明

本文资料截至 2026 年 8 月 2 日。独立或综合资料用于判断总体趋势;公司发布页用于说明产品路线、用户数、价格和公司自报评测,不据此宣布跨平台“总冠军”。不同榜单的工具权限、推理预算、题集版本和评分方法不同,分数不可直接横比。

独立与综合资料

公司一手资料