返回博客

智能体的商业壁垒:工作流、验证成本与价值分配

从 OpenAI、Anthropic 与阿里云的公开动作出发,分析智能体如何从模型调用走向企业流程,以及为什么验收、复核和异常处理决定商业价值。

模型能连续调用工具之后,企业为什么还不敢把完整流程交给它?常见解释是模型还不够强。但另一个问题同样关键:即使它做对了大部分步骤,确认结果、处理例外和承担错误的成本,是否已经低于人工流程?

我的判断是:当多个模型达到某类任务的能力门槛后,竞争重心会部分转向工作流控制与验证成本。这里的“控制”指接入真实任务、获得适当权限、执行动作并确认结果的能力。它不等于占据聊天入口,也不意味着模型能力从此不重要。

一、三个动作,指向三种产品落点

2026 年 2 月 5 日,OpenAI 宣布 Frontier,将企业上下文、智能体权限和评估纳入同一平台;公告当时仅向有限客户开放。这是公司公布的产品定位与发布范围,不是企业投资回报已经得到独立验证的证据。来源:OpenAI 发布公告。

2026 年 4 月 8 日,Anthropic 介绍 Managed Agents 的架构:将会话记录、调度模型与工具的执行循环,以及运行代码的沙箱分离,使组件故障后可以恢复或替换。它关注的是持续运行的基础设施问题。来源:Anthropic 工程说明。

2026 年 5 月 26 日,阿里云宣布智能体生态更新,包括将超过 60 款云产品的常用能力转为 Skills 与 MCP 兼容形式,并推出 Qwen Cloud 和面向企业的 JVS Agent Suite。这里记录的是官方宣布的能力与产品,不把它们直接当作采用量或收入。来源:阿里云公告。

三个落点分别偏向企业协作平台、托管执行环境和云端工具生态。我的推断是,它们都在争取模型调用之后的持续业务活动:谁负责上下文、执行状态与质量反馈,谁就更接近企业每天重复发生的工作。但产品方向一致,并不能证明最终利润也会集中在同一层。

二、把计价单位从一次调用换成一次验收

设想一个采购对账流程:智能体需要读取合同与发票,识别差异,提交更正建议,并由有权限的人确认。生成一段合理解释只是中间产物。真正的交付需要最新数据、正确的系统状态,以及可追溯的批准记录。这个例子是分析用的假设场景。

因此,我更愿意用下面的核算框架,而不是单独比较每百万 token 的价格:

\[ C_{\mathrm{accept}} = \frac{C_{\mathrm{infer}}+C_{\mathrm{exec}}+C_{\mathrm{review}}+C_{\mathrm{ops}}}{N_{\mathrm{accept}}} \]

这里,\(C_{\mathrm{accept}}\) 是单位验收任务成本;\(C_{\mathrm{infer}}\) 是模型与工具调用成本,\(C_{\mathrm{exec}}\) 是执行环境成本,\(C_{\mathrm{review}}\) 是人工复核与返工成本,\(C_{\mathrm{ops}}\) 是集成与运维的摊销成本;\(N_{\mathrm{accept}}\) 是验收通过的任务数。各项在同一核算周期内统计,金额采用同一币种;只有 \(N_{\mathrm{accept}} > 0\) 时,单位成本才有定义。

这不是实测结果。分子必须包括失败尝试的支出;分母必须采用预先固定的验收标准。同时报告全部适用任务的完成率、任务难度分布和漏检错误,避免靠挑选简单任务或放宽标准制造降本。错误造成的业务损失也应单独列示,不能被平均调用费用掩盖。

验证尤其容易被低估。系统说“已完成”,不代表外部系统真的发生了正确变化。Anthropic 的评估指南也强调,应区分交互记录与最终环境状态。来源:2026 年 1 月 9 日的智能体评估指南。在采购例子中,验收应核对账目、授权和证据,而不是再请一个模型评价文字是否像正确答案。

智能体价值形成的概念链:模型达到能力门槛后,经上下文和授权执行、结果验证与异常恢复,才可能转化为重复使用与付费;失败反馈进入下一轮流程改进。
图 1|原创概念图。箭头表示有条件的因果机制,不代表已测量的效果或收入增长。

三、价值会流向哪里?取决于谁减少了最贵的环节

模型厂商可能保留能力溢价,也可能向运营层延伸。更强的模型若能减少重试、复核和漏检,即使调用单价更高,也可能拥有更低的验收成本。Frontier 所代表的平台方向,还可能让供应商参与集成与反馈;不过,若每个客户都需要大量定制服务,服务收入增加未必伴随利润率改善。

云厂商有机会承接持续执行产生的资源需求。沙箱、存储和工具连接让“生成答案”变成“运行任务”。阿里云的产品组合使这种路径可见,但云资源消耗增加只是可能的变现渠道。它究竟是新增价值,还是原有计算需求的迁移,需要用实际付费和单位成本判断。

垂直应用的机会在于定义并交付可验收结果。领域团队如果掌握任务入口、例外规则和客户认可的质量标准,就可能减少部署、复核与返工。但拥有更多连接器或更长的提示词并不是充分壁垒。优势需要体现在新客户上线更快、相同质量下人工投入更少、模型更换后仍能稳定交付。

这也解释了为什么“按结果收费”只是合同形式,而不是经济性保证。供应商若包揽异常处理,却没有把异常率降下来,就可能把软件业务做成人力外包。客户价值、供应商收入与供应商利润,要分别核算。

四、三个足以推翻强版本判断的反例

首先,部分任务的主要瓶颈仍是能力。模型如果不能理解关键约束,完善的工作流只能更稳定地执行错误。相反,一次能力跃迁可能让原先复杂的补救逻辑失去价值;Anthropic 的架构文章也提醒,围绕旧模型限制设计的辅助逻辑会过时。因而,任何长期壁垒都不能仅建立在今天模型的缺陷上。

其次,开放接口会削弱排他性。Qwen 团队在 2025 年 7 月 22 日发布 Qwen3-Coder 时,同时推出开源 Qwen Code,并强调工具接入。来源:Qwen 团队公告。这不能证明迁移没有成本,却足以反对“每个工作流必然被一家模型厂商锁定”的推断。企业原有业务系统也可能保留任务入口和权限优势。

最后,有些流程根本不需要通用智能体:规则稳定时,确定性自动化可能更便宜;结果难以验证且错误代价很高时,复核可能与亲自完成同样昂贵。此时,辅助人做关键一步,可能比自主执行全流程更有商业价值。

五、未来 6—24 个月,观察什么才算验证?

以下是从本文发布日出发的观察窗口,不是增长预测,也没有预设数值目标。比较时应固定任务范围,并与现行人工流程及最合适的确定性自动化方案对照。

窗口可观察指标对应判断
6 个月内:至 2027 年 4 月验收完成率、每次验收的人工作业时间、失败恢复时间及漏检错误是否真正减少总工作量,而非把工作转移给复核人员?
6—12 个月:至 2027 年 10 月同一业务流程的持续使用、模型升级后的回归失败、替换模型所需的集成与验证工作价值能否重复交付?依赖的是某个模型,还是可迁移的流程能力?
12—24 个月:至 2028 年 10 月付费续约、包含人工服务与基础设施的毛利、每个验收任务的收入和成本价值是否被客户认可,并转化为可持续的供应商经济性?

评测提升、真实采用、收入增长是三类证据,不能互相替代。科学场景还要进一步区分计算结果、实验验证和现实效果:运行了更多分析,并不能直接证明发现了更多有效知识。

我会优先关注那些能在明确任务上,把验收标准、错误记录和完整成本一起展示的产品。如果模型能力提升已足以消除大部分集成与复核成本,或开放工具让这些能力迅速商品化,那么工作流层能够长期获取额外利润的判断就需要下调。值得投资的不是流程的复杂程度,而是它持续减少的不确定性和劳动。

参考资料

  1. Introducing OpenAI Frontier — OpenAI · 2026-02-05 · 查阅 2026-10-06
  2. Scaling Managed Agents: Decoupling the brain from the hands — Anthropic · 2026-04-08 · 查阅 2026-10-06
  3. Alibaba Cloud Unveils Advanced Agentic AI Ecosystem for Global Customers · 2026-05-26 · 查阅 2026-10-06
  4. Demystifying evals for AI agents — Anthropic · 2026-01-09 · 查阅 2026-10-06
  5. Qwen3-Coder: Agentic Coding in the World — Qwen Team · 2025-07-22 · 查阅 2026-10-06
利友诚

关于作者

利友诚 · Youcheng Li

北京大学智能学院人工智能专业博士研究生,导师为王立威教授;Isoplex Intelligence(壹索智能)联合创始人兼 CTO。

研究关注医疗人工智能、生成式基础模型、诊断推理与科学智能体。以第一作者或共同第一作者身份在 Nature Biomedical Engineering、Scientific Data、KDD 和 PLOS Computational Biology 发表研究。