当企业开始推动 AI 转型,最容易得到的数字通常是调用量:多少人在用、用了多少次、增长了多少。 它直观、实时,也很适合做成一张不断上涨的看板。

但越是在真实的企业实践里,我越觉得这个数字危险。不是因为调用量完全没用,而是因为它太容易被当成价值本身。

01 / ACTIVITY

调用量首先是一个活跃度指标,而不是价值指标

从人的角度看,一旦 Agent 使用量与个人绩效、转型意愿甚至津贴挂钩,人就会自然地开始优化这个数字。

原本一次可以完成的任务,可能被拆成多轮对话;线下已经完成的工作,也可能在 Agent 中重复一遍。最终,数据证明的可能不是 AI 创造了多少价值,而是谁更擅长表现出“我正在积极使用 AI”。

从组织角度看,“一次调用”本身也缺少稳定口径。是一项完整任务、用户发出的一条消息、一次模型请求,还是 Agent 在后台执行的一次工具调用?不同统计方式,可以让同一项工作呈现出完全不同的数字。

一个调用量很高的 Agent,可能很受欢迎,也可能只是因为能力不足,用户不得不反复追问、重试和纠错。

因此,调用量适合观察系统有没有被使用、容量是否异常、采用趋势如何;它不适合直接回答 AI 创造了多少价值。

02 / VALUE PATHS

我目前用三条路径理解 AI 的价值

如果调用量不是价值,那企业应该衡量什么?我更倾向于把 AI 带来的价值分成提质、提效和使能。它们描述的是价值产生的路径,而收入、成本、风险和客户体验,才是最终承接价值的业务结果。

01

QUALITY

提质

在投入基本不变的情况下,让结果更准确、完整、稳定,或者减少错误、返工与业务风险。

02

EFFICIENCY

提效

在结果基本一致的情况下,用更少的时间、人力或成本完成同一项工作。

03

ENABLEMENT

使能

让一个人或组织完成过去无法完成,或者成本高到不值得完成的事情。

“提量”不必单独成为第四类。相同时间里产出更多,通常是提效的结果;过去无法生产的内容现在可以规模化生产,通常属于使能。 如果新增产出没有需求、质量不合格,也没有改变任何后续结果,它就只是更多产出,而不是更多价值。

03 / EVIDENCE

奖励的不是 AI 活动,而是经过验证的业务增量

一种更稳妥的衡量方式,是在 Agent 已经进入真实业务后,再比较使用 AI 前后的差异:原来需要投入多少时间、完成多少任务、达到什么质量;引入 Agent 后,这些结果发生了怎样的变化。

01进入真实业务

创建完成只代表潜在能力存在。

02验证前后差异

比较相近任务、难度与质量标准。

03核算增量产出

确认改善主要来自新的 AI 工作方式。

04计算组织收益

把真实改善映射到业务结果。

这种 before-and-after 对比也需要谨慎。业务量变化、人员熟练度提升、流程调整,都可能导致结果改善。 基线应尽量采用相同任务、相近难度和一致质量标准;高价值场景还可以用抽样复核、同期对照或小范围试点,确认差异确实主要来自新的工作方式。

真正应该追问的是:如果没有这个 Agent,业务结果会有什么不同?

04 / PRODUCTIVITY DIVIDEND

AI 创造价值之后,生产力红利由谁获得?

假设 Agent 每天为一名员工节省一小时,但公司没有立刻减少成本,员工也没有在当天增加产出。 这并不意味着价值尚未产生。

员工可以减少加班,获得更多休息和生活时间。更好的状态还可能进一步影响创造力、主动性和长期投入。 这些收益不一定立刻出现在利润表里,却是真实的个人价值,也可能转化为组织的长期能力。

节省出的时间也可能被重新投入更高质量、更具创造性的工作,或转化为更多有效产出。 但如果所有时间都被新的低价值任务重新填满,企业也许获得了短期产出,员工层面的收益却会消失。

因此,衡量“节省了多少小时”还不够,还需要观察这些时间后来流向了哪里。

  • 减少加班与恢复精力
  • 提高质量或探索新想法
  • 转化为更多有效产出
  • 被更多低价值任务重新占满

05 / INCENTIVE

让员工愿意创造并公开效率,需要分享生产力红利

如果员工把原来八小时的工作五小时做完,公开这件事后得到的只是更多任务,那么隐藏节省出的三小时,反而是一种理性选择。

如果组织能把员工借助 AI 创造的额外产出,转化为可以确认的组织收益,那么其中一部分收益应该交还给价值创造者。 员工可以通过收入、奖金、晋升机会或时间自主权,分享自己创造的生产力红利。

如果设计激励,也应同时看见创建者和使用者的贡献:创建者承担场景识别、 设计、开发与维护,使用者则让能力进入真实工作,并持续验证、纠错和反馈。 两者的价值来自不同环节,不能只奖励其中一端。

创建决定了 AI 能不能工作,使用决定了它有没有真正创造价值。

但奖励不能绑定创建了多少 Agent、申报了多少节省工时或调用了多少次。 只有当提质、提效或使能结果经过验证后,才应该形成可分配的收益池。

06 / OPEN QUESTION

关于“质量提高值多少钱”,仍然没有通用答案

提效可以折算为工时,提量可以统计有效产出;但质量提高如何稳定地换算成收益,仍然是更难的问题。 错误率下降、返工减少、评审分数提高,都可以成为证据,却不一定能直接回答这次改善值多少钱。

我不想为了得到一个完整公式,就假装这个问题已经被解决。现阶段更诚实的做法,是明确哪些价值已经可以验证, 哪些仍需要业务方、财务和管理机制共同定义。

这篇文章不试图给出一个包办一切的公式。当前更可靠的判断是: 调用量可以用来运营系统,但只有经过验证的业务增量, 才有资格进入价值核算和激励分配。

FIELD NOTE · 2026.07.28

企业 AI 转型不应该从“怎样让所有人多用 AI”开始,而应该从“哪些业务结果值得被改变”开始。

返回全部思考