一、为什么席位数、活跃人数和 Token 都不是最终答案
采购席位只能说明企业给员工发了工具,活跃人数只能说明工具被打开过,Token 数量只能说明模型处理了多少内容。这三项都不能直接证明业务结果。
一个客服 Agent 一天生成了 500 条回复,如果其中 200 条需要人工重写,另有 20 条给出了错误承诺,那么“生成 500 条”就不是成果。一个代码 Agent 提交了 30 个修改,如果大部分没有通过测试、评审或上线验收,也不能把 30 次提交都算作产出。
OpenAI 的建议是从一个具体工作流开始,在工作真正发生的系统里定义“完成”:
- 客服场景:问题是否真正解决,而不是回复是否生成
- 研发场景:代码变更是否通过测试与评审,而不是写了多少行
- 法务场景:合同是否按质量标准完成审阅,而不是摘要有多长
- 财务场景:预测材料是否准确、按时、可用于决策,而不是做了多少张表
这一步听起来简单,实际却是很多 AI 项目最缺的。没有“完成”的定义,团队就只能用调用量代替价值,用演示效果代替交付结果。
二、企业真正该算的是“单次成功任务成本”
很多模型选型会从每百万 Token 的价格开始。这个数字适合比较账面单价,却不适合直接判断业务成本。
OpenAI 在计分卡里特别强调:更便宜的模型可能需要更多轮尝试、更长等待和更多人工复核;更贵的模型如果一次就把任务做对,最终反而可能更便宜。因此企业应该统计的不是“调用一次多少钱”,而是“得到一个达到质量线的结果,一共花了多少钱”。
可以把计算拆成三步:
- 汇总完成这批任务的完整成本
- 只统计达到质量标准的成功任务
- 用完整成本除以成功任务数
完整成本至少应包括:
- 模型或平台费用
- 员工操作与等待时间
- 人工复核时间
- 重试、返工和纠错成本
- 接口、权限、日志和运维成本的合理分摊
假设两个模型都处理 100 份材料:
| 指标 | 模型 A | 模型 B |
|---|---|---|
| 模型调用成本 | 300 元 | 700 元 |
| 达到质量线的任务 | 60 个 | 92 个 |
| 人工修订与重试成本 | 900 元 | 350 元 |
| 完整成本 | 1200 元 | 1050 元 |
| 单次成功任务成本 | 20 元 | 约 11.4 元 |
模型 A 的调用单价更低,但模型 B 的成功结果更便宜。这也是为什么企业不能只听“某模型降价了多少”,而要结合自己的工作流做真实验收。
三、可靠性必须变成可统计的业务指标
AI 项目常用“准确率”表达质量,但真实工作并不只有对和错。OpenAI 给出了更适合企业执行的三类结果:
- Ready to use:交付后可直接使用,达到既定质量线
- Needs correction:需要再次生成或由人修改
- Needs escalation:必须由人接管并完成
这三类数据比一句“效果不错”更有用,因为它们能直接映射人工成本和风险。
如果一个 Agent 的直接可用率从 45% 提升到 75%,即使 Token 成本没有下降,项目的单次成功任务成本也可能明显降低。反过来,如果模型看起来更聪明,却频繁在关键步骤要求人工接管,那么它可能适合做辅助工具,还不适合进入自动执行链路。
可靠性也离不开边界。AI 从写草稿走向调用工具、修改数据或触发流程前,企业至少要先定义:
- 它可以访问哪些数据
- 它可以使用或修改哪些系统
- 哪些动作必须人工审批
- 出现异常时如何停止、回滚和追责
能力决定第一次试用,可靠性才决定它能不能成为日常流程的一部分。
四、规模扩大后,AI 的经济性应该越来越好
AI 试点阶段能跑通,不代表扩大到全公司仍然划算。账号变多、任务变长、接入系统变复杂后,复核、权限、日志和运维成本都可能一起上涨。
更稳的观察方式,是对同一个工作流连续跟踪:
- 达到质量线的任务数量
- 完成这些任务的总成本
- 单次成功任务成本
- 直接可用、需要修订、需要升级的比例
如果成功任务增长速度快于总成本,且质量没有下降,说明每一块 AI 预算正在买到更多成果。如果调用量快速增长,成功任务却没有同步增长,项目可能只是从“小规模演示”变成了“大规模浪费”。
这也提醒企业,模型路由不能只按任务名称配置。低风险、高频、结构化任务可以优先用经济型模型;复杂判断、长流程或高价值任务可以使用更强模型。最终选择仍应由“单次成功任务成本”决定,而不是由厂商名气或 Token 单价决定。
五、老板和项目负责人应该怎么用这张计分卡
对老板:把预算从“买工具”改成“买结果”
立项会上不要只问买多少账号、接哪个模型,还要追问:
- 这个工作流当前每月完成多少次?
- 人工完成一次需要多久、多少钱?
- AI 做到什么程度才算成功?
- 直接可用率达到多少才值得扩大?
- 哪类错误会让项目立即停止?
只有这些问题能回答,预算才不是一笔模糊的“创新费用”。
对项目负责人:先建立人工基线,再跑 AI 试点
没有人工基线,就无法证明 AI 带来了提升。建议先抽取最近两到四周的真实任务,记录平均耗时、完成率、返工率和异常成本,再让 AI 处理同类任务进行对照。
测试时不要只挑最漂亮的案例,也要保留失败任务。只展示成功截图,会让后续预算判断失真。
对企业落地:先选一个可验收的工作流
第一批试点适合选择这些特征:
- 输入和输出相对明确
- 业务价值能够量化
- 有现成的人工作业基线
- 失败后可以人工接管
- 暂时不需要高风险自动写入
例如客服问题归类、销售会前材料、合同条款初审、测试用例生成、经营数据差异说明,都比“让 AI 提升全员效率”更容易算清楚。
六、一张可以直接执行的四周试点表
| 阶段 | 要做的事 | 验收重点 |
|---|---|---|
| 第 1 周 | 选定一个工作流,采集人工基线 | 完成定义、人工耗时、质量线 |
| 第 2 周 | 小样本运行,记录所有失败与修订 | 直接可用率、修订率、升级率 |
| 第 3 周 | 调整提示、知识、模型和权限 | 单次成功任务成本是否下降 |
| 第 4 周 | 用真实任务复测并做扩容判断 | 价值增长是否快于总成本 |
试点结束后只做三种决定:
- 扩大:质量稳定,单次成功任务成本明显低于人工基线
- 保留辅助模式:有价值,但仍需要较多人工判断
- 停止或重构:调用量很高,成功成果少,风险或返工不可控
七、华茂思捷判断
OpenAI 这套计分卡最有价值的地方,不是发明了一个新名词,而是把 AI 投资从“买了多少”重新拉回“完成了什么”。
企业真正要追踪的,不是 Token 消耗曲线,而是有多少任务达到了质量线;不是单次调用有多便宜,而是一个成功结果的完整成本;不是员工说“挺好用”,而是结果能否稳定直接使用;不是规模变大后账单涨了多少,而是价值是否比成本增长得更快。
如果这四个问题没有答案,AI 项目越热闹,预算越容易失真。反过来,只要从一个可验收工作流开始,把完成定义、完整成本、可靠性和扩容条件写清楚,企业就能逐步建立自己的 AI 投资账本。
如果你正在评估企业 AI 试点、Agent 工作流或模型成本,可以先查看 核心服务。如果已有具体岗位、任务量和系统清单,也可以通过 联系咨询 一起设计一套四周试点与 AI ROI 计分表。
新闻来源
- OpenAI:A scorecard for the AI age

