一、OpenAI 公开的五个教训到底是什么
OpenAI 原文把经验归纳成五条:让所有人获得 AI,同时给他们一个真正使用的理由;围绕“决策”重做完整工作流;让财务专业人员成为工具的建设者;把速度与清晰的责任、控制放在一起;按“每单位智能产生的价值”衡量回报。
这五条没有一条是“选最强模型”。它们依次回答了五个企业问题:员工为什么用、流程怎样改、谁最懂需求、结果由谁负责、投入到底值不值。
OpenAI 还提到,传统月结和预测仍包含大量找资料、解释变动、拼输入、做图表和转幻灯片的工作。AI 能压缩这些环节,但财务仍要核数字、作判断、批准基线并最终签字。这也是整篇文章最重要的边界。
二、第一课不是买账号,而是让真实工作进入实验
“给所有人访问权限”很容易被理解成给财务部统一采购 AI 会员。原文后半句更重要:还要创造一个使用理由。OpenAI 举的做法,是让团队带着想改变的重复任务参加财务黑客松,并让技术人员帮助他们快速构建、测试和改进。
其中一个结果是 IR-GPT:它基于经过批准的投资者关系材料,为尽调问题生成初稿。采购和税务等领域也开始构建定制 GPT。用例不是由软件销售人员凭空想出来,而是由最接近工作的人提出。
中小企业可以把“黑客松”换成更朴素的一周试验:每位财务人员提交一项每周重复、输入相对稳定、结果能人工检查的工作,例如归集付款附件、比对发票字段、整理回款异常。先用真实样本跑通十次,再决定是否系统化。
三、第二课是围绕决策重做全流程
一份预测交到老板手上之前,可能经过导数、合表、对账、解释差异、做图和做 PPT。若 AI 只负责最后写一段摘要,前面最耗时、最容易错的环节没有改变,价值自然有限。
OpenAI 提出的思路,是从重要决策倒推:这个决定需要哪些数据、工具、审批和交接?哪些步骤可以由 AI 分析、协调或完成?哪些步骤必须保留财务复核?
例如预算执行分析,不应只是“让 AI 看一张表”。更完整的链路是:读取已批准预算、总账实际数、采购订单、应计项目和交易明细;持续对账;把差异追到原始业务;生成第一版解释;将例外项推给责任人;由财务决定是否调整预测。此前我们在《财务票据初审总靠人工翻?》里拆过类似的票据、合同、付款与异常标记链路,关键同样是证据和复核,而不是一段漂亮回答。
四、第三课是让财务人员成为“工具建设者”
OpenAI 表示,其财务团队成员正在用 ChatGPT Work 和 Codex 构建仪表盘与工具;还举了一位没有编程经验的同事为广告业务制作预测拆分工具的例子。工具把月度预测拆成周度、日度计划,考虑工作日和节假日,并让数字继续绑定已批准模型。
这不等于每位会计都要转岗做程序员。真正的变化是,懂口径的人可以更直接地参与定义工具:字段从哪里来,什么叫异常,哪些数字可以改,哪个版本是已批准版本,谁能看到敏感数据。
企业仍需要工程人员处理账号权限、接口、测试、部署和维护,但需求不该只在会议里转述。财务人员最好能直接维护规则、提示模板、映射表和例外清单,让系统变化跟得上业务变化。
五、第四课是速度必须和责任、控制一起上线
OpenAI 称,IR-GPT 能把过去耗时数小时、甚至延续到夜间的材料检索和初稿工作压缩到数秒产生强初稿。但投资者关系团队仍要阅读、补充判断和上下文,并检查不同投资者之间的回答是否一致。
这句话可以直接改写成企业财务的上线原则:AI 加速工作,人对结果负责。系统至少要说明四件事:能访问哪些数据,能执行哪些动作,什么时候必须审批,什么情况要升级给人工。
每个数字还要能回到可靠来源,每份预测要有变动解释,任何对已批准基线的修改都要经过授权。没有这些控制,自动化越快,错误扩散也越快。特别是付款、报税、资金调拨等不可轻易撤销的动作,不宜从“生成建议”一步跳到“自动执行”。
六、第五课是按可靠完成的工作衡量 AI 回报
许多企业用登录人数、提问次数或 Token 消耗量证明 AI 有价值。它们只能说明工具被打开了,不能说明工作完成得更好。
OpenAI 建议关注 AI 可靠完成的工作,以及由此产生的价值。换成财务语言,可以按任务建立一张计分卡:原来耗时多少,AI 后总耗时多少;一次通过率多少;需要多少人工修订;是否减少错付、漏收或逾期;关账和预测提前了多久;系统运行和维护总成本是多少。
《OpenAI 发布 AI 投资计分卡》也强调,调用量不是 ROI。最实用的分母不是 Token,而是“达到质量线的成功任务”。一个每天回答一万次却频繁返工的机器人,可能不如一个每天只处理五十笔、但能稳定找齐付款证据的流程。
七、“零日关账”不是今天买、明天实现
零日关账的吸引力在于,管理层随时能看到已对账、可追溯的财务位置,而不是月末再拼出过去发生了什么。持续预测则在此基础上呈现业务怎样变化、接下来可能发生什么,以及哪个决策会改变结果。
但要达到这个状态,前提不是模型够聪明,而是业务数据能及时进入系统,科目和组织口径稳定,订单、合同、发票、付款与总账能够关联,异常有负责人,历史更改有记录。
如果企业现在仍靠不同部门私下传 Excel、客户名称常常不一致、预算版本找不到批准记录,直接上自动预测,只会把数据混乱包装成更快的图表。AI 可以帮助匹配和解释,不能替企业发明缺失的事实。
八、最适合先自动化的三类财务工作
第一类是资料归集与初审。发票、合同、付款申请和审批附件有明确字段,AI 可以提取、分类、查缺并标记冲突,由财务复核。
第二类是差异解释初稿。系统把预算、实际、订单与业务记录连接起来,先找出金额和时间差异,再生成带来源的解释候选,责任部门确认原因。
第三类是周期性管理报告。已批准数据进入固定模板,自动生成趋势、异常和待决事项,但保留口径版本、来源链接和人工发布按钮。
相反,战略性会计判断、税务立场、重大资金安排和无充分证据的预测,不适合一开始就全自动。企业可先让 AI 做“准备材料和提出候选”,把最终判断留给有权限的人。
九、采购“财务机器人”前先检查数据地基
老板可以先问财务负责人六个问题:预算有唯一批准版本吗?总账、订单、合同和回款能用稳定编号关联吗?同一客户、项目和部门的名称是否统一?历史调整能否看到修改人和时间?权限能否区分查看、编辑、审批和导出?关键报表能否追到原始凭证?
若大部分答案是否定的,预算应先投入数据治理、接口和流程。可以参考《ChatGPT 进了 Excel》所讨论的边界:Excel 里的 AI 真正进入企业工作,并不是读到一个文件就结束,而是要处理真实数据权限、版本和流程。
还要确认模型服务是否会接触身份证、银行卡、薪酬、合同价格等敏感信息,数据是否离境、是否用于训练、日志保存多久、员工能否把文件下载到个人设备。财务自动化的风险往往不在回答文风,而在数据流向。
十、判断一款财务 AI 产品,别只看演示
演示时,销售人员通常会展示“上传报表,一句话生成分析”。企业验收时应换成自己的脏数据和异常样本,并追问:数字来源能否点击查看?缺失数据会提示还是猜测?同一问题重复执行是否稳定?更换预算版本会不会串数?无权限员工能否看到工资和利润?模型失败后有没有降级流程?
还要看交付物:规则能否配置,提示词和口径归谁,接口文档是否提供,日志能否导出,停用供应商后数据怎样带走,人工复核能否留下记录。
真正可用的财务 AI,不是“永远回答”,而是知道什么时候证据不足、主动停止并把问题交给正确的人。
十一、一个更稳妥的 90 天落地顺序
前 30 天只做盘点:选一条高频流程,画清输入、审批、异常、输出和责任人;收集正常与异常样本;建立当前耗时和错误基线。
第 31—60 天做受控试点:只读接入必要数据,让 AI 提取、比对和生成初稿;所有结果由财务确认;记录漏报、误报、返工与节省时间。
第 61—90 天才考虑系统化:把稳定规则做成接口和页面,补齐账号权限、审计日志、版本控制、告警和回滚;按成功任务和业务结果复盘是否扩展。
如果试点没有改善周期、质量或风险,就应停止扩张,重新检查流程,而不是通过增加调用量制造繁荣。
十二、老板最后该买什么
小企业流程简单、数据量有限,可以先用成熟财务软件加受控 AI 功能;多系统、多组织或特殊审批较多的企业,更可能需要定制集成;涉及高敏感数据、离线环境或严格审计时,还要评估私有化与本地模型。
不论采用哪种方式,采购清单都应包含数据连接、规则配置、权限审批、证据追溯、人工复核、日志审计、效果指标和退出方案。模型名称只是其中一项,而且往往不是最难的一项。
华茂思科判断:AI 原生财务先改责任链,再改报表
新闻来源与口径说明
- OpenAI:What building an AI-native finance function taught me,发布于 2026 年 8 月 10 日。本文对五条经验、IR-GPT、零日关账和持续预测的描述均以该原文为依据。
- OpenAI 原文明确表示,零日关账与自动持续预测仍是正在建设的目标。本文不把它们写成已经完成的产品能力,也不声称所有企业照搬即可实现。
- 本文的 90 天顺序、采购清单和指标是面向企业落地的分析建议,不是 OpenAI 官方实施承诺。

