一份三年的路线图,为什么过不了第一次预算评审?
因为它不是计划,是一份穿着计划外衣的预测。我见过一份十四个月的 AI 路线图三月获批、十一月被悄悄删掉,原因不在技术:它给还没界定过范围的工作承诺了日期,第一个诚实的工时估算就把它推倒了。
可信的 AI 落地路线图只有 90 天,只包含一条进入生产的流程;第 90 天之后的一切都是猜测,应该被标成猜测跟踪,而不是排进日程。
三年能力地图好读,也能回答董事会的问题,但计划是一串承诺,而承诺需要先有范围:能诚实承诺的,是 90 天和一条真人按真体量在用的流程。
把周期拉长,为什么反而更贵?
因为它把不确定性按确定性的价格卖了出去:本质上是买入一份关于未来能力的期权,却用义务的语气写成了招人、选平台、排集成顺序。底层技术一动——去年让某个用例算不过账的模型档位,今年通常就是便宜的那一档——地图不会跟着调整,它只是变成一份错了的、并且已经有人为之负责的文档。
推理价格的降幅我不编具体数字,它取决于你量哪一档模型;但把一档模型的成本结构外推到 36 个月,等于押一个几乎肯定朝你有利方向移动的价格。更贵的是第二项:长路线图把唯一产生信息的工作往后推,输出多久错一次、谁必须复核、集成花了多少,都要到生产里才知道。
一条流程想在第 90 天进生产,得同时成立哪六件事?
约束不在野心,在可测试性。六条同时成立,候选流程才是 90 天的形状;缺一条,项目不会响亮地失败,而是拖到第七个月。
体量够大。 每月几百次以上,不是几十次。体量摊薄集成成本,也才让错误率有统计意义。
存在确定的成败判定。 不用开会就能把输出打成对或错。若唯一结论是“团队感觉它更好了”,你拿到的是带预算编码的 demo。
已有系统承载结果。 输出落到人本来就会看的地方:工单队列、ERP 字段、CRM 记录。新建落点等于新建一个采用问题。
错了便宜、可回退。 由人改的草稿可以;自动付款、发货、对外发布不行。
有一个具名的负责人。 不是委员会,是一个每周的轻松或辛苦取决于结果的人。
说得清人工流程现在的成本。 没有这个基线,一年后没人能判断新的这条是不是更便宜。
六条全成立,90 天不算激进;只成立三条,90 天就是幻想——诚实的做法是先把缺口补上,那本身也是一个 90 天项目。
候选流程怎么打分,才不至于把会开成辩论?
用这六条打分,选体量最高、每道门都过的那个。这是我第一次工作会议上用的表,通常很快结束争论:大多数候选栽在同一两行上。
| 候选流程 | 每月实例量 | 有客观判定? | 已有承载系统? | 出错的代价 | 90 天结论 |
|---|---|---|---|---|---|
| 发票与采购单异常分诊 | 1000–8000 | 有,比对采购单行项 | 有,ERP | 低,人工确认 | 首选 |
| 线索资格判断与分配 | 300–3000 | 部分,分配结果可查 | 有,CRM | 低 | 路由规则已写下来就是首选 |
| 合同条款抽取 | 50–400 | 有,比对条款库 | 部分 | 中,法务复核 | 可行,但复核量拖慢进度 |
| 内部制度问答 | 无法估计 | 无,正确性有争议 | 无 | 低,但看不见 | 最差的首选 |
| 对外邮件起草 | 200–2000 | 无,质量是主观的 | 部分 | 中到高,品牌风险 | 等复核层建好再说 |
| 自动采购决策 | 低 | 无 | 有 | 高,涉及资金 | 任何包装下都不是 90 天项目 |
挂掉的往往是想象价值最高的那些。内部制度问答是我被问得最多的,也最不该做第一个:没人定义得出什么叫正确答案,评测集变成研究课题,90 天就消失在里面。
这 90 天里,钱到底花在哪一行?
几乎不花在推理上,这个数字通常让财务意外。
一个算例,假设全部写明:每月 4000 份文件,每份平均 1200 个输入 token、400 个输出 token,合计 480 万输入和 160 万输出 token。按示例单价每百万输入 3 美元、每百万输出 12 美元算,每月约 14.4 加 19.2 美元,也就是 34 美元上下;换中档模型是个位数。价目表一直在动,把那几个单价当占位符,换成你自己的重算一遍,答案的形状不会变。
| 成本项 | 90 天里的真实形状 | 风险在哪 |
|---|---|---|
| 模型推理 | 每月几十到几百美元 | 几乎可以忽略;每季度核对价目表 |
| 集成工程 | 一个工程师 4–6 周,对接一个系统 | 目标系统没有 API 时会被严重低估 |
| 评测集 | 用 200–500 个真实案例建可打分的测试集 | 最常被跳过,也是没人能证明结果的原因 |
| 人工复核层 | 按体量百分比配,不按固定人头 | 真正的运营成本,决定能不能扩大 |
| 流程负责人的时间 | 每周 3–5 小时,连续 12 周 | 计划里最常忘记预留的一行 |
| 外部顾问 | 固定范围,不是按月续费 | 范围是路线图时,账单跟着猜测量涨 |
外部顾问那一行,我的做法是按固定范围而不是按月计费:范围一旦是路线图,账单就跟着猜测膨胀。
钱不在推理上,而在周期时间和复核层。复核比例是第 90 天报告里最该写下的数字:八周后每 100 条输出有 40 条要人工订正,你手上是个工具;只有 4 条,它就够格进入流程变更的讨论。这套拆法我在按 token 计价的一次运行成本模型里写过完整版本。
第 91 天之后写什么?
标成猜测。90 天之后的那一节不是路线图,是一份具名下注的登记表,每条都带触发条件和终止条件,不写日期——90 天之后的日期都是编的。
三条通常够用:第二条流程,条件是第一条的复核比例连续四周守住;平台选型,条件是它需要同一个集成面;人头或供应商决策,条件是体量越过一个写明的门槛。写不成“观察到 Y 就做 X”的那一行,不是下注,是愿望。
组织上的好处也在这里。拿出三年地图的人,每个季度都要为整套方案接受一次公投;拿出 90 天和一条流程的人,第 90 天的评审是一个决策,三种结果提前约定:扩大、按住、停止。有权喊停的人该坐在第 45 天的评审里——一个不能被取消的试点,就是一份文档更差的全面推广。
周一先做哪一件事?
拿出你手上的路线图,找到第一期里列的第一条流程,用上面六个条件在一个会里问一遍。答得上来,就把文档从第 90 天剪断,后面改写成带触发条件的下注;答不上来,你是在花掉探索预算之前就知道,这比事后知道便宜得多。不舒服的地方在于,这样做出来的计划比组织预期的短,一定有人问第二年怎么办。答案是 90 天之后你会知道,而知道比一张排期表值钱。
继续阅读
- 什么时候不该用 AI:能写成规则的事,就不要交给模型2026-03-106 分钟AI 战略
- AI 自建还是采购:标配买回来,差异化自己建2026-03-026 分钟AI 战略
- 企业 AI 落地:卡住的地方是流程归属,不是模型能力2026-03-266 分钟AI 落地