跳到正文
深圳 · 大湾区 · 地球

90 天 AI 落地路线图:只上一条流程,其余全部标成猜测

多数 AI 落地路线图是三年能力地图,却按承诺的价格出售。能过 P&L 的版本只有 90 天、一条流程,并且提前写好了终止条件。

6 分钟阅读1,417
AI StrategyEnterprise暂无译文。

一份三年的路线图,为什么过不了第一次预算评审?

因为它不是计划,是一份穿着计划外衣的预测。我见过一份十四个月的 AI 路线图三月获批、十一月被悄悄删掉,原因不在技术:它给还没界定过范围的工作承诺了日期,第一个诚实的工时估算就把它推倒了。

可信的 AI 落地路线图只有 90 天,只包含一条进入生产的流程;第 90 天之后的一切都是猜测,应该被标成猜测跟踪,而不是排进日程。

三年能力地图好读,也能回答董事会的问题,但计划是一串承诺,而承诺需要先有范围:能诚实承诺的,是 90 天和一条真人按真体量在用的流程。

把周期拉长,为什么反而更贵?

因为它把不确定性按确定性的价格卖了出去:本质上是买入一份关于未来能力的期权,却用义务的语气写成了招人、选平台、排集成顺序。底层技术一动——去年让某个用例算不过账的模型档位,今年通常就是便宜的那一档——地图不会跟着调整,它只是变成一份错了的、并且已经有人为之负责的文档。

推理价格的降幅我不编具体数字,它取决于你量哪一档模型;但把一档模型的成本结构外推到 36 个月,等于押一个几乎肯定朝你有利方向移动的价格。更贵的是第二项:长路线图把唯一产生信息的工作往后推,输出多久错一次、谁必须复核、集成花了多少,都要到生产里才知道。

一条流程想在第 90 天进生产,得同时成立哪六件事?

约束不在野心,在可测试性。六条同时成立,候选流程才是 90 天的形状;缺一条,项目不会响亮地失败,而是拖到第七个月。

体量够大。 每月几百次以上,不是几十次。体量摊薄集成成本,也才让错误率有统计意义。

存在确定的成败判定。 不用开会就能把输出打成对或错。若唯一结论是“团队感觉它更好了”,你拿到的是带预算编码的 demo。

已有系统承载结果。 输出落到人本来就会看的地方:工单队列、ERP 字段、CRM 记录。新建落点等于新建一个采用问题。

错了便宜、可回退。 由人改的草稿可以;自动付款、发货、对外发布不行。

有一个具名的负责人。 不是委员会,是一个每周的轻松或辛苦取决于结果的人。

说得清人工流程现在的成本。 没有这个基线,一年后没人能判断新的这条是不是更便宜。

六条全成立,90 天不算激进;只成立三条,90 天就是幻想——诚实的做法是先把缺口补上,那本身也是一个 90 天项目。

候选流程怎么打分,才不至于把会开成辩论?

用这六条打分,选体量最高、每道门都过的那个。这是我第一次工作会议上用的表,通常很快结束争论:大多数候选栽在同一两行上。

候选流程每月实例量有客观判定?已有承载系统?出错的代价90 天结论
发票与采购单异常分诊1000–8000有,比对采购单行项有,ERP低,人工确认首选
线索资格判断与分配300–3000部分,分配结果可查有,CRM路由规则已写下来就是首选
合同条款抽取50–400有,比对条款库部分中,法务复核可行,但复核量拖慢进度
内部制度问答无法估计无,正确性有争议低,但看不见最差的首选
对外邮件起草200–2000无,质量是主观的部分中到高,品牌风险等复核层建好再说
自动采购决策高,涉及资金任何包装下都不是 90 天项目

挂掉的往往是想象价值最高的那些。内部制度问答是我被问得最多的,也最不该做第一个:没人定义得出什么叫正确答案,评测集变成研究课题,90 天就消失在里面。

这 90 天里,钱到底花在哪一行?

几乎不花在推理上,这个数字通常让财务意外。

一个算例,假设全部写明:每月 4000 份文件,每份平均 1200 个输入 token、400 个输出 token,合计 480 万输入和 160 万输出 token。按示例单价每百万输入 3 美元、每百万输出 12 美元算,每月约 14.4 加 19.2 美元,也就是 34 美元上下;换中档模型是个位数。价目表一直在动,把那几个单价当占位符,换成你自己的重算一遍,答案的形状不会变。

成本项90 天里的真实形状风险在哪
模型推理每月几十到几百美元几乎可以忽略;每季度核对价目表
集成工程一个工程师 4–6 周,对接一个系统目标系统没有 API 时会被严重低估
评测集用 200–500 个真实案例建可打分的测试集最常被跳过,也是没人能证明结果的原因
人工复核层按体量百分比配,不按固定人头真正的运营成本,决定能不能扩大
流程负责人的时间每周 3–5 小时,连续 12 周计划里最常忘记预留的一行
外部顾问固定范围,不是按月续费范围是路线图时,账单跟着猜测量涨

外部顾问那一行,我的做法是按固定范围而不是按月计费:范围一旦是路线图,账单就跟着猜测膨胀。

钱不在推理上,而在周期时间和复核层。复核比例是第 90 天报告里最该写下的数字:八周后每 100 条输出有 40 条要人工订正,你手上是个工具;只有 4 条,它就够格进入流程变更的讨论。这套拆法我在按 token 计价的一次运行成本模型里写过完整版本。

第 91 天之后写什么?

标成猜测。90 天之后的那一节不是路线图,是一份具名下注的登记表,每条都带触发条件和终止条件,不写日期——90 天之后的日期都是编的。

三条通常够用:第二条流程,条件是第一条的复核比例连续四周守住;平台选型,条件是它需要同一个集成面;人头或供应商决策,条件是体量越过一个写明的门槛。写不成“观察到 Y 就做 X”的那一行,不是下注,是愿望。

组织上的好处也在这里。拿出三年地图的人,每个季度都要为整套方案接受一次公投;拿出 90 天和一条流程的人,第 90 天的评审是一个决策,三种结果提前约定:扩大、按住、停止。有权喊停的人该坐在第 45 天的评审里——一个不能被取消的试点,就是一份文档更差的全面推广。

周一先做哪一件事?

拿出你手上的路线图,找到第一期里列的第一条流程,用上面六个条件在一个会里问一遍。答得上来,就把文档从第 90 天剪断,后面改写成带触发条件的下注;答不上来,你是在花掉探索预算之前就知道,这比事后知道便宜得多。不舒服的地方在于,这样做出来的计划比组织预期的短,一定有人问第二年怎么办。答案是 90 天之后你会知道,而知道比一张排期表值钱。

继续阅读

更多「AI 战略」

准备构建一套系统?[ 预约会议 ]