跳到正文
深圳 · 大湾区 · 地球

人在回路设计:让人审决策和证据,而不是一屏模型输出

人工审核变成瓶颈,几乎从来不是模型不够好,而是复核人被要求读完整屏输出、自己把结论重推一遍。把决策、规则和证据摆进同一屏,复核成本才会从输出长度上解耦。

6 分钟阅读1,421
AI SystemsEnterprise暂无译文。

人在回路卡住的地方,是复核人眼前那一屏东西

人工复核拖垮一条流程,通常不是因为复核人不认真,而是界面把模型生成的东西整屏递过去,让他自己重推一遍结论。推一遍要多久,决定这条流程在量上来之后还活不活得下去。

我做过的一条信贷审批流程,试点时一天四十件,两位分析师在共享收件箱里复核,皆大欢喜。放到一天四百件,队列每周多积一天半,议题从「模型够不够好」变成「要不要再招人」。模型没问题,出问题的是界面:一份能往下滚的长文档,底下挂个聊天框。

人工审核只有在人审的是「一个决策加它的证据」而不是「一屏模型输出」时才能扩展,于是界面成了系统里难的那部分,模型反而是简单的那部分。

机制如下。开工时我先做的一件事,是跟复核人一起看他眼前那一屏(我的服务范围与交付方式);这一屏定了,人头和工期才算得出来。

审输出和审决策,不是同一件工作

复核人真正的活是下判断,不是读。审输出把顺序弄反了:先读再判断,而读是无界的那一段——生成得越长,判断越慢,被跳过的也越多。审决策把顺序倒过来,先摆结论,再摆支撑它的那几条特定证据,文本从「必须吸收的」变成「可以翻查的」。

维度审模型输出审决策加证据
复核人看到什么一份生成好的文档或草稿一条用系统语言写的动议,加上所套用的规则
单件耗时分钟级,随输出长度增长几十秒,只随模糊程度增长
「通过」意味着什么「读起来说得通」「在这个条款下这个动作是对的」
审计留下什么一句批注,如果有动作、规则、证据片段、模型与 prompt 版本、复核人
量上来后成本怎么走跟着输出量和人头涨跟着真正模糊的案例占比走

最后一行是商业要点:审输出的成本绑在模型生成多少字上,这个数字会被模型选择推高;审决策的成本绑在业务本身有多模糊上,这个数字你能测,也能压。

同一屏里必须同时有这五样东西

少一样,复核人就退回去自己推答案。

  • 用系统语言写的动议。「通过发票 4471,金额 12880 元,记在成本中心 2103 下」一眼可判;三段说明「该发票看起来与采购订单一致」不行。
  • **规则的原文和位置。**判断来自供应商框架协议第 4.2 条,就让他看到第 4.2 条。
  • **两到四条证据,每条指向原文的精确位置。**点不进送货单那一行的复核人只能信任转述,那和模型出现之前一样。
  • **与上一次同类案例的差异。**数量涨了 40%、换了供应商、账期缩短,这类提示给复核人的经验一个着力点。
  • 反事实。「送货单若是 42 件而不是 24 件,这条就变成驳回。」它把复核人一周后就无视的置信度分数,换成一件具体要核的事。

这一屏底下,整次运行必须可重放:复核人问「它为什么这么说」时,答案应该是一键点进输入、版本和成本,而不是约一个写 prompt 的人开会。这套视图怎么落到实现里,让复核从几分钟压到一分钟内的决策视图设计里有完整清单;补装到一条已经在跑量的流程上,钱就是在这里花掉的。

复核人还要有三个出口——通过、改判断、带理由码驳回。自由文本的驳回框等于没有人驳回,而理由码是这套系统今后最有用的一份数据。

复核时间的算术,试点报告里从来不写

单件复核耗时几乎从不出现在试点报告里,而它才决定这门生意成不成立。下表是我的秒表数据,两个客户的队列,不是公开基准:当成问题的形状,签合同前先量你自己的队列。假设另写一条:一天 600 件,复核人每天按 7 小时有效工时计。

600 件/天的复核设计单件耗时每日复核工时需要多少人力
读完整输出,自己重建结论4 分钟40 小时约 5.7 个全职
决策视图,含规则与证据45 秒7.5 小时约 1.1 个全职
分层:70% 一键确认,30% 走决策视图10 秒 / 45 秒3.4 小时约 0.5 个全职

折成钱:一位复核人的全成本按每年 30 万元计,含薪资、社保和管理分摊,这是我在深圳见到的口径。250 个工作日乘 7 小时是 1750 小时,折下来约每小时 170 元。于是 5.7 个全职是每年约 170 万元的一条经常性支出,1.1 个全职 33 万元,0.5 个全职 15 万元。这道差距就是界面工作全部的回报,而且它比任何模型改进都先出现在预算表上。

两条要摆在 CFO 面前:这个省法假设量又大又稳,一天三十件时全都不成立,那就不该建;界面工作也不免费,一版能点进证据的视图是几周工程量。

哪些决定本来就不该过人的手

界面让剩下的复核变便宜,分层决定还剩多少复核要做。

层级特征处理方式
自动可逆、有规则、金额低、量大不进人工,按 1/50 抽样审计,留痕
确认有规则,但输入脏模型给动议,人一键确认,证据可见
决策不可逆、外部可见或超金额线完整决策视图,具名责任人,加第二读者

依据不是「模型有多自信」,而是三件事:动作能不能撤销、客户或监管会不会看见、有没有写下来的规则。规则不在背后的动作,置信度再高也不该进第一层:复核人没有东西判它,审计也没有东西查它。

回路会安静地失效

  • **橡皮图章。**只盯一个数:被后手复核或下游审计推翻的通过占多少。通过率长期高于 99%、一次都没被推翻,这套复核就是装饰。
  • **队列深度。**两百件待办时,判断比四十件时差。给队列设上限、轮岗;队列变长说明分层有缺陷。
  • **会腐烂的证据。**存储路径一改,指向源文档的链接就断。点过三次死链的人会停止点击,决策视图会悄悄退化成加了装饰的输出视图。
  • **只审简单的案例。**最省事的抽样是查高置信度那批,因为快。注意力该放在边界带上,反事实那一行就是为它准备的。

花钱之前先问四个问题

复核人在屏幕上看什么;按你预期的量,一件要几秒;多少比例落进完整决策层;通过之后谁来推翻它。第一个答案是「一份文档加一个聊天框」的话,这条系统就带了一条没有上限的人头支出,换模型不会改变它。人在回路真正的版本不是一个人检查机器,而是一台机器把一条决策、它的规则和它的证据摆出来,让人在一分钟之内裁定。预算里给界面留的位置应该和给模型的一样重,因为决定这是一条便宜流程还是一个新增部门的,是复核时间的算术。

继续阅读

更多「AI 系统架构」

准备构建一套系统?[ 预约会议 ]