跳到正文
深圳 · 大湾区 · 地球

企业已有的数据资产其实够用了,缺的是把业务副产品变成可查询资产的那份 schema

说自己没有数据的团队,通常只是没有 schema:数据一直躺在已经付费的系统里,把它整理成可查询资产是一次性投入。它不随业务量增长,也不会为每次提问重新付一遍。

6 分钟阅读1,383
AI EconomicsEnterprise暂无译文。

说“我们没有数据”的人,多半在说另外三件事

一位运营负责人告诉我,AI 落地上最大的障碍是没有数据。这句话按字面理解几乎从来不成立:四年的扫码记录和异常代码一直躺在他的仓储系统里,从没有人导出过。这家公司里,“数据”已经等于“仪表盘”:没有仪表盘,就没有数据,这个结论写进预算,代价是买一批本来不需要的数据。

企业已有的数据资产通常不是不够,是没被整理过。只有一种处境真缺数据,另外两种是别的问题:没有人标注过任务的样本,比如哪一张发票的科目后来被改过,这是 schema 问题;数据在,但没有谁有权决定谁可以读,这是需要法律负责人签字的治理决定。真正算缺失的,是流程本身没被记录——纸质单据、口头沟通、某个人的本地表格。

企业已有的数据资产通常已经够用:真正缺的是那份把运营副产品变成可查询资产的 schema,而 schema 是一次性成本,不随数据量或查询次数增长,也不必为每一次提问重新购买。

决策对象就此换掉:买数据集、招数据团队、等数据仓库立项,都在解决错误的问题。

你已经付过钱的系统里躺着什么

每一套系统都已采购、已备份,而且有人的工作依赖它准确——有人要对正确性负责的数据,才会被持续修正。

已经在用的系统里面可以直接用的东西成为资产之前缺什么
ERP 或财务系统发票、审批流、成本中心、过账日期科目后来被人工更正的那一行
工单或 ITSM工单正文、分类、处理人、时间戳修复有没有站住;重开记录没人建模
CRM客户历史、商机阶段、丢单原因同一家客户三种写法下的实体身份
邮件与文档库合同、补充协议、例外审批要用的条款被埋在正文里
通话录音与转写老员工怎么描述判断依据和绕开的做法说话人归属,通话结果的原因码
个人 Excel让流程跑起来的对账逻辑和本地规则归属、版本,离开这台电脑的路径

把第三列再看一遍:没有一行写“需要更多数据”。每一行要求的都是对身份、结果或结构做决定,这些决定属于 schema,做完一次就固定下来。

副产品与资产之间隔着六个属性

六个属性,一个下午就能审计完一份数据算不算资产。

实体身份稳定:一个真实对象对应一个主键,别名归并干净;事件时间落在同一个时区;状态迁移保留下来,“怎么走到这一步”通常比“最后停在哪”更值钱;有一个结果字段,哪怕很粗;有来源信息,让审阅的人能追回原系统;以及一条在写入第一个 embedding 之前就定好的访问边界。

身份这一条卡住的项目最多。我核过的一套账里,同一家中型供应商有十一种写法:三种带法律后缀,两种拼错,一个商号,五种尾部多了空格。在这件事解决之前,回答“我们在这家供应商身上花了多少”的模型都在回答假问题。归并它用了一个下午:和应付账款负责人过规则,写一个规则文件,再加四十条人工例外——这笔成本此后所有下游问题都在继承。

schema 要花多少钱,为什么说是一次性

两种成本性质不同。抽取和 embedding 是边际成本,且很小:供应商公开价目表上,一款主流小型 embedding 模型约每百万 token 零点零二美元(写这篇时的挂牌价),三百万 token 的历史文档(一家中型后台的规模)嵌入一次大约六美分。在这部分报出大数字的,定价定错了对象。

schema 是固定成本,由人做出来。我最近界定范围的三个项目里,这项工作落在八到十五个工作日:一个工程师,加过程负责人断断续续的时间——只有他知道例外在哪。按工程师全负荷每天九百美元算,一次性支出七千二百到一万三千五百美元。多数团队的替代方案是带指导委员会的数据平台立项,报价单位是季度。

成本项性质单个流程的典型量级
实体归并与 schema 定义一次性,人力8–15 天,工程师加过程负责人
抽取管道搭建一次性,工程3–5 天,之后无人值守
历史回填与 embedding一次性,边际API 成本从几美分到几十美元
刷新与监控经常性,很小每月几小时,随 schema 变更增长
业务变化后的重新标注经常性,偶发它不“永远免费”的诚实原因

代价也要说清楚:一次性指的是它不随数据量放大,也不是每次查询重新买一遍;不是指它永不改动——新增产品线、子公司或审批规则,schema 就要扩展。买的是能便宜吸收这些变化的底座,而不是每次重建。身份、结果、来源三类字段怎么落到具体列上,把运营副产品变成可查询资产的 schema 到底包含什么那篇(英文版)里有更细的拆解。

哪些数据应该主动排除在外

范围纪律决定一次性成本是不是真的只发生一次。写抽取代码前,我会先提三条排除:访问边界无法书面达成一致的,第一版不进来,后加比试点期间打官司便宜;决策用不到的个人数据,在抽取时就丢掉——存储之后再脱敏是承诺,不是控制;负责人说不清一行代表什么的那张表不建模,建在没人理解的字段上的 schema 只会高效地产出自信的错误答案。

捕获率只有六成、价值却依赖完整的数据,通常比没有数据更糟。

什么情况下确实需要新数据

有三种情况我会承认:决策靠口头完成、没有系统记录;要预测的结果从没被写下来过;决策依赖第三方掌握、对方不愿共享的信息——最后一种先是商业问题,然后才是技术问题。

这三种情况下的第一份交付物是埋点,不是模型:用九十天把决策和结果记下来,格式要小到做事的人愿意维护。它同时给你一份 schema 和一份数据集,比建在假设上的试点便宜一个量级。

批预算之前,先问清楚三件事

问 schema 是什么、谁拥有它、建起来要多少钱。如果没有人答得上来,被推销的其实是“一个模型加一批从未被整理过的数据”,失败会以模型效果差的形式出现,尽管问题从一开始就是身份和结果字段没定义。

schema 这份资产的寿命比这一季在用的模型长,它让同一职能里的第二条流程明显比第一条便宜。把预算留给无聊的那一半,拿六个属性审计一条真实流程,再用自己的数字做决定。多数自认数据贫乏的企业其实只是 schema 贫乏,后者好解决得多。

继续阅读

更多「AI 成本与回报」

准备构建一套系统?[ 预约会议 ]