数据治理

2026 对话式 BI 自建还是采购:TCO 全算账

对话式 BI 的「自建还是采购」,争议焦点早已不是「工程师能不能做出一个能聊营收的机器人」——多数团队可以——而是「三年之后,您自建的那套东西是否还正确、安全、有人维护」。这几乎没人诚实算过账。

关键数据: Gartner(2024)估计到 2025 年多数企业 AI 概念验证无法进入生产环境,维护负担是主要原因之一;IDC(2024)预计全球 AI 软件与基础设施支出将继续以两位数复合增长;2024–2025 年咨询实践中常见的行业基准认为,企业 AI 交付成本的 50%–70% 花在数据准备、集成与治理上,而非模型本身;Stack Overflow 开发者调查(2024)显示技术债仍是工程团队最大痛点之一——而自建分析平台正是技术债的温床。

问题变了,评估框架却没有

五年前,分析领域的自建与采购之争围绕仪表盘展开:打包工具能不能表达您的 KPI。到 2026 年,比较对象已经变成「答案引擎」——一个在企微群里接住销售总监自然语言提问,返回一个受治理、口径正确、带权限控制、可溯源数字的系统。这个重构推翻了旧直觉:仪表盘是视觉产物,答案引擎是决策基础设施。您比较的不是两个产品,而是两笔持续的责任。

大多数内部对比材料都有一个陷阱:拿厂商报价对比团队的首轮自建估算,然后就此打住。这两个数字通常都大致正确,也都不太相关。诚实的比较是三年 TCO,并且把失败模式算进去——而失败模式是不对称的。采购的平台不满意,合同到期换掉就是;自建半成品的平台不满意,最稀缺的人手已经投进去十八个月,此时承认失败的内部政治成本,通常远高于将就着维护它的技术成本。

「自建」到底包含什么:演示背后的完整技术栈

演示只要两周:把大模型 API 接到数据库 schema 上,贴几个示例问题,效果令人信服。而能在企业环境里活下来的平台至少有七个部件,每一个都是实打实的工程承诺:

  • Schema 与元数据层:精心维护的表和字段描述、关联路径、业务语境,让模型知道「GMV 不含已取消订单」。这不是一次性文档,而是随管道变化持续衰减的活资产。
  • 语义层:把营收、活跃客户、毛利率等指标口径统一定义一次,让每个答案都出自同一套受治理的计算。没有它,机器人每答一题就重新推导一次指标,迟早和财务汇报对不上。
  • 查询生成与执行路径:text-to-SQL 或语义 API 调用层,含方言处理、查询防护、超时与缓存。
  • 评测体系(eval harness):一套版本化的、含数百个真实业务问题与标准答案的题库,每次换模型或改提示词都跑一遍。这是最被低估的部件:没有它,您无法判断上周的模型升级是变好了还是悄悄变差了。
  • 权限与行级安全:答案引擎必须和数仓一样按提问者、按查询执行同一套数据权限。这里出错是数据泄露事故,不是一张 bug 单。
  • 审计与可观测性:每个问题、每条生成的 SQL、每个结果和纠错全部落日志——既为调优,也为第二年必然到来的合规对话。
  • 部署触面:接入企微、钉钉、飞书、Teams 或 WhatsApp——每个渠道各有认证流程、消息限额和管理后台。

两到四名资深工程师能把这套东西搭起来。而在数仓、业务口径、模型与 LLM 供应商都在持续变化的前提下让它一直保持正确,才是真正的工作,而且永无止境。

自建的隐性成本,逐项列清

压垮自建项目的都是经常性成本,因为它们占用的是组织最舍不得挪用的人才。

语义层是一个常设项目,不是一个项目。 和财务、业务一起把五十个指标口径定义清楚要开几个月的会;业务变化后持续维护口径,是一笔永续的税。跳过它的团队,上线的是一个数字会漂移的分析机器人——高管会上出现一次对不上的数,内部工具的信用就破产了,比任何技术故障都快。

评测体系决定您建的是资产还是负债。 2024–2025 年的行业经验一致表明:模型升级、提示词修改、schema 变更之后,回答准确率会以未被度量的方式退化。一套像样的评测题库启动要一个工程师月,之后持续维护。没有题库的团队靠轶事导航:CFO 发现一个错数,从此没人信这个工具。

安全评审是许多自建项目悄悄死掉的地方。 一个读数仓、写 SQL 的系统,要过应用安全、数据治理,往往还有渗透测试;金融、含租户个人信息的地产等受监管行业还要加模型风险评审。六个月的评审等待很常见,而且 rarely 出现在自建计划里。

维护是三条耦合的升级跑步机,不是一条。 LLM 供应商按自己的节奏弃用模型,数仓在换驱动和查询 API,IM 平台在改机器人接口。三者要同时有人负责,永久负责。

隐性成本首年实际投入第二至三年经常性典型失效症状
语义层与指标字典3–6 工程师月(含业务投入)0.5–1 FTE机器人数字与财务对不上
评测体系1–2 工程师月起步0.25–0.5 FTE升级后准确率悄悄漂移
安全与模型风险评审3–6 个月周期,0.5–1 FTE 投入会议每次大改重审上线拖延两个季度以上
IM 渠道集成每渠道 1–2 工程师月接口变更维护工具只活在一个群里
模型与平台升级不定合计 0.5–1 FTE没人敢升级模型
值班与故障响应普遍低估0.25–0.5 FTE静默错误答案、无告警

把中型自建项目的经常性一列加总,通常等于 2–3 个 FTE 永久投入,外加评审周期的机会成本。这才是「自建还是采购」材料里应该出现的数字——也是大多数材料省略的数字。

采购侧同样不是零风险

诚实要双向。采购对话式 BI 平台把工程负担转移出去的同时,也引入了四种需要在尽调时明确检验的风险:

  • 指标治理依赖。 如果厂商的语义层表达不了您的业务逻辑——经纪行怎么算净佣金收入、工厂怎么定义准时齐套——您要么接下一个配置工程,要么接受静默的口径错配。试点时请用您十个最难的真实问题去测,而不是厂商的十个演示问题。
  • 数据驻留与安全模型。 厂商的推理在哪里跑、日志记什么、架构是否要求您的数据离开租户边界?在大湾区和香港,跨境数据姿态是董事会级问题,不是 IT 细节。
  • 语义层带来的原厂锁定。 讽刺的是,让自建变贵的那个部件也让采购变「黏」:一旦指标字典以厂商格式存在,迁移就意味着重新定义与重新验证。缓解手段是合同化:要求以开放格式导出指标定义与查询日志。
  • 您无法控制的模型更替。 厂商会基于成本与能力替换底层模型。您的保护是它的评测纪律——要求查看,并问清模型变更影响您的答案之前有多少通知期。

2026 年的定价结构差异很大——按席位、按提问次数、按连接数——每种都会塑造不同的使用行为。按次计费惩罚驱动采纳的那种自由试验;包月式奖励重度使用,但采纳不及预期时价值会搁浅。请按您自己真实的问题量预测来建模,而不是按厂商的标杆客户。

一个可参照的三年 TCO 测算

下表测算一家中型企业:约 500 名实名用户、三个 IM 渠道、已有云数仓、数据团队 8–12 人。区间为基于 2024–2026 年行业基准的示意性估计,请按您的薪资带宽与厂商报价重新校准——对比的「形态」比精确数字更重要。

成本项(三年,美元)自建采购(平台)
工程建设(语义层、查询路径、评测、集成)45万–75万(2–4 FTE × 12–18 个月)含在实施中,3万–6万
实施服务5万–10万内部投入3万–6万
许可/基础设施/模型推理6万–15万15万–35万
稳态维护(第二至三年)40万–90万(2–3 FTE)5万–12万(0.25–0.5 FTE 管理)
安全、风险与合规8万–20万内部工时3万–8万(与厂商证明材料分摊)
重建/失败风险拨备15万–40万期望值成本0–6万(退出与续约工作量)
三年示意合计约 119 万–250 万约 29 万–73 万

对这张表的三条诚实脚注。第一,自建列区间很宽,因为范围蔓延是常态:多数自建项目从「一个团队的问题」长成「全公司都要用」,预算却没同步重谈。第二,采购列的前提是平台能表达您的指标;如果不能,配置成本上升,对比会收窄。第三,两列都没计入数据团队时间的机会价值:每花一个 FTE 维护内部答案引擎,就少一个 FTE 建需求预测模型。对多数 CDO 的记分卡而言,机会成本才是最大的那一行。

您真正在比较的基线:维持现状的成本

每一份「自建还是采购」的分析,都默认了一个未经审视的对手:现状。常规对比框架假设不上新平台的成本是零,而现实是,组织早已在为一条断掉的问题-答案链路持续付费。把这笔基线摆上台面,不仅改变算术,更改变会议室里谁支持变革。

维持现状的成本构成是可清点的。分析积压:超过一定规模的数据团队,实际上都在运营一个报表与取数请求的隐形工单队列,2024–2025 年的行业经验一致显示,分析师有 30%–50% 的时间耗在重复性临时请求上。仪表盘蔓延:大型企业动辄积累数千张报表却没有单一事实来源,其中相当一部分早已静默过期。影子分析:财务与运营人员在私有电子表格里维护着自建模型,用不受治理的数字回答本该受治理的问题——这是一笔没人列预算的审计风险。还有决策延迟:等了三周才拿到的流失分析,等到月末才能排上的定价复盘。这些都不会出现在传统 TCO 表的任何一列里,却往往是整页纸上最大的数字。

对话式 BI 的经济功能恰恰是缩短「业务提问」到「受治理答案」的路径,而 IM 原生形态在此关键:问题就在对话发生的地方提出——企微或 Teams 的群聊里——答案带着数据溯源在同一线程返回。每一个在群里被治理化回答的问题,都是一张从未进入积压队列的工单、一个从未诞生的表格。

于是诚实的重构是:正确的比较不是「自建成本对比许可成本」,而是「现状成本 + 选项一成本」对比「现状成本 + 选项二成本」。由于现状项两边相同,前一节的 TCO 表仍然决定选边——但现状数字决定这个项目值不值得立项。高管层应该要求把这笔账算出来:每季度工单量 × 平均处理工时 × 分析师全成本,再加上对决策延迟价值的保守估计。在我们服务的客户评估中,这个合计数超过自建或采购任一列数倍是常态。

决定第三年经济性的合同条款

采购侧的风险本质上是合同风险,因此谈判清单与产品评估同样重要。以下五条条款,区分了「可运转的三年关系」与「缓慢的人质处境」:

  • 定义与数据导出权。 语义层或指标定义、提问日志、评测数据集,必须能以文档化的非专有格式、无罚金地导出,并写入合同。仅这一条,就能把锁定从结构性问题降级为商业问题。
  • 模型变更通知。 模型变更影响您的答案前,提前 30 天书面通知,并附厂商基于您自有问题集的评测差异报告。您买的就是它的评测纪律——请检查。
  • 数据处理与驻留附表。 写明推理区域、明确「不用您的数据训练」条款、日志姿态留档。对大湾区企业,这是安全评审委员会真正会读的那一条。
  • 准确率救济。 2026 年真正的准确率 SLA 仍然罕见——但厂商被问及此事时的反应,暴露它的成熟度。回答「我们公布准确率基准,并给您题库自行验证」的厂商,和回答「AI 本来就是概率性的」的厂商,是两种完全不同的交易对手。
  • 退出条款。 过渡协助、明确的数据删除时限与证明、一年期退出期的价格表。签约时谈退出条款不花一分钱;续约时再谈,谈判筹码已经易手。

先试点、后签约,因为试点期是您的筹码窗口:之后筹码翻向厂商。坚持试点使用真实数据、真实权限模型,按前文的十问测试执行,成功标准在启动前书面确认。

自建路线也需要对应的「合同」:一份内部章程。指定唯一产品负责人,把永久维护经费单独列支而不是挤占团队善意,并写明 sunset 条件——什么情况下退役自建改为采购。内部平台很少死于糟糕代码,几乎都死于权属涣散:所有人都在用,没人对它的正确性负责。

按数据团队规模给出决策建议

正确答案与您数据组织的规模和授权的相关性,远高于与预算的相关性。

  • 10 人以下数据团队(分析与工程合计、服务全公司):采购,几乎无条件。自建会吃掉您 20%–30% 的全部产能,去做不构成差异化的基础设施。您的差异化是指标口径和它支撑的决策——管道买来的,口径要自己的,并坚持可导出。
  • 10–40 人、有平台职能的数据团队:混合模式。采购对话层与 IM 原生部署;省下的工程产能投入严谨的内部语义层与评测实践。谈判时争取自带语义定义或指标存储的权利。2026 年拥有真正数据组织的企业,多数落在这里。
  • 40 人以上、有监管约束、特殊数据驻留需求或真正新颖的问题类型:自建可以成立,但要诚实地限定范围——只在打包产品确实做不到的领域自建答案引擎,其余全部采购。并且把维护线按一个永久产品团队来预算,因为它就是。

有一个决策测试能穿透所有 PPT:选出上季度十个最难的真实问题——涉及口径边界、权限细节、跨域关联的那种。让它们跑一遍厂商试点,再让团队给出自建方案的最优内部估算。比较的不只是正确率,还有耗时和动用的人数。在我们的部署经验里,这十个问题对三年结局的预测力,超过任何电子表格。

一个真正跑得完的 30 天决策流程

把评估压缩到四周,避免让这类决策死于六个月的委员会漂移。第一周:盘点真正重要的问题——拉取真实查询日志或热门报表需求,聚类成问题族,与财务一起敲定指标口径表。第二周:在您真实的 IM 环境、真实的权限配置下跑厂商试点,对正确率、权限行为与响应延迟打分。第三周:按上文的测算模板、用您自己的薪资带宽,做出诚实的 TCO,并同时呈给 CIO、CFO 与安全负责人——不要逐个排队。第四周:决策,并撰写决策备忘录,写明所选路径的退出条件。备忘录很重要:把「什么情况下我们会推翻这个决定」写下来的团队,在续约时决策更冷静;而写退出条件的过程,会迫使锁定问题在您还有谈判筹码时浮出水面。

常见问题

对中型企业,可信的三年全成本估计在 120 万–250 万美元:45 万–75 万的首轮工程建设,外加 2–3 个 FTE 的永久维护,覆盖语义层、评测体系、安全复审,以及 LLM、数仓、IM 平台三条升级线。演示很便宜,经常性责任才是成本。
四个:厂商语义层表达不了您的指标逻辑时的口径依赖;数据驻留与日志姿态——在大湾区这是董事会级议题;指标定义存于厂商格式导致的锁定,可用合同导出权缓解;以及您无法控制的模型更替,靠审查厂商的评测纪律来对冲。
取上季度十个最难的真实业务问题——涉及口径边界、权限细节、跨域关联——在您真实 IM 环境、真实用户权限下跑试点,对正确性、权限遵从与延迟打分。这比功能清单或演示问题集对三年满意度的预测力强得多。
主要是 40 人以上数据团队、面临打包产品无法满足的监管或数据驻留约束,或问题类型市场确实没人服务的组织。即便如此,也应把自建范围严格限定在打包产品确实失效的领域,按永久产品团队预算,其余全部采购。
预约个性化演示

准备好让数据变得可审计了吗?

了解 Beehive Strategy 的对话式治理平台,如何把目录与血缘变成你的团队能用自然语言查询的答案。

预约演示 探索解决方案
30%
审计准备更快
25%
事件成本更低
40%
修复时间更短
2 周
上线一个目录