對話式 BI 的「自建還是採購」,爭議焦點早已不是「工程師能不能做出一個能聊營收的機器人」——多數團隊可以——而是「三年之後,您自建的那套東西是否還正確、安全、有人維護」。這幾乎沒人誠實算過賬。
問題變了,評估框架卻沒有
五年前,分析領域的自建與採購之爭圍繞儀表盤展開:打包工具能不能表達您的 KPI。到 2026 年,比較物件已經變成「答案引擎」——一個在企微群裡接住銷售總監自然語言提問,返回一個受治理、口徑正確、帶許可權控制、可溯源數字的系統。這個重構推翻了舊直覺:儀表盤是視覺產物,答案引擎是決策基礎設施。您比較的不是兩個產品,而是兩筆持續的責任。
大多數內部對比材料都有一個陷阱:拿廠商報價對比團隊的首輪自建估算,然後就此打住。這兩個數字通常都大致正確,也都不太相關。誠實的比較是三年 TCO,並且把失敗模式算進去——而失敗模式是不對稱的。採購的平臺不滿意,合同到期換掉就是;自建半成品的平臺不滿意,最稀缺的人手已經投進去十八個月,此時承認失敗的內部政治成本,通常遠高於將就著維護它的技術成本。
「自建」到底包含什麼:演示背後的完整技術棧
演示只要兩週:把大模型 API 接到資料庫 schema 上,貼幾個示例問題,效果令人信服。而能在企業環境裡活下來的平臺至少有七個部件,每一個都是實打實的工程承諾:
- Schema 與後設資料層:精心維護的表和欄位描述、關聯路徑、業務語境,讓模型知道「GMV 不含已取消訂單」。這不是一次性文件,而是隨管道變化持續衰減的活資產。
- 語義層:把營收、活躍客戶、毛利率等指標口徑統一定義一次,讓每個答案都出自同一套受治理的計算。沒有它,機器人每答一題就重新推導一次指標,遲早和財務彙報對不上。
- 查詢生成與執行路徑:text-to-SQL 或語義 API 呼叫層,含方言處理、查詢防護、超時與快取。
- 評測體系(eval harness):一套版本化的、含數百個真實業務問題與標準答案的題庫,每次換模型或改提示詞都跑一遍。這是最被低估的部件:沒有它,您無法判斷上週的模型升級是變好了還是悄悄變差了。
- 許可權與行級安全:答案引擎必須和數倉一樣按提問者、按查詢執行同一套資料許可權。這裡出錯是資料洩露事故,不是一張 bug 單。
- 審計與可觀測性:每個問題、每條生成的 SQL、每個結果和糾錯全部落日誌——既為調優,也為第二年必然到來的合規對話。
- 部署觸面:接入企微、釘釘、飛書、Teams 或 WhatsApp——每個渠道各有認證流程、訊息限額和管理後臺。
兩到四名資深工程師能把這套東西搭起來。而在數倉、業務口徑、模型與 LLM 供應商都在持續變化的前提下讓它一直保持正確,才是真正的工作,而且永無止境。
自建的隱性成本,逐項列清
壓垮自建專案的都是經常性成本,因為它們佔用的是組織最捨不得挪用的人才。
語義層是一個常設專案,不是一個專案。 和財務、業務一起把五十個指標口徑定義清楚要開幾個月的會;業務變化後持續維護口徑,是一筆永續的稅。跳過它的團隊,上線的是一個數字會漂移的分析機器人——高管會上出現一次對不上的數,內部工具的信用就破產了,比任何技術故障都快。
評測體系決定您建的是資產還是負債。 2024–2025 年的行業經驗一致表明:模型升級、提示詞修改、schema 變更之後,回答準確率會以未被度量的方式退化。一套像樣的評測題庫啟動要一個工程師月,之後持續維護。沒有題庫的團隊靠軼事導航:CFO 發現一個錯數,從此沒人信這個工具。
安全評審是許多自建專案悄悄死掉的地方。 一個讀數倉、寫 SQL 的系統,要過應用安全、資料治理,往往還有滲透測試;金融、含租戶個人資訊的地產等受監管行業還要加模型風險評審。六個月的評審等待很常見,而且 rarely 出現在自建計劃裡。
維護是三條耦合的升級跑步機,不是一條。 LLM 供應商按自己的節奏棄用模型,數倉在換驅動和查詢 API,IM 平臺在改機器人介面。三者要同時有人負責,永久負責。
| 隱性成本 | 首年實際投入 | 第二至三年經常性 | 典型失效症狀 |
|---|---|---|---|
| 語義層與指標字典 | 3–6 工程師月(含業務投入) | 0.5–1 FTE | 機器人數字與財務對不上 |
| 評測體系 | 1–2 工程師月起步 | 0.25–0.5 FTE | 升級後準確率悄悄漂移 |
| 安全與模型風險評審 | 3–6 個月週期,0.5–1 FTE 投入會議 | 每次大改重審 | 上線拖延兩個季度以上 |
| IM 渠道整合 | 每渠道 1–2 工程師月 | 介面變更維護 | 工具只活在一個群裡 |
| 模型與平臺升級 | 不定 | 合計 0.5–1 FTE | 沒人敢升級模型 |
| 值班與故障響應 | 普遍低估 | 0.25–0.5 FTE | 靜默錯誤答案、無告警 |
把中型自建專案的經常性一列加總,通常等於 2–3 個 FTE 永久投入,外加評審週期的機會成本。這才是「自建還是採購」材料裡應該出現的數字——也是大多數材料省略的數字。
採購側同樣不是零風險
誠實要雙向。採購對話式 BI 平臺把工程負擔轉移出去的同時,也引入了四種需要在盡調時明確檢驗的風險:
- 指標治理依賴。 如果廠商的語義層表達不了您的業務邏輯——經紀行怎麼算淨佣金收入、工廠怎麼定義準時齊套——您要麼接下一個配置工程,要麼接受靜默的口徑錯配。試點時請用您十個最難的真實問題去測,而不是廠商的十個演示問題。
- 資料駐留與安全模型。 廠商的推理在哪裡跑、日誌記什麼、架構是否要求您的資料離開租戶邊界?在大灣區和香港,跨境資料姿態是董事會級問題,不是 IT 細節。
- 語義層帶來的原廠鎖定。 諷刺的是,讓自建變貴的那個部件也讓採購變「黏」:一旦指標字典以廠商格式存在,遷移就意味著重新定義與重新驗證。緩解手段是合同化:要求以開放格式匯出指標定義與查詢日誌。
- 您無法控制的模型更替。 廠商會基於成本與能力替換底層模型。您的保護是它的評測紀律——要求檢視,並問清模型變更影響您的答案之前有多少通知期。
2026 年的定價結構差異很大——按席位、按提問次數、按連線數——每種都會塑造不同的使用行為。按次計費懲罰驅動採納的那種自由試驗;包月式獎勵重度使用,但採納不及預期時價值會擱淺。請按您自己真實的問題量預測來建模,而不是按廠商的標杆客戶。
一個可參照的三年 TCO 測算
下表測算一家中型企業:約 500 名實名使用者、三個 IM 渠道、已有云數倉、資料團隊 8–12 人。區間為基於 2024–2026 年行業基準的示意性估計,請按您的薪資頻寬與廠商報價重新校準——對比的「形態」比精確數字更重要。
| 成本項(三年,美元) | 自建 | 採購(平臺) |
|---|---|---|
| 工程建設(語義層、查詢路徑、評測、整合) | 45萬–75萬(2–4 FTE × 12–18 個月) | 含在實施中,3萬–6萬 |
| 實施服務 | 5萬–10萬內部投入 | 3萬–6萬 |
| 許可/基礎設施/模型推理 | 6萬–15萬 | 15萬–35萬 |
| 穩態維護(第二至三年) | 40萬–90萬(2–3 FTE) | 5萬–12萬(0.25–0.5 FTE 管理) |
| 安全、風險與合規 | 8萬–20萬內部工時 | 3萬–8萬(與廠商證明材料分攤) |
| 重建/失敗風險撥備 | 15萬–40萬期望值成本 | 0–6萬(退出與續約工作量) |
| 三年示意合計 | 約 119 萬–250 萬 | 約 29 萬–73 萬 |
對這張表的三條誠實腳註。第一,自建列區間很寬,因為範圍蔓延是常態:多數自建專案從「一個團隊的問題」長成「全公司都要用」,預算卻沒同步重談。第二,採購列的前提是平臺能表達您的指標;如果不能,配置成本上升,對比會收窄。第三,兩列都沒計入資料團隊時間的機會價值:每花一個 FTE 維護內部答案引擎,就少一個 FTE 建需求預測模型。對多數 CDO 的記分卡而言,機會成本才是最大的那一行。
您真正在比較的基線:維持現狀的成本
每一份「自建還是採購」的分析,都預設了一個未經審視的對手:現狀。常規對比框架假設不上新平臺的成本是零,而現實是,組織早已在為一條斷掉的問題-答案鏈路持續付費。把這筆基線擺上檯面,不僅改變算術,更改變會議室裡誰支援變革。
維持現狀的成本構成是可清點的。分析積壓:超過一定規模的資料團隊,實際上都在運營一個報表與取數請求的隱形工單佇列,2024–2025 年的行業經驗一致顯示,分析師有 30%–50% 的時間耗在重複性臨時請求上。儀表盤蔓延:大型企業動輒積累數千張報表卻沒有單一事實來源,其中相當一部分早已靜默過期。影子分析:財務與運營人員在私有電子表格裡維護著自建模型,用不受治理的數字回答本該受治理的問題——這是一筆沒人列預算的審計風險。還有決策延遲:等了三週才拿到的流失分析,等到月末才能排上的定價覆盤。這些都不會出現在傳統 TCO 表的任何一列裡,卻往往是整頁紙上最大的數字。
對話式 BI 的經濟功能恰恰是縮短「業務提問」到「受治理答案」的路徑,而 IM 原生形態在此關鍵:問題就在對話發生的地方提出——企微或 Teams 的群聊裡——答案帶著資料溯源在同一執行緒返回。每一個在群裡被治理化回答的問題,都是一張從未進入積壓佇列的工單、一個從未誕生的表格。
於是誠實的重構是:正確的比較不是「自建成本對比許可成本」,而是「現狀成本 + 選項一成本」對比「現狀成本 + 選項二成本」。由於現狀項兩邊相同,前一節的 TCO 表仍然決定選邊——但現狀數字決定這個專案值不值得立項。高管層應該要求把這筆賬算出來:每季度工單量 × 平均處理工時 × 分析師全成本,再加上對決策延遲價值的保守估計。在我們服務的客戶評估中,這個合計數超過自建或採購任一列數倍是常態。
決定第三年經濟性的合同條款
採購側的風險本質上是合同風險,因此談判清單與產品評估同樣重要。以下五條條款,區分了「可運轉的三年關係」與「緩慢的人質處境」:
- 定義與資料匯出權。 語義層或指標定義、提問日誌、評測資料集,必須能以文件化的非專有格式、無罰金地匯出,並寫入合同。僅這一條,就能把鎖定從結構性問題降級為商業問題。
- 模型變更通知。 模型變更影響您的答案前,提前 30 天書面通知,並附廠商基於您自有問題集的評測差異報告。您買的就是它的評測紀律——請檢查。
- 資料處理與駐留附表。 寫明推理區域、明確「不用您的資料訓練」條款、日誌姿態留檔。對大灣區企業,這是安全評審委員會真正會讀的那一條。
- 準確率救濟。 2026 年真正的準確率 SLA 仍然罕見——但廠商被問及此事時的反應,暴露它的成熟度。回答「我們公佈準確率基準,並給您題庫自行驗證」的廠商,和回答「AI 本來就是機率性的」的廠商,是兩種完全不同的交易對手。
- 退出條款。 過渡協助、明確的資料刪除時限與證明、一年期退出期的價格表。簽約時談退出條款不花一分錢;續約時再談,談判籌碼已經易手。
先試點、後簽約,因為試點期是您的籌碼視窗:之後籌碼翻向廠商。堅持試點使用真實資料、真實許可權模型,按前文的十問測試執行,成功標準在啟動前書面確認。
自建路線也需要對應的「合同」:一份內部章程。指定唯一產品負責人,把永久維護經費單獨列支而不是擠佔團隊善意,並寫明 sunset 條件——什麼情況下退役自建改為採購。內部平臺很少死於糟糕程式碼,幾乎都死於權屬渙散:所有人都在用,沒人對它的正確性負責。
按資料團隊規模給出決策建議
正確答案與您資料組織的規模和授權的相關性,遠高於與預算的相關性。
- 10 人以下資料團隊(分析與工程合計、服務全公司):採購,幾乎無條件。自建會吃掉您 20%–30% 的全部產能,去做不構成差異化的基礎設施。您的差異化是指標口徑和它支撐的決策——管道買來的,口徑要自己的,並堅持可匯出。
- 10–40 人、有平臺職能的資料團隊:混合模式。採購對話層與 IM 原生部署;省下的工程產能投入嚴謹的內部語義層與評測實踐。談判時爭取自帶語義定義或指標儲存的權利。2026 年擁有真正資料組織的企業,多數落在這裡。
- 40 人以上、有監管約束、特殊資料駐留需求或真正新穎的問題型別:自建可以成立,但要誠實地限定範圍——只在打包產品確實做不到的領域自建答案引擎,其餘全部採購。並且把維護線按一個永久產品團隊來預算,因為它就是。
有一個決策測試能穿透所有 PPT:選出上季度十個最難的真實問題——涉及口徑邊界、許可權細節、跨域關聯的那種。讓它們跑一遍廠商試點,再讓團隊給出自建方案的最優內部估算。比較的不只是正確率,還有耗時和動用的人數。在我們的部署經驗裡,這十個問題對三年結局的預測力,超過任何電子表格。
一個真正跑得完的 30 天決策流程
把評估壓縮到四周,避免讓這類決策死於六個月的委員會漂移。第一週:盤點真正重要的問題——拉取真實查詢日誌或熱門報表需求,聚類成問題族,與財務一起敲定指標口徑表。第二週:在您真實的 IM 環境、真實的許可權配置下跑廠商試點,對正確率、許可權行為與響應延遲打分。第三週:按上文的測算模板、用您自己的薪資頻寬,做出誠實的 TCO,並同時呈給 CIO、CFO 與安全負責人——不要逐個排隊。第四周:決策,並撰寫決策備忘錄,寫明所選路徑的退出條件。備忘錄很重要:把「什麼情況下我們會推翻這個決定」寫下來的團隊,在續約時決策更冷靜;而寫退出條件的過程,會迫使鎖定問題在您還有談判籌碼時浮出水面。