生成式 AI 進入企業預算表已經兩年多,判斷一家中國企業 AI 成熟度的最可靠訊號,不是釋出會上的宏大敘事,而是員工究竟在哪兒用這項技術——答案是:就在他們每天泡著的那個聊天視窗裡。
2026 年年中,中國企業 AI 落地到底走到了哪一步
撥開釋出會的喧囂,2026 年中國企業 AI 落地的圖景,在各家分析機構、廠商披露和一線從業者的反饋中高度一致。McKinsey 歷年的 State of AI 調研(2024、2025 版)發現:在某個區域性環節使用生成式 AI 的組織比例持續攀升,但真正把 AI 推廣到多個業務部門、產生全域性影響的企業,全球佔比仍是個位數百分比。中國走的也是這條 S 曲線,只是擴散通道不一樣。
在北美和歐洲,企業 AI 主要是從辦公套件長出來的——文件助手、表格助手、郵箱助手、程式碼助手。而在中國,對應的陣地是企業 IM。企業微信、釘釘、飛書不是「附加在工作上的聊天工具」,而是審批、彙報、客戶溝通、跨部門協作本來就在發生的操作層。IDC(2025)預測中國 AI 支出增速顯著高於全球均值,其中相當一部分增量,正被這些協同平臺及其低程式碼、小程式、第三方聯結器生態所吸收。
截至 2026 年 9 月,有三個方向明確、已成共識的趨勢:
- 對話式介面成為非技術人員的預設入口。 高管和一線管理者大體上跳過了 BI 看板時代——他們從沒養成登入分析門戶的習慣,指望他們改變的廠商都失望了。聊天視窗反轉了漏斗:不再是把人拉到資料面前,而是資料主動回答提問的人。
- 開源權重模型改寫了「自建還是採購」的爭論。 自 2025 年 1 月 DeepSeek-R1 釋出以來,Qwen、GLM 等開源權重模型家族持續迭代,斯坦福 AI Index(2025)記錄了開源與閉源模型效能差距的收窄。對擁有私有資料和合規約束的企業來說,在私有云或本地部署一個能力過硬的開源模型,已經從「少數派玩法」變成常規選項。
- 「試點到生產」的鴻溝仍是第一殺手。 2026 年死掉的 AI 試點,多數死於資料準備不足、許可權設計缺位和變革管理失敗,而不是模型能力不夠。這不是中國特有的問題——這是全球共性——但在中國落地時表現為幾個具體的摩擦點:內部系統碎片化、集團資料煙囪、以及 IT 部門對任何觸碰客戶資料的東西都持保守態度。
第四個趨勢值得單獨一節來講,因為在我們的一線實踐中,它的影響最為深遠:資料分析不再是一個「要去的地方」,而是變成了「送到嘴邊的回答」。
IM 原生化:資料分析搬進了企業微信
我們在香港和大灣區客戶中觀察到的最核心的落地模式,不是某個新模型、新智慧體框架或新看板,而是一次「位置遷移」:對資料提問這件事,現在發生在企業微信裡——就在區域銷售總監問昨天動銷率、門店店長上報缺貨、CFO 過目本週資金頭寸的同一個會話執行緒裡。
技術細節反而不重要,重要的是行為結果。當回答一個資料問題需要開啟電腦、找到對應看板、回憶每個篩選器是什麼意思時,使用率會卡在授權席位的零頭。而當它只需要在本來就開著的群聊裡打一句話——「上週華南退貨率多少,跟八月比呢」——幾秒內收到一張帶正確數字的圖,使用就會在沒有任何內部通知的情況下自然擴散。在我們的部署經驗中,同樣的使用者盤子,IM 原生對話式分析與門戶式 BI 的使用量差距,常常以數量級計。行業普遍估計,傳統 BI 部署中活躍席位的佔比不足 20–30%;IM 原生渠道的設計目標,正是打破這個天花板。
決定 BI 能否推廣的從來不是「看板做得多好」,而是「從一個問題到一個答案之間隔著幾次點選」。
為什麼這個模式率先在中國成型?三個結構性原因:
- 企業 IM 滲透率接近全覆蓋。 騰訊披露企業微信服務企業以千萬計、觸達使用者以億計;阿里釘釘、位元組飛書也公開過同量級資料。西方市場沒有任何一個協同平臺能在企業內部擁有這樣的覆蓋度,還同時接入供應商、經銷商、加盟商都在用的微信消費級身份網路。
- 生態開放是制度設計,不是偶然。 三大平臺都提供完善的 API 和機器人框架。一個在群聊裡回答問題、發圖表的機器人是一等公民,而不是爬頁面的旁門左道。這正是 MCP(模型上下文協議)類整合得以落地的前提:一個治理良好的聯結器可以坐在群聊和資料倉儲之間,執行許可權控制、記錄每一次查詢、把業務語言翻譯成受治理的 SQL。
- 一線工作天然是移動優先的。 零售督導、物業經理、產線主管從來不是桌面 BI 的使用者。IM 渠道直接出現在他們本來就用來幹活的裝置上——而資料驅動決策的「最後一公里」恰恰在這裡。
治理層面的含義是實打實的,沒有商量餘地。把分析能力搬進聊天層卻不做許可權架構,等於架起一臺資料洩漏機器:群聊本身就是一個分享面。我們落地的成熟做法,是把每一次查詢都繫結到提問者的身份和角色——店長只看自己的門店,區域總監只看自己的區域,誰也別想「問」出別人的數字。這正是語義層和查詢治理層的價值所在,也是為什麼「直接把大模型接到資料庫上」至今仍是我們被請去評審的方案裡最常見、也最危險的偷懶捷徑。
國產模型生態:對採購方到底意味著什麼
2026 年的第二個結構性故事,是國產大模型生態成熟為真正的買方市場。2023 年企業選國產大模型時,可選面窄、能力差距明顯;到 2025 年末和 2026 年,賽道已經空前擁擠——DeepSeek、阿里 Qwen 家族、智譜 GLM、月之暗面 Kimi、位元組豆包、MiniMax 等——而且至少在企業真正跑的那類工作負載上,與海外前沿模型的差距已經小到對多數場景無感。斯坦福 AI Index(2025)對此有系統記錄,其中開源權重模型的進步速度最快。
對採購方而言,有四個直接影響:
| 採購維度 | 2023–2024 的現實 | 2026 的現實 | 實際含義 |
|---|---|---|---|
| 模型能力 | 與前沿模型差距明顯 | 推理、SQL、中文任務差距收窄 | 模型不再是瓶頸,資料準備才是 |
| 部署方式 | API 優先,私有化選項有限 | DeepSeek、Qwen、GLM 等開源家族支援私有 VPC 或本地部署 | 受監管行業可以把資料留在自己手裡 |
| 成本曲線 | 高且波動 | 斯坦福 AI Index(2025)記錄推理成本陡降 | 試點失敗的代價下降,但「停在試點」的藉口也消失了 |
| 供應商鎖定 | 顯著 | API 可移植性改善,開源權重提供退出通道 | 籤合同時就按 12–18 個月內換模型來談 |
開源權重這一步尤其值得強調,因為它改變了採購邏輯。當一個能力過硬的模型權重可以下載、可以在您自己的 VPC 裡跑,模型層就變成了大宗商品:用您自己的評測集打分、按季度複測、出現更好的就換。真正沒有商品化——價值持續沉澱——的是模型周圍的 everything else:編碼了貴司指標定義的語義層、許可權模型、能攔住迴歸的評測體系,以及您的人本來就在用的整合入口。
我們建議客戶把模型選型當成一個 12–18 個月的決定,而不是終身大事。具體做法:從真實業務問題和真實業務黑話中提煉 100–200 道帶標準答案的題,構建私有評測集;每個季度用它給候選模型打分;讓應用層和模型廠商之間的抽象足夠薄,換模型只是改配置,而不是立項。
這對工具選型意味著什麼
推論是:評估對話式分析廠商時,「你們用哪個模型」已經不該是第一個問題。該問的是:原生支援哪些 IM 平臺;查詢時如何執行許可權;業務黑話如何對映到表結構(語義層);在您的資料上實測準確率是多少(而不是公開榜單);模型答錯時有沒有可回溯的引用鏈。這五問答不利落的廠商,賣給您的是 Demo,不是交付。
從副駕到智慧體:部署的真實差距
2026 年的第三個故事,是智慧體(Agent)進入企業工作流——以及智慧體 Demo 與智慧體部署之間的鴻溝。行業共識已經從「副駕建議、人來執行」走向「智慧體在監督下規劃並執行多步任務」。Gartner(2025)對智慧體 AI 的採用意向給出了激進的增長預測;但同一週期的分析師評論也指出,真正把智慧體放進生產環境、幹成實際工作的組織仍是少數。
在我們的一線經驗裡,隔開這兩者的幾乎從來不是模型能力,而是四件不性感的事:
- 帶真實許可權的工具接入。 能回答問題的智慧體,必須被允許以行級、列級許可權去觸碰答案所在的系統——數倉、CRM、ERP。絕大多數企業的許可權模型當初並不是為非人類主體設計的,補這一課是每個部署裡最慢的一步。
- 確定性的評測體系。 「Demo 裡好好的,第三週壞了」是最典型的失敗劇本。能跑通長久的團隊把智慧體行為當軟體管:版本化的評測集、每次改提示詞或換模型都跑回歸、準確率漂移有告警。
- 失敗兜底。 成熟的部署先約束智慧體「能做什麼」(先只讀;下單、調價這類寫操作等幾個月再說)和「能看什麼」(繫結身份的行級安全)。智慧體在治理圍欄內活動,而不是揣著整個大樓的鑰匙。
- 人工升級路徑。 我們知道的每一個生產級智慧體都有明確的交接設計:置信度低或問題超綱時,明說,然後轉給真人。這個設計的成本幾乎為零;沒有它的成本,是一條錯誤答案在四十人的群裡刷完存在感、信任清零。
IM 場景把這四點都放大了。跑在企業微信裡的對話式智慧體,直面所有員工的口語、錯別字和連環追問,遠比精裝修的 Web 應用「髒」。但它也能拿到 Web 應用永遠拿不到的東西:整個群的對話上下文——哪些問題反覆出現、哪些數字總被質疑、真實工作流在哪裡。系統性挖掘智慧體查詢日誌的團隊,等於在給自己的分析職能做持續的需求調研。日誌就是需求文件。
資料棧 implications:語義層與治理
在 IM 原生化浪潮和智慧體浪潮底下,還有一場更安靜的技術遷移,值得 CDO 們顯式規劃。自然語言查詢加業務使用者這個組合,把語義層——業務術語與物理表結構之間的受治理對映——從「錦上添花」推成了關鍵基礎設施。
原因很簡單,是道算術題。把大模型直接懟到一張 400 張表的數倉上,它會對著正確性遠低於其自信程度的 SQL 源源不斷地輸出。業務語言天然多義:「銷售額」可能指 GMV、淨收入或者已確認收入,取決於誰在問;「活躍客戶」在多數公司有五種定義。語義層的價值就是在模型看到問題之前把歧義解決掉:把模型的任務從「對著陌生表結構寫出正確的 SQL」降級為「把一個已消歧的問題翻譯成基於已知定義的受治理查詢」。在我們自己的部署裡,這一層是真實企業資料上 60–70% 可用回答與 90%+ 之間的差別——這與業界公開報告的方向性發現一致,也是每一家嚴肅的對話式 BI 廠商都把語義對映和查詢治理做成一等元件的原因。
第二個影響:許可權從報表層前移到了查詢層。當所有人都透過同一個聊天入口提問,查詢引擎必須在執行時強制繫結身份的訪問控制——誰在問、什麼角色、哪些行。事後報表許可權在這種架構下形同虛設。第一批 IM 原生推廣中搞錯這件事的企業,通常收穫一次令人印象深刻的資料洩漏,然後收到一紙「全部下線」的高管令。查詢時治理要在上線前做預算,而不是在事故後。
| 層級 | 傳統 BI 棧 | IM 原生對話式棧 | 實際變化 |
|---|---|---|---|
| 介面 | 門戶、看板、定時郵件 | 企業微信 / 釘釘 / 飛書群聊與單聊機器人 | 使用從每週「看」變成每天「問」 |
| 查詢引擎 | 報表裡的固定 SQL;BI 工具內的語義模型 | NL → 語義層 + LLM → 受治理 SQL | 業務使用者不寫篩選條件;治理前移到查詢時 |
| 訪問控制 | 報表與目錄許可權 | 每次查詢執行繫結身份的行/列級安全 | 一次洩漏足以終結整個專案,必須先設計 |
| 質量控制 | 釋出前的看板驗收 | 版本化評測集、迴歸測試、準確率監控 | 評測從一次性門禁變成持續過程 |
| 推廣動力 | 培訓會和行政要求 | 零培訓的聊天行為、群內網路效應 | 推廣週期從季度級壓縮到天級 |
香港企業能從內地模式學到什麼
香港企業觀察內地落地模式時,最關心的問題是:哪些能照搬?在零售連鎖、金融服務、物業管理和製造業兩條線都有部署經驗之後,我們的回答是:打法幾乎完全可以遷移,節奏預期和平臺選擇不能。
- IM 原生邏輯放之四海皆準,只是平臺不同。 在香港,同樣的模式更多跑在 WhatsApp 和 Teams 上,而不是企業微信——貿易公司和消費品牌與供應商、渠道夥伴的日常就在 WhatsApp 群裡;跨國企業則統一在 Teams。架構模式(聊天與數倉之間的 MCP 式受治理聯結器)與平臺無關。選您的人已經在用的那塊陣地,別讓他們搬家。
- 只要治理前置,內地式的速度在香港同樣做得到。 我們能在兩週內完成一個香港企業級部署,恰恰是因為許可權設計、語義對映和評測體系被當作核心工作流,而不是事後補丁。第一個月還在爭論選哪個模型的團隊,第一個月什麼都沒做出來,最後得出了和別人一樣的結論。
- 資料準備度始終是硬約束。 內地跑得快的企業,往往先做完了那些不光彩的功課:有一個作為唯一事實來源的數倉或湖倉、有人對指標定義負責、IT 治理能在有條件下說「可以」。這不是技術差距,是組織差距——在香港一模一樣。
- 兩地監管姿態不同,設計應對相同。 內地的資料安全與個保法框架,和香港的 PDPO,方向一致:敏感資料留在自己控制範圍內、記錄每一次訪問、執行最小許可權。自有 VPC 裡跑開源權重模型同時滿足兩邊,這也是它成為我們金融、地產客戶預設選項的原因之一。
關於時機的判斷。讀完內地案例,最容易產生的錯覺是「視窗正在關閉」。證據恰恰相反。McKinsey(2025)仍然發現全球大多陣列織未實現全企業級 AI 影響;在我們客戶群裡持續兌現損益效應的,是那些 12–18 個月前就帶著剋制的、治理良好的用例起步、然後持續複利的公司。今天用一個有紀律的試點起步,好過兩年前用一個失控的大專案起步。
給持懷疑態度 CIO 的 90 天行動清單
對正在決定「要不要做、怎麼做」的香港或大灣區企業,行之有效的模式可以塞進一個季度:
- 第 1–2 周:選一類高頻問題,而不是一個宏大主題。 不是「零售 AI」,而是「區域總監每天在運營群裡問的、分門店的昨日動銷」。一類問題意味著一套語義對映、一個評測集、一條可度量的準確率紅線。
- 第 2–4 周:搭受治理的聯結器。 先對相關的 20–50 張表做語義層(不是整個數倉),許可權對映到組織架構、繫結身份,開啟查詢日誌。如果您的數倉連行級安全都沒有,先補這一課——每個跳過它的團隊後來都後悔了。
- 第 4–6 周:10–30 名實名使用者的私域試點。 真實群聊,不是沙箱。評測得分每週公佈。試點的交付物不是那個機器人,而是那套告訴您「機器人夠不夠可信」的度量體系。
- 第 6–10 周:用真實查詢調優。 從查詢日誌裡挖出沒答上和答錯的問題,擴充套件語義層,重跑評測。準確率爬升最快的周,永遠是您在黑話對映上投入最多的那幾周——模型從來不是問題。
- 第 10–13 周:用數字做決策。 試點使用者每週提問佔比、評測集準確率、對比舊流程的響應時間。三個數字,一個決定:擴、停、留。結構化的付費試點——我們的是兩週、HKD 25k / RMB 20k——買的正是這個決策,不是一場演示。
以上所有內容的共同主線是:2026 年企業 AI 的難點在組織和架構,不在模型。這對 CIO 是好訊息:組織和架構問題有已知的解法、預算科目和時間表。此刻在中國用 AI 贏的企業,不是願景最宏大的那批,而是選定一個問題、治理好管道、誠實度量、然後讓使用自然擴散的那批。
2026 年底之前的四個方向
剋制的方向性判斷,附上理由:
- 智慧體的寫許可權將逐職能逐步放開。 只讀分析智慧體是橋頭堡;能「動手」的智慧體(建立採購單、調整營銷預算)會在評測體系和審批流之後一個職能一個職能地上線。預期 2026–2027 年讀寫邊界清晰可見、但推進不均勻。
- 語義層將成為標準配置。 隨著 NL-to-SQL 成熟,差異化完全轉移到受治理的語義和評測。沒有語義故事的廠商,會淪為按 token 賣算力的託管商。
- IM 原生化成為中國企業軟體的及格線。 任何不能被企業微信、釘釘或飛書呼叫的企業應用,都會越來越像上個時代的軟體。服務中國市場的廠商已經在圍繞這個假設重構產品。
- 模型成本繼續下降,治理支出上升。 斯坦福 AI Index(2025)記錄的推理成本下降趨勢沒有反轉。真正增長的預算科目不是模型開銷,而是評測、安全和資料治理——這恰恰是它該去的地方。
過去兩年從深圳到香港的持久教訓是:企業 AI 落地是一個穿著技術外衣的物流問題。把它當物流問題來做的企業——一次一個受治理的用例、就在工作本來所在的那扇聊天視窗裡——正在悄悄拉開身位。2026 年 9 月,是加入他們的好月份。