生成式 AI 进入企业预算表已经两年多,判断一家中国企业 AI 成熟度的最可靠信号,不是发布会上的宏大叙事,而是员工究竟在哪儿用这项技术——答案是:就在他们每天泡着的那个聊天窗口里。
2026 年年中,中国企业 AI 落地到底走到了哪一步
拨开发布会的喧嚣,2026 年中国企业 AI 落地的图景,在各家分析机构、厂商披露和一线从业者的反馈中高度一致。McKinsey 历年的 State of AI 调研(2024、2025 版)发现:在某个局部环节使用生成式 AI 的组织比例持续攀升,但真正把 AI 推广到多个业务部门、产生全局影响的企业,全球占比仍是个位数百分比。中国走的也是这条 S 曲线,只是扩散通道不一样。
在北美和欧洲,企业 AI 主要是从办公套件长出来的——文档助手、表格助手、邮箱助手、代码助手。而在中国,对应的阵地是企业 IM。企业微信、钉钉、飞书不是「附加在工作上的聊天工具」,而是审批、汇报、客户沟通、跨部门协作本来就在发生的操作层。IDC(2025)预测中国 AI 支出增速显著高于全球均值,其中相当一部分增量,正被这些协同平台及其低代码、小程序、第三方连接器生态所吸收。
截至 2026 年 9 月,有三个方向明确、已成共识的趋势:
- 对话式界面成为非技术人员的默认入口。 高管和一线管理者大体上跳过了 BI 看板时代——他们从没养成登录分析门户的习惯,指望他们改变的厂商都失望了。聊天窗口反转了漏斗:不再是把人拉到数据面前,而是数据主动回答提问的人。
- 开源权重模型改写了「自建还是采购」的争论。 自 2025 年 1 月 DeepSeek-R1 发布以来,Qwen、GLM 等开源权重模型家族持续迭代,斯坦福 AI Index(2025)记录了开源与闭源模型性能差距的收窄。对拥有私有数据和合规约束的企业来说,在私有云或本地部署一个能力过硬的开源模型,已经从「少数派玩法」变成常规选项。
- 「试点到生产」的鸿沟仍是第一杀手。 2026 年死掉的 AI 试点,多数死于数据准备不足、权限设计缺位和变革管理失败,而不是模型能力不够。这不是中国特有的问题——这是全球共性——但在中国落地时表现为几个具体的摩擦点:内部系统碎片化、集团数据烟囱、以及 IT 部门对任何触碰客户数据的东西都持保守态度。
第四个趋势值得单独一节来讲,因为在我们的一线实践中,它的影响最为深远:数据分析不再是一个「要去的地方」,而是变成了「送到嘴边的回答」。
IM 原生化:数据分析搬进了企业微信
我们在香港和大湾区客户中观察到的最核心的落地模式,不是某个新模型、新智能体框架或新看板,而是一次「位置迁移」:对数据提问这件事,现在发生在企业微信里——就在区域销售总监问昨天动销率、门店店长上报缺货、CFO 过目本周资金头寸的同一个会话线程里。
技术细节反而不重要,重要的是行为结果。当回答一个数据问题需要打开电脑、找到对应看板、回忆每个筛选器是什么意思时,使用率会卡在授权席位的零头。而当它只需要在本来就开着的群聊里打一句话——「上周华南退货率多少,跟八月比呢」——几秒内收到一张带正确数字的图,使用就会在没有任何内部通知的情况下自然扩散。在我们的部署经验中,同样的用户盘子,IM 原生对话式分析与门户式 BI 的使用量差距,常常以数量级计。行业普遍估计,传统 BI 部署中活跃席位的占比不足 20–30%;IM 原生渠道的设计目标,正是打破这个天花板。
决定 BI 能否推广的从来不是「看板做得多好」,而是「从一个问题到一个答案之间隔着几次点击」。
为什么这个模式率先在中国成型?三个结构性原因:
- 企业 IM 渗透率接近全覆盖。 腾讯披露企业微信服务企业以千万计、触达用户以亿计;阿里钉钉、字节飞书也公开过同量级数据。西方市场没有任何一个协同平台能在企业内部拥有这样的覆盖度,还同时接入供应商、经销商、加盟商都在用的微信消费级身份网络。
- 生态开放是制度设计,不是偶然。 三大平台都提供完善的 API 和机器人框架。一个在群聊里回答问题、发图表的机器人是一等公民,而不是爬页面的旁门左道。这正是 MCP(模型上下文协议)类集成得以落地的前提:一个治理良好的连接器可以坐在群聊和数据仓库之间,执行权限控制、记录每一次查询、把业务语言翻译成受治理的 SQL。
- 一线工作天然是移动优先的。 零售督导、物业经理、产线主管从来不是桌面 BI 的用户。IM 渠道直接出现在他们本来就用来干活的设备上——而数据驱动决策的「最后一公里」恰恰在这里。
治理层面的含义是实打实的,没有商量余地。把分析能力搬进聊天层却不做权限架构,等于架起一台数据泄漏机器:群聊本身就是一个分享面。我们落地的成熟做法,是把每一次查询都绑定到提问者的身份和角色——店长只看自己的门店,区域总监只看自己的区域,谁也别想「问」出别人的数字。这正是语义层和查询治理层的价值所在,也是为什么「直接把大模型接到数据库上」至今仍是我们被请去评审的方案里最常见、也最危险的偷懒捷径。
国产模型生态:对采购方到底意味着什么
2026 年的第二个结构性故事,是国产大模型生态成熟为真正的买方市场。2023 年企业选国产大模型时,可选面窄、能力差距明显;到 2025 年末和 2026 年,赛道已经空前拥挤——DeepSeek、阿里 Qwen 家族、智谱 GLM、月之暗面 Kimi、字节豆包、MiniMax 等——而且至少在企业真正跑的那类工作负载上,与海外前沿模型的差距已经小到对多数场景无感。斯坦福 AI Index(2025)对此有系统记录,其中开源权重模型的进步速度最快。
对采购方而言,有四个直接影响:
| 采购维度 | 2023–2024 的现实 | 2026 的现实 | 实际含义 |
|---|---|---|---|
| 模型能力 | 与前沿模型差距明显 | 推理、SQL、中文任务差距收窄 | 模型不再是瓶颈,数据准备才是 |
| 部署方式 | API 优先,私有化选项有限 | DeepSeek、Qwen、GLM 等开源家族支持私有 VPC 或本地部署 | 受监管行业可以把数据留在自己手里 |
| 成本曲线 | 高且波动 | 斯坦福 AI Index(2025)记录推理成本陡降 | 试点失败的代价下降,但「停在试点」的借口也消失了 |
| 供应商锁定 | 显著 | API 可移植性改善,开源权重提供退出通道 | 签合同时就按 12–18 个月内换模型来谈 |
开源权重这一步尤其值得强调,因为它改变了采购逻辑。当一个能力过硬的模型权重可以下载、可以在您自己的 VPC 里跑,模型层就变成了大宗商品:用您自己的评测集打分、按季度复测、出现更好的就换。真正没有商品化——价值持续沉淀——的是模型周围的 everything else:编码了贵司指标定义的语义层、权限模型、能拦住回归的评测体系,以及您的人本来就在用的集成入口。
我们建议客户把模型选型当成一个 12–18 个月的决定,而不是终身大事。具体做法:从真实业务问题和真实业务黑话中提炼 100–200 道带标准答案的题,构建私有评测集;每个季度用它给候选模型打分;让应用层和模型厂商之间的抽象足够薄,换模型只是改配置,而不是立项。
这对工具选型意味着什么
推论是:评估对话式分析厂商时,「你们用哪个模型」已经不该是第一个问题。该问的是:原生支持哪些 IM 平台;查询时如何执行权限;业务黑话如何映射到表结构(语义层);在您的数据上实测准确率是多少(而不是公开榜单);模型答错时有没有可回溯的引用链。这五问答不利落的厂商,卖给您的是 Demo,不是交付。
从副驾到智能体:部署的真实差距
2026 年的第三个故事,是智能体(Agent)进入企业工作流——以及智能体 Demo 与智能体部署之间的鸿沟。行业共识已经从「副驾建议、人来执行」走向「智能体在监督下规划并执行多步任务」。Gartner(2025)对智能体 AI 的采用意向给出了激进的增长预测;但同一周期的分析师评论也指出,真正把智能体放进生产环境、干成实际工作的组织仍是少数。
在我们的一线经验里,隔开这两者的几乎从来不是模型能力,而是四件不性感的事:
- 带真实权限的工具接入。 能回答问题的智能体,必须被允许以行级、列级权限去触碰答案所在的系统——数仓、CRM、ERP。绝大多数企业的权限模型当初并不是为非人类主体设计的,补这一课是每个部署里最慢的一步。
- 确定性的评测体系。 「Demo 里好好的,第三周坏了」是最典型的失败剧本。能跑通长久的团队把智能体行为当软件管:版本化的评测集、每次改提示词或换模型都跑回归、准确率漂移有告警。
- 失败兜底。 成熟的部署先约束智能体「能做什么」(先只读;下单、调价这类写操作等几个月再说)和「能看什么」(绑定身份的行级安全)。智能体在治理围栏内活动,而不是揣着整个大楼的钥匙。
- 人工升级路径。 我们知道的每一个生产级智能体都有明确的交接设计:置信度低或问题超纲时,明说,然后转给真人。这个设计的成本几乎为零;没有它的成本,是一条错误答案在四十人的群里刷完存在感、信任清零。
IM 场景把这四点都放大了。跑在企业微信里的对话式智能体,直面所有员工的口语、错别字和连环追问,远比精装修的 Web 应用「脏」。但它也能拿到 Web 应用永远拿不到的东西:整个群的对话上下文——哪些问题反复出现、哪些数字总被质疑、真实工作流在哪里。系统性挖掘智能体查询日志的团队,等于在给自己的分析职能做持续的需求调研。日志就是需求文档。
数据栈 implications:语义层与治理
在 IM 原生化浪潮和智能体浪潮底下,还有一场更安静的技术迁移,值得 CDO 们显式规划。自然语言查询加业务用户这个组合,把语义层——业务术语与物理表结构之间的受治理映射——从「锦上添花」推成了关键基础设施。
原因很简单,是道算术题。把大模型直接怼到一张 400 张表的数仓上,它会对着正确性远低于其自信程度的 SQL 源源不断地输出。业务语言天然多义:「销售额」可能指 GMV、净收入或者已确认收入,取决于谁在问;「活跃客户」在多数公司有五种定义。语义层的价值就是在模型看到问题之前把歧义解决掉:把模型的任务从「对着陌生表结构写出正确的 SQL」降级为「把一个已消歧的问题翻译成基于已知定义的受治理查询」。在我们自己的部署里,这一层是真实企业数据上 60–70% 可用回答与 90%+ 之间的差别——这与业界公开报告的方向性发现一致,也是每一家严肃的对话式 BI 厂商都把语义映射和查询治理做成一等组件的原因。
第二个影响:权限从报表层前移到了查询层。当所有人都通过同一个聊天入口提问,查询引擎必须在执行时强制绑定身份的访问控制——谁在问、什么角色、哪些行。事后报表权限在这种架构下形同虚设。第一批 IM 原生推广中搞错这件事的企业,通常收获一次令人印象深刻的数据泄漏,然后收到一纸「全部下线」的高管令。查询时治理要在上线前做预算,而不是在事故后。
| 层级 | 传统 BI 栈 | IM 原生对话式栈 | 实际变化 |
|---|---|---|---|
| 界面 | 门户、看板、定时邮件 | 企业微信 / 钉钉 / 飞书群聊与单聊机器人 | 使用从每周「看」变成每天「问」 |
| 查询引擎 | 报表里的固定 SQL;BI 工具内的语义模型 | NL → 语义层 + LLM → 受治理 SQL | 业务用户不写筛选条件;治理前移到查询时 |
| 访问控制 | 报表与目录权限 | 每次查询执行绑定身份的行/列级安全 | 一次泄漏足以终结整个项目,必须先设计 |
| 质量控制 | 发布前的看板验收 | 版本化评测集、回归测试、准确率监控 | 评测从一次性门禁变成持续过程 |
| 推广动力 | 培训会和行政要求 | 零培训的聊天行为、群内网络效应 | 推广周期从季度级压缩到天级 |
香港企业能从内地模式学到什么
香港企业观察内地落地模式时,最关心的问题是:哪些能照搬?在零售连锁、金融服务、物业管理和制造业两条线都有部署经验之后,我们的回答是:打法几乎完全可以迁移,节奏预期和平台选择不能。
- IM 原生逻辑放之四海皆准,只是平台不同。 在香港,同样的模式更多跑在 WhatsApp 和 Teams 上,而不是企业微信——贸易公司和消费品牌与供应商、渠道伙伴的日常就在 WhatsApp 群里;跨国企业则统一在 Teams。架构模式(聊天与数仓之间的 MCP 式受治理连接器)与平台无关。选您的人已经在用的那块阵地,别让他们搬家。
- 只要治理前置,内地式的速度在香港同样做得到。 我们能在两周内完成一个香港企业级部署,恰恰是因为权限设计、语义映射和评测体系被当作核心工作流,而不是事后补丁。第一个月还在争论选哪个模型的团队,第一个月什么都没做出来,最后得出了和别人一样的结论。
- 数据准备度始终是硬约束。 内地跑得快的企业,往往先做完了那些不光彩的功课:有一个作为唯一事实来源的数仓或湖仓、有人对指标定义负责、IT 治理能在有条件下说「可以」。这不是技术差距,是组织差距——在香港一模一样。
- 两地监管姿态不同,设计应对相同。 内地的数据安全与个保法框架,和香港的 PDPO,方向一致:敏感数据留在自己控制范围内、记录每一次访问、执行最小权限。自有 VPC 里跑开源权重模型同时满足两边,这也是它成为我们金融、地产客户默认选项的原因之一。
关于时机的判断。读完内地案例,最容易产生的错觉是「窗口正在关闭」。证据恰恰相反。McKinsey(2025)仍然发现全球大多数组织未实现全企业级 AI 影响;在我们客户群里持续兑现损益效应的,是那些 12–18 个月前就带着克制的、治理良好的用例起步、然后持续复利的公司。今天用一个有纪律的试点起步,好过两年前用一个失控的大项目起步。
给持怀疑态度 CIO 的 90 天行动清单
对正在决定「要不要做、怎么做」的香港或大湾区企业,行之有效的模式可以塞进一个季度:
- 第 1–2 周:选一类高频问题,而不是一个宏大主题。 不是「零售 AI」,而是「区域总监每天在运营群里问的、分门店的昨日动销」。一类问题意味着一套语义映射、一个评测集、一条可度量的准确率红线。
- 第 2–4 周:搭受治理的连接器。 先对相关的 20–50 张表做语义层(不是整个数仓),权限映射到组织架构、绑定身份,打开查询日志。如果您的数仓连行级安全都没有,先补这一课——每个跳过它的团队后来都后悔了。
- 第 4–6 周:10–30 名实名用户的私域试点。 真实群聊,不是沙箱。评测得分每周公布。试点的交付物不是那个机器人,而是那套告诉您「机器人够不够可信」的度量体系。
- 第 6–10 周:用真实查询调优。 从查询日志里挖出没答上和答错的问题,扩展语义层,重跑评测。准确率爬升最快的周,永远是您在黑话映射上投入最多的那几周——模型从来不是问题。
- 第 10–13 周:用数字做决策。 试点用户每周提问占比、评测集准确率、对比旧流程的响应时间。三个数字,一个决定:扩、停、留。结构化的付费试点——我们的是两周、HKD 25k / RMB 20k——买的正是这个决策,不是一场演示。
以上所有内容的共同主线是:2026 年企业 AI 的难点在组织和架构,不在模型。这对 CIO 是好消息:组织和架构问题有已知的解法、预算科目和时间表。此刻在中国用 AI 赢的企业,不是愿景最宏大的那批,而是选定一个问题、治理好管道、诚实度量、然后让使用自然扩散的那批。
2026 年底之前的四个方向
克制的方向性判断,附上理由:
- 智能体的写权限将逐职能逐步放开。 只读分析智能体是桥头堡;能「动手」的智能体(创建采购单、调整营销预算)会在评测体系和审批流之后一个职能一个职能地上线。预期 2026–2027 年读写边界清晰可见、但推进不均匀。
- 语义层将成为标准配置。 随着 NL-to-SQL 成熟,差异化完全转移到受治理的语义和评测。没有语义故事的厂商,会沦为按 token 卖算力的托管商。
- IM 原生化成为中国企业软件的及格线。 任何不能被企业微信、钉钉或飞书调用的企业应用,都会越来越像上个时代的软件。服务中国市场的厂商已经在围绕这个假设重构产品。
- 模型成本继续下降,治理支出上升。 斯坦福 AI Index(2025)记录的推理成本下降趋势没有反转。真正增长的预算科目不是模型开销,而是评测、安全和数据治理——这恰恰是它该去的地方。
过去两年从深圳到香港的持久教训是:企业 AI 落地是一个穿着技术外衣的物流问题。把它当物流问题来做的企业——一次一个受治理的用例、就在工作本来所在的那扇聊天窗口里——正在悄悄拉开身位。2026 年 9 月,是加入他们的好月份。