走过试点阶段的保险公司,对 AI 的终点站高度一致——风险决策更快、理赔成本更低、欺诈发现更早——但对自身当前位置的判断却五花八门,而这个「认知差」恰恰决定了 2026 年预算的成败。
为什么大量试点停在半路
问五家保险公司 AI 项目进展如何,得到的答案几乎是同一个模子:试点结果亮眼、高管站台支持,但就是没有拿得出手的生产部署。卡住项目的很少是模型本身——到 2026 年,商用大模型和梯度提升类风险模型在分诊、摘要、风险标记这类任务上的精度早已够用。真正卡住的是模型周围的一切:核保指引锁在 PDF 附件里,理赔资料散落在核心系统、文档平台和邮箱三处;以及没有一套公认的办法,向监管证明机器为什么给出这个建议。
还有一个更隐蔽的经济原因。试点团队用的是公司里最好的人:资深核保师、数据科学家、厂商的架构师。而生产环境要求的是普通员工在一个下雨的周二下午处理一份复杂案件时,也愿意用这套系统。如果工作流不贴合理赔员和核保师的实际作业方式,试点期的漂亮数字一上生产线就会蒸发。
2026 年真正做出成果的保险公司有一个共同习惯:谈「成熟度层级」,而不是谈「项目」。他们能用一句话说清自己的核保、理赔流程各处在哪一级,以及卡在下一级的具体原因是什么。本文提供的就是这套语言:一个五级成熟度模型,随后按核保、理赔分诊、反欺诈三条线逐一盘点,最后落到监管期望与人机协同模式——这两件事决定了整套东西能否通过审计。
五级成熟度模型
下表刻意用「结果」而非「技术」作区分维度。采购一个大模型许可证不会让您的层级上升;改变谁来做决策、多快做决策、留下怎样的证据链,才会。
| 层级 | 名称 | 核保特征 | 理赔特征 | 人的角色 | 典型业务占比(行业估计,2025–2026) |
|---|---|---|---|---|---|
| 一级 | 全人工 | 纸质 PDF,凭经验判断,邮件收单 | 电话报案,纸质表单,人工核赔 | 全部人工 | 商用特殊险种仍常见 |
| 二级 | 辅助作业 | 电子化提交,数据靠人工拉取,清单核对 | 电子报案,工作流队列,单证扫描 | 全部人工,但更快 | 中型保险公司主流状态 |
| 三级 | 规则增强 | 外部数据接口,规则引擎标记例外 | 规则分诊,简单案件直通处理 | 复核例外项 | 个人险种常见目标态 |
| 四级 | 模型增强 | 结构化+非结构化数据的 ML 风险评分 | ML 分诊,照片定损,准备金建议 | 阈值审批与覆盖 | 头部个人险与中小企险公司 |
| 五级 | 有监督的自动化 | 风险偏好内自动报价,AI 起草转报 | 多数案件直通,人处理复杂与可疑件 | 定政策、抽检、处理边缘案 | 少数但持续增长,集中在窄险种 |
对这张表有三点阅读提示。第一,商业价值最大的跳跃是二级到四级,而不是四级到五级。麦肯锡(2023)描述的费用率改善,绝大部分来自把流程中重复的中段自动化,而不是去掉最后一个人类决策者。第二,大多数保险公司并非全条线处于同一层级:一家综合险企可能车险理赔已是四级,货运险还在一级。诚实的度量单位是「流程级」,不是「公司级」。第三,第五级与其说是技术成就,不如说是治理成就——在审计追踪和模型验证体系达标之前,没有任何公司能真正到达。
核保:哪些环节真能自动化
提交件分诊是最确定的赢面。商用险核保师每天有相当大比例的时间——行业估计在 30%–40%——花在本来就不该报价的提交件上:超出风险偏好、关键资料缺失、或者在别处已重复承保。一个能读提交件、对照偏好规则、直接给出「拒单/补件/优先队列」的模型,改变了核保台的经济性,却完全不触碰任何风险决策。正因如此,面向经纪人的分诊几乎总是商用险线上第一个生产级 AI 部署。
风险评分是第二个赢面,但带一个前提。基于结构化数据的梯度提升模型已经默默高效了十年——续保倾向的信用式评分、定价用的赔付成本模型。2024–2026 年的变化在于:大模型终于能消化提交件里过去进不了模型的那约六成非结构化内容——工程报告、现场照片、财务报表。做得好的保险公司把大模型当「抽取层」用:它把文档转成带置信度分数的结构化字段,而风险决策仍然交给上层一个传统的、可解释的模型。做得不好的保险公司直接让大模型回答「风险怎么样」,然后发现没法向精算师或监管解释这个答案。
2026 年仍然自动化不了的是真正的「新颖性」环节:复杂结构化风险、项目型业务、再保条约,以及一切提交件本身就是经纪人与核保师之间谈判的生意。在复杂商用险上尝试全自动报价的公司,大多已退回到「偏好外自动拒、窄区间内自动报、中间全人工」——细看正是标准的四级形态。
数据地基问题
每一个核保自动化案例最终都撞上同一个瓶颈:风险数据不在可查询状态。提交件在邮箱里,损失记录是经纪人发来的扫描 PDF,核心系统里存的是保单行政数据而非风险数据。跳过语义层——一套受治理的、按条线统一定义的敞口、保费、损失率口径——的公司,最终要为每一个 AI 用例重造一遍数据管道,AI 项目于是变成一个带着市场预算的 ETL 项目。这正是对话式、MCP 驱动的分析层要解决的问题:语义定义只建一次,无论是核保仪表盘,还是回答「上季度大湾区中型商业物业的损失率是多少」的 AI 助手,都从同一套受治理的口径取数。
理赔分诊:直通式处理的前沿
直通式处理(STP)——一件理赔在无人触碰的情况下结案——是理赔转型中被引用最多的指标,也是脱离语境时最容易误导的指标。一块车窗玻璃的理赔和一起致命工伤事故进入的是同一条报案通道;报一个笼统的 STP 率几乎说明不了任何问题。真正重要的是「指定案件段内」的 STP 率,以及人工监督该段时的漏损率。
2026 年跑通的模式是「分段优先」分诊。在首次接报时,模型沿三个维度给案件分类:复杂度(简单/标准/复杂)、可疑度(干净/待核/调查)、严重度(准备金区间)。简单且干净、准备金低于阈值的案件自动直通付款;其余案件第一次就路由到具备对应技能的处理人手上——因为理赔中仅次于漏损的第二大成本,是同一份案卷被错误的团队处理两次。据 2024–2025 年间的厂商与咨询案例研究,落地该模式的公司在自动化段报告中,处理周期缩短 30%–50%,且随着模型从人工覆盖中学习还有小幅提升。
生成式 AI 给分诊增加了一项真正的新能力:对案卷本身做摘要。理赔员打开一份有四十份文档、两次查勘记录、跨三年的旧案,是典型的转办场景,而 LLM 摘要能明显压缩熟悉案情的时间。治理上的界限同样清晰:摘要只是便利工具,永远不能替代案卷本身成为决策记录。让摘要替代阅读原始案卷的公司,恰恰制造了监管现在正在追问的那种「AI 说的」责任。
反欺诈:精准度决定成败
欺诈检测是保险业最古老的 AI 应用,也是营销与实践落差最大的领域。技术是成熟的,经济学是残酷的。每个反欺诈模型都产生两类错误,而保险公司一贯低估其中之一的代价:误报。调查一件正当理赔要耗费人力、拖延赔付、伤害客户关系,并且在边际上引发对监管的投诉。2024–2025 年的行业讨论收敛到同一个教训:一个纸面精准度 90% 的模型,若标记量超出调查产能,在运营上依然不可行——因为此时真正起控制作用的不是模型,而是积压队列。
2026 年成熟的运作方式,是把欺诈评分当作「路由输入」而非「结论」。每件理赔都带一个欺诈倾向分,只调整其分诊路径——高分件连同具体信号路由到反欺诈调查组,低分件正常流转。人来闭环:每一次调查结论(确认欺诈、排除、存疑)都作为带标签样本回喂模型。信号本身也在随数据可得性演进——把按理赔员、诊所、修理厂、电话号码关联起来的网络分析,如今例行揪出规则系统从未发现的职业欺诈团伙,2023 年以来的咨询与厂商研究反复记录了这一模式。
针对 2026 年的两点相邻提醒。其一,深度伪造与合成文档欺诈在远程理赔中已是运营现实——电话理赔的语音克隆、AI 生成的受损照片都不再是理论风险,险企的应对是把活体检测与元数据取证设为标准入案控制。其二,欺诈模型是整个模型组合里对可解释性最敏感的一类。一个与邮编、职业或理赔人语言强相关的欺诈评分,不只是公平性问题,而是一次可以预见的监管发现。
2026 年监管究竟期待什么
2023 至 2026 年间,保险 AI 的监管方向显著收紧,且尽管工具不同,各辖区方向高度一致。美国 NAIC 面向保险机构的 AI 使用示范公告(2023)已被多数州以某种形式采纳,围绕书面 AI 治理计划、成文的模型验证与第三方厂商监督提出要求。欧盟 AI 法案(2024)在 2026–2027 年分阶段生效,对产生法律或类似重大影响的核保与定价用途按「高风险」对待,附加文档、人类监督与准确性义务。在亚洲,包括新加坡金管局与香港保险业监管局在内的监管机构发布了强调管理层问责、模型清单与公平结果(而非规定性技术标准)的指引。
横向对比这些文件,期待集出奇一致:
- 成文的模型清单:覆盖在用及厂商提供的所有 AI 模型,每个模型指定责任人。
- 人类有意义监督的证据:不是走过场,而是样本复核、覆盖追踪与申诉通道。
- 与影响相称的可解释性:对不利核保决策,能用客户读得懂的语言陈述实质性理由。
- 受保护属性的偏差测试,结果与整改留档。
- 厂商问责:面对监管的是保险公司自己,而不是模型供应商。
务实的解读是:2026 年没有任何监管机构要求保险公司解释每一次模型输出,但所有监管机构都要求您解释那些「伤到了人」的输出。围绕不利动作——拒保、欺诈转报、准备金上调——设计审计追踪,您就已经建好了监管检查中最看重的八成合规能力。
如果您的 AI 项目无法在一个工作日内,调出上个月任何一次不利决策背后的理由码与数据输入,这不是一个合规缺口,而是一个缺失的系统能力——预算就应该这么立。
经得起审计的人机协同模式
「人在回路」写在行业里每一份 AI 治理文件上,但真正落到运营的比大多数公司承认的要少。失效模式人尽皆知:把一个人放进流程,AI 建议旁边放一个预勾选的确认框,几周内批准率就收敛到接近 100%。监管机构已注意到这一现象;欧盟 AI 法案(2024)的监督条款明确考虑了自动化偏倚,审计方也越来越多地索取「批准率漂移曲线」作为真实复核的证据。
实践中有四种模式扛得住检验:
- 阈值加抽检:低于重要性阈值由 AI 自动决策;高于阈值由人在 AI 输入辅助下决策;并对自动决策按月做随机抽样、由资深核保或理赔管理者复核。抽检是把控制从「装饰」变成「证据」的关键。
- 盲评先行:对高影响决策,复核人先记录自己的判断,再展示 AI 建议。成本高,但这是唯一被证明能压制锚定效应的模式,一些险企将它保留给欺诈转报与大额准备金。
- 带理由的覆盖:每一次覆盖 AI 建议都记录结构化理由码。一举两得——既生成监管要的解释记录,又是模型能拿到的最高价值训练数据。
- 季度挑战评审会:由核保与理赔管理层常设评审模型漂移、覆盖模式与投诉数据,会议纪要留档。当监管问「管理层如何监督」,纪要就是答案。
要避免的模式,是付款后才重新审议决策的「事后评审会」——它什么也拦不住,只生产纸张,不生产控制。
度量项目本身:能证明推进的 KPI
成熟度模型如果只能体现在幻灯片上,就毫无用处。每一级都应绑定 CFO 认可的指标:开工前先取基线,每季度如实上报,不做叙事性修饰。度量纪律还能防住项目最常见的病灶——团队优化一个「看起来像进展」的指标,比如「上线了几个 AI 功能」「训练了几个模型」,这两项都不会出现在利润表上。
| KPI | 证明什么 | 在哪些层级变化 | 健康方向 |
|---|---|---|---|
| 商用提交件处理时长 | 分诊自动化是真实的 | 二至四级 | 自动化段下降 30%–50% |
| 报价周转时间 | 风险偏好初筛有效 | 二至四级 | 明显缩短且损失率不漂移 |
| 分段理赔周期 | 改善的是分段而非平均值 | 二至四级 | 分段级呈现,不用混合值 |
| 段内 STP 率 | 自动化深度站得住 | 三至四级 | 上升而漏损率不升 |
| 理赔漏损率 | 自动化没有偷工减料 | 全部层级 | STP 上升时持平或下降 |
| 覆盖率及其漂移 | 人类监督是真实的 | 四至五级 | 稳定,不收敛到零 |
| 不利决策理由覆盖率 | 审计链完整 | 全部层级 | 100% 可在一个工作日内回溯 |
| 每千次决策投诉量 | 提速没有侵蚀公平 | 全部层级 | 持平或下降 |
其中两项需要特别强调,因为它们最常缺席。覆盖率的漂移是自动化偏倚的金丝雀:如果上线后一个季度内,人工对 AI 建议的批准率平滑地爬向 100%,您的人在回路已经退化成一个签字环节,治理文件里的监督主张就不再成立。不利决策理由覆盖率则是审计链的完整性检查:每一次拒保、欺诈转报、准备金上调,系统都必须能在一个工作日内复现理由码与输入数据。从第一天就度量这两项的公司,第一次监管检查的成本会大幅降低;事后才补的公司会发现历史决策无法重构,缺口直接变成一项监管发现。
最后一条度量建议:拒绝混合平均值。一个项目在最简单的两成案件上把周期缩短了四成,而其余八成原地踏步,混合平均会呈现约 8% 的「改善」,实则毫无意义。分段级汇报读起来慢,但更诚实,而且精算与财务部门迟早会这么要求。
按成熟度排布的十二个月路线图
对当前处于二级的险企,一年内在一到两个职能上走到三至四级的现实路径如下。第一、二季度:建设语义层与模型清单——不起眼,却是一切的前置;在一条商用险线部署提交件分诊,配套成文的覆盖闭环。第三季度:扩展到量最大、严重度最低的理赔分段,且直通仅对保守准备金阈值以下的案件开放。第四季度:上线欺诈评分作为路由信号,设立季度挑战评审会,并委托独立模型验证——让治理故事在被监管问询之前先被审计一次。打乱这个顺序的公司——先上模型、后补数据与治理——正是那些试点停摆的公司;成熟度模型存在的意义,恰恰是阻止这种花钱方式。