官方单源|OpenAI 称 Univé 许可激活率达 97%
采用漏斗比采购席位更有信息量,但效率数字和智能体进度仍是客户案例自报。
本文要点
- 案例首次集中披露 97% 许可激活率和 85% 获许可用户周活。
- 案例披露每位活跃用户每周平均 40 次提示及约 1500 个自定义 GPT。
- 宠物理赔准备被称从数小时缩至数分钟,但最终决定仍由受训人员负责。
阅读辅助
先看数字、证据和来源,再读正文。
97% 激活率和 85% 周活构成两级采用漏斗,但两项分母不同。
推广初期(日期未披露) · Univé 把管理层培训、企业认证、权限继承、隐私评估和人工问责纳入推广框架。
这是一篇官方单源客户案例:采用、效率和工作流数字均来自 OpenAI 与 Univé 的案例叙述,未见独立审计或公开原始数据。低置信不否定其指标设计价值,但限制了跨组织比较和效果外推。
席位数只能说明采购规模,采用率还要经过激活与持续使用两道门槛。OpenAI 在北京时间 2026 年 7 月 31 日 15:00 发布荷兰合作制保险机构 Univé 的客户案例,并给出从许可到持续使用的几级口径。
案例自报称,ChatGPT Enterprise 许可激活率为 97%,获许可用户周活跃率为 85%,每位活跃用户平均每周发出 40 次提示,员工累计创建了约 1500 个自定义 GPT。这些数字来自 OpenAI 与客户共同呈现的供应商案例,未见第三方审计、原始样本或公开仪表盘。
效率叙事也需要收窄到原文边界。宠物保险理赔中,案例称 Workspace Agent 可准备材料,使原本需要数小时的准备工作在数分钟内达到“可供决定”的状态;它没有说最终理赔决定由 AI 作出,也没有给出准确时长、样本量、错误率或申诉结果。
对企业买方而言,这份材料适合作为采用指标设计的参考,不适合作为保险业生产率基准。它展示了应该问哪些问题,也暴露了供应商客户案例通常不会回答的分母、质量与责任问题。
先把采用漏斗的分母对齐
采购席位只说明组织取得了访问权。激活说明用户至少完成启用,周活更接近持续使用,提示强度则描述活跃用户使用得有多频繁。再往下才是工作流制品、稳定复用和业务结果。
| 漏斗层级 | 案例披露 | 分母或口径 | 能说明什么 | 仍不能说明什么 |
|---|---|---|---|---|
| 获许可 | 未披露绝对人数 | ChatGPT Enterprise 许可总量未知 | 组织已配置企业产品 | 覆盖全体员工的比例 |
| 已激活 | 97% | 全部 ChatGPT Enterprise 许可 | 许可闲置比例较低 | 用户是否持续使用 |
| 每周活跃 | 85% | 获许可用户,不是全体员工 | 使用具有一定连续性 | 活跃定义、周期与岗位差异 |
| 使用强度 | 40 次提示/周 | 每位活跃用户的周均值 | 工具进入日常操作的频率 | 提示是否有效、是否节省时间 |
| 工作流制品 | 约 1500 个 | 员工创建的自定义 GPT 总数 | 员工参与搭建的广度 | 活跃率、复用率与质量 |
| 业务环节 | 数小时→数分钟 | 宠物理赔的材料准备环节 | 准备动作可能显著压缩 | 最终决定速度与质量是否改善 |
85% 的分母已经是获许可用户,因此不能再把它与 97% 相乘,写成“82.45% 的许可用户周活”。若两项确实来自同一批许可和同一观察周期,周活人数约相当于已激活人数的 87.6%;但这只是用 85÷97 得出的条件性推算,不是案例公布的指标,也不能在缺少周期定义时当作正式结论。
同样,40 次提示是活跃用户均值,不是所有获许可用户的均值,更不是每名员工的均值。均值可能由一小批重度使用者抬高,也可能包含试验、返工和重复提示。若要判断采用是否健康,至少还需要中位数、分位数、连续活跃周数和按岗位拆分的数据。
约 1500 个自定义 GPT提供了另一种广度信号。它说明员工不只消费聊天界面,也在把提示、知识和操作习惯封装成内部制品。不过,累计创建数量不能替代生产应用数量:同一员工可创建多个 GPT,制品可能无人复用,也可能在测试后废弃。案例未披露月活、调用量、拥有者、复核频率或下线率。
高采用率背后是组织机制,不是一个按钮
OpenAI 的叙述把 Univé 的推广拆成领导层方向、治理护栏和员工共创三部分。管理层参与专门的 AI leadership sessions;治理从推广开始就纳入企业认证、连接器权限继承、隐私评估、安全审查、负责任 AI 原则、持续监控和明确的人工问责;员工则获得时间和结构去重新设计自己的工作。
案例称,权限会沿用底层企业系统的授权,避免 AI 看到员工原本无权访问的信息。这是一项重要的设计原则,但仍是客户案例中的治理描述。页面没有提供安全审计报告、权限误配率、数据泄露事件统计或外部合规意见,不能据此断言护栏已经覆盖所有风险。
员工共创也有两面。它减少了等待中央开发团队排期的成本,让理赔、核保、财务、人力、法务、IT、客服和管理等岗位自行试验;与此同时,约 1500 个内部制品会带来版本、所有权、知识更新、访问控制和退役管理负担。制品越多,治理对象也越多。
因此,97% 与 85% 值得关注的原因,不是它们证明了某种普遍的“AI 转型成功率”,而是它们把组织采用拆出了可观测层级。企业若只报告购买席位数,无法区分访问权、真实活跃和业务嵌入;若只报告提示量,又可能把高频试验误当成已验证价值。
理赔准备变快,不等于 AI 接管理赔
宠物保险场景是这份案例中最具体的工作流。原文称,一个 Workspace Agent 可以汇总理赔文件、审阅兽医发票、核对保单条件、识别缺失信息、标记异常,并在理赔人员开始评估前准备一份可追溯建议。
这里的动作集中在“准备”。案例所说的 数小时缩至数分钟,对应材料搜集、阅读、结构化和建议准备,不对应最终理赔决定,也没有证明客户从提交到结案的端到端时长按同样幅度下降。原文把产出描述为 ready for decision,准确中文应是“准备到可供决定”,不能扩写成“数分钟自动完成理赔”。
责任边界更明确:受训理赔人员对每一项最终决定仍负全部责任。AI 准备工作,人作出决定。专业人员需要检查证据、应用经验并承担批准结果;如果建议错误,不能以“由智能体生成”为由转移责任。
核保用例采用相似分工。案例描述 Workspace Agent 在核保人员开始工作前整理队列、组合已批准企业来源的信息、识别缺失文件、标记风险信号并提示优先事项。它的价值主张仍是减少搜集和整理时间,把专业判断留给核保人员,而不是让模型自主承保。
| 业务阶段 | 原文状态 | 当前可确认边界 | 仍缺少的证据 |
|---|---|---|---|
| 当前任务辅助 | AI at Univé today、can assemble | Agent 可以准备理赔材料 | 全部门端到端覆盖率 |
| 人工责任 | remains fully accountable | 受训人员仍对最终决定负全责 | 建议错误与人工改写率 |
| 主动工作流 | actively exploring、are designed to | 正在探索并描述设计目标 | 受控生产范围与稳定性 |
| 运营愿景 | ambition | Univé 的目标状态 | 已经落地的新运营模式 |
主动 Workspace Agents 仍是下一阶段
案例特意把相关段落命名为 “Initiatives being explored”。原文说,当前用例主要在单项任务中支持员工,Univé 正在探索下一阶段:让 Workspace Agents 在获批准的企业系统之间主动准备周期性工作,在员工开始一天工作之前汇集信息、呈现上下文并形成有证据的起点。
这段话同时包含现在时和目标态。当前材料支持“已有任务级辅助用例”和“正在探索主动工作流”;它不支持“主动智能体已经在全公司持续运行”。are designed to 描述设计目的,ambition 描述希望形成的新运营模式,都不是全面部署或稳定生产的完成时。
状态差异会直接影响风险判断。任务级助手通常由员工触发并在眼前复核,主动工作流则可能在无人注视时跨系统读取、组合和排序信息。后者需要更严格的权限最小化、执行记录、异常停止、建议溯源和人工接管机制。案例称新应用仍会在治理框架内评估,但没有披露试点范围、上线门槛或运行指标。
供应商案例还把“今天的提示将演进为 agentic workflows”写成 Univé 的判断。它可以说明组织方向,却不能证明技术迁移必然发生。提示频繁、制品众多与主动工作流可靠之间,还隔着数据质量、权限配置、工具失败、长流程状态管理和问责设计。
这份案例最值得借鉴的是测量顺序。企业采用不应从“买了多少席位”直接跳到“节省了多少成本”,中间至少要经过激活、持续活跃、使用强度、工作流沉淀和可验证结果。Univé 案例把前四层放到同一页,信息密度高于只展示总用户数的营销材料。
但越靠近业务结果,证据越薄。97%、85%、40 次和约 1500 个都有明确口径起点,理赔的“数小时到数分钟”却没有样本、分布、质量对照和审计。它可以支持试点价值假设,尚不足以支持全行业生产率外推。
责任边界比速度数字更关键。保险决定会影响客户权益,准备材料可以自动化,最终判断仍要由受训人员作出并承担责任。若企业无法保留模型建议所依据的材料、人工修改和最终批准记录,“人类在环”就可能只剩形式。
主动 Workspace Agents 的表述也应保持克制。Univé 正在探索的是更主动、更周期性的准备模式;把目标态提前写成全面部署,会同时夸大采用成熟度和低估治理难度。对企业买方而言,诚实标注“探索中”比制造智能体已无处不在的印象更有决策价值。
从案例走向可验证运营
下一步需要补齐的不是更多口号,而是可以持续审计的分母。许可总数、全体员工覆盖率、活跃定义和统计周期公开后,97% 与 85% 才能与其他组织比较。岗位分布也很重要:少数知识密集岗位的高活跃,和全组织均匀采用,是两种不同状态。
自定义 GPT 应进入生命周期管理。企业需要知道哪些制品在过去 30 天仍被调用,多少由多人复用,知识源何时更新,谁负责批准变更,以及多久未用后自动退役。只有把累计数量改造成活跃、复用、质量和治理指标,约 1500 个才会从创新氛围信号转成运营能力证据。
理赔试点则应同时测速度与质量。除了准备耗时,还应公布中位数和高分位耗时、缺失信息识别率、错误建议率、人工改写率、返工率、客户申诉率和最终决定一致性。若准备时间下降但专业人员花更多时间核对,端到端收益可能低于页面呈现。
主动工作流进入生产前,需要明确从探索到上线的门槛:允许访问哪些系统,能否写入或只读,异常时如何停止,证据如何回放,人工在何处确认,谁对错误排序或遗漏负责。达到这些条件后,“主动准备一天的工作”才从 ambition 变成可验收的运行状态。
在更多数据出现前,合理结论应保持两层:Univé 客户案例展示了一个较完整的企业采用漏斗,也描述了清晰的人机责任边界;所有采用和效率结果仍是 OpenAI 与客户的自报,主动 Workspace Agents 的更广泛运营模式仍处于探索阶段。