FIELD REPORTS / 人才 · 心理 · 体验 实测记录

上线之后,数字说话

以下案例覆盖人才测评、心理健康与 NPS 客户体验三类场景,均经客户授权脱敏发布。每个案例按「背景 → 配置 → 结果 → 边界」记录——最后一栏尤其重要:我们只承诺数据能支撑的结论,边界写在那里,是因为它们真的存在。

CASES 05 PUBLISHED DOMAINS TALENT / MENTAL-HEALTH / NPS DISCLOSURE CLIENT-AUTHORIZED · DE-IDENTIFIED
CASE-01 · CAMPUS SCREENING

某头部新能源集团:8,200 人校招,题库被刷穿之后

行业新能源制造 · 集团校招
规模8,200 人 / 单季
引擎配置L1 CAT + L2 AIG + L4 常模
周期6 周(含 2 周试点标定)

背景

原笔试题库使用四年,培训机构整理出覆盖率约七成的「真题集」公开售卖。分数分布逐年右移、顶部堆积,HR 不得不在笔试后再加一轮人工筛简历。

配置

认知 + 逻辑 + 职业倾向三模块 CAT,平均抽题 18 道;AIG 流水线每两周补充一批标定新题;行为监测与文本相似度检测全程开启。

结果

分数分布恢复正态,顶部堆积消失。217 例疑似作弊被标记,其中经追问验证确认 137 例,成绩作废处理。HR 初筛工时下降约七成,笔试后直接进面的比例首次有了测量依据。

「第一次有厂商把『动态出题』解释成我们听得懂的工程参数,而不是一句 AI 口号。」— 集团校招负责人 · 项目复盘会记录
OUTCOME LOG · CASE-01VERIFIED
-52%
平均题量
40 题 → 19 题 · SE 持平
-41%
测评时长
完测率 +9pp
217
疑似作弊标记
追问验证确认 137 例
-70%
HR 初筛工时
校招组 6 人 → 2 人
BOUNDARY / 适用边界以上为单一校招季数据;分数对入职绩效的长期预测效度仍在追踪(当前样本为入职 6 个月,r=.28,n=1,104)。
CASE-02 · MANAGEMENT TRAINEE

某全国性商业银行:管培生选拔的人机双轨制

行业金融 · 总行管培项目
规模1,500 人 / 年
引擎配置L3 对话追问 + L5 逐人报告
周期全年 · 人机平行评分 90 天

背景

管培选拔历来依赖专家面试,成本高、口径漂移大,且监管对自动化决策的合规要求逐年收紧——银行需要一套「AI 提效、但每一步都能向监管解释」的方案。

配置

对话式追问 + Rubric 12 锚点量表,AI 评分与人类专家双轨并行 90 天;低置信评分自动路由专家复核;按受保护特征分组做差异影响监测,全程留痕可审计。

结果

双轨期人机一致性稳定在 κ=0.79,达到上线门槛后 AI 评分转正、专家转为抽检制。年度偏见审计按「4/5 法则」通过,无分组差异影响比低于 0.8 的维度。

「评审专家从『每份都看』变成『只看有分歧的』,但没有任何一个分数是 AI 单独说了算的。」— 总行人力资源部 · 项目验收报告
OUTCOME LOG · CASE-02VERIFIED
0.79
人机一致性 κ
双轨期 90 天均值
100%
偏见审计通过
4/5 法则 · 全部维度
.31
绩效相关 r
入职 6 个月 · n=187
-64%
专家评阅工时
抽检制后
BOUNDARY / 适用边界绩效相关样本仅一届管培生(n=187),置信区间较宽;跨年度稳定性待第二届数据验证。
CASE-03 · INTERNAL MOBILITY

某互联网平台:晋升评审,从「感觉」到「曲线」

行业互联网 · 技术序列
规模2,300 人 / 季度盘点
引擎配置L1 CAT + L4 滚动常模 + L5 报告
周期连续 4 个季度

背景

技术晋升评审会的常态:每位候选人讨论 40 分钟,大量时间花在评委之间对齐「他到底什么水平」。一年一次的盘点数据,到评审时已经过期半年。

配置

季度 20 分钟 CAT 短测,滚动常模按「技术序列 × 职级带」月度更新;晋升评审材料中嵌入个人成长曲线与团队分布位置,九宫格仅作建议、不作结论。

结果

评审会平均时长下降近六成——争议减少不是因为数据替人做了决定,而是评委们在讨论前就对齐了对事实的认知。晋升申诉率下降 44%,员工侧反馈「至少知道自己是被什么标准衡量的」。

「评审会终于从辩论赛变成了决策会。曲线放在那里,我们要讨论的是例外,而不是事实。」— 技术委员会秘书 · 季度复盘
OUTCOME LOG · CASE-03VERIFIED
-58%
评审会平均时长
40min → 17min / 人
-44%
晋升申诉率
4 季度均值 vs 前一年
0.4σ
可识别的成长幅度
连续两季度最小可检变化
T+0
盘点报告出具
测评当日生成
BOUNDARY / 适用边界前两季度使用行业合成常模(自有常模积累中),跨公司比较结论需谨慎;九宫格建议不参与强制分布。
CASE-04 · MENTAL HEALTH SCREENING

某大型制造集团:3.1 万员工的心理筛查,从「没人填」到「填得完」

行业制造业 · 员工心理关怀(EAP)
规模31,000 人 / 年度两轮
引擎配置L1 CAT + L4 常模 + L5 报告
周期年度两轮 · 伦理审查先行

背景

集团此前用全量表年度普测:单份 15–20 分钟,流水线员工填写率不足四成,且集中填写时敷衍作答比例高——数据量有了,数据质量没有。HR 真正需要的转介线索,淹没在噪声里。

配置

专家审定的标准量表题库 + CAT 自适应施测:低风险者平均 6 题收敛,高风险信号才展开探测。阳性结果不生成任何自动化结论,直接路由 EAP 咨询师;雇主侧只能看到聚合匿名分布(n≥30)。伦理审查与转介机制先于系统上线。

结果

平均填写时长降至 5 分钟以内,填写率首次过半;经 EAP 复核的转介准确率 86%——系统筛出的高风险个案中,绝大多数确实需要人工介入。漏报率经抽样回访评估为 4.1%,已在报告中如实披露。

「筛查的价值不是测得多,而是该被看见的人真的被看见了——而且没有人在流程里被机器贴标签。」— 集团 EAP 项目负责人 · 年度复盘
OUTCOME LOG · CASE-04VERIFIED
-68%
平均填写时长
16min → 5min
52%
填写率
vs 上一年 38% · +14pp
86%
转介准确率
EAP 人工复核口径
4.1%
漏报率(如实披露)
抽样回访评估
BOUNDARY / 适用边界漏报率基于抽样回访(n=620),存在抽样误差;心理筛查不构成医学诊断,系统在任何环节都不输出诊断性结论。
CASE-05 · DYNAMIC NPS

某连锁咖啡品牌:NPS 开放题,从「还行」到可执行的证据

行业连锁餐饮 · 客户体验(CX)
规模46 万份问卷 / 半年
引擎配置L2 追问生成 + L3 对话追问 + L5 摘要
周期半年 · 2 周主题树校准

背景

品牌每月回收约 8 万份 NPS 问卷,但 80% 的开放题只有「还行」「不错」这类无效文本。CX 团队知道分数,不知道为什么;门店收到低分告警,收到的只有一句情绪,没有任何可改进的线索。

配置

打分后按分数段与回答内容动态追问 ≤3 轮:9 分追问「哪一点最值得推荐」,3 分追问「具体哪个环节」;文本按主题树聚类 × 情感 × 紧急度分析,贬损者实时路由区域督导,门店 / 产品 / 管理层各收一份视角摘要。

结果

可执行反馈(含具体场景与对象)占比从 18% 升至 61%。其中「出杯速度」主题被聚类定位到 23 家门店的午高峰动线问题,整改后这些门店的 NPS 环比上升 11 分。

「以前 NPS 是 monthly report 里的一个数字,现在它是督导每天早上打开的待办清单。」— 客户体验总监 · 季度业务回顾
OUTCOME LOG · CASE-05VERIFIED
3.4×
可执行反馈占比
18% → 61%
23
门店被定位整改
「出杯速度」主题聚类
+11
整改门店 NPS 环比
整改后 8 周均值
90s
平均完成时长
移动端 · 含追问
BOUNDARY / 适用边界NPS 环比提升与整改存在同期营销活动的混杂因素,未做严格因果识别;「可执行反馈」按含具体场景与对象的文本占比计。

数据口径说明

以上数字均来自客户项目验收材料或双方确认的复盘记录,统计口径以各案例标注为准。κ 为 Cohen's Kappa;r 为 Pearson 相关;SE 为测量标准误。案例中「确认作弊」均经过至少两道独立证据。我们不出示无法验证的数字——如果您需要,可在保密协议下查阅原始口径说明。

下一个案例,可以是你的场景。

我们接受试点:8 周、可量化验收指标、效度报告随交付。达不到约定门槛,合同里有退出条款。