以下案例覆盖人才测评、心理健康与 NPS 客户体验三类场景,均经客户授权脱敏发布。每个案例按「背景 → 配置 → 结果 → 边界」记录——最后一栏尤其重要:我们只承诺数据能支撑的结论,边界写在那里,是因为它们真的存在。
原笔试题库使用四年,培训机构整理出覆盖率约七成的「真题集」公开售卖。分数分布逐年右移、顶部堆积,HR 不得不在笔试后再加一轮人工筛简历。
认知 + 逻辑 + 职业倾向三模块 CAT,平均抽题 18 道;AIG 流水线每两周补充一批标定新题;行为监测与文本相似度检测全程开启。
分数分布恢复正态,顶部堆积消失。217 例疑似作弊被标记,其中经追问验证确认 137 例,成绩作废处理。HR 初筛工时下降约七成,笔试后直接进面的比例首次有了测量依据。
管培选拔历来依赖专家面试,成本高、口径漂移大,且监管对自动化决策的合规要求逐年收紧——银行需要一套「AI 提效、但每一步都能向监管解释」的方案。
对话式追问 + Rubric 12 锚点量表,AI 评分与人类专家双轨并行 90 天;低置信评分自动路由专家复核;按受保护特征分组做差异影响监测,全程留痕可审计。
双轨期人机一致性稳定在 κ=0.79,达到上线门槛后 AI 评分转正、专家转为抽检制。年度偏见审计按「4/5 法则」通过,无分组差异影响比低于 0.8 的维度。
技术晋升评审会的常态:每位候选人讨论 40 分钟,大量时间花在评委之间对齐「他到底什么水平」。一年一次的盘点数据,到评审时已经过期半年。
季度 20 分钟 CAT 短测,滚动常模按「技术序列 × 职级带」月度更新;晋升评审材料中嵌入个人成长曲线与团队分布位置,九宫格仅作建议、不作结论。
评审会平均时长下降近六成——争议减少不是因为数据替人做了决定,而是评委们在讨论前就对齐了对事实的认知。晋升申诉率下降 44%,员工侧反馈「至少知道自己是被什么标准衡量的」。
集团此前用全量表年度普测:单份 15–20 分钟,流水线员工填写率不足四成,且集中填写时敷衍作答比例高——数据量有了,数据质量没有。HR 真正需要的转介线索,淹没在噪声里。
专家审定的标准量表题库 + CAT 自适应施测:低风险者平均 6 题收敛,高风险信号才展开探测。阳性结果不生成任何自动化结论,直接路由 EAP 咨询师;雇主侧只能看到聚合匿名分布(n≥30)。伦理审查与转介机制先于系统上线。
平均填写时长降至 5 分钟以内,填写率首次过半;经 EAP 复核的转介准确率 86%——系统筛出的高风险个案中,绝大多数确实需要人工介入。漏报率经抽样回访评估为 4.1%,已在报告中如实披露。
品牌每月回收约 8 万份 NPS 问卷,但 80% 的开放题只有「还行」「不错」这类无效文本。CX 团队知道分数,不知道为什么;门店收到低分告警,收到的只有一句情绪,没有任何可改进的线索。
打分后按分数段与回答内容动态追问 ≤3 轮:9 分追问「哪一点最值得推荐」,3 分追问「具体哪个环节」;文本按主题树聚类 × 情感 × 紧急度分析,贬损者实时路由区域督导,门店 / 产品 / 管理层各收一份视角摘要。
可执行反馈(含具体场景与对象)占比从 18% 升至 61%。其中「出杯速度」主题被聚类定位到 23 家门店的午高峰动线问题,整改后这些门店的 NPS 环比上升 11 分。
以上数字均来自客户项目验收材料或双方确认的复盘记录,统计口径以各案例标注为准。κ 为 Cohen's Kappa;r 为 Pearson 相关;SE 为测量标准误。案例中「确认作弊」均经过至少两道独立证据。我们不出示无法验证的数字——如果您需要,可在保密协议下查阅原始口径说明。