DYNAMIC QUESTIONNAIRE ENGINE · CAT × AIG × IRT

问卷的下一题,
上一题的答案决定。

Quiz-AI 动态问卷与测评引擎:CAT 自适应抽题 × AI 自动出题 × 对话式追问 × 滚动常模校准 × 逐人生成报告。人才测评、心理筛查、NPS 客户体验——所有用到问卷的地方,五个环节的动态,每一环都有信效度担保。

CAL.GRID 64×64 · θ EST. RUNNING · σ=0.31
[CAT] θ=0.42 → select item #3417 (b=0.51, a=1.32)
01 问题陈述 / THE OLD LEDGER

传统问卷的三笔旧账

DEBT_01

题库固化

题目泄露、练习效应,题库开发以「年」为周期。同一套题在招聘季被反复刷穿,区分度逐季衰减。

DEBT_02

常模静态

常模样本一采用五年,分数区间 + 固定评语查表出报告。人群分布早已漂移,参照系却还停在原处。

DEBT_03

「AI 动态」话术泛滥

每家厂商都说自己「动态」。但动态发生在哪一环?出题、抽题、追问、评分还是报告?没人说得清。

Quiz-AI 的回答:把「动态」拆成五层,每层给出可验证的实现。
02 产品逻辑 / FIVE LAYERS OF DYNAMIC

五层动态引擎

「动态」不是一句广告语,而是五个可独立验证的工程环节。向下滚动,逐层拆解——每一层都标明它的数据依赖。敢写明依赖,才敢谈效度。

L1 · 选题路径动态

CAT 自适应抽题

每答一题,系统实时更新能力估计 θ,下一题从题库中选择信息函数最大的题目。能力强的人遇到的题更难,题题不同路——练习效应在选题层就被瓦解。

DATA DEPENDENCYPLATE·L1
L1 · 需要标定题库(IRT 参数 b/a 已校准)
FIG.1 — θ CONVERGENCE / ITEM-BY-ITEM
θ 作答数 → TRUE θ = 0.42 θ̂ = -0.83 · SE=0.91
L2 · 题目内容动态

AIG 自动出题

题目不是被「抽」出来的,而是被「生成」出来的。认知模型定义测什么,题目模板定义怎么测,LLM 批量生成候选题,专家审核与试测标定之后才入库——题库以「周」为周期生长。

DATA DEPENDENCYPLATE·L2
L2 · 需要认知模型 + 试测样本人群标定
FIG.2 — ITEM GENERATION PIPELINE
01认知模型construct map
02题目模板item template
03LLM 生成batch generate
04专家审核human review
05标定入库calibrate & bank
L3 · 交互过程动态

对话式追问

AI 面试官听懂候选人刚才说了什么,再决定问什么。模糊的回答会被追问细节,具体的回答会被追问迁移——评分基于 Rubric 量表,而非「感觉」。

DATA DEPENDENCYPLATE·L3
L3 · 无需常模,依赖 Rubric(需定期人机校准)
FIG.3 — ADAPTIVE FOLLOW-UP / LIVE
L4 · 常模/标定动态

滚动常模校准

常模不再是五年一采的阶梯表。每一次施测的匿名化数据回流,常模曲线按月滚动更新——分数永远参照「此刻」的人才市场,而非五年前的快照。

DATA DEPENDENCYPLATE·L4
L4 · 需要持续施测量(客户数据隔离,仅参数回流)
FIG.4 — ROLLING NORM vs STATIC NORM
时间 → STATIC NORM · 5YR STEPS ROLLING NORM · MONTHLY
L5 · 报告内容动态

逐人生成报告

同一份测评数据,不是查表套评语,而是按读者视角逐人生成。HR 看到风险与匹配度,面试官看到追问建议,候选人看到发展反馈——三份报告,三个用途。

DATA DEPENDENCYPLATE·L5
L5 · 需要岗位胜任力模型 + 报告模板库
FIG.5 — REPORT RENDERER / PER-READER
REPORT.HR · CANDIDATE #A-2209GENERATED 0.8s

岗位匹配度:高(P87),录用风险点 1 项

分析与系统思维维度位于常模 P87,与目标岗位模型高度匹配;抗压维度 P41,低于团队均值,建议在试用期配置明确的支持机制。

分析思维 · ANALYTICALP87 ↑
抗压韧性 · RESILIENCEP41
REPORT.INTERVIEWER · CANDIDATE #A-2209GENERATED 0.6s

建议复试追问方向:2 条

候选人在「资源冲突」情境题中选择回避策略,建议复试以真实项目案例追问其升级路径;其分析优势可用一道开放式估算题验证迁移性。

追问 1 · 冲突升级路径CONFLICT
追问 2 · 开放估算验证ESTIMATION
REPORT.CANDIDATE · YOUGENERATED 0.7s

你的突出优势:结构化拆解问题

你在复杂信息中定位关键变量的速度超过 87% 的同龄人。发展建议:在高压时限下,你的决策稳定性有提升空间,可尝试时间盒练习。

优势 · 结构化拆解TOP 13%
建议 · 时间盒训练TIME-BOX
03 效度证据 / VALIDITY DASHBOARD

不谈效度的「动态」,都是话术。

每一项「动态」都对应一个可审计的测量指标。以下数字来自内部验证研究与试点客户数据,边界条件如实标注。

α = 0.00
AI 生成题目的内部一致性
SRC: 2024 内部标定研究 n=12,400 · 与传统题目 α=0.81 无统计学差异(p>.05)
0%
AI 面试评分与人类专家的一致性
SRC: 双盲评分对照 · 评分者间一致性按加权 Kappa 计
≈0%
CAT 相比固定测验节省的题量
SRC: 模拟 + 实测 · 在同等测量精度(SE≤0.32)下
≥0.00
人机复核一致率上线门槛
POLICY: Cohen's Kappa · 未达标模型不得上线评分
SUPPORTING EVIDENCE / CAUTIONARY BOUNDARIES
结构化面试评分可靠性AI 评分 × Rubric 锚定量表
0.80 κ
CAT 测量精度保持题量减半时的标准误控制
SE .32
LLM 裁判需 Rubric 校准未校准评分漂移 · 警示边界
REQ.
小样本岗位常模不足n<300 岗位需用合成常模 · 警示边界
LIMIT
支持性证据警示性边界(如实标注)
04 系统架构 / PIPELINE TOPOLOGY

七个模块,一条闭环

从建模到报告,数据沿管线单向流动、逐模块留痕;末端数据脱敏回流,反哺出题与常模——系统每运转一次,就校准一次自己。

MOD·01建 模 CONSTRUCT MOD·02出 题 AIG MOD·03施 测 CAT MOD·04评 分 SCORING MOD·05参 照 NORMING MOD·06报 告 REPORT MOD·07数据回流 FEEDBACK ANONYMIZED PARAM REFLOW · 参数级回流,原始作答不出域 TOPO.LOG — 7 MODULES · 1 CLOSED LOOP · EVERY STEP AUDITABLE
GUARD·01

信效度验证

每次题库更新、模型迭代,先过信效度门槛再上线,验证报告留档可审计。

GUARD·02

反作弊

行为监测 × 文本相似度检测 × 追问验证三道防线,异常作答实时标记。

GUARD·03

合规审计

全链路留痕:每道题的来源、每次评分的模型版本、每份报告的生成记录。

GUARD·04

人类复核兜底

低置信评分自动路由至人类专家复核,AI 永远不做唯一决策者。

05 安全与合规 / COMPLIANCE WHITEPAPER

按最严格的规则设计

合规框架 / Regulatory

§1.1

EU AI Act · 高风险类目应对

招聘场景属高风险 AI 系统。Quiz-AI 提供完整的技术文档、日志留存与人类监督机制,支持客户完成合规评估。

STATUS: ALIGNED / 技术文档随产品交付
§1.2

NYC Local Law 144 · 偏见审计

支持按年度对评分模型做独立偏见审计(AEDT),按受保护族群分组输出差异影响比,结果可对外公示。

STATUS: AUDIT-READY / 年度审计接口开放
§1.3

中国 PIPL · 自动化决策知情权

候选人知情同意前置;提供自动化决策说明与人工复核申诉通道;数据境内存储,支持删除权行使。

STATUS: COMPLIANT / 候选人端内置知情流程
§1.4

敏感个人信息 · 心理健康数据

心理筛查数据属敏感个人信息:单独同意、加密存储、最小化访问,筛查阳性结果只路由给有资质的人工转介渠道,不出现在任何自动化报告中。

STATUS: COMPLIANT / 伦理审查 + 人工转介双前置

工程承诺 / Engineering

§2.1

评分模型上线即锁定

版本化管理,每次评分可复现、可回溯。同一份作答,任何时候重跑都得到同一分数——这是测量的底线。

COMMIT: REPRODUCIBLE SCORING
§2.2

AI 出证据,人做决策

双轨制:AI 提供证据与建议,录用与否永远由人决定。系统设计上不允许 AI 评分成为唯一淘汰依据。

COMMIT: HUMAN-IN-THE-LOOP
§2.3

不作面部微表情分析

我们只分析语言与行为数据。所谓「微表情识人」没有心理测量学效度支持——我们不会把它卖给你。

COMMIT: NO PSEUDOSCIENCE
06 预约演示 / BOOK A DEMO

让每一次测评,都比上一次更准——而且说得出为什么。

[FORM] 已收到 · 我们将在 1 个工作日内联系您。
DEMO REQUEST LOGGED · REF #