AI 判分
AI 判分用于按明确规则处理开放文本答案。系统可以对高置信度结果自动写分,并把低置信度、风险标记、规则失效或模型失败的结果转入人工复核。
AI 评分不能替代评分标准。规则越具体、示例越有代表性,评分结果越稳定。
适用范围
当前版本支持填空题和多行文本题等文本人工题。图片、文件、音视频或其他不支持的题型不会由 AI 猜测评分,需保留为人工任务。
第一步:选择 AI 自动判分
- 进入 考试 → 人工评卷,打开目标考试。
- 点击 规则与方案。
- 在分配模式中选择 AI 自动判分。
- 查看固定题、随机题池和不支持题目的覆盖情况。

一个考试同一时间只使用一种阅卷模式。切换模式时,仅应调整尚未完成的评分任务。
第二步:配置评分规则
点击 配置评分规则,为每道支持的人工题设置:
- 纳入 AI 自动评分:决定该题是否进入自动判分方案。
- 参考答案:描述理想答案和可接受的等价表达。
- 评分点:把满分拆成可判断的要求;启用评分点的分值之和必须等于题目满分。
- 扣分与封顶规则:说明缺项、错误、矛盾、危险导向或无关内容的处理方式。
- 评分示例:提供满分、部分得分和零分示例。
- 最小评分单位:例如 0.5 分。
- 自动评分门槛:低于门槛时不自动写分,而是进入人工复核。
- 评分模型:选择组织已配置且可用的 AI 模型。

页面的 智能优化 可以辅助生成参考答案、扣分规则和示例。生成后必须由熟悉业务的人员核对,不能直接把生成内容当作最终评分标准。
编写高质量规则
参考答案
说明必须覆盖的事实、步骤或结论,同时允许不同措辞。不要只粘贴一段范文,否则容易把表达相似度误当作内容正确性。
评分点
每个评分点只描述一个可判断目标,并写明分值。例如“识别风险 4 分”“提出处置步骤 6 分”,比“整体质量 10 分”更容易稳定执行。
扣分与封顶
明确以下边界:
- 只给结论、没有过程时最高得分;
- 出现关键事实错误时扣多少分;
- 多写错误内容如何处理;
- 自相矛盾或完全无关时是否判 0 分;
- 哪些风险内容必须转人工复核。
评分示例
至少准备满分、典型部分得分和零分示例。示例应体现评分点,而不是只展示不同长度的答案。
第三步:预览并应用方案
保存规则后返回分配页:
- 确认固定题和随机题池的规则覆盖率达到要求。
- 点击 预览自动判分。
- 检查现有待评项、可自动评分项、缺失规则项和不支持项。
- 确认无误后点击 确认并应用。
保存规则只是保存草稿;只有确认应用后,系统才会冻结当前题目与随机题池快照,并开始自动判分。
第四步:监控与人工复核
应用后,考试页会显示 AI 自动判分进度,包括已配置题目、生成中、已自动评分、待人工复核和失败数量。

在 AI 异常复核 中查看题目、答卷、AI 建议、置信度、异常状态和风险标记。复核人员应依据原评分规则独立判断,确认后再提交最终得分。
风险控制建议
- 高风险认证或资格考试先用历史样卷做一致性验证;
- 自动评分门槛从较高值开始,再根据复核结果调整;
- 规则变更后重新预览并应用,不要假设草稿已生效;
- 对不同语言、极短答案、否定表达和对抗性内容准备测试样例;
- 定期抽查已自动评分结果,不只关注异常队列;
- 为最终成绩保留人工申诉和复核流程。
上线检查清单
- 只纳入了支持的文本人工题
- 每题参考答案覆盖关键事实和等价表达
- 评分点分值之和等于题目满分
- 扣分、封顶和零分规则清晰
- 至少准备三档评分示例
- 评分模型可用,自动评分门槛已确认
- 固定题和随机题池覆盖完整
- 已预览并确认应用方案
- 异常复核负责人已明确
常见问题
保存规则后为什么没有开始自动判分?
保存的是项目规则草稿。返回分配页点击 预览自动判分,再 确认并应用,方案才会生效。
低于门槛的答案会被判 0 分吗?
不会。系统不会自动写分,而是把结果转入人工复核。门槛表示自动落分条件,不代表模型正确率。
为什么规则覆盖率没有达到 100%?
检查固定题和随机题池中是否仍有人工题未启用或规则不完整,并查看不支持题目数量。评分点分值不等于满分也会阻止应用。
下一步
完成 AI 判分后,进入 成绩统计 检查待阅卷数量、通过率和成绩分布。