跳到主要内容

AI 判分

AI 判分用于按明确规则处理开放文本答案。系统可以对高置信度结果自动写分,并把低置信度、风险标记、规则失效或模型失败的结果转入人工复核。

AI 评分不能替代评分标准。规则越具体、示例越有代表性,评分结果越稳定。

适用范围

当前版本支持填空题和多行文本题等文本人工题。图片、文件、音视频或其他不支持的题型不会由 AI 猜测评分,需保留为人工任务。

第一步:选择 AI 自动判分

  1. 进入 考试 → 人工评卷,打开目标考试。
  2. 点击 规则与方案
  3. 在分配模式中选择 AI 自动判分
  4. 查看固定题、随机题池和不支持题目的覆盖情况。

AI 自动判分方案

一个考试同一时间只使用一种阅卷模式。切换模式时,仅应调整尚未完成的评分任务。

第二步:配置评分规则

点击 配置评分规则,为每道支持的人工题设置:

  • 纳入 AI 自动评分:决定该题是否进入自动判分方案。
  • 参考答案:描述理想答案和可接受的等价表达。
  • 评分点:把满分拆成可判断的要求;启用评分点的分值之和必须等于题目满分。
  • 扣分与封顶规则:说明缺项、错误、矛盾、危险导向或无关内容的处理方式。
  • 评分示例:提供满分、部分得分和零分示例。
  • 最小评分单位:例如 0.5 分。
  • 自动评分门槛:低于门槛时不自动写分,而是进入人工复核。
  • 评分模型:选择组织已配置且可用的 AI 模型。

AI 评分规则

页面的 智能优化 可以辅助生成参考答案、扣分规则和示例。生成后必须由熟悉业务的人员核对,不能直接把生成内容当作最终评分标准。

编写高质量规则

参考答案

说明必须覆盖的事实、步骤或结论,同时允许不同措辞。不要只粘贴一段范文,否则容易把表达相似度误当作内容正确性。

评分点

每个评分点只描述一个可判断目标,并写明分值。例如“识别风险 4 分”“提出处置步骤 6 分”,比“整体质量 10 分”更容易稳定执行。

扣分与封顶

明确以下边界:

  • 只给结论、没有过程时最高得分;
  • 出现关键事实错误时扣多少分;
  • 多写错误内容如何处理;
  • 自相矛盾或完全无关时是否判 0 分;
  • 哪些风险内容必须转人工复核。

评分示例

至少准备满分、典型部分得分和零分示例。示例应体现评分点,而不是只展示不同长度的答案。

第三步:预览并应用方案

保存规则后返回分配页:

  1. 确认固定题和随机题池的规则覆盖率达到要求。
  2. 点击 预览自动判分
  3. 检查现有待评项、可自动评分项、缺失规则项和不支持项。
  4. 确认无误后点击 确认并应用

保存规则只是保存草稿;只有确认应用后,系统才会冻结当前题目与随机题池快照,并开始自动判分。

第四步:监控与人工复核

应用后,考试页会显示 AI 自动判分进度,包括已配置题目、生成中、已自动评分、待人工复核和失败数量。

AI 判分进度与异常复核

AI 异常复核 中查看题目、答卷、AI 建议、置信度、异常状态和风险标记。复核人员应依据原评分规则独立判断,确认后再提交最终得分。

风险控制建议

  • 高风险认证或资格考试先用历史样卷做一致性验证;
  • 自动评分门槛从较高值开始,再根据复核结果调整;
  • 规则变更后重新预览并应用,不要假设草稿已生效;
  • 对不同语言、极短答案、否定表达和对抗性内容准备测试样例;
  • 定期抽查已自动评分结果,不只关注异常队列;
  • 为最终成绩保留人工申诉和复核流程。

上线检查清单

  • 只纳入了支持的文本人工题
  • 每题参考答案覆盖关键事实和等价表达
  • 评分点分值之和等于题目满分
  • 扣分、封顶和零分规则清晰
  • 至少准备三档评分示例
  • 评分模型可用,自动评分门槛已确认
  • 固定题和随机题池覆盖完整
  • 已预览并确认应用方案
  • 异常复核负责人已明确

常见问题

保存规则后为什么没有开始自动判分?

保存的是项目规则草稿。返回分配页点击 预览自动判分,再 确认并应用,方案才会生效。

低于门槛的答案会被判 0 分吗?

不会。系统不会自动写分,而是把结果转入人工复核。门槛表示自动落分条件,不代表模型正确率。

为什么规则覆盖率没有达到 100%?

检查固定题和随机题池中是否仍有人工题未启用或规则不完整,并查看不支持题目数量。评分点分值不等于满分也会阻止应用。

下一步

完成 AI 判分后,进入 成绩统计 检查待阅卷数量、通过率和成绩分布。