三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

AI自动出题为什么会出错?企业考试系统如何用知识库约束、题目质检与人工审核控制“幻觉题”

AI自动出题为什么会出错?企业考试系统如何用知识库约束、题目质检与人工审核控制“幻觉题”

一、企业考试中的AI出题,和普通AI问答不是一回事

很多人第一次设计AI出题功能时,思路通常比较直接。

例如把培训资料发送给大模型,然后使用类似下面的提示词:

根据以下培训资料生成20道单选题,每道题包含题干、4个选项、标准答案和解析。

模型很快就可以返回20道题。

如果只是内部练习,这种方式可能已经够用。

但是如果这些题目要进入正式考试题库,问题就复杂得多。

企业考试通常具有几个明显特点:

  1. 答案必须以企业提供的资料为准;

  2. 题目可能直接影响员工培训成绩;

  3. 部分考试与岗位资格、安全培训、制度考核相关;

  4. 题目和答案必须能够追溯来源;

  5. 同一道题可能被几百甚至几千名员工使用;

  6. 错误答案可能导致大批成绩需要重新计算。

所以企业考试系统不能只关注:

“AI能不能生成题目?”

而应该关注:

“AI生成的题目能不能安全进入正式题库?”

这两个问题完全不同。


二、AI自动出题最容易出现哪些问题?

实际设计AI命题功能时,至少要重点防范以下几类问题。

1. AI补充了培训资料中不存在的内容

假设企业培训资料中写的是:

“新员工进入生产区域前,应完成三级安全教育。”

如果模型自身知识中包含大量安全生产相关资料,它可能在生成题目时加入:

“三级安全教育分别由公司级、车间级、班组级组织。”

这一描述在某些场景中可能成立。

但问题在于:

用户上传的培训资料里并没有这句话。

对于企业考试来说,这就是一个非常重要的边界。

AI不能因为“知道更多”,就自动把外部知识加入企业内部考试。

否则就可能出现:

培训资料讲的是A;

AI根据通用知识生成了B;

员工按照培训资料选择A;

系统却按照AI答案判错。

因此企业AI命题的第一条原则应该是:

答案必须来自指定培训资料,而不是来自模型自身的通用知识。


三、为什么会产生所谓的“幻觉题”?

从大模型工作机制来看,它更擅长做的是:

根据上下文生成概率上最合理的文本。

而不是传统数据库意义上的:

查询一个已经确定的唯一答案。

因此在企业AI命题过程中,如果没有知识边界约束,大模型可能会:

  • 补全材料中没有说明的信息;

  • 将常识当成企业制度;

  • 把两个章节内容组合到一起;

  • 根据上下文推导出一个“看起来正确”的答案;

  • 将过期资料与当前资料混用;

  • 对模糊内容进行自行解释。

在普通聊天中,这些问题有时并不严重。

但一旦进入考试题库,就会变成:

题目错误、答案错误和评分争议。

因此,正式AI命题系统不能只使用Prompt,还需要引入知识库和审核机制。


四、正确的AI命题架构应该是什么样?

一个相对完整的企业AI命题链路可以设计为:

培训资料上传

文档解析

章节拆分

知识点提取

企业知识库

指定知识范围

AI生成候选题

题目结构校验

答案一致性校验

重复题检测

难度与题型检查

人工审核

正式题库

这里有一个很重要的概念:

AI首先生成的应该是“候选题”,而不是“正式题”。

只有通过规则校验和人工审核后,才允许进入正式题库。

这个设计看似增加了几个步骤,实际上可以大幅降低后期考试纠错成本。


五、第一道防线:知识库约束

AI命题最重要的一步,是建立资料边界。

例如企业上传:

  • 《员工安全培训手册.pdf》

  • 《2026年度生产管理制度.docx》

  • 《设备操作规范.pdf》

系统首先不要直接要求AI出题,而应该先进行文档解析。

例如拆分为:

文档:员工安全培训手册 第一章:安全管理基本要求 1.1 员工入厂要求 1.2 劳动防护用品 1.3 危险区域管理 第二章:事故处理 2.1 事故报告 2.2 应急响应 2.3 事故复盘

随后进一步形成知识片段。

例如:

knowledge_id:K202608090001 document: 员工安全培训手册.pdf chapter: 1.2 劳动防护用品 content: 员工进入指定生产区域前,应按照岗位要求正确佩戴安全帽、 防护服及其他规定的劳动防护用品。

AI生成试题时,不再把整个互联网知识作为答案依据,而是明确要求:

只能根据指定knowledge_id对应的内容生成试题。


六、RAG在AI出题中的作用是什么?

这里就可以引入RAG,也就是检索增强生成。

简单理解就是:

先找资料,再让AI根据资料生成。

例如管理员选择:

岗位:设备维护人员
知识点:设备检修安全
题型:单选题
数量:10道

系统不是直接告诉AI:

请生成10道设备检修安全题。

而是先从企业知识库中检索与“设备检修安全”最相关的知识片段。

例如:

K001:设备检修前必须切断电源。 K002:检修前应悬挂警示标识。 K003:特殊设备检修需要执行双人确认制度。 K004:检修完成后需要填写检修记录。

然后将这些知识片段与命题要求一起发送给模型。

这样模型生成内容的范围会明显缩小。

换句话说:

不是让AI自己想应该考什么,而是告诉AI只能根据哪些内容出题。


七、只做RAG还不够,还需要强制“来源绑定”

企业考试系统最好进一步要求:

每一道AI题必须绑定来源。

例如一道人机生成的题目:

题干: 设备检修前首先应该进行哪项操作? A. 填写检修总结 B. 切断设备电源 C. 更换操作人员 D. 启动备用设备 答案: B 知识点: 设备检修安全 来源文档: 设备安全管理制度.pdf 来源章节: 第三章 设备检修 来源知识片段: K202608090025

这种设计有两个好处。

第一,管理员审核题目时可以直接查看原文。

第二,如果后续员工对题目提出异议,可以快速追溯:

这道题到底根据哪一段培训资料生成。

这比只保存题干和标准答案要可靠得多。


八、第二道防线:题目结构校验

大模型返回内容之后,首先不要校验知识,而应该先检查数据结构。

例如系统要求AI必须返回:

{ "questionType": "single", "stem": "题干", "options": [ "选项A", "选项B", "选项C", "选项D" ], "answer": ["B"], "analysis": "答案解析", "knowledgePoint": "知识点", "sourceId": "K202608090025" }

系统收到数据后,可以首先进行程序校验。

例如:

单选题是否只有一个答案?

多选题是否至少有两个正确答案?

答案是否存在于选项中?

是否缺少题干?

是否存在空选项?

是否存在完全相同的选项?

判断题答案是否只能为“正确/错误”?

这些问题完全没有必要交给人工发现。

程序就可以直接拦截。


九、第三道防线:答案一致性校验

这是AI题目质检中非常关键的一步。

一种比较实用的方法是:

生成模型和校验模型分离。

第一阶段:

模型A负责出题。

第二阶段:

模型B重新根据原始知识片段独立回答这道题。

例如:

AI第一次生成:

题目: 设备检修前首先应该做什么? AI答案: B. 切断电源

系统随后把:

  • 原始知识片段;

  • 题目;

  • 选项;

重新交给验证流程。

验证模型需要回答:

根据提供的资料重新判断正确答案。 如果资料无法确定答案,请返回: UNSURE

如果第二次得到的答案仍然是:

B

说明一致性相对较高。

如果第二次得到:

C

或者:

UNSURE

这道题就不应该自动进入题库,而应该进入人工复核队列。


十、为什么一定要允许模型回答“不确定”?

很多AI系统容易忽略一个非常重要的设计:

允许AI不知道。

如果Prompt要求:

必须从ABCD中选择一个正确答案。

那么即使资料不足,大模型也必须选择一个。

这就非常容易制造错误答案。

更合理的设计应该是:

如果当前资料不足以唯一确定标准答案, 禁止猜测。 返回: UNSURE

企业AI命题系统应该把:

“无法出题”

视为一个正常结果。

而不是强迫AI:

“必须出一道题。”

从系统设计角度来说:

少生成一道题没有什么问题;

生成一道错误题进入正式考试,问题反而更大。


十一、第四道防线:检测“多个正确答案”

单选题最常见的问题,并不是完全没有正确答案,而是:

存在两个看起来都正确的答案。

例如:

发生设备异常时应该: A. 立即停止相关操作 B. 根据规定报告负责人 C. 继续观察设备运行 D. 删除运行记录

如果培训资料同时要求:

立即停止操作;

并报告负责人。

那么A和B实际上都可能成立。

但AI却可能把这道题生成成单选题。

因此题目审核时,可以增加:

选项唯一性检查。

让验证模型分别判断:

A是否正确? B是否正确? C是否正确? D是否正确?

如果检测结果为:

A:正确 B:正确 C:错误 D:错误

那么这道单选题就应该直接标记为:

答案不唯一。

系统可以选择:

  • 自动改为多选题;

  • 返回AI重新生成;

  • 进入人工审核。


十二、第五道防线:重复题检测

AI一次生成几十甚至几百道题时,很容易出现一种情况:

文字不同,但考察的是同一件事情。

例如:

题目1:

设备检修前首先应该做什么?

题目2:

进行设备检修作业之前,操作人员应优先执行哪一步?

这两个题目文字不同,但本质高度相似。

传统字符串匹配可能发现不了。

这时可以使用Embedding向量进行语义相似度检测。

例如将新题与题库现有试题进行向量比较。

如果:

similarity > 0.92

则标记:

高度相似

如果:

0.82 < similarity <= 0.92

则标记:

疑似重复

最终交给管理员确认是否入库。

需要注意的是,这里的阈值不能机械固定,不同行业、题库规模和题型都可以单独调优。


十三、第六道防线:控制题目难度

AI出题还有一个很常见的问题:

管理员要求:

生成10道中等难度题。

最后可能出现:

8道几乎直接从原文抄答案;

2道需要复杂推理。

所以题目难度不能只依赖模型自己标记。

企业考试系统可以采用多个维度评估:

1. 知识层级

是简单记忆,还是理解和应用?

2. 答案显著程度

答案是否可以直接从题干中推断出来?

3. 干扰项质量

错误选项是不是一眼就能排除?

4. 推理步骤

是否需要结合两个以上知识点?

5. 历史作答数据

题目正式使用以后,还可以根据真实答题数据重新计算难度。

例如某道题:

1000人作答;

950人答对。

那么即使AI最初将它标记为“困难”,实际上它也更可能是一道简单题。

所以长期来看:

AI预测难度 + 历史作答数据

应该结合使用。


十四、人工审核为什么仍然不能取消?

做到这里可能会有人问:

既然已经进行了这么多自动校验,还需要人工审核吗?

答案仍然是:

正式考试建议保留人工审核。

原因很简单。

程序可以判断:

答案格式是否正确;

是否重复;

是否缺少选项;

是否存在明显歧义;

是否超出资料范围。

但是企业内部还有很多业务语义,AI并不了解。

例如:

某项制度已经发布新版本,但旧文件还存在知识库;

某个岗位实际执行的是集团补充规定;

某项政策只适用于特定分公司;

某个安全要求在不同生产区域执行标准不同。

这些情况仅靠模型很难完全判断。

因此更合理的设计不是:

AI替代命题人员。

而是:

AI完成80%左右的机械工作,人工完成最后的业务确认。


十五、正式题库最好增加“AI题目状态”

传统题库通常只有:

启用;

停用。

如果加入AI命题,建议增加更加细化的生命周期。

例如:

AI生成 ↓ 自动质检中 ↓ 质检失败 或 待人工审核 ↓ 审核通过 ↓ 正式题库 ↓ 已用于考试

甚至可以增加字段:

AI生成时间 生成模型 来源资料 知识片段ID 自动质检结果 人工审核人 审核时间 修改记录 正式入库时间

这样以后无论是系统管理员还是技术人员,都能够知道:

这道题是怎么来的。


十六、AI题目修改后,为什么要保留版本?

还有一个容易被忽略的问题。

AI生成一道题以后,管理员可能修改:

题干;

选项;

答案;

解析。

如果直接覆盖原数据,后面就很难知道:

到底是AI原始答案错了;

还是人工修改以后出现错误。

因此可以设计:

Question QuestionVersion

例如:

QuestionID:10086 Version 1: AI原始生成 Version 2: 管理员第一次修改 Version 3: 审核人员修改答案 Version 4: 正式发布版本

对于正式考试系统来说,版本控制不仅适用于试卷,同样适用于题目。


十七、宏远培训考试系统中的AI命题可以怎样设计?

以企业培训考试系统的实际应用场景为例,AI命题不应该成为一个孤立功能。

更合理的方式,是让它与已有培训业务结合。

例如宏远培训考试系统中,可以按照这样的业务链路组织AI命题:

企业上传培训资料

系统识别课程章节

建立知识点

选择课程或知识范围

AI生成单选、多选、判断等候选题

自动检查题目结构

检查答案与资料一致性

检测重复题

管理员人工审核

进入正式题库

参与固定组卷或随机组卷

员工正式考试

根据答题结果分析知识点掌握情况

这样AI就不再只是一个:

“点击按钮生成20道题”

的小工具。

而是进入:

课程 → 知识点 → 题库 → 试卷 → 考试 → 数据分析

整个培训考试体系。

对于企业来说,这种AI能力才更有实际价值。


十八、真正有价值的不是“AI一次生成多少题”

现在很多系统介绍AI命题时,会重点强调:

“一分钟生成100道题。”

从技术上看,生成100道题并不困难。

真正困难的问题其实是:

这100道题里有多少可以直接使用?

多少题答案唯一?

多少题与企业资料一致?

多少题没有重复?

多少题难度合理?

多少题可以安全用于正式考试?

假设:

AI一次生成100道题;

最终只有40道能够使用。

那么表面上生成速度很快,管理员实际上仍然需要大量时间审核。

因此评价企业AI命题能力,不能只看:

生成速度。

更应该看:

有效题目率。


十九、可以建立AI题目质量评分

为了方便管理员快速审核,还可以给每一道AI题生成一个质量评分。

例如:

资料一致性:30分 答案唯一性:20分 题目完整性:15分 重复度:15分 干扰项质量:10分 难度匹配:10分

满分100。

例如:

题目A: 资料一致性:30 答案唯一性:20 完整性:15 重复度:14 干扰项:9 难度匹配:8 综合评分:96

系统可以设置:

90分以上: 优先审核 70-90分: 普通审核 70分以下: 建议重新生成

这样管理员就不需要从几百道AI试题中无差别逐题检查。


二十、AI命题最终应该形成完整证据链

如果AI未来大量参与企业正式考试,那么题目本身也应该具备一定的可追溯能力。

理想情况下,一道AI题应该能够追溯:

谁上传了培训资料 ↓ 使用了哪个版本的资料 ↓ 引用了哪个知识片段 ↓ 什么时候调用AI生成 ↓ AI最初生成了什么内容 ↓ 经过哪些自动检查 ↓ 检查结果是什么 ↓ 哪个管理员进行了人工审核 ↓ 管理员修改了哪些内容 ↓ 什么时候进入正式题库 ↓ 参加过哪些正式考试

这实际上和在线考试中的答题日志、交卷日志、考试版本控制思路非常类似。

考试系统发展到一定阶段以后,真正重要的能力往往不是:

有没有这个功能。

而是:

出了问题以后能不能解释清楚。


二十一、一个更完整的AI命题技术架构

如果把整个方案整理成技术架构,大致可以分成五层。

第一层:资料层

包括:

Word;

PDF;

PPT;

培训制度;

岗位手册;

产品资料;

安全规程;

课程资料。

第二层:知识处理层

负责:

文档解析;

章节识别;

文本切片;

知识点提取;

Embedding;

向量检索;

版本管理。

第三层:AI生成层

负责:

Prompt模板;

RAG知识召回;

题型控制;

难度控制;

知识点控制;

结构化输出。

第四层:AI质检层

负责:

结构检查;

答案一致性;

答案唯一性;

资料范围检测;

重复题检测;

敏感内容检测;

难度分析。

第五层:业务审核层

负责:

人工审核;

题目修改;

版本记录;

正式入库;

试卷组卷;

正式考试;

考后统计。

这五层组合起来以后,AI出题才真正从:

大模型Demo

变成:

可以进入企业生产环境的考试系统能力。


二十二、结语

AI确实正在改变企业考试系统的命题方式。

过去一个管理员可能需要花几个小时阅读资料、整理知识点、编写几十道题。

现在借助大模型,同样的初步工作可能很快就可以完成。

但对于正式考试来说:

“生成出来”不等于“可以使用”。

真正可靠的AI命题系统,必须解决四个核心问题:

第一,AI只能基于指定企业知识出题;

第二,每一道题都应该能够追溯原始资料;

第三,AI生成以后必须经过自动质量检测;

第四,正式进入题库之前仍然要保留人工审核。

因此未来企业培训考试系统中,真正有竞争力的AI命题能力,不会只是一个“AI出题”按钮。

而应该是一套完整的:

知识库约束 + AI生成 + 自动质检 + 人工审核 + 版本追溯

的题目生产体系。

只有把这些环节真正串起来,AI才能从提高命题效率的辅助工具,逐渐成为企业培训考试数字化体系中真正可靠的一部分

← 返回列表