一、企业考试中的AI出题,和普通AI问答不是一回事
很多人第一次设计AI出题功能时,思路通常比较直接。
例如把培训资料发送给大模型,然后使用类似下面的提示词:
根据以下培训资料生成20道单选题,每道题包含题干、4个选项、标准答案和解析。
模型很快就可以返回20道题。
如果只是内部练习,这种方式可能已经够用。
但是如果这些题目要进入正式考试题库,问题就复杂得多。
企业考试通常具有几个明显特点:
答案必须以企业提供的资料为准;
题目可能直接影响员工培训成绩;
部分考试与岗位资格、安全培训、制度考核相关;
题目和答案必须能够追溯来源;
同一道题可能被几百甚至几千名员工使用;
错误答案可能导致大批成绩需要重新计算。
所以企业考试系统不能只关注:
“AI能不能生成题目?”
而应该关注:
“AI生成的题目能不能安全进入正式题库?”
这两个问题完全不同。
二、AI自动出题最容易出现哪些问题?
实际设计AI命题功能时,至少要重点防范以下几类问题。
1. AI补充了培训资料中不存在的内容
假设企业培训资料中写的是:
“新员工进入生产区域前,应完成三级安全教育。”
如果模型自身知识中包含大量安全生产相关资料,它可能在生成题目时加入:
“三级安全教育分别由公司级、车间级、班组级组织。”
这一描述在某些场景中可能成立。
但问题在于:
用户上传的培训资料里并没有这句话。
对于企业考试来说,这就是一个非常重要的边界。
AI不能因为“知道更多”,就自动把外部知识加入企业内部考试。
否则就可能出现:
培训资料讲的是A;
AI根据通用知识生成了B;
员工按照培训资料选择A;
系统却按照AI答案判错。
因此企业AI命题的第一条原则应该是:
答案必须来自指定培训资料,而不是来自模型自身的通用知识。
三、为什么会产生所谓的“幻觉题”?
从大模型工作机制来看,它更擅长做的是:
根据上下文生成概率上最合理的文本。
而不是传统数据库意义上的:
查询一个已经确定的唯一答案。
因此在企业AI命题过程中,如果没有知识边界约束,大模型可能会:
补全材料中没有说明的信息;
将常识当成企业制度;
把两个章节内容组合到一起;
根据上下文推导出一个“看起来正确”的答案;
将过期资料与当前资料混用;
对模糊内容进行自行解释。
在普通聊天中,这些问题有时并不严重。
但一旦进入考试题库,就会变成:
题目错误、答案错误和评分争议。
因此,正式AI命题系统不能只使用Prompt,还需要引入知识库和审核机制。
四、正确的AI命题架构应该是什么样?
一个相对完整的企业AI命题链路可以设计为:
培训资料上传
↓
文档解析
↓
章节拆分
↓
知识点提取
↓
企业知识库
↓
指定知识范围
↓
AI生成候选题
↓
题目结构校验
↓
答案一致性校验
↓
重复题检测
↓
难度与题型检查
↓
人工审核
↓
正式题库
这里有一个很重要的概念:
AI首先生成的应该是“候选题”,而不是“正式题”。
只有通过规则校验和人工审核后,才允许进入正式题库。
这个设计看似增加了几个步骤,实际上可以大幅降低后期考试纠错成本。
五、第一道防线:知识库约束
AI命题最重要的一步,是建立资料边界。
例如企业上传:
《员工安全培训手册.pdf》
《2026年度生产管理制度.docx》
《设备操作规范.pdf》
系统首先不要直接要求AI出题,而应该先进行文档解析。
例如拆分为:
文档:员工安全培训手册 第一章:安全管理基本要求 1.1 员工入厂要求 1.2 劳动防护用品 1.3 危险区域管理 第二章:事故处理 2.1 事故报告 2.2 应急响应 2.3 事故复盘随后进一步形成知识片段。
例如:
knowledge_id:K202608090001 document: 员工安全培训手册.pdf chapter: 1.2 劳动防护用品 content: 员工进入指定生产区域前,应按照岗位要求正确佩戴安全帽、 防护服及其他规定的劳动防护用品。AI生成试题时,不再把整个互联网知识作为答案依据,而是明确要求:
只能根据指定knowledge_id对应的内容生成试题。
六、RAG在AI出题中的作用是什么?
这里就可以引入RAG,也就是检索增强生成。
简单理解就是:
先找资料,再让AI根据资料生成。
例如管理员选择:
岗位:设备维护人员
知识点:设备检修安全
题型:单选题
数量:10道
系统不是直接告诉AI:
请生成10道设备检修安全题。
而是先从企业知识库中检索与“设备检修安全”最相关的知识片段。
例如:
K001:设备检修前必须切断电源。 K002:检修前应悬挂警示标识。 K003:特殊设备检修需要执行双人确认制度。 K004:检修完成后需要填写检修记录。然后将这些知识片段与命题要求一起发送给模型。
这样模型生成内容的范围会明显缩小。
换句话说:
不是让AI自己想应该考什么,而是告诉AI只能根据哪些内容出题。
七、只做RAG还不够,还需要强制“来源绑定”
企业考试系统最好进一步要求:
每一道AI题必须绑定来源。
例如一道人机生成的题目:
题干: 设备检修前首先应该进行哪项操作? A. 填写检修总结 B. 切断设备电源 C. 更换操作人员 D. 启动备用设备 答案: B 知识点: 设备检修安全 来源文档: 设备安全管理制度.pdf 来源章节: 第三章 设备检修 来源知识片段: K202608090025这种设计有两个好处。
第一,管理员审核题目时可以直接查看原文。
第二,如果后续员工对题目提出异议,可以快速追溯:
这道题到底根据哪一段培训资料生成。
这比只保存题干和标准答案要可靠得多。
八、第二道防线:题目结构校验
大模型返回内容之后,首先不要校验知识,而应该先检查数据结构。
例如系统要求AI必须返回:
{ "questionType": "single", "stem": "题干", "options": [ "选项A", "选项B", "选项C", "选项D" ], "answer": ["B"], "analysis": "答案解析", "knowledgePoint": "知识点", "sourceId": "K202608090025" }系统收到数据后,可以首先进行程序校验。
例如:
单选题是否只有一个答案?
多选题是否至少有两个正确答案?
答案是否存在于选项中?
是否缺少题干?
是否存在空选项?
是否存在完全相同的选项?
判断题答案是否只能为“正确/错误”?
这些问题完全没有必要交给人工发现。
程序就可以直接拦截。
九、第三道防线:答案一致性校验
这是AI题目质检中非常关键的一步。
一种比较实用的方法是:
生成模型和校验模型分离。
第一阶段:
模型A负责出题。
第二阶段:
模型B重新根据原始知识片段独立回答这道题。
例如:
AI第一次生成:
题目: 设备检修前首先应该做什么? AI答案: B. 切断电源系统随后把:
原始知识片段;
题目;
选项;
重新交给验证流程。
验证模型需要回答:
根据提供的资料重新判断正确答案。 如果资料无法确定答案,请返回: UNSURE如果第二次得到的答案仍然是:
B说明一致性相对较高。
如果第二次得到:
C或者:
UNSURE这道题就不应该自动进入题库,而应该进入人工复核队列。
十、为什么一定要允许模型回答“不确定”?
很多AI系统容易忽略一个非常重要的设计:
允许AI不知道。
如果Prompt要求:
必须从ABCD中选择一个正确答案。
那么即使资料不足,大模型也必须选择一个。
这就非常容易制造错误答案。
更合理的设计应该是:
如果当前资料不足以唯一确定标准答案, 禁止猜测。 返回: UNSURE企业AI命题系统应该把:
“无法出题”
视为一个正常结果。
而不是强迫AI:
“必须出一道题。”
从系统设计角度来说:
少生成一道题没有什么问题;
生成一道错误题进入正式考试,问题反而更大。
十一、第四道防线:检测“多个正确答案”
单选题最常见的问题,并不是完全没有正确答案,而是:
存在两个看起来都正确的答案。
例如:
发生设备异常时应该: A. 立即停止相关操作 B. 根据规定报告负责人 C. 继续观察设备运行 D. 删除运行记录如果培训资料同时要求:
立即停止操作;
并报告负责人。
那么A和B实际上都可能成立。
但AI却可能把这道题生成成单选题。
因此题目审核时,可以增加:
选项唯一性检查。
让验证模型分别判断:
A是否正确? B是否正确? C是否正确? D是否正确?如果检测结果为:
A:正确 B:正确 C:错误 D:错误那么这道单选题就应该直接标记为:
答案不唯一。
系统可以选择:
自动改为多选题;
返回AI重新生成;
进入人工审核。
十二、第五道防线:重复题检测
AI一次生成几十甚至几百道题时,很容易出现一种情况:
文字不同,但考察的是同一件事情。
例如:
题目1:
设备检修前首先应该做什么?
题目2:
进行设备检修作业之前,操作人员应优先执行哪一步?
这两个题目文字不同,但本质高度相似。
传统字符串匹配可能发现不了。
这时可以使用Embedding向量进行语义相似度检测。
例如将新题与题库现有试题进行向量比较。
如果:
similarity > 0.92则标记:
高度相似
如果:
0.82 < similarity <= 0.92则标记:
疑似重复
最终交给管理员确认是否入库。
需要注意的是,这里的阈值不能机械固定,不同行业、题库规模和题型都可以单独调优。
十三、第六道防线:控制题目难度
AI出题还有一个很常见的问题:
管理员要求:
生成10道中等难度题。
最后可能出现:
8道几乎直接从原文抄答案;
2道需要复杂推理。
所以题目难度不能只依赖模型自己标记。
企业考试系统可以采用多个维度评估:
1. 知识层级
是简单记忆,还是理解和应用?
2. 答案显著程度
答案是否可以直接从题干中推断出来?
3. 干扰项质量
错误选项是不是一眼就能排除?
4. 推理步骤
是否需要结合两个以上知识点?
5. 历史作答数据
题目正式使用以后,还可以根据真实答题数据重新计算难度。
例如某道题:
1000人作答;
950人答对。
那么即使AI最初将它标记为“困难”,实际上它也更可能是一道简单题。
所以长期来看:
AI预测难度 + 历史作答数据
应该结合使用。
十四、人工审核为什么仍然不能取消?
做到这里可能会有人问:
既然已经进行了这么多自动校验,还需要人工审核吗?
答案仍然是:
正式考试建议保留人工审核。
原因很简单。
程序可以判断:
答案格式是否正确;
是否重复;
是否缺少选项;
是否存在明显歧义;
是否超出资料范围。
但是企业内部还有很多业务语义,AI并不了解。
例如:
某项制度已经发布新版本,但旧文件还存在知识库;
某个岗位实际执行的是集团补充规定;
某项政策只适用于特定分公司;
某个安全要求在不同生产区域执行标准不同。
这些情况仅靠模型很难完全判断。
因此更合理的设计不是:
AI替代命题人员。
而是:
AI完成80%左右的机械工作,人工完成最后的业务确认。
十五、正式题库最好增加“AI题目状态”
传统题库通常只有:
启用;
停用。
如果加入AI命题,建议增加更加细化的生命周期。
例如:
AI生成 ↓ 自动质检中 ↓ 质检失败 或 待人工审核 ↓ 审核通过 ↓ 正式题库 ↓ 已用于考试甚至可以增加字段:
AI生成时间 生成模型 来源资料 知识片段ID 自动质检结果 人工审核人 审核时间 修改记录 正式入库时间这样以后无论是系统管理员还是技术人员,都能够知道:
这道题是怎么来的。
十六、AI题目修改后,为什么要保留版本?
还有一个容易被忽略的问题。
AI生成一道题以后,管理员可能修改:
题干;
选项;
答案;
解析。
如果直接覆盖原数据,后面就很难知道:
到底是AI原始答案错了;
还是人工修改以后出现错误。
因此可以设计:
Question QuestionVersion例如:
QuestionID:10086 Version 1: AI原始生成 Version 2: 管理员第一次修改 Version 3: 审核人员修改答案 Version 4: 正式发布版本对于正式考试系统来说,版本控制不仅适用于试卷,同样适用于题目。
十七、宏远培训考试系统中的AI命题可以怎样设计?
以企业培训考试系统的实际应用场景为例,AI命题不应该成为一个孤立功能。
更合理的方式,是让它与已有培训业务结合。
例如宏远培训考试系统中,可以按照这样的业务链路组织AI命题:
企业上传培训资料
↓
系统识别课程章节
↓
建立知识点
↓
选择课程或知识范围
↓
AI生成单选、多选、判断等候选题
↓
自动检查题目结构
↓
检查答案与资料一致性
↓
检测重复题
↓
管理员人工审核
↓
进入正式题库
↓
参与固定组卷或随机组卷
↓
员工正式考试
↓
根据答题结果分析知识点掌握情况
这样AI就不再只是一个:
“点击按钮生成20道题”
的小工具。
而是进入:
课程 → 知识点 → 题库 → 试卷 → 考试 → 数据分析
整个培训考试体系。
对于企业来说,这种AI能力才更有实际价值。
十八、真正有价值的不是“AI一次生成多少题”
现在很多系统介绍AI命题时,会重点强调:
“一分钟生成100道题。”
从技术上看,生成100道题并不困难。
真正困难的问题其实是:
这100道题里有多少可以直接使用?
多少题答案唯一?
多少题与企业资料一致?
多少题没有重复?
多少题难度合理?
多少题可以安全用于正式考试?
假设:
AI一次生成100道题;
最终只有40道能够使用。
那么表面上生成速度很快,管理员实际上仍然需要大量时间审核。
因此评价企业AI命题能力,不能只看:
生成速度。
更应该看:
有效题目率。
十九、可以建立AI题目质量评分
为了方便管理员快速审核,还可以给每一道AI题生成一个质量评分。
例如:
资料一致性:30分 答案唯一性:20分 题目完整性:15分 重复度:15分 干扰项质量:10分 难度匹配:10分满分100。
例如:
题目A: 资料一致性:30 答案唯一性:20 完整性:15 重复度:14 干扰项:9 难度匹配:8 综合评分:96系统可以设置:
90分以上: 优先审核 70-90分: 普通审核 70分以下: 建议重新生成这样管理员就不需要从几百道AI试题中无差别逐题检查。
二十、AI命题最终应该形成完整证据链
如果AI未来大量参与企业正式考试,那么题目本身也应该具备一定的可追溯能力。
理想情况下,一道AI题应该能够追溯:
谁上传了培训资料 ↓ 使用了哪个版本的资料 ↓ 引用了哪个知识片段 ↓ 什么时候调用AI生成 ↓ AI最初生成了什么内容 ↓ 经过哪些自动检查 ↓ 检查结果是什么 ↓ 哪个管理员进行了人工审核 ↓ 管理员修改了哪些内容 ↓ 什么时候进入正式题库 ↓ 参加过哪些正式考试这实际上和在线考试中的答题日志、交卷日志、考试版本控制思路非常类似。
考试系统发展到一定阶段以后,真正重要的能力往往不是:
有没有这个功能。
而是:
出了问题以后能不能解释清楚。
二十一、一个更完整的AI命题技术架构
如果把整个方案整理成技术架构,大致可以分成五层。
第一层:资料层
包括:
Word;
PDF;
PPT;
培训制度;
岗位手册;
产品资料;
安全规程;
课程资料。
第二层:知识处理层
负责:
文档解析;
章节识别;
文本切片;
知识点提取;
Embedding;
向量检索;
版本管理。
第三层:AI生成层
负责:
Prompt模板;
RAG知识召回;
题型控制;
难度控制;
知识点控制;
结构化输出。
第四层:AI质检层
负责:
结构检查;
答案一致性;
答案唯一性;
资料范围检测;
重复题检测;
敏感内容检测;
难度分析。
第五层:业务审核层
负责:
人工审核;
题目修改;
版本记录;
正式入库;
试卷组卷;
正式考试;
考后统计。
这五层组合起来以后,AI出题才真正从:
大模型Demo
变成:
可以进入企业生产环境的考试系统能力。
二十二、结语
AI确实正在改变企业考试系统的命题方式。
过去一个管理员可能需要花几个小时阅读资料、整理知识点、编写几十道题。
现在借助大模型,同样的初步工作可能很快就可以完成。
但对于正式考试来说:
“生成出来”不等于“可以使用”。
真正可靠的AI命题系统,必须解决四个核心问题:
第一,AI只能基于指定企业知识出题;
第二,每一道题都应该能够追溯原始资料;
第三,AI生成以后必须经过自动质量检测;
第四,正式进入题库之前仍然要保留人工审核。
因此未来企业培训考试系统中,真正有竞争力的AI命题能力,不会只是一个“AI出题”按钮。
而应该是一套完整的:
知识库约束 + AI生成 + 自动质检 + 人工审核 + 版本追溯
的题目生产体系。
只有把这些环节真正串起来,AI才能从提高命题效率的辅助工具,逐渐成为企业培训考试数字化体系中真正可靠的一部分