Measuring what Matters: Construct Validity in Large Language Model Benchmarks
📅 2026/7/27 9:10:01
👁️ 阅读次数
📝 编程学习
文章总结与翻译
一、主要内容
该研究聚焦大型语言模型(LLM)基准测试的结构效度问题,通过29位专家对445篇来自顶级ML和NLP会议的基准测试相关论文进行系统性综述,核心内容如下:
- 研究背景:LLM基准测试对评估模型能力、识别安全与鲁棒性问题至关重要,但"安全性""鲁棒性"等抽象现象的测量需具备强结构效度(即测量工具能准确反映目标现象)。当前LLM评估领域缺乏统一标准,结构效度相关的最佳实践尚未明确。
- 研究方法:从ICML、ICLR、NeurIPS等6个核心会议2018-2024年的46,114篇论文中,经关键词筛选、LLM辅助过滤和人工审核,最终纳入445篇符合标准的论文,采用定制编码手册对现象定义、任务设计、评估指标和研究结论等维度进行标注分析。
- 关键发现:
- 78.2%的论文对目标现象提供了定义,但47.8%的定义存在争议或缺乏共识;
- 仅10%的基准测试采用完整真实世界任务,40.7%使用构造任务,且27%存在便利抽样问题;
- 81.3%的基准测试至少部分使用精确匹配指标,仅16%采用统计检验支持结果比较;
- 仅53.4%的论文为基准测试的结构效度提供了证据,几乎所有论文在至少一个维度存在不足。
- 核心建议:提出8项提升LLM基准测试结构效度的关键建议,包括明确现象定义、聚焦目标现象测量、构建代表性数据集、承认数据复用局
编程学习
技术分享
实战经验