Evaluating Open-Weight Large Language Models for Structured Data Extraction from Narrative Medica...
📅 2026/7/25 2:48:38
👁️ 阅读次数
📝 编程学习
文章核心总结与创新点
主要内容
该研究系统评估了15款开源大语言模型(LLMs)在多场景、多语言临床报告(病理和放射学)结构化信息提取中的表现,覆盖结直肠癌肝转移、肝癌、神经退行性疾病等6类疾病,涉及荷兰语、英语、捷克语三种语言。通过对比零样本、少样本、思维链等6种提示策略,结合人工标注共识作为基准,分析模型规模、领域专业性、提示策略对提取性能的影响,最终验证了中小规模通用型LLMs在优化提示策略下,可达到接近专家标注的提取效果。
创新点
- 首次跨多医疗领域(病理+放射学)、多语言、多模型规模开展开源LLMs结构化提取系统评估,突破以往单一任务、单语言研究局限。
- 验证了中小规模通用型LLMs(4B-150B参数)性能与大型模型相当,且优于医疗专用LLMs,为资源有限机构提供实用方案。
- 提出提示图(Prompt Graph)策略,相比零样本提示实现12.7%的性能提升,明确了优化提示策略比模型规模更能影响提取效果。
- 提供开源框架与标准化基准,支持研究者快速适配自有数据集,降低临床数据结构化应用门槛。
英文原文翻译(Markdown格式)
Abstract(摘要)
背景:大型语言模型(LLMs)正越来越多地被探索用于从自由文本临床记录中提取结构化信息。然而,大多数研究聚焦于单一任务、有限模型和英语报告,在疾病类型、语言、提示策略和报告类型等维度的性能理解上存在空白
编程学习
技术分享
实战经验