三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus

Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus

文章核心总结与翻译

一、主要内容

本文提出了一种可解释的混合框架,用于大规模文本语料库的叙事分析,核心是将词袋模型(BoW)的主题建模与基于大型语言模型(LLM)的问答(Q&A)叙事模型相结合,共享再生核希尔伯特空间(RKHS)的潜在表示。

核心流程

  1. 主题筛选:通过BoW主题模型对语料库进行无监督主题学习,由LLM筛选出与用户兴趣相关的主题及对应文档;
  2. 问答生成:LLM设计分类问题并对筛选后的文档作答,将文档转化为结构化的Q&A向量;
  3. 叙事建模:基于Q&A数据构建双softmax叙事模型,每个叙事对应一组问答概率分布(PMF),可解释为对语料的连贯视角;
  4. 高效推断与外推:通过函数梯度下降实现模型学习,借鉴Transformer架构设计上下文问答外推机制,无需重复查询LLM即可预测未标注文档的问答结果;
  5. 多场景验证:在联合国大会演讲(2002-2007)、NeurIPS会议论文(1987-2019)等数据集上验证,支持跨语言分析(中英双语)。

关键优势

  • 可解释性:从问题设计、叙事结构到证据溯源均透明可审计;
  • 高效性:减少LLM重复调用成本,支持大规模语料扩展;
  • 灵活性:适配多语言、多领域(地
← 返回列表