长文本问题的本质,不是“装得下“,而是“看得见、记得住、说得准“

📅 2026/7/29 16:30:10 👁️ 阅读次数 📝 编程学习
长文本问题的本质,不是“装得下“,而是“看得见、记得住、说得准“

万字长文塞不进上下文?聊聊提示词压缩、长文本切片和"防幻觉"这三件套

目录

  • 万字长文塞不进上下文?聊聊提示词压缩、长文本切片和"防幻觉"这三件套
    • 1. 为什么"上下文越大≠效果越好"
    • 2. 第一件套:提示词压缩(Prompt Compression)
      • 2.1 Selective Context(剑桥,2023)
      • 2.2 LLMLingua(微软,2023)
      • 2.3 LongLLMLingua(微软,2024)
      • 2.4 LLMLingua-2(微软,2024)
      • 2.5 其他值得一看的方向
    • 3. 第二件套:长文本处理的工程范式
      • 3.1 RAG(检索增强生成)
      • 3.2 Map-Reduce 与 Refine
      • 3.3 层次化摘要(Hierarchical Summarization)
      • 3.4 滑动窗口 / StreamingLLM
      • 3.5 长上下文模型 + 位置编码扩展
    • 4. 第三件套:防止幻觉的关键招式
      • 4.1 强制引用(Citation / Attribution)
      • 4.2 Chain-of-Verification(CoVe,Meta, 2023)
      • 4.3 Self-RAG(华盛顿大学, 2024)
      • 4.4 拒识机制(Refusal / Abstain)
      • 4.5 Self-Consistency
    • 5. 实战组合:一份"长文档问答"参考架构
    • 6. 你需要记住的 3 句话
    • 7. 拓展阅读 & 工具速查

“我把一份 300 页的产品手册扔给 GPT-4,它读了三秒,给我一个一本正经的错误答案。”

如果你也遇到过这种尴尬,这篇文章值得花 8 分钟读完。

1. 为什么"上下文越大≠效果越好"

主流大模型的上下文窗口已经卷到离谱:

模型上下文窗口
GPT-4 Turbo / GPT-4o128K
Claude 3.5 Sonnet200K
Gemini 1.5 Pro1M(实验态 2M)
Kimi(月之暗面)200K~2M
Qwen2.5-1M1M

但工程实践中你会发现三个反直觉的现象:

  1. “Lost in the Middle”(Liu et al., 2023):长上下文里中间部分的信息几乎被模型忽略,呈典型的 U 形召回。
  2. 越长越贵:128K 一次推理的