三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

大模型技术之数据预处理:从海量网页到高质量训练语料

大模型技术之数据预处理:从海量网页到高质量训练语料

大模型的智能上限,一半取决于数据预处理。本文结合 2026 年最新动态,拆解去重、过滤、合成数据等核心环节,讲清数据如何成为决定模型能力的关键变量。

大模型技术之数据预处理:从海量网页到高质量训练语料

引言:模型的能力,一半藏在数据里

前两篇文章我们分别拆解了 Transformer 架构与它一统天下的底层原因。但有一个经常被忽略的事实:同一套架构、同样的算力,喂不同的数据,训练出来的模型能力可以天差地别。

2026 年 6 月,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》,明确提出要建设“AI-Ready”的高质量数据集,把数据清洗、标注、质检等环节上升到国家行动层面。与此同时,行业里的共识也在变化:当模型架构趋同、算力成本高企,数据预处理正成为拉开模型差距的核心竞争环节

本文就来拆解大模型技术中最“脏活累活”却最决定成败的一环——数据预处理。

一、为什么数据预处理如此重要

先看一组数据规模增长曲线:2020 年 GPT-3 用约 3000 亿 token 预训练,2024 年 DeepSeek-V3 达到 14.8 万亿,2026 年的 Qwen-3、GLM-5、DeepSeek-V4 已经攀升到 30–40 万亿 token 量级。语料规模六年增长近四个数量级。

但规模并不是全部。加州大学伯克利分校的研究者 Hernandez 在 2022 年发现:仅将 0.1% 的数据重复 100 次,就会让一个 8 亿参数模型的有效容量跌到 4 亿参数的水平——浪费了约一半的训练计算量。反之,RefinedWeb 证明经过去重和过滤的纯网页数据,可以超越精挑细选的多源混合语料;FineWeb-Edu 和 DCLM 更进一步,靠更优的过滤策略在相同算力下带来数倍等效数据量的性能提升。

一句话总结:数据预处理不是锦上添花,而是决定模型能力上限的胜负手。

二、工业级数据预处理流水线

从原始网页爬取(如 Common Crawl)到可训练语料,工业界普遍采用八阶段流水线:

阶段处理内容典型效果
1. 语言识别过滤非目标语言丢弃 50–80% 文档
2. 精确去重SHA-256/MD5 哈希去重移除完全重复文档
3. 模糊去重MinHash LSH 近重复检测再压缩 10–25%
4. 启发式过滤词数、标点比例、重复行清除模板与噪音
5. 质量分类器模型打分(如 FineWeb-Edu)保留高教育质量内容
6. PII 移除敏感信息脱敏保障隐私合规
7. 去污染剔除测试集重叠内容防止评估作弊
8. 格式标准化转为 Parquet/JSONL 分片供训练框架直接读取

Hugging Face 开源了 Datatrove 库,NVIDIA 则有 NeMo Curator——两者都实现了这套流水线,且支持在 GPU 集群上分布式执行。一个值得注意的趋势是:数据清洗正从 CPU 密集型转向 GPU 加速,8 块 H100 的模糊去重吞吐可以达到 CPU 方案的 9 倍。

三、去重:最基础也最讲究的环节

去重是所有前沿模型一致采用的预处理步骤。网络爬取数据中有两类重复:一是跨页面冗余——不同 URL 托管相同内容;二是时序冗余——同一页面在每月快照中被反复抓取。这两类冗余高度集中,少数页面甚至被重复数千次。

去重方法分两类,实践中叠加使用:

  • 精确去重:基于文档级哈希(SHA-256)或 URL 比对,移除完全相同的内容。OLMo 用 Bloom filter 实现概率性去重,以极低内存成本处理万亿级语料。
  • 模糊去重:针对仅有细微编辑差异的近重复文档,主流方案是 MinHash + 局部敏感哈希(LSH)。Hugging Face 的 FineWeb 用 112 个哈希函数、14 个桶,目标锁定相似度 75% 以上的文档对;InternLM-2 公开了参考配置——128 个哈希函数、5-gram、Jaccard 阈值 0.7。

去重的层级也在细化:LLaMA-3 在 URL 级、文档级、行级三个层次去重,连导航菜单等样板片段都不放过;DeepSeek-V2 则跨不同时期的 Common Crawl 快照做 MinHash,专门消除时序冗余。

为什么这么较真?除了浪费算力,重复还会放大记忆与隐私风险——研究表明,模型逐字复现某段训练文本的概率,与该文本出现次数呈对数线性增长。高频重复的内容,模型可能直接背下来。

四、合成数据:2026 年的共识与争议

合成数据是近两年最火的话题。2023 年 Phi-1 率先在预训练中使用“教科书质量”的合成数据——一个 13 亿参数的模型,仅用 10 亿合成 token 训练,在编程基准上就追平了 10 倍规模的模型。秘诀不在于生成量,而在于策展纪律:内容要有教育连贯性、多样性、教学结构。

到 2026 年,Qwen-3、Phi-4、Kimi-K2 等前沿模型均已采纳合成数据;DeepSeek-V3 是唯一明确排除合成预训练数据的主流模型,坚持“用天然数据控制分布”。

但合成数据有明确风险:模型坍缩——用模型生成的数据反复训练,会逐步收窄数据分布,导致多样性丧失。实践指南给出的核心原则是“积累而非替换”:每个微调周期保留至少 10% 的真实数据,就能显著限制性能退化。OpenAI 在 2025 年也证实,模型在自身输出上训练,会逐渐忘记真实分布。

五、2026 年最新动向:从“堆数据”到“建体系”

结合最新资讯,2026 年数据预处理呈现三个鲜明趋势:

第一,政策推动行业高质量数据集建设。国家数据局 6 月方案部署了强基扩容、标注攻坚、提质增效等六大专项行动,推动数据标注从“以人为主”转向“人机协同、专家深度参与”,并鼓励用合成数据解决稀缺场景数据采集成本高的问题。数据从“基础资源”升级为“战略资产”。

第二,多模态数据预处理成为新战场。文本之外,图像、音频、视频、点云、时序数据、科学数据的预处理管线正在加速建设。具身智能所需的物理交互数据、世界模型所需的视频数据,都依赖全新的数据工程。

第三,数据工程细节披露越来越少。Qwen-3 对去重只字未提,LLaMA-4 甚至未发布技术报告——数据工程已成为各家模型的核心竞争力,透明度下降本身就是数据价值的注脚。

结语:高质量文本是下一个稀缺资源

有研究预测,人类产生的高质量文本将在2026 至 2032 年间被大模型消耗殆尽。当简单扩充数据量的收益持续下降,数据预处理的核心命题将从“如何清洗”转向“如何更高效地利用每一段文本”。正如青稞社区 2026 年数据工程综述所言:数据如何驱动智能、知识如何从大规模语料中涌现,仍是这个领域尚未回答的关键问题。

对于普通开发者,理解数据预处理,就是理解大模型能力的源头——下一次当你惊叹某个模型表现惊艳时,别忘了,一半功劳属于那些在幕后做数据清洗的人。

参考文献:

  • 国家数据局 (2026). 《关于推进行业高质量数据集建设行动的实施方案》国数科基〔2026〕25号
  • 李煜东 (2026). “LLM 预训练数据工程的关键实践”(知乎专栏/青稞社区)
  • Penedo et al. (2024). “The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale”, arXiv:2406.17557
  • 青稞社区 (2026). “工业级 LLM 预训练数据工程的关键实践”
  • NVIDIA (2026). “Mastering LLM Techniques: Text Data Processing”
  • Spheron Network (2026). “AI Pretraining Data Curation on GPU Cloud: NeMo Curator, Datatrove & FineWeb”
  • Digital Applied (2026). “Synthetic Data for LLM Training: Decision Guide 2026”
  • DeepSeek-AI (2024). “DeepSeek-V3 Technical Report”, arXiv:2412.19437
← 返回列表