大模型的智能上限,一半取决于数据预处理。本文结合 2026 年最新动态,拆解去重、过滤、合成数据等核心环节,讲清数据如何成为决定模型能力的关键变量。
大模型技术之数据预处理:从海量网页到高质量训练语料
引言:模型的能力,一半藏在数据里
前两篇文章我们分别拆解了 Transformer 架构与它一统天下的底层原因。但有一个经常被忽略的事实:同一套架构、同样的算力,喂不同的数据,训练出来的模型能力可以天差地别。
2026 年 6 月,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》,明确提出要建设“AI-Ready”的高质量数据集,把数据清洗、标注、质检等环节上升到国家行动层面。与此同时,行业里的共识也在变化:当模型架构趋同、算力成本高企,数据预处理正成为拉开模型差距的核心竞争环节。
本文就来拆解大模型技术中最“脏活累活”却最决定成败的一环——数据预处理。
一、为什么数据预处理如此重要
先看一组数据规模增长曲线:2020 年 GPT-3 用约 3000 亿 token 预训练,2024 年 DeepSeek-V3 达到 14.8 万亿,2026 年的 Qwen-3、GLM-5、DeepSeek-V4 已经攀升到 30–40 万亿 token 量级。语料规模六年增长近四个数量级。
但规模并不是全部。加州大学伯克利分校的研究者 Hernandez 在 2022 年发现:仅将 0.1% 的数据重复 100 次,就会让一个 8 亿参数模型的有效容量跌到 4 亿参数的水平——浪费了约一半的训练计算量。反之,RefinedWeb 证明经过去重和过滤的纯网页数据,可以超越精挑细选的多源混合语料;FineWeb-Edu 和 DCLM 更进一步,靠更优的过滤策略在相同算力下带来数倍等效数据量的性能提升。
一句话总结:数据预处理不是锦上添花,而是决定模型能力上限的胜负手。
二、工业级数据预处理流水线
从原始网页爬取(如 Common Crawl)到可训练语料,工业界普遍采用八阶段流水线:
| 阶段 | 处理内容 | 典型效果 |
|---|---|---|
| 1. 语言识别 | 过滤非目标语言 | 丢弃 50–80% 文档 |
| 2. 精确去重 | SHA-256/MD5 哈希去重 | 移除完全重复文档 |
| 3. 模糊去重 | MinHash LSH 近重复检测 | 再压缩 10–25% |
| 4. 启发式过滤 | 词数、标点比例、重复行 | 清除模板与噪音 |
| 5. 质量分类器 | 模型打分(如 FineWeb-Edu) | 保留高教育质量内容 |
| 6. PII 移除 | 敏感信息脱敏 | 保障隐私合规 |
| 7. 去污染 | 剔除测试集重叠内容 | 防止评估作弊 |
| 8. 格式标准化 | 转为 Parquet/JSONL 分片 | 供训练框架直接读取 |
Hugging Face 开源了 Datatrove 库,NVIDIA 则有 NeMo Curator——两者都实现了这套流水线,且支持在 GPU 集群上分布式执行。一个值得注意的趋势是:数据清洗正从 CPU 密集型转向 GPU 加速,8 块 H100 的模糊去重吞吐可以达到 CPU 方案的 9 倍。
三、去重:最基础也最讲究的环节
去重是所有前沿模型一致采用的预处理步骤。网络爬取数据中有两类重复:一是跨页面冗余——不同 URL 托管相同内容;二是时序冗余——同一页面在每月快照中被反复抓取。这两类冗余高度集中,少数页面甚至被重复数千次。
去重方法分两类,实践中叠加使用:
- 精确去重:基于文档级哈希(SHA-256)或 URL 比对,移除完全相同的内容。OLMo 用 Bloom filter 实现概率性去重,以极低内存成本处理万亿级语料。
- 模糊去重:针对仅有细微编辑差异的近重复文档,主流方案是 MinHash + 局部敏感哈希(LSH)。Hugging Face 的 FineWeb 用 112 个哈希函数、14 个桶,目标锁定相似度 75% 以上的文档对;InternLM-2 公开了参考配置——128 个哈希函数、5-gram、Jaccard 阈值 0.7。
去重的层级也在细化:LLaMA-3 在 URL 级、文档级、行级三个层次去重,连导航菜单等样板片段都不放过;DeepSeek-V2 则跨不同时期的 Common Crawl 快照做 MinHash,专门消除时序冗余。
为什么这么较真?除了浪费算力,重复还会放大记忆与隐私风险——研究表明,模型逐字复现某段训练文本的概率,与该文本出现次数呈对数线性增长。高频重复的内容,模型可能直接背下来。
四、合成数据:2026 年的共识与争议
合成数据是近两年最火的话题。2023 年 Phi-1 率先在预训练中使用“教科书质量”的合成数据——一个 13 亿参数的模型,仅用 10 亿合成 token 训练,在编程基准上就追平了 10 倍规模的模型。秘诀不在于生成量,而在于策展纪律:内容要有教育连贯性、多样性、教学结构。
到 2026 年,Qwen-3、Phi-4、Kimi-K2 等前沿模型均已采纳合成数据;DeepSeek-V3 是唯一明确排除合成预训练数据的主流模型,坚持“用天然数据控制分布”。
但合成数据有明确风险:模型坍缩——用模型生成的数据反复训练,会逐步收窄数据分布,导致多样性丧失。实践指南给出的核心原则是“积累而非替换”:每个微调周期保留至少 10% 的真实数据,就能显著限制性能退化。OpenAI 在 2025 年也证实,模型在自身输出上训练,会逐渐忘记真实分布。
五、2026 年最新动向:从“堆数据”到“建体系”
结合最新资讯,2026 年数据预处理呈现三个鲜明趋势:
第一,政策推动行业高质量数据集建设。国家数据局 6 月方案部署了强基扩容、标注攻坚、提质增效等六大专项行动,推动数据标注从“以人为主”转向“人机协同、专家深度参与”,并鼓励用合成数据解决稀缺场景数据采集成本高的问题。数据从“基础资源”升级为“战略资产”。
第二,多模态数据预处理成为新战场。文本之外,图像、音频、视频、点云、时序数据、科学数据的预处理管线正在加速建设。具身智能所需的物理交互数据、世界模型所需的视频数据,都依赖全新的数据工程。
第三,数据工程细节披露越来越少。Qwen-3 对去重只字未提,LLaMA-4 甚至未发布技术报告——数据工程已成为各家模型的核心竞争力,透明度下降本身就是数据价值的注脚。
结语:高质量文本是下一个稀缺资源
有研究预测,人类产生的高质量文本将在2026 至 2032 年间被大模型消耗殆尽。当简单扩充数据量的收益持续下降,数据预处理的核心命题将从“如何清洗”转向“如何更高效地利用每一段文本”。正如青稞社区 2026 年数据工程综述所言:数据如何驱动智能、知识如何从大规模语料中涌现,仍是这个领域尚未回答的关键问题。
对于普通开发者,理解数据预处理,就是理解大模型能力的源头——下一次当你惊叹某个模型表现惊艳时,别忘了,一半功劳属于那些在幕后做数据清洗的人。
参考文献:
- 国家数据局 (2026). 《关于推进行业高质量数据集建设行动的实施方案》国数科基〔2026〕25号
- 李煜东 (2026). “LLM 预训练数据工程的关键实践”(知乎专栏/青稞社区)
- Penedo et al. (2024). “The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale”, arXiv:2406.17557
- 青稞社区 (2026). “工业级 LLM 预训练数据工程的关键实践”
- NVIDIA (2026). “Mastering LLM Techniques: Text Data Processing”
- Spheron Network (2026). “AI Pretraining Data Curation on GPU Cloud: NeMo Curator, Datatrove & FineWeb”
- Digital Applied (2026). “Synthetic Data for LLM Training: Decision Guide 2026”
- DeepSeek-AI (2024). “DeepSeek-V3 Technical Report”, arXiv:2412.19437