ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

大模型训练三步:预训练、微调、对齐到底有什么区别

大模型训练三步:预训练、微调、对齐到底有什么区别 如果把一个大模型LLM从“什么都不会”训练成 ChatGPT、DeepSeek、Qwen 这类可以和人正常交流、完成复杂任务的模型完整的训练流程可以概括成预训练Pre-training微调Fine-tuning / SFT对齐Alignment这三个步骤在目标定位、解决的问题和底层技术实现上均有不同的分工。那么这三个步骤分别是做什么又分别解决了什么问题呢我们是如何得到现在强大好用的大模型的呢本文针对这些问题进行解答。完整的大模型训练流程完整的大模型训练流程可以理解为一条流水线如下图所示其中预训练解决“能力从哪里来”微调解决“模型会不会按任务要求做”对齐解决“模型做得是否符合人类期望”。不过需要先说明一点严格来说“微调”和“对齐”存在一定重叠。很多资料会把 SFT 也归入 Alignment 的广义范畴。为了方便理解下面采用工程上最常见的“三阶段”划分。预训练、微调、对齐以及他们的区别2.1 预训练(Pre-training)预训练是什么拿海量未标注数据让模型通过自监督学习建立通用的语言、知识和推理能力。预训练解决什么问题 在预训练之前模型权重为随机初始化没有任何语言和常识能力。通过预训练让模型掌握自然语言语法、常识事实、代码逻辑和推理先验。使模型具备了理解上下文并预测后续词元Token的统计规律。预训练使用什么数据 预训练数据通常是海量、广泛、通用的数据数据量通常非常大。核心思想是不用人工给每条数据标注答案让数据本身提供监督信号。这是预训练和后面的微调、对齐最大的区别之一。预训练使用什么技术Transformer架构目前主流 LLM 基本都建立在 Transformer 架构之上。Self-Supervised Learning预训练使用的数据不需要人工给每条数据打标签。核心就是利用文本本身构造监督信号然后预测下一个Token。大规模分布式训练模型可能有几十亿、几百亿甚至更多参数数据也达到极大规模因此需要Data Parallel、Tensor Parallel、ZeRO、混合精度、FlashAttention等技术。2.2 微调 (Fine-tuning / SFT)微调是什么 在已经完成预训练的 Base Model 上用规模相对较小但质量更高、更有针对性的标注数据继续进行有监督训练让模型从“通用能力”变成“更擅长某类任务、领域或交互方式”的模型。微调解决什么问题预训练之后基座模型Base Model只能进行续写而不能给出回答。通过微调解决预训练模型只会漫无边际“续写”而非“回答”的问题。 通过微调可以让模型学会“按照指令做事”或者让模型适应特定领域或者让模型完成特定任务或者让模型学会特定的输出格式微调使用什么数据微调数据通常不是越多越好而是越“高质量、针对性强”越好。常见的SFT数据为Prompt-Response Pairs。微调使用什么技术全量微调 (Full Parameter Fine-Tuning)更新所有模型权重但在计算损失时通常只对 Response 部分计算 Cross-Entropy。直接 Full Fine-tuning 的成本非常高。参数高效微调 (PEFT - Parameter-Efficient Fine-Tuning) 核心思想是不要把整个大模型都训练一遍只训练很少一部分参数。 例如LoRA / QLoRA 通过冻结预训练骨干网络利用低秩矩阵分解更新权重Prefix Tuning / Prompt Tuning 通过在输入层或各层 Attention 前拼接可学习的虚拟 Token 向量。2.3 对齐 Alignment对齐是什么同样的问题大模型可能会有多种回答但大模型并不知道人类更喜欢什么样的回答。通过大模型对齐可以让模型的行为、回答方式和价值偏好更符合人类需求。对齐解决什么问题SFT 后的模型虽然能遵循指令但有时候可能会输出有害的回答。 通过大模型对齐进行 HHH 原则落地让回答符合 Helpful有用、Honest诚实/减少幻觉、Harmless无害/拒绝恶意指令。解决模型不听话、“多个答案到底哪个更好”、减少有害和不安全行为、减少大模型的幻觉Hallucination。对齐使用什么数据与预训练和 SFT 不同Alignment 最重要的数据通常不是普通文本也不是问题-答案对而是人类偏好数据 / Reward 数据 / 可验证反馈数据。对齐使用什么技术首先是最经典的 Alignment 方法基于强化学习的对齐 (RLHF - Reinforcement Learning from Human Feedback)。使用人类标注的偏好排序数据训练一个打分网络得到奖励模型 (Reward Model, RM)。在输入为 (Prompt, Response)时能够输出标量评分 然后使用 PPO (Proximal Policy Optimization) 或 REINFORCE 算法以 RM 得分为优化目标同时引入 KL 散度惩罚项防止模型输出偏离 SFT 基线太远导致模式坍塌。免强化学习的直接偏好对齐DPO (Direct Preference Optimization)即绕过显式训练 Reward Model 的步骤通过将 RL 目标解析推导为直接在成对数据上的隐式对比损失。规则与安全干预Constitutional AI基于宪法原则的自对齐与 RLAIF、安全护栏过滤Guardrails。2.4 核心区别对比维度预训练 (Pre-training)微调 (Fine-tuning / SFT)对齐 (Alignment)主要功能学习世界知识与语言建模学习交互格式与指令遵循约束价值导向与行为边界数据形态海量无标注纯文本Raw Text结构化问答对Instruction-Response偏好成对数据Prompt 胜出项/失败项数据量级Trillions of TokensTB/PB 级数千到数百万条高质量样本数万到数十万条偏好比较对算力开销占总算力 90% - 99%占总算力 1% - 5%占总算力 1%但工程稳定性要求极高对知识的影响注入知识模型的知识上限由该阶段决定激活知识调整表达通常不注入大量新事实约束行为权衡偏好可能引入轻微“对齐税”学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表