知行札记
专题AI 模型与系统模型训练与适配

训练与适配

解释预训练目标、数据管线、优化与分布式训练,以及监督和偏好后训练的取舍。

训练在改变什么

训练用数据计算损失,再沿梯度更新参数。预训练提供广泛的语言与任务表征,继续预训练调整领域分布,后训练塑造指令遵循、回答方式和偏好。全参数或参数高效适配描述更新范围;SFT、DPO 或强化学习描述目标和数据形式。这两组分类可以组合,例如用 LoRA 做 SFT,也可以用 LoRA 做偏好优化。

自回归预训练常用下一 token 的负对数似然:

L=−1T∑t=1Tlog⁡pθ(xt∣x<t).\mathcal L=-\frac{1}{T}\sum_{t=1}^{T}\log p_\theta(x_t\mid x_{<t}).

真实 token 被赋予越高概率,该位置损失越小。对数把整句概率的连乘变成可加的损失,也连接到理想编码长度。模型要降低损失,会利用对预测有帮助的规律;损失下降本身没有规定它应如何表示知识,也不等同于下游任务质量提高。罕见事实、合法性、工具可执行性和任务成功需要额外数据与评价。

构造情境:文本连续描述某对象的位置变化,下一句询问它当前在哪里。只记词频难以处理许多组合,表示并更新位置关系可能帮助降低预测误差。这说明任务规律如何成为学习信号;模型是否真的形成可迁移状态,需要用未见组合、干预和行为测试判断。把连续质量变化阈值化成“整题全对”时,分数还可能呈现突变,不能仅凭折线突然上升证明新的内部机制出现。涌现指标研究,2023 年

下一 token 目标对未来影响提供间接信号,多 token 预测等辅助目标则让共享骨干承担更远位置的预测任务。一种方案为同一位置设置多个未来 token 预测头;目标增加的覆盖与额外头的条件关系需要按具体设计理解,多个边缘预测不能自动组成正确的联合序列。它也可以提供投机草稿,是否保留目标分布仍取决于推理时验证。多 token 预测研究,2024 年

数据管线决定学到的分布

数据处理包括来源选择、授权检查、解析、质量过滤、精确与近似去重、语言或领域分类、数据混合和序列打包。每一步都会改变训练分布。高质量筛选可能改善噪声,也可能过度排除方言、短文或少数领域;去重降低记忆重复样本的机会,却要避免把模板相似但内容不同的样本一起删掉。

训练数据需要记录来源、处理版本和混合比例。验证集在清洗前就应确定独立边界,按文档、作者、时间或任务来源切分,避免同一材料的不同片段落在训练和验证两边。公开基准及其解题分析可能混入语料,污染检查应覆盖题面、答案、变体和解释,不能只搜题目原句。

把短样本拼成一条长序列能减少 padding。是否允许样本之间互相注意、是否重置位置、是否只对回答计算损失,会改变任务。数据管线的 mask 和标签移位需要作为训练语义的一部分审查。增加序列长度还会增加激活与注意力成本,吞吐不能只按样本数比较。

清洗和混合分别回答“保留哪些样本”和“各类样本采多少”。长度、字符或质量规则会排除噪声,也可能删掉口语、论坛和少数语言。用模型给文档打标签,再训练小过滤器,是把生成模型作为裁判;用生成文本直接训练,是把它作为语料。前者传递裁判偏好,后者传递教师的输出分布,两条路径需要分别检查。

精确去重识别同一文本,近重复检测识别高重合片段,语义去重进一步判断内容接近。后两者可能删掉包含独有条件的相似材料。反复见到同一样本相当于增加它的权重,但额外训练是否仍有收益取决于数据量、模型和目标,没有普遍的“四个 epoch 后无效”阈值。

各域采样权重决定预算去向。DoReMi 在较小代理模型上比较各域相对参考模型的过量损失,优化混合权重,再将权重用于更大模型训练;它展示了自动配比的方法,迁移仍依赖域划分、参考模型与规模。DoReMi,2023 年,第 2 节 末期学习率衰减与高质量数据混入也会共同塑造最终模型,需要把阶段、顺序和混合比例记入实验条件。

合成数据的递归使用需要保留真实数据与长尾覆盖。Shumailov 等的研究说明,以后代输出替换真实分布会逐步损失信息;Gerstgrasser 等在其累积真实与合成数据的设定中避免了同类坍缩。两项结果针对不同数据管理策略,不能推出所有合成数据必然退化,也不能承诺只保留少量真实数据就永久安全。教师错误、筛选偏置与来源污染仍需单独验证。递归替换研究,2024 年、累积数据研究,2024 年第二版

参数、数据与算力的共同预算

在同一模型族和训练设置内,模型规模、训练 token 数和计算量与损失之间常能拟合 scaling law。它用于估计预算分配,系数取决于语料、架构、训练范围和拟合区间。Chinchilla 研究 指出其固定训练预算实验中,模型与数据需要共同扩展。把某个经验 token/参数比例当作所有模型的最优值,会忽略数据质量、重复训练、推理成本和最终任务。

训练预算相同,较小但训练更充分的模型可能减少部署成本;较大模型也可能更适合后续任务。决策需要同时看预训练损失、任务分数、训练周期和预计调用量。计算最优与服务生命周期成本最优是不同目标,不能只比较训练 FLOPs。

一个常见拟合形式为

L(N,D)=E+AN−α+BD−β.L(N,D)=E+A N^{-\alpha}+B D^{-\beta}.

NN 是参数量,DD 是训练 token,E,A,B,α,βE,A,B,\alpha,\beta 由实验拟合。若近似训练成本为 C∝NDC\propto ND,固定成本就需要在规模与训练量之间分配。输出投影是否计入、warmup 长度、学习率、数据质量和模型形状会改变拟合结果;总参数与 MoE 激活参数也不能互换。需要服务 QQ 次时,总成本还包括 Q cinfer(N)Q\,c_{infer}(N),较小模型的更长训练可能在部署中得到摊销,但质量与延迟目标仍是约束。生命周期预算研究

优化、精度与稳定性

随机小批量提供带噪声的梯度估计。学习率决定每次更新幅度;warmup、衰减、梯度裁剪、权重衰减和优化器状态共同影响稳定性。AdamW 为参数维护一阶和二阶统计,权重衰减与梯度更新分离。优化器比较必须统一训练 token、模型、调参预算和任务质量,单一实验中的速度收益无法直接推广。

FP16 与 BF16 都占两字节,指数和尾数分配不同。BF16 有更大的指数范围,FP16 更容易出现数值上溢或小量下溢;loss scaling 用放大损失和恢复梯度尺度缓解部分下溢。权重、累加、归一化、梯度和优化器状态不必使用同一精度。低精度收益取决于具体算子、设备与通信实现,需要同时观察数值稳定和端到端耗时。

标准 FP16 分配 5 位指数与 10 位小数,BF16 分配 8 位指数与 7 位小数,另外各有一位符号。BF16 扩大范围,同时牺牲相邻可表示数的精细程度。loss scaling 在反向之后恢复梯度尺度,溢出检测可能跳过更新并调整缩放;它无法修复所有前向数值错误。

常见 FP8 的 E4M3 和 E5M2 分配不同的指数/小数位,训练还需为张量或块选择缩放。当前缩放根据本次幅度计算,延迟缩放使用历史幅度估计;粒度与更新时机是两个独立选择。更细粒度可以降低离群值影响,也增加尺度记录、规约和搬运。敏感累加、归一化与 softmax 可以保留较高精度;使用某个 FP8 矩阵内核无法说明整个模型都以 FP8 计算。DeepSeek-V3 技术报告,2024 年,低精度训练部分

Muon 对矩阵参数的梯度动量做近似正交化:若动量矩阵为 UΣV⊤U\Sigma V^\top,理想变换接近 UV⊤UV^\top,重新分配奇异方向的更新幅度,实际使用 Newton–Schulz 等迭代近似。权重衰减、更新尺度、适用参数类别与分布式聚合共同影响结果。其训练 FLOPs 收益属于给定模型与比较实验,不能当作普遍墙钟加速。Muon 扩展研究,2025 年,第 2 节

QK-Clip 在参数更新后,按观察到的注意力分数增长重新缩放查询和键投影权重,直接控制造成失稳的通道。它与归一化激活、裁剪梯度或截断最终 logit 是不同操作;目标阈值、分头处理和 MLA 位置/内容分支属于具体设计。Kimi K2 报告提供了该方法的训练案例,仍需在其他训练设置中核对质量与稳定性。Kimi K2,2025 年第一版,第 2.1 节

loss spike 可能来自异常批次、梯度爆炸、精度问题、数据分布变化或恢复状态错误。应保留批次标识、梯度范数、学习率、溢出记录和检查点状态,先定位触发条件。检查点若缺优化器、调度器、随机状态或数据游标,恢复后的训练轨迹可能不同。降低学习率或跳过数据只能作为有证据的处理方案,不能代替原因分析。

显存账与分布式切分

训练显存包含权重、梯度、优化器状态、激活和临时缓冲。冻结参数减少梯度和优化器状态,仍需保留权重及影响反向传播的激活。激活检查点保存较少中间结果,在反向时重算,用计算换显存。梯度累积把一次逻辑批次分成多次微批,不改变单次序列的峰值激活规模。

以低精度权重和梯度各 2 字节、FP32 主权重 4 字节、Adam 的两个状态各 4 字节为构造条件,参数相关载荷是每参数 16 字节。70 亿参数约 112 GB 十进制,尚不含激活和缓冲;不同实现的主权重、梯度精度和状态压缩会改变这个数。

在普通数据并行中,若每设备微批为 bb、累积次数为 aa、数据并行副本数为 dd,全局样本批次是 badbad。pipeline 阶段共同处理同一批样本,不应再乘 pipeline 阶段数。按 token 比较时还需实际有效序列长度;padding 和变长样本会让样本批次与 token 批次不同。

切分方式分开什么主要交换
数据并行 DP不同数据批次每副本保留模型,梯度同步增加通信
状态分片权重、梯度或优化器状态节省重复存储,计算前后需要聚合和分发
张量并行 TP层内矩阵或头单层能跨设备,频繁集合通信要求高带宽
流水线并行 PP不同层需要调度微批,填充和排空产生空泡
上下文并行 CP长序列位置交换远端键值或注意力统计,处理因果负载不均
专家并行 EPMoE 专家token 路由和 all-to-all 可能成为瓶颈

ZeRO 分阶段切分优化器、梯度和参数状态,FSDP 等实现也利用参数分片与按需聚合。流水线的经典空泡估算依赖阶段均衡和具体调度;1F1B 交替前向与反向主要改善激活驻留,不能据此保证没有空泡。切分组合要看设备互连、层大小、长序列和专家流量,更多设备可能提高总吞吐,也可能降低每设备效率。

ZeRO 的第一阶段分片优化器状态,第二阶段再分梯度,第三阶段再分参数。参数分片在运算前按需聚合,梯度归并后送回所属分片;节省持久驻留与增加通信是同一机制的两面。具体 FSDP 版本的张量边界、预取和组合条件属于实现实践,不能由名称推断完全相同的峰值占用。

张量并行可把一个升维投影的输出通道分给多个设备,让各设备计算自己的中间特征;下一个降维投影按这些输入通道切分,各自算出部分输出,再求和。这样可以避免先把完整中间向量集中到一张卡,代价是层内通信。它应依据矩阵存储约定描述“输入/输出维切分”,避免把行列名直接套到不同框架。Megatron-LM 原论文

在阶段等时、无额外通信且采用相应 GPipe 调度的理想模型中,pp 个阶段处理 mm 个微批,空泡比例为 (p−1)/(m+p−1)(p-1)/(m+p-1)。构造 p=4,m=8p=4,m=8 时约为 27.3%。更多微批可以摊薄装填与排空,同时增加调度或驻留成本;1F1B 将部分反向提前,交错和零空泡调度另有依赖与内存条件。GPipe

同一参数下,多个微批的梯度可以累加。要得到按有效 token 平均的大批次目标,变长微批需要按有效 token 数加权,不能将每个微批的平均 loss 等权相加;dropout、批次相关运算和浮点累加顺序也可能改变实际轨迹。上述等价条件不能扩展成“所有微批切分结果逐位相同”。

SFT:学习输入与回答的对应关系

监督微调 SFT 用指令、上下文和目标回答训练模型。回答可以来自人工、筛选后的现有数据或模型生成,但生成数据需要验证,避免把错误、冗长风格和偏见一起放大。loss mask 通常区分用户提示和回答;模板、终止符、截断方式也影响行为。

少量高质量数据有时能显著改善表达方式,但数量需求取决于任务新颖度、底座能力、领域覆盖和评价标准。不能从某个千条数据实验推导所有任务只需千条,也不能认定 SFT 永远只能复用已有能力。数据质量、覆盖和更新容量需共同考察。

偏好优化:把“更好”变成训练信号

RLHF 的经典链路先收集同一提示下的回答比较,训练奖励模型,再优化策略。Bradley–Terry 偏好模型写成 P(yw≻yl∣x)=σ(r(x,yw)−r(x,yl))P(y_w\succ y_l\mid x)=\sigma(r(x,y_w)-r(x,y_l)),把奖励差变成选中概率。PPO 一类方法还可能需要参考模型和值模型;参考策略的 KL 惩罚限制策略漂移,价值估计辅助信用分配。InstructGPT 是该流程的原始案例。

DPO 在特定偏好模型和 KL 正则假设下,把奖励关系改写成策略与参考策略的概率比。对一对胜出、落败回答,其目标含

−log⁡σ(β[log⁡πθ(yw∣x)πref(yw∣x)−log⁡πθ(yl∣x)πref(yl∣x)]).-\log\sigma\left(\beta\left[\log\frac{\pi_\theta(y_w\mid x)}{\pi_{ref}(y_w\mid x)}-\log\frac{\pi_\theta(y_l\mid x)}{\pi_{ref}(y_l\mid x)}\right]\right).

β\beta 控制相对参考策略的约束尺度。它简化了经典奖励模型加在线 RL 的链路,仍依赖偏好对的质量和覆盖。错误偏好、长度偏置与分布偏移不会因公式简化而消失。DPO 原始论文 给出了推导与实验条件。

行为对齐与运行边界

对齐训练调整拒绝、帮助性、诚实性和风格。Constitutional AI 用成文原则指导批评、修订和 AI 偏好反馈,减少部分人工标注负担;原则的覆盖、裁判质量与训练分布仍限制结果。原始研究 描述了训练流程。

拒绝行为可以在部分模型的中间表示中被干预。拒绝方向研究 提供了具体实证;这个结果不能推出所有模型只有一个拒绝方向、全部安全行为可完整删除,或跨模型通用同一向量。权重中的行为倾向会被输入分布和后续微调改变,外部授权和执行约束仍需要独立实施。

任务适配的参数选择详见本专题的 参数高效适配,推理学习与长程环境奖励详见 推理与交互学习。

最后更新于

本页目录