知行札记
大模型应用与适配学习路线

练手模型、训练工具与算力预算

核对数据、模型许可、显存配置和历史价格,组织小规模适配实验。

从任务与数据选择基座

小规模适配先定义行为目标,并保存原模型、改进提示、提供正确资料的基线。自行制作或有明确许可的公开资料可转为训练样例;下载数据集前读取 license、来源和个人信息处理条件。按任务组织 prompt/completion 或消息序列,保留原文/实体身份,按来源、时间或实体切分,减少近重复泄漏。没有通用的“几百条必定有效”门槛,应从可检查的小样本发现标签和模板错误,再以学习曲线决定扩展。

基座选择检查实际参数量、模态、模板、上下文、tokenizer、license 和目标工具支持。Instruct 模型可用于继承已有对话行为的适配;Base 模型需要自己组织指令数据和行为形成,名称中的 Base 不表示从随机初始化重新预训练。

归档模型候选练手考虑不能直接推广的结论
Qwen 小尺寸系列中文、尺寸、模型卡及教程支持4B 名称不等于恰好 40 亿参数;各尺寸模态与许可分别核对
Llama 3.1/3.2 小模型较多公开示例与生态Community License 与门禁有具体条件;语言列表不能证明中文一定不可用
Gemma 系列小模型与多模态路线各代许可、有效/总参数与硬件不同
Ministral 系列本地小模型及相应工具支持原稿“中文最弱”缺少同条件评测
GLM-4-9B 等中文任务与国内教程自定义许可、版本和登记条件不能泛化到所有 GLM

原报告核对过 Qwen3.5-4B 约 4.66B 参数和多模态属性,但 0.8B/2B 规格存在缺口;原报告关于 Gemma 4、Ministral 3 新许可及 GLM 条款的具体判断未在本轮逐项刷新,部署与分享前阅读对应 revision 的模型卡和许可。Qwen 模型、Llama 模型与许可、Gemma、Mistral、GLM。

工具按需要的控制程度选择

LLaMA-Factory 的 LlamaBoard 降低配置录入成本,Unsloth notebook 提供目标模型的可用路径,Axolotl 用 YAML 保存完整配置;TRL/PEFT 便于直接查看 Trainer、LoRA 与 loss mask。图形界面同样需要理解数据、模板、损失和验证,直接底层库也可作为课程的一部分,无法用“新手一律不适合”排除。LLaMA-Factory、Unsloth、Axolotl、TRL SFT、PEFT。

采用已有 notebook 时固定 CUDA/驱动、torch、transformers、trainer、量化和 attention 版本,先检查 tokenizer 与 labels。assistant-only loss 依赖支持助手 mask 的模板,设置选项后仍需打印实际标签。保存 adapter 需要基座 revision、模板和 tokenizer;继续训练还需要 optimizer、随机状态与进度。合并、量化或转换后重新评测。

显存是配置结果

权重位宽只解释显存的一部分。激活、梯度、optimizer、临时缓冲、上下文和 rollout 会影响训练峰值。原报告转引 Unsloth 最低 QLoRA 值:3B 约 3.5GB、7B 约 5GB、8B 约 6GB、14B 约 8.5GB、27B 约 22GB、70B 约 41GB;LLaMA-Factory 表列 7B QLoRA 约 6GB。这些是工具方在特定配置的参考最低值,本轮未运行复测,不能当作任意长序列、模型或训练方法的保证。Unsloth 需求说明、LLaMA-Factory 硬件说明。

两张 T4 各 16GB 不能默认承载单卡需 22GB 的配置,需要工具支持的切分或 offload。降低 batch 可以减少部分激活,权重本身放不下时需改变模型、精度或切分。bf16 的参数字节数是算术下界,尚未包含训练与推理临时状态;不据此宣称免费 GPU 可完成全部评测。

免费平台与付费算力的条件

Kaggle 配额、GPU 类型与最长会话按账户和供给变化,归档 30 小时/周来自二手交叉记录,本轮没有核实当前分配。Colab 官方 FAQ 明确资源与使用限制动态变化,付费也不保证任意资源;不能以“免费 T4”作为正式截止日前必然可用的算力。Kaggle Notebooks、Colab FAQ。

归档报价原时点及来源性质用于预算时的限制
RunPod 3090:0.22/0.50 美元每小时,4090:0.34/0.742026-09-27 原报告直接读取的社区/可靠云报价地域、主机、容量、存储和开关机规则需刷新
RunPod H100 PCIe:1.99/2.89 美元每小时同上不代表目标训练比消费卡更便宜
AutoDL 4090:约 1.68 元每小时2026-09 报告转引 3 月/7 月第三方资料未核当前官网;停机后存储等费用另查
Colab Pro:9.99 美元每月、100 units原报告二手价格,登录页未核实units 不是固定 GPU 小时,模型与GPU消耗不同
Vast.ai 的较低报价原报告的 P2P 市场观察可靠性、网络、容器及数据安全按主机判断

以上保留历史比较口径,不能作为当前采购报价。国内其他候选包括智星云、潞晨云、恒源云、矩池云、阿里云 PAI 和腾讯云;海外有 Lambda、Modal 等。单次估计成本为开机小时 × 当前费率 + 存储/流量/API/评测 + 重试和空闲支出。原报告的“7B 训练 2–5 小时,1–2 美元”缺少数据规模和实测,不用于保证预算。RunPod、AutoDL、Colab 订阅、Vast.ai。

一个可交付实验包含什么

记录目标、数据卡、分割与去重、模型与许可、三个基线、训练配置、实际环境、候选检查点、逐例评测、峰值显存、时间、账单和失败。先短运行核对损失范围与资源,再决定是否增加训练;停止和恢复先验证到可用的检查点。训练 loss 下降不能代替任务评测。

本页补足了原计划的数据格式、切分与预算方法,没有执行训练,也没有建立个人账号的免费配额。境内下载、模型上传、租卡支付、实际环境兼容和最低显存仍需在采用环境核查。

最后更新于

本页目录