练手模型、训练工具与算力预算
核对数据、模型许可、显存配置和历史价格,组织小规模适配实验。
从任务与数据选择基座
小规模适配先定义行为目标,并保存原模型、改进提示、提供正确资料的基线。自行制作或有明确许可的公开资料可转为训练样例;下载数据集前读取 license、来源和个人信息处理条件。按任务组织 prompt/completion 或消息序列,保留原文/实体身份,按来源、时间或实体切分,减少近重复泄漏。没有通用的“几百条必定有效”门槛,应从可检查的小样本发现标签和模板错误,再以学习曲线决定扩展。
基座选择检查实际参数量、模态、模板、上下文、tokenizer、license 和目标工具支持。Instruct 模型可用于继承已有对话行为的适配;Base 模型需要自己组织指令数据和行为形成,名称中的 Base 不表示从随机初始化重新预训练。
| 归档模型候选 | 练手考虑 | 不能直接推广的结论 |
|---|---|---|
| Qwen 小尺寸系列 | 中文、尺寸、模型卡及教程支持 | 4B 名称不等于恰好 40 亿参数;各尺寸模态与许可分别核对 |
| Llama 3.1/3.2 小模型 | 较多公开示例与生态 | Community License 与门禁有具体条件;语言列表不能证明中文一定不可用 |
| Gemma 系列 | 小模型与多模态路线 | 各代许可、有效/总参数与硬件不同 |
| Ministral 系列 | 本地小模型及相应工具支持 | 原稿“中文最弱”缺少同条件评测 |
| GLM-4-9B 等 | 中文任务与国内教程 | 自定义许可、版本和登记条件不能泛化到所有 GLM |
原报告核对过 Qwen3.5-4B 约 4.66B 参数和多模态属性,但 0.8B/2B 规格存在缺口;原报告关于 Gemma 4、Ministral 3 新许可及 GLM 条款的具体判断未在本轮逐项刷新,部署与分享前阅读对应 revision 的模型卡和许可。Qwen 模型、Llama 模型与许可、Gemma、Mistral、GLM。
工具按需要的控制程度选择
LLaMA-Factory 的 LlamaBoard 降低配置录入成本,Unsloth notebook 提供目标模型的可用路径,Axolotl 用 YAML 保存完整配置;TRL/PEFT 便于直接查看 Trainer、LoRA 与 loss mask。图形界面同样需要理解数据、模板、损失和验证,直接底层库也可作为课程的一部分,无法用“新手一律不适合”排除。LLaMA-Factory、Unsloth、Axolotl、TRL SFT、PEFT。
采用已有 notebook 时固定 CUDA/驱动、torch、transformers、trainer、量化和 attention 版本,先检查 tokenizer 与 labels。assistant-only loss 依赖支持助手 mask 的模板,设置选项后仍需打印实际标签。保存 adapter 需要基座 revision、模板和 tokenizer;继续训练还需要 optimizer、随机状态与进度。合并、量化或转换后重新评测。
显存是配置结果
权重位宽只解释显存的一部分。激活、梯度、optimizer、临时缓冲、上下文和 rollout 会影响训练峰值。原报告转引 Unsloth 最低 QLoRA 值:3B 约 3.5GB、7B 约 5GB、8B 约 6GB、14B 约 8.5GB、27B 约 22GB、70B 约 41GB;LLaMA-Factory 表列 7B QLoRA 约 6GB。这些是工具方在特定配置的参考最低值,本轮未运行复测,不能当作任意长序列、模型或训练方法的保证。Unsloth 需求说明、LLaMA-Factory 硬件说明。
两张 T4 各 16GB 不能默认承载单卡需 22GB 的配置,需要工具支持的切分或 offload。降低 batch 可以减少部分激活,权重本身放不下时需改变模型、精度或切分。bf16 的参数字节数是算术下界,尚未包含训练与推理临时状态;不据此宣称免费 GPU 可完成全部评测。
免费平台与付费算力的条件
Kaggle 配额、GPU 类型与最长会话按账户和供给变化,归档 30 小时/周来自二手交叉记录,本轮没有核实当前分配。Colab 官方 FAQ 明确资源与使用限制动态变化,付费也不保证任意资源;不能以“免费 T4”作为正式截止日前必然可用的算力。Kaggle Notebooks、Colab FAQ。
| 归档报价 | 原时点及来源性质 | 用于预算时的限制 |
|---|---|---|
| RunPod 3090:0.22/0.50 美元每小时,4090:0.34/0.74 | 2026-09-27 原报告直接读取的社区/可靠云报价 | 地域、主机、容量、存储和开关机规则需刷新 |
| RunPod H100 PCIe:1.99/2.89 美元每小时 | 同上 | 不代表目标训练比消费卡更便宜 |
| AutoDL 4090:约 1.68 元每小时 | 2026-09 报告转引 3 月/7 月第三方资料 | 未核当前官网;停机后存储等费用另查 |
| Colab Pro:9.99 美元每月、100 units | 原报告二手价格,登录页未核实 | units 不是固定 GPU 小时,模型与GPU消耗不同 |
| Vast.ai 的较低报价 | 原报告的 P2P 市场观察 | 可靠性、网络、容器及数据安全按主机判断 |
以上保留历史比较口径,不能作为当前采购报价。国内其他候选包括智星云、潞晨云、恒源云、矩池云、阿里云 PAI 和腾讯云;海外有 Lambda、Modal 等。单次估计成本为开机小时 × 当前费率 + 存储/流量/API/评测 + 重试和空闲支出。原报告的“7B 训练 2–5 小时,1–2 美元”缺少数据规模和实测,不用于保证预算。RunPod、AutoDL、Colab 订阅、Vast.ai。
一个可交付实验包含什么
记录目标、数据卡、分割与去重、模型与许可、三个基线、训练配置、实际环境、候选检查点、逐例评测、峰值显存、时间、账单和失败。先短运行核对损失范围与资源,再决定是否增加训练;停止和恢复先验证到可用的检查点。训练 loss 下降不能代替任务评测。
本页补足了原计划的数据格式、切分与预算方法,没有执行训练,也没有建立个人账号的免费配额。境内下载、模型上传、租卡支付、实际环境兼容和最低显存仍需在采用环境核查。
最后更新于