知行札记
AI 技术生态调研

训练、模型服务与开放度

比较训练工具、推理引擎、量化产物和开放模型的完整成本。

先确定要改变什么和怎样验收

训练适配需要目标、数据、保留评测、基座与模板;推理服务需要硬件、产物、请求分布和服务目标。已有模型加提示、提供正确资料和参数适配分别建立基线。外部事实缺失与解析错误通常先在资料链路处理,训练收益需由独立评测确认。SFT、DPO、GRPO 对应不同的数据和反馈,按目标选择,不能把三者作为所有项目的固定阶段。

训练路线解决的操作成本采用与验证条件
PyTorch + Transformers/datasets + PEFT/TRL/Accelerate直接组织模型、数据、LoRA 及训练器兼容矩阵、模板与标签、分布式配置需自己掌握
Unsloth特定模型及硬件上的训练/推理优化厂商提速与节省显存需在自己的配置复测
LLaMA-Factory配置、WebUI 和多种适配方式实际模型支持、插件和运行依赖
AxolotlYAML 配置及可复核训练管线参数、数据格式、版本升级
FSDP/DeepSpeed参数、梯度、优化器切分与 offloadGPU 通信、内存峰值和传输代价
torchtitan/Megatron/NeMo更大规模分布式训练集群、并行组合、运维和平台要求

PyTorch 是这些归档候选的共同基础,不能据此称为整个机器学习领域唯一底座。bitsandbytes 提供量化加载及相关训练路线,torchao 涉及量化与 QAT;NF4、FP8、FP4 和硬件支持需逐项匹配。torchtune 等候选的归档维护信号保留为采用前检查项。Transformers、PEFT、TRL、Accelerate、Unsloth、LLaMA-Factory、Axolotl、DeepSpeed、torchtitan、NeMo。

显存由权重、激活、梯度、optimizer、KV 与临时缓冲组成。模型参数量相同,序列长度、微批次、目标模块、内核与切分不同也会改变峰值。多张卡总容量、最低显存和训练小时数不能脱离配置作为承诺。保存数据及模型 revision、依赖、实际测量和失败记录后,才有可复核成本。

数据工具与历史配方的条件

datasets 组织数据、流式读写及相关来源,tokenizers 组织文本编码,WebDataset、Lance 等可用于特定规模与存储结构。数据管线还需记录 shard、采样、shuffle、近重复和训练位置;所谓支持 agent trace 要检查角色、调用、回执和失效样例如何转为训练 messages。下载加速器 hf_transfer 或对应 Hub 工具只改变取得效率,不替代 revision、哈希和授权。归档 datasets v5 的流式 shuffle 与 tokenizer 后端迁移应按目标 release 复核,不能将旧配置无条件带入新管线。datasets、tokenizers、WebDataset。

FineWeb/DCLM 的 HTML 提取比较说明质量标准和吞吐必须同时确认。FineWeb 曾按人工审查选择 trafilatura;DCLM 报告 §4.2 与附录 J 在其 Common Crawl、RefinedWeb 过滤和训练设置下,发现 resiliparse 与 trafilatura 的下游表现接近,前者约快 8 倍;profiling 使用 10 份 WARC、约 90 万网页。这个结果支持该负载的选择,无法推广为所有网页与论坛都使用同一提取器。FineWeb 报告、DCLM 原报告。

FineWeb-Edu 先用 Llama3-70B-Instruct 为约 50 万网页按教育价值打分,再训练较小回归/分类模型筛选原网页;合成内容在这里提供标签。作者报告更高阈值增强若干知识与推理基准,同时明显损害 HellaSwag、PIQA。判断质量要保留 rubric、阈值和任务分布,无法用“教育价值高”替代所有语料的质量。FineWeb-Edu 数据卡的 Annotation、Filtering and results。

OLMo 2 的 Dolmino Mix 1124 总池约 843B token,实际末期训练采用子集。7B 用相同 50B 子集的三种数据顺序训练再平均;13B/32B 的公开配方结合 100B 和 300B 子集训练的检查点。总池规模、单条训练轨迹、重复训练消耗和模型平均分别记账,不能把池规模当作每个模型实际训练量或固定 FLOPs 比例。Ai2 的 OLMo 2 32B 说明,Mid-training。

这些是公开工程案例与本轮读取的原始材料,本轮没有复跑数据管线。它们可帮助确定对照和记录项,不能直接成为小规模微调的默认数据、混合比或退火配置。

推理引擎如何比较

引擎或部署路线主要取向重点限制
vLLMGPU 服务、批处理及较广模型支持目标架构、内核、并发和兼容接口
SGLang服务与前缀/结构化生成等优化负载、缓存共享与目标模型支持
TensorRT-LLM、Triton、DynamoNVIDIA 优化与服务编排生态构建、硬件、产物及运维复杂度
llama.cppGGUF、本地 CPU/GPU 与混合推理目标后端、上下文与并发;也有服务及连续批处理能力
Ollama、LM Studio本地模型分发与应用入口资源、服务认证、并发及产品许可
MLX/MLX-LMApple Silicon 本地路线统一内存、模型转换及平台约束
LMDeploy、GPUStack、NIM、Infinity模型部署、资源管理、包装或专用嵌入服务与现有硬件、部署及任务是否匹配

归档对 vLLM 与 SGLang 的取舍包含批处理、共享前缀、工具约束及低延迟需求。两者支持面随版本变化,统一负载下才可排名;TGI 的历史维护状态也需从官方仓库复核后再决定迁移。vLLM、SGLang、TensorRT-LLM、Triton、Dynamo、llama.cpp、Ollama、MLX-LM、LMDeploy。

测量请求分布、TTFT、token 间隔、P95/P99、有效吞吐、显存、错误及质量。prefix cache、chunked prefill、量化、推测解码与预填充/解码拆分各有成本;能加载模型不能证明服务达到质量和尾延迟目标。

量化方法、格式和内核分别核对

GGUF 是模型文件格式及相应量化生态,常见于 llama.cpp、Ollama 和本地应用;AWQ、GPTQ 是量化方法及相应实现,FP8/FP4 是数值格式。相同“4-bit”还可能具有不同 group size、量化参数与加载内核。Marlin、EXL2、AutoRound、bitsandbytes 等涉及不同硬件与工具支持。vLLM 量化、llama.cpp、GPTQModel、torchao。

归档转引单个 H200/Qwen2.5-32B 负载中 Marlin 与默认内核的巨大吞吐差异,能支持“内核选择重要”的检查方向,无法证明所有硬件都应采用同一种量化。AWQ 优于 GPTQ、GGUF 固定慢 1.8 倍、FP8 无质量损失等推广不作为结论。每个部署产物检查模板、tokenizer、特殊 token 和任务质量,合并 LoRA 或转换之后重新比较。

云服务把哪些成本移出去

模型 API(Together、Fireworks、DeepInfra、Groq、Cerebras、Hugging Face)将部分模型运行交给供应商;GPU/serverless 平台(Modal、RunPod、Baseten、Replicate、Beam、Cerebrium、fal、Koyeb、DigitalOcean、Spheron)运行自有产物或容器;Bedrock、Foundry、Vertex AI 面向企业云治理,CoreWeave、Lambda 等提供 GPU 资源。计费形态、目录规模与冷启动数字具有时点与厂商口径,本轮没有重新比较全部报价。

API 成本包含输入、输出、缓存及调用工具;自托管成本包含 GPU 开机与空闲、存储、流量、备份、维护和容量冗余。归档的“70B 每百万输出 token 约 0.88–2.26 美元”是 2026-05 的第三方计算,供应商、输入假设、利用率和计费维度不足以复核统一比较,不能据此计算当前盈亏分界。应把同一任务的完整账单与质量合格吞吐比较,低利用率可能使自租 GPU 更贵。

开放度与复现的不同要求

API-only 开放调用;开放权重允许本地推理及许可范围内的适配;开放训练代码、数据与配方才进一步支持训练流程复现。技术报告、权重、训练代码和数据各自核对,不能只用“开源”一词覆盖它们。OLMo 是开放训练材料的重要参照,具体模型的许可与发布物以对应版本为准。OLMo、DeepSeek-V3 技术报告。

DeepSeek-V3 报告给出约 278.8 万 H800 GPU 小时,按假设每小时 2 美元计算约 557.6 万美元;该口径针对报告列出的训练,不含此前研究、消融和数据管线的完整研发支出。成功训练账单、复现预算、项目全部成本应分别说明。后训练成本通常较完整预训练小,仍需数据、评测、推理 rollout 和工程投入。

归档前沿材料还转引 Vercel 某网关的开放权重 token 份额与花费份额变化。单个平台、月份与模型池只能反映其自身流量,token 比例与金额比例不同,不能推导全球市场或普遍能力领先;Epoch 对前沿成本的外推也受年份、算法与硬件假设限制。所谓开放模型统一滞后一至两年没有可量化依据,不能承担选型结论。

本页没有运行训练、模型转换或负载实验;硬件和复现经济学是材料比较与条件分析,质量、速度及费用需在采用配置上确认。

最后更新于

本页目录