评测、项目交付与外部反馈
用公开基准、保留任务和外部评审检查学习成果及局限。
三类评价分别回答什么
公开基准可诊断通用能力及回归;保留任务集检查目标场景;外部用户、社区或评审检查需求和交付。分数提升、真实使用与比赛获奖具有不同含义。固定 prompt、chat template、采样、模型 revision 与评分口径,再比较原模型和适配模型。
C-Eval 提供中文学科四选一,公开验证标签便于本地自测,隐藏测试与验证区分;CMMLU 提供不同中文主题;GSM8K 用于特定小学数学推理题。它们不覆盖全部中文应用、工具权限、事实引用和长期任务。数据与代码许可分开,C-Eval 和 CMMLU 的非商业数据条款需要在实际使用时核对。C-Eval、CMMLU、GSM8K。
GSM8K 原数据分割为 7,473 训练和 1,319 测试题,合计 8,792;原报告“约 8.5K”的数字不用于精确口径。C-Eval 的 dev、val、test 不同,报告里 1,346 道 val 对应公开验证集;采用子集或不同 few-shot 时如实说明。部分旧 dataset script 无法由新加载器直接执行,应按固定版本和官方数据方式取得。
评测脚本怎样被复核
lm-evaluation-harness 提供任务配置与模型 adapter,OpenCompass 提供其他评测管线。任务 ID、chat template 和依赖随版本演进,先使用所锁定版本的帮助和任务列表确认,再运行。以下只是命令结构;EVAL_TASK 是已确认任务名,MODEL_PATH 是本地基座或已合并产物,不是任意 adapter 路径。
python -m lm_eval --help
python -m lm_eval --model hf \
--model_args "pretrained=$MODEL_PATH" \
--tasks "$EVAL_TASK" --batch_size 1 \
--output_path ./evaluation-output保存命令、依赖、完整配置、逐例输出与汇总。选择题是否计算各选项似然、生成式问题如何提取答案、截断和拒绝怎样评分,都影响结果。不同工具得到同名“准确率”不能自动比较。新模型架构、量化或多模态加载还需目标 adapter 支持,本轮未运行这条命令。lm-evaluation-harness、OpenCompass。
保留任务集和评分契约
从真实目标中建立有权限的保留集,按来源/实体/时间切分。原材料的 10–20% hold-out、50–300 条偏好对或 80–200 条盲评题是规模建议,样本少或同族集中会使不确定性较大。关键是覆盖任务和失败类型,并报告逐例结果,不能仅用一个比例证明独立。
确定性任务用解析、计算、引用身份和权限断言;事实问答核查答案及证据支持;主观文本用明确 rubric、人工标注或固定 judge。偏好对用于训练时必须与最终评价隔离。报告准确率、胜率或平均分时写清分母、拒绝、平局、缺失与失败处理,按关键子组报告回归。
MT-Bench、FastChat 的模型裁判流程与 AlpacaEval 可提供比较范式,默认模型和价格随时间变化。交换 A/B 次序、盲化模型身份与人工抽查可检查位置及偏好,不构成彻底消偏保证;“避免同家族裁判”也不能单独证明独立。若换成 DeepSeek 或其他裁判,需核对接口、rubric、输出解析及校准,原报告未给可运行替换配置。FastChat、AlpacaEval。
交付材料让他人能判断什么
应用 demo 提供问题、数据来源、使用方式、权限、已知失败、模型和版本;适配项目增加训练数据说明、基座许可、配置、基线和质量变化;工具项目增加允许操作、审批、幂等、取消和恢复。真实用户反馈同时记录任务是否完成、结果是否支持、耗时与失败,播放或下载量只能说明接触量。
外部反馈可来自课程作业、HF/Datawhale 社区、开源 issue、同行 review 或真实用户。要求审阅者针对固定用例给具体错误与可改位置;自己制作的示意数据与真实用户任务分别报告。初学者可以先公开最小合规 demo,无需以购买大显卡或完成全部训练为门槛。
赛事是有条件的反馈入口
lablab.ai、Devpost 和天池有应用及数据赛事,选择时核对当届任务、评审维度、允许模型、数据许可、组队、年龄/学生/身份、地域、费用、提交和作品公开条款。指定平台 API credits 可能附截止、账户与地域条件;提交代码或 demo 也可能产生托管成本。lablab.ai、Devpost、天池。
归档记录 2026 年灵波世界模型挑战赛、知乎及欧莱雅校园赛等具体活动,另有 Nebius、AssemblyAI、AMD 等平台赛。那些 2026 年 10–12 月日期不能保证 16 周路线在 2027 年 1 月收官时仍可参加。科大讯飞、智谱下一期主办赛、部分实名要求、免费参赛和奖金额均存在未确认项,不把历史列表当作当前开放报名承诺。
本轮完成资源和评价方式的案头整理,未参加课程、赛事、运行基准或进行真实用户评审;因此交付的是条件化学习路线及检查方法,完成周期、收入和就业结果没有已验证保证。
最后更新于