知行札记
专题AI 模型与系统模型与 AI 系统评测

模型与 AI 系统评测

建立任务、样本、指标、测量误差、事实与攻击评价的共同主线。

先明确要判断什么

模型选型、提示修订、RAG 回归、Agent 验收和安全测试需要不同问题。确定输入分布、允许工具、质量要求、服务目标和不可接受效果,再选择样本与判定。一个公开榜单可以定位候选,无法替代目标任务证据。

模型与整个系统分开:同一底座加不同检索、工具或预算,效果可能不同;同一脚手架换模型,也需确认上下文、格式与权限兼容。记录实际系统配置和版本,才能复查变化来自哪里。

样本与指标

数据按真实任务类型、难度、语言、长度与风险分层,保留无答案、错前提和边界样本。开发时调整提示的集合与最终 held-out 保持独立;来源近重复和不断选择最好结果都可能泄漏。

指标要交代分母。准确率按题、声明或整个任务计算,含义不同;pass@k 允许多次尝试,不能直接与 pass@1 比较;平均分还需尾部、成本和拒绝条件。人工规则、程序断言和模型裁判各有覆盖边界。

构造同样准确率的两系统:一个错在低风险措辞,另一个错在授权对象。仅总体平均无法判断采用。分层结果与失败样本使差异可见,这个例子没有代表真实测试。

指标要说明计数单位。准确率按题统计,pass@k 按候选集合统计,Agent 成功率按任务与环境初态统计;把同一任务多个采样当成独立任务会低估不确定性。数据分层后可以分别报告语言、难度和任务族,再按明确权重汇总,避免一类容易题支配总分。

分类或检测任务的精确率表示被判为阳性者中真实阳性的比例,召回率表示真实阳性中被找出的比例。实际阳性比例改变时,相同检测器的精确率也可能改变。风险筛选需报告误报、漏报及其实际损失;AUROC 描述阈值变化下的排序,无法直接给出部署阈值的正确处理率。

测量变化与不确定性

固定同一题配对比较通常比独立题集合更能定位变化。采样随机性、提示顺序、环境、判定器和题目样本都影响分数。重复运行、置信区间或 bootstrap 需要按实际假设计算,不能用一次小数差宣布稳定胜出。

对于近似独立同分布的二元题,比例标准误可估为 p(1−p)/n\sqrt{p(1-p)/n};题目相关、分层权重和多次输出会改变估算。接近饱和时剩余错误少,差别可能由一两题决定;难题覆盖和每题审查变得更重要。

基准、污染与 Agent 验收 说明效度,模型裁判与事实检测 说明测量器,安全测量与红队 说明攻击与效用。

最后更新于

本页目录