知行札记
专题AI 模型与系统模型与 AI 系统评测

基准、污染与智能体验收

说明公开基准、动态样本、测试覆盖和真实成功的关系。

污染改变分数的含义

题面、答案、解题讲解、代码仓库或近重复变体进入训练,会使分数混合任务能力与材料曝光。污染可以来自公开抓取和模型生成回声。模型能背出某题不是所有相关任务无效的证明,但会削弱该题作为独立检验的力度。

n-gram/近重复检测检查字面,语义相似检查变体,行为探针观察题面补全或异常熟悉,成员推断有额外访问与统计条件。各种方法各有漏报和误报;黑箱未检出无法证明未训练。成员推断也有黑箱路线,不能统一说必须白盒 logits。

保留训练来源边界、检索工具使用、题目版本、检测方法和结果,有助于评价污染风险。厂商截止日期与私有训练内容不可核查时,按未知处理。

刷新、私有与跨期比较

动态刷新降低公开旧题反复出现的风险,已发布新题也会逐渐传播。私有 held-out 限制泄漏,同时减少社区直接审查。canary 可帮助查特定内容是否出现,未见 canary 不证明其他资料未进入。

公开、刷新和可比之间有真实张力,但没有一般数学定理说最多同时取二。锚题、难度校准、分层重加权和版本报告能改善跨期比较,仍需披露残余条件。旧静态基准对某些任务仍有用途,饱和或污染程度必须具体分析。

题目难度和区分度可以用项目反应理论讨论。在简化 Rasch 模型中,能力为 θ\theta、题目难度为 bb,通过概率 P=σ(θ−b)P=\sigma(\theta-b),单题的 Fisher 信息为 P(1−P)P(1-P)。通过率为 0.50.5 时取最大值 0.250.25,为 0.990.99 时约 0.00990.0099。这是该模型下的计算;带区分度、猜测参数或多维能力的 IRT 公式不同,经验题目也未必满足其假设。

饱和的基准仍可以提供旧能力回归或稀少错误检查。要比较更强系统,增加匹配当前能力范围的题、保持一部分锚题并检查评分稳定性。修改题面、数字或对象能检验泛化,但题目变难或答案口径改变也会影响跨期可比性。

SWE-bench 的判定层

SWE-bench 提供仓库快照与问题,执行补丁后检查 FAIL_TO_PASS 和 PASS_TO_PASS 测试,分别观察目标失败是否修复、已有行为是否保留。SWE-bench 原研究

测试覆盖、issue 提示、环境依赖和训练曝光都会影响结果。被挑选测试通过可以遗漏完整套件失败、隐藏行为或维护要求。人工清洗和更广仓库改善部分问题,也增加成本并形成新的版本边界。审计的具体比例只属于所查模型、补丁、样本和判定,不能推广为所有榜单固定虚高。

对实际 Agent 验收

任务验收看最终目标状态、正确对象、允许效果、成本和恢复。工具调用语法、单步测试、轨迹合理性与真实完成分别测量。空操作基线确认评分确实要求必要行动,标准解确认任务可解,扰动与故障注入检查恢复。

轨迹最短未必最好:必要核查、审批和回执可能增加步骤。模型自述完成不能替代目标系统观察。自动测试足以判定的部分用程序,合法性、证据和维护约束按明确规则检查;开放质量可用校准后裁判或人审。

评测环境隔离副作用、凭证和隐藏评分,保持多尝试之间初始状态一致。与生产差异包括模拟工具、网络、账户和数据规模,结论需随这些边界保留。

最后更新于

本页目录