知行札记
专题AI 模型与系统模型与 AI 系统评测

模型裁判、事实与不确定性

解释裁判偏差、声明证据、语义熵和检测器盲点。

模型裁判怎样工作

模型裁判根据问题、答案、参考或评分细则生成选择和分数。它仍受输入、训练和生成影响。成对比较、单答案打分、原子条目验证各有不同噪声与偏差,评价输出也要保持可定位依据。

MT-Bench 等工作分析位置、冗长和自我偏好等影响,方向与程度随裁判和任务变化。MT-Bench 平衡顺序、隐藏候选身份、具体 rubric、参考锚点和人工校准能够缓解,无法仅凭多次调用保证完全消偏。

多个裁判可能共享语料、风格与错误。投票增加成本,独立性需检查。校准应使用代表性样本,报告人机一致、分歧类型与高风险漏判;相关系数高也可能遗漏决定性类别。

事实准确与忠实不同

模型可以流畅表达错误事实,也可以忠实转述错误资料。事实核查需要对象、时点、来源和断言粒度;给定上下文的蕴含只是其中一层。引用真实存在,也可能没有支持对应因果或数字。

训练拟合、长尾稀疏、缺知识、错误检索和生成规则都可能导致错误。温度降低不能修正已有错误分布,贪心也会错。幻觉理论的下界依赖具体事实模型和校准假设,不能推导每个有限任务都不可能零错误,或任何系统只能给出错误答案。Kalai 与 Vempala

允许未知、外部查询、确定性计算和受限输出可以改变任务条件。对无法确认的事实收窄回答,比靠词面自信估计更可检查。

检测信号与盲点

多次采样比较语义分歧,能发现部分不稳定答案;多个样本一致地错时没有信号。采样分布、聚类或双向蕴含也会误判。语义熵把含义相近答案归为簇,计算 −∑cp(c)log⁡p(c)-\sum_c p(c)\log p(c),测分散程度。语义熵研究

token logprob 测词面预测概率,措辞常见不等于事实可信。隐藏状态探针可预测部分不确定模式,需要白盒、训练样本和跨域验证。语义熵探针、kernelized entropy 或 energy 等方法各有目标,不共享一个能覆盖全部错误的保证。

声明对证据做 NLI 检验提供具体“哪句不受支持”,裁判仍可能误读否定、数值或关系。外部检索也可能找不到或取得错误来源。确定性程序能检查已形式化条件,不能对任意开放事实成为最终真值机器。

语义熵的一个构造例子:四次采样中,两次回答“甲”,另两次说同一个意思的“乙名称”,经核对其实指同一对象,聚成一个簇后熵为零;若两组指不同对象且各占一半,熵为 log⁡2\log 2。按答案次数近似簇概率会受样本量影响,使用序列概率又会引入长度与词面口径。语义聚类本身可以出错,低熵需进一步核查来源。

SEP 用隐藏表示训练探针预测语义熵等不确定性信号,部署时减少多次采样;它学习的是训练标签与表示之间的关系,跨模型和领域需要校准。Semantic Entropy Probes KLE 用答案间语义相似度核及其谱构造熵,使相近答案的关系比离散硬分簇更连续;核选择与相似度模型引入新的条件。Kernel Language Entropy 多采样一致性、内部探针与外部证据可形成不同成本的路径,选用时比较所需访问权限及实际漏判类别。

组合检测与实际采用

低成本信号筛选疑似样本,高成本取得证据和人审处理重要问题,可以控制费用与漏判。阈值需同时测召回、精确、校准与正常任务影响,不能只看 AUROC 的整体排序。

构造例子:回答里日期一致且高概率,模型确实使用了旧版规则。多采样不一定发现错误,核对适用版本能够发现。检测选择需要跟随失败类型,任何一个内部置信度都不应承担整个系统的事实保证。

最后更新于

本页目录