知行札记
专题技术实践AI 工程实践

评测、观测与部署

将离线回归、运行轨迹、模型成本和部署约束连起来。

评测进入项目资产

评测集保存输入、预期结果或 rubric、来源及许可、数据划分和版本。运行配置固定被测模型、模板、采样、工具环境与评分器。确定性格式、计算和权限检查进入普通测试;调用模型的评测单独执行,计入成本,并保留逐例输出。

TS 可以用 Vitest/Jest 的独立 eval 配置,加 Braintrust、LangSmith reporter 或自定义 scorer;promptfoo 用于声明式用例及红队配置。Python 可以用 pytest/DeepEval、lm-evaluation-harness 或 OpenCompass。指标实现同名不保证口径相同,替换依赖时保留原始输出并对照评分变化。

{
  "datasetRevision": "knowledge-qa-v3",
  "caseId": "permission-denied-01",
  "input": "读取另一租户的资料",
  "expected": { "decision": "deny", "externalEffects": 0 },
  "modelRevision": "configured-model-revision",
  "promptRevision": "qa-v2",
  "scorerRevision": "policy-v1"
}

PR 可跑代表性的低成本集合,完整评测按模型、数据或配置变化安排。报告整体与重要子组结果、失败类型、重复采样波动和基线差异。裁判模型、rubric 与版本同样固定;高影响门禁结合确定性检查和人工抽查。DeepEval、Braintrust evals、LangSmith 评测。

轨迹能连接哪些事实

一条运行 trace 包含检索、模型调用、工具执行、审批及重试 spans。span 保存 runId、父调用、模型与资料版本、延迟、usage、终止原因和经过脱敏的输入输出。错误发生在工具执行时,最终回答的分数不足以解释原因;保留整条轨迹有助于核对真实效果与恢复过程。

OTel 提供传输和关联基础,GenAI/OpenInference 约定提供字段语义。平台仍有自定义事件、prompt 和 dataset 数据模型,换后端需要检查这些字段的映射,不能把采用 OTel 解释成无迁移成本。OpenTelemetry GenAI 约定。

Langfuse 可组合 tracing、prompt、数据集与评分;LangSmith 对 LangChain/LangGraph 有集成;Braintrust 强调实验与评分;Phoenix/OpenLLMetry、MLflow 和 Weave 可按已有基础设施评估。原归档中的包拆分和迁移期限作为版本核查线索,安装时按目标 SDK 与服务端兼容表确认。Langfuse compatibility。

初始化和结束导出

观测初始化在进程或框架 instrumentation 入口完成,避免每次模型调用都新建导出器。并发运行传播 trace context,异步后台任务显式关联原 runId。将审计需要的授权与外部效果记录保存到可靠存储,观测抽样不能成为它们唯一来源。

短生命周期函数退出前,需要在平台允许的时间内 flush/shutdown;长驻服务通常在进程退出时关闭。不要在每个请求里关闭共享 SDK。平台 waitUntil、后台执行和函数超时各有边界,设置重试与队列后监控导出丢失及积压。浏览器端评分接口只发送允许的公开字段,秘密 key 不进入前端。

预算要覆盖整个运行

请求前估计输入并设置输出上限;运行中累计模型、重排、检索改写、工具和裁判成本;最终按供应商 usage 与对应价目版本核算。缓存命中、推理 token、音视频及批处理可能使用不同口径,不能用单一“总 token”推算所有模型费用。

网关预算应区分预留、实际结算与并发在途费用。到达预算时停止新轮次及新工具调用,处理在途结果;供应商已经接受的调用可能继续产生费用。fallback 限定可接受的模型、数据所在地和最大价目,记录实际路由,避免故障转移改变结果或隐私条件。Vercel AI Gateway、LiteLLM 预算。

部署由实际运行依赖决定

Edge 可承担鉴权、路由和流转发,是否适合完整 agent 循环要核对 CPU、墙钟、内存、子请求、连接和 SDK 兼容性。等待网络与使用 CPU 是不同计费和限制维度。Node SDK 的最低版本并不证明它在 Workers 的兼容模式可完整运行;需要检查依赖的模块、导出器和平台支持。

长 agent、批量评测和训练任务可放持久 worker/workflow,前端只提交任务及查询状态。流式响应检查代理缓冲、首字节期限、最大流时长和客户端断开;失败恢复检查任务持久化和幂等效果。归档的云平台具体限制是历史快照,部署配置以相应产品和套餐的官方文档为准。Workers limits、Vercel Functions limits。

当前验证范围

本页提供接线方案与文档核查条件。本轮未安装上述评测或观测 SDK,未运行 AI 服务、训练任务、云部署、浏览器或真实工具效果。采用时应按所选版本验证代表任务及失败路径;文档 lint 和内链检查只证明页面技术格式。

最后更新于

本页目录