评测、观测与部署
将离线回归、运行轨迹、模型成本和部署约束连起来。
评测进入项目资产
评测集保存输入、预期结果或 rubric、来源及许可、数据划分和版本。运行配置固定被测模型、模板、采样、工具环境与评分器。确定性格式、计算和权限检查进入普通测试;调用模型的评测单独执行,计入成本,并保留逐例输出。
TS 可以用 Vitest/Jest 的独立 eval 配置,加 Braintrust、LangSmith reporter 或自定义 scorer;promptfoo 用于声明式用例及红队配置。Python 可以用 pytest/DeepEval、lm-evaluation-harness 或 OpenCompass。指标实现同名不保证口径相同,替换依赖时保留原始输出并对照评分变化。
{
"datasetRevision": "knowledge-qa-v3",
"caseId": "permission-denied-01",
"input": "读取另一租户的资料",
"expected": { "decision": "deny", "externalEffects": 0 },
"modelRevision": "configured-model-revision",
"promptRevision": "qa-v2",
"scorerRevision": "policy-v1"
}PR 可跑代表性的低成本集合,完整评测按模型、数据或配置变化安排。报告整体与重要子组结果、失败类型、重复采样波动和基线差异。裁判模型、rubric 与版本同样固定;高影响门禁结合确定性检查和人工抽查。DeepEval、Braintrust evals、LangSmith 评测。
轨迹能连接哪些事实
一条运行 trace 包含检索、模型调用、工具执行、审批及重试 spans。span 保存 runId、父调用、模型与资料版本、延迟、usage、终止原因和经过脱敏的输入输出。错误发生在工具执行时,最终回答的分数不足以解释原因;保留整条轨迹有助于核对真实效果与恢复过程。
OTel 提供传输和关联基础,GenAI/OpenInference 约定提供字段语义。平台仍有自定义事件、prompt 和 dataset 数据模型,换后端需要检查这些字段的映射,不能把采用 OTel 解释成无迁移成本。OpenTelemetry GenAI 约定。
Langfuse 可组合 tracing、prompt、数据集与评分;LangSmith 对 LangChain/LangGraph 有集成;Braintrust 强调实验与评分;Phoenix/OpenLLMetry、MLflow 和 Weave 可按已有基础设施评估。原归档中的包拆分和迁移期限作为版本核查线索,安装时按目标 SDK 与服务端兼容表确认。Langfuse compatibility。
初始化和结束导出
观测初始化在进程或框架 instrumentation 入口完成,避免每次模型调用都新建导出器。并发运行传播 trace context,异步后台任务显式关联原 runId。将审计需要的授权与外部效果记录保存到可靠存储,观测抽样不能成为它们唯一来源。
短生命周期函数退出前,需要在平台允许的时间内 flush/shutdown;长驻服务通常在进程退出时关闭。不要在每个请求里关闭共享 SDK。平台 waitUntil、后台执行和函数超时各有边界,设置重试与队列后监控导出丢失及积压。浏览器端评分接口只发送允许的公开字段,秘密 key 不进入前端。
预算要覆盖整个运行
请求前估计输入并设置输出上限;运行中累计模型、重排、检索改写、工具和裁判成本;最终按供应商 usage 与对应价目版本核算。缓存命中、推理 token、音视频及批处理可能使用不同口径,不能用单一“总 token”推算所有模型费用。
网关预算应区分预留、实际结算与并发在途费用。到达预算时停止新轮次及新工具调用,处理在途结果;供应商已经接受的调用可能继续产生费用。fallback 限定可接受的模型、数据所在地和最大价目,记录实际路由,避免故障转移改变结果或隐私条件。Vercel AI Gateway、LiteLLM 预算。
部署由实际运行依赖决定
Edge 可承担鉴权、路由和流转发,是否适合完整 agent 循环要核对 CPU、墙钟、内存、子请求、连接和 SDK 兼容性。等待网络与使用 CPU 是不同计费和限制维度。Node SDK 的最低版本并不证明它在 Workers 的兼容模式可完整运行;需要检查依赖的模块、导出器和平台支持。
长 agent、批量评测和训练任务可放持久 worker/workflow,前端只提交任务及查询状态。流式响应检查代理缓冲、首字节期限、最大流时长和客户端断开;失败恢复检查任务持久化和幂等效果。归档的云平台具体限制是历史快照,部署配置以相应产品和套餐的官方文档为准。Workers limits、Vercel Functions limits。
当前验证范围
本页提供接线方案与文档核查条件。本轮未安装上述评测或观测 SDK,未运行 AI 服务、训练任务、云部署、浏览器或真实工具效果。采用时应按所选版本验证代表任务及失败路径;文档 lint 和内链检查只证明页面技术格式。
最后更新于