知行札记
AI 技术生态调研

评测、观测、网关与成本

比较回归、轨迹、供应商治理和自托管运营的完整链路。

将回归和运行记录连接起来

确定性测试检查格式、计算、权限和接口;模型评测检查固定输入下的质量及工具轨迹;线上观测连接请求、模型、检索与外部效果。三类记录互补。任务具有工具和恢复时,逐步轨迹很重要;单次简单分类无需因此引入完整 agent 平台。

平台或工具侧重采用条件与成本
Langfuse追踪、prompt、datasets、scores 与开源部署SDK/server 兼容,开源与企业模块许可;自托管存储运维
LangSmithLangChain 系观测、评测与相关部署产品SaaS/企业自托管条件、数据传输与厂商绑定
Braintrustdataset、task、scorer 和实验,TS 测试集成评分器版本、独立 eval 配置、云费用及数据治理
Phoenix/OpenInferenceOTel 相关追踪、评测与仪表盘instrumentation、存储及部署方式
MLflow/Weave既有实验及模型记录生态已有 Databricks/W&B 投资及所用开放功能
DeepEval/RAGAS/promptfoopytest、RAG 指标或声明式用例与红队评分模型、阈值、样本与成本

Opik、Giskard、TruLens、Inspect AI、OpenCompass、lm-evaluation-harness 等分别支持轨迹、风险测量或基准任务,需按要测的对象选用。平台界面与指标数量不能证明评分可靠。Langfuse、LangSmith、Braintrust、Phoenix、MLflow、Weave、DeepEval、RAGAS、promptfoo、Inspect AI。

集成和自托管的真实负担

TS 的 Vitest/Jest 可使用独立 eval suite 与 Braintrust 等 reporter,Python 可用 pytest/DeepEval;需要模型调用的套件单独计费和运行,避免普通单测依赖外部付费服务。固定 dataset、prompt、模型、sampling、scorer 和逐例输出。模型 judge 存在位置、冗长和模型偏好,人工样例、交换顺序或双向比较能检验部分偏差,无法保证彻底消除。

追踪保留 request/run、模型身份、重试、token、检索资料版本及工具结果,正文和凭据脱敏。OTel 统一传输与部分属性约定;各平台的自定义字段、实验和评分数据仍有迁移成本。初始化和导出生命周期按进程管理,后台队列在退出时 flush;每个请求重复建立并关闭 exporter 可能降低吞吐。

Langfuse 的归档部署包含应用/worker、PostgreSQL、ClickHouse、Redis 与对象存储,版本与拓扑以采用文档为准;软件许可宽松不意味着整套运营免费。LangSmith 的 SDK 与商业部署授权分别确认。归档记录的 Langfuse TS/Python major、旧 Cloud 接口停止日期、配额及价格未全部在本轮重新确认,采用前查兼容表,不能以原期限代替当前公告。

测试扩展与历史计费口径

vitest-evals 将模型测试和 runner 连接,Braintrust 的 wrapVitest/reporter 把运行映射为实验与 spans,autoevals 提供可独立使用的 scorer;evalite 提供本地输出、轨迹与回归界面,采用前核对稳定/beta 版本。复杂多步骤逻辑可在代码里表达,声明式 promptfoo 用例利于配置与红队;两种路线都保存 dataset、评分器和原始结果。vitest-evals、Braintrust Vitest、autoevals、evalite。

OpenLLMetry 提供 instrumentation,AgentOps 偏运行回放,Giskard 偏扫描和测试生成;openai/evals 也是归档中的评测框架候选。LangWatch、Maxim、Openlayer、Future AGI、Galileo、Confident AI 等商业路线进入采购比较时核对自己的 workload、数据、权限和费用,营销对比不能承担整体效果排名。关于并购、停止维护和团队转型的历史线索,本轮未重新验证,不用来宣称某能力已经消失。OpenLLMetry、AgentOps、Giskard、OpenAI evals。

归档 2026-10-03 的 TS 运维稿记录 Langfuse 付费起点约 29 美元/月、LangSmith 39 美元/席/月、Braintrust 249 美元/月,以及免费 units/traces/处理数据和 scores;部分数字来自厂商对比或第三方拆解,未重新核对全部官方价目。units、trace、score、GB 与留存不是相同计费对象,不直接排高低。模型 judge API、自托管数据库与对象存储、日志保留、导出及人工标注还需单独算。Langfuse pricing、LangSmith pricing、Braintrust pricing。

本地 token 预检可用 gpt-tokenizer、tiktoken/js-tiktoken 或目标模型 tokenizer。编码词表、消息包装、工具 schema、多模态及隐藏推理使预估与供应商账单不同;WASM 与纯 JS 的内存及启动在 Edge 上也需测量。旧 llm-cost 或库内价目需检查更新时间,最终结算保存所用供应商价目版本,无法仅靠静态 tokenizer 得到所有模型的完整费用。gpt-tokenizer、tiktoken、JS tiktoken。

网关控制哪些事实

网关管理供应商凭据、模型别名、路由、限流、缓存及预算;应用管理身份、业务授权及输出验证;推理引擎管理模型计算。统一网关减少接入成本,新增全调用路径上的可用性、数据与安全责任。

候选主要取向要核对的边界
LiteLLM Proxy统一多供应商及自托管治理API 支持、发行物、数据库、依赖与安全公告
BifrostGo 网关路线功能、部署、授权;语言本身不提供整体安全保证
Portkey/Helicone网关及观测控制托管控制面与自托管核心的区别
Kong/Envoy/WSO2 AI Gateway既有 API 平台扩展已有运维能力、插件、策略和许可
OpenRouter托管模型聚合数据经第三方、路由、账单和供应商行为
Cloudflare/Vercel AI Gateway所属平台的托管治理地域、平台边界、缓存、fallback 与 BYOK 口径

LiteLLM Proxy、Bifrost、Portkey、Helicone、Envoy AI Gateway、OpenRouter、Cloudflare AI Gateway、Vercel AI Gateway。

缓存键包含租户、模型/adapter、完整语义前缀、工具、资料和输出要求,权限变化后不能继续复用旧资料结果。fallback 需匹配原请求所用能力;流已开始后更换模型应由应用明确重试或新运行,避免拼出混合答案。并发中的预算预估与延迟到达的账单存在差值,需预留和结算,不能将查询一次余额称为绝对硬上限。

供应链事件限定到实际发行物

本轮读取 LiteLLM 官方安全公告,确认 2026-03-24 PyPI 的 1.82.7、1.82.8 是公告列出的受影响包;官方将当时的官方 Proxy Docker 路线列为未受影响,并报告新发布管线和核查。这个事件需要核对发行物、安装来源和时间,不能推广为整个 Python 生态不可信,或以后全部 Docker 镜像永远安全。LiteLLM 官方安全公告。

固定版本及 digest、核查签名和可信发布来源能帮助控制漂移;哈希匹配只能证明取得的是那份文件,不能证明被攻陷的合法发布物安全。归档中的 CVE-2026-42271、Chroma 等其他漏洞编号没有在本轮取得完整原始公告,不作为当前暴露或项目淘汰的结论。实际服务仍需跟踪相应版本的官方 advisory,隔离凭据与工具权限。

成本按一次合格结果计算

一次运行成本包括每次模型尝试、输入/输出/缓存、嵌入、重排、资料解析、judge、工具、存储和网络。自托管还包含空闲 GPU、冗余容量和人员。按吞吐比较时记录可用时段与质量标准;调用便宜但失败更多,会增加每次合格结果成本。token 账单、GPU 时薪和月订阅应使用同一负载转换后比较,不能直接排名。

Edge/serverless 适合的范围由实际依赖决定。TS 的 Node 版本声明不必然代表每个 SDK 都依赖 Node 独有接口,Workers 兼容层也不必然覆盖文件、native module 或长任务;Python 服务、GPU 进程和持久 worker 有不同运行条件。核对 CPU 时间、墙钟、内存、文件、连接及平台套餐,长任务通过受控后台运行承接。Cloudflare Workers 限制、Vercel Functions。

本页保留 TS 运维及 Python 评测/服务稿的能力与采用条件;未重新验证所有平台价格、合规认证、配额、BYOK 优惠或社区采用率。没有执行真实线上调用、供给方 failover 或性能测试。

最后更新于

本页目录