模型输出流与调用预算
说明增量内容、结束原因、工具参数、取消与模型调用消耗的关系。
一条输出怎样逐步形成
模型服务可以在生成尚未完成时返回片段。片段可能属于可显示文本、某个内容块、工具调用参数或音频时间段;应用用调用与内容身份将它们合并。一轮生成可能提出多个工具请求,不能仅按事件到达顺序把所有参数拼成一份对象。传输事件格式取决于接口,本页解释共同的生成语义。
构造例子:第一段工具参数是 {"quantity":,下一段才是 2}。第一段还不具备完整 JSON 语法;即使中途恰好拼出一个合法对象,也可能尚未收到该调用的完成事件。执行应等待完整参数,再进行 schema、语义和权限检查。文本可以先显示,行动不能按可见文字猜测执行。
输出的完成原因可能区分正常停止、长度截断、工具请求、拒绝、取消或错误。网络不再传字节仅说明传输停止。生成达到长度上限时,回答可能缺后半段;工具请求已经结束时,用户任务也可能尚未结束。应用应保存部分内容和实际原因,让后续处理辨认这些状态。
生成、取消与再次调用
取消可以停止客户端等待或播放,并向服务传递停止请求;设备已有音频缓冲、远端生成和已执行工具各有生命周期。是否确认停止与是否已付费,依接口回执和实际状态判断。通用请求投递、幂等和任务恢复由软件流程负责,模型接口提供的是其中一段观察。
再次生成未必得到相同内容。采样、模型版本、上下文裁剪、工具观察和供应商回退都可能改变条件分布。若断流后重跑,前一段可见文字与新回答的关系应明确处理;把新流直接续在旧半句后,可能形成原本没有任何模型完整生成过的回答。
更换模型还需重新核对上下文容量、消息模板、多模态输入、工具选择与 schema 支持。记录实际模型和最终分支,使结果评价对应真正使用的条件。某个模型的格式保证不能沿用到未核对的回退接口。
token 消耗怎样进入任务预算
输入、输出、缓存命中、内部推理、多模态和工具可能按不同口径计数或计费。内部推理 token 未必全部公开展示,输出上限也未必只限制可见文字。应按目标接口确认窗口与 usage 语义;最终 usage 未收到时,本地分词只能提供声明口径下的估计。
一次用户任务可能调用模型多次。将实际消耗聚合到任务,连同检索、重排和工具成本计算,并限制累计 token、调用数与墙钟时间。前缀命中改变重复输入的部分开销,逻辑上下文长度仍存在;价格条件属于具体服务调研。
构造预算:任务最多允许四次调用,计划为抽取、两次核查和整理。某次核查失败后,宿主应在剩余预算内决定重试、调整路径或返回已有结果与缺口。提示中的“最多四次”可以影响模型行为,预算守卫仍由宿主执行。身份、凭证、日志保存与数据权限属于一般软件边界,这里只使用相应约束作为调用前提。
最后更新于