知行札记
专题AI 模型与系统多模态表示与生成

视频、语音与交互模型

说明时间一致性、音频码本、全双工和动作条件世界模型。

视频把一致性扩展到时间

视频表示可以使用帧 patch 或时空压缩。联合去噪允许多个时刻互相影响,全注意力的交互规模随全部位置平方增长。因果生成按帧或块推进,支持流式与历史缓存;如果保留无限增长的历史,全历史注意力的总成本仍可能超线性,缓存只消除了部分重算。

滑窗限制历史访问,降低成本,也可能丢失早期身份、位置和事件。用模型自己上一段输出作条件,产生与训练真实帧条件不同的分布,可能出现漂移、重复和动态衰减。自身 rollout 训练、少步蒸馏、额外记忆和关键帧约束分别处理不同失效,没有一项自动保证长时间一致。

物体恒存、遮挡后恢复、相机运动、接触与因果动作应分别测量。帧级美观和视频总体偏好可能掩盖细小但决定性的物理错误。

语音识别与生成的两种表示

ASR 从声学信号产生文字,可使用 encoder-decoder 逐 token 解码,或 CTC/transducer 对齐路线。CTC 引入 blank,并对多种帧到文本对齐求和;转导器同时利用声学与已输出文本条件。模型支持哪些语言、翻译、时间戳和流式方式,取决于训练和接口,架构家族不决定全部质量。

神经音频 codec 把波形编码成较低帧率的潜表示。残差向量量化 RVQ 逐层近似剩余残差,得到多个码本索引,再解码还原声音。SoundStream、EnCodec 是具体方法。

浅层与深层码本常体现粗细声学分工;要把某层称为“语义层”,应检查是否有语义监督或实证。VALL-E 与 Moshi/Mimi 的训练和生成结构不同,不能统一赋予每个第一码本相同语义。VALL-E、Moshi

多码本若逐项串行生成,输出率可很高。错位调度、帧内小网络、并行补细节或块生成可以减少关键路径,不等于删除了码本之间的依赖。音质、跳词、重复、韵律、发音与说话人一致性需要分别检查。

以每秒 50 帧、每帧 8 个码本索引的虚构 codec 为例,完全展平的序列每秒包含 400 个音频 token。delay pattern 将不同码本按时间错位,使同一步可以预测不同帧的不同层;生成与还原需要对应偏移,开始和结束的边界还会带来等待。depth transformer 则在每个时间帧内沿码本深度逐层产生条件分布,时间网络负责跨帧关系。两种方式缩短不同的关键路径,帧内依赖和解码延迟仍需计算。

Moshi 将用户音频与自身音频组织为并行流,并结合与生成语音相关的文本流;Mimi 的语义训练目标使第一层承担特定语义信号。这里的语义码本和双流结构来自其公开设计,不能从任意 codec 的层数推断。Moshi 论文

ASR 的 CTC 可通过插入 blank 和合并连续重复符号,将多种帧级路径映射到同一文本。对于含两个相同连续字符的文本,中间 blank 帮助区分“重复帧”与“真的重复字符”。encoder-decoder 可以逐词利用语言上下文,CTC 或 transducer 的流式能力也要由编码器视野与训练决定。字符错误率、词错误率、时间戳误差和断句延迟分别衡量不同问题。

全双工需要模型与播放链共同协作

级联 ASR→文本模型→TTS 便于替换与诊断,可以通过流式分块降低等待。若必须等用户结束后才响应,它呈现半双工行为;级联架构也可以设计持续听、打断和增量输出,半双工并非其不可改变的结构定律。

原生双流模型持续处理用户音频与自身输出,并学习何时接话或让位。全双工还需声学回声消除、VAD、网络抖动处理、输入时标、播放缓冲和取消。模型停止生成时,设备已有排队音频可能继续播放,因此“用户打断成功”需要观察整个链。

延迟应拆成采集窗口、编码、网络、模型、解码和可听播放,不将 codec 的理论帧长写成产品总延迟。文字转写也可能丢失语气、停顿和重叠说话信息,端到端语音则需要更多可控和审计手段。

世界模型的用途需要明确

帧预测模型学习 p(xt+1∣x≤t)p(x_{t+1}\mid x_{\le t});控制规划需要考虑动作,例如 p(st+1∣st,at)p(s_{t+1}\mid s_t,a_t);合成传感器数据引擎则服务下游训练。三者都可能被称为世界模型,验收对象不同。

作为交互环境,需要动作确实改变状态、任务可重复、奖励可判定。作为机器人动力学模型,需要动作条件、分布外预测与 sim-to-real 评价。作为数据引擎,需要证明生成样本改善真实任务,并排除伪相关和评测泄漏。

逼真的视频不能单独证明物理规律被可靠学到。受控实验可以改变速度、质量、对象组合和未见情境,区分记忆近邻与可迁移关系;某个二维实验的失败也不能证明所有世界模型永远失败。物理泛化研究、V-JEPA 2 提供不同任务下的研究入口。

最后更新于

本页目录