多模态表示与生成
理解图像、视频和音频的表示、跨模态连接及理解与生成的不同目标。
模态先成为可以计算的表示
文本、图像、音频与视频有不同的空间和时间结构。多模态模型需要将这些信号变成可计算表示,再学习模态之间的对应。一个模型能接收图像,不等于能够生成图像;能生成视频,也不等于能够按动作可靠模拟物理世界。
理解任务从输入提取信息,例如描述物体、识别文字或定位区域。生成任务从条件构造输出,例如图像、语音或下一段视频。共享编码器、连接器、语言骨干和生成解码器可以组合,但各个目标的训练、表示和评价需明确。
图像怎样进入序列
ViT 将图像切成 patch,每个 patch 展平并投影为向量,加位置信息后送入 Transformer。若宽高可整除 patch 边长 ,patch 数为 ;边缘处理、CLS 与多尺度会改变真实数量。patch 向量可以是连续表示,只有使用离散码本等额外步骤时才成为离散 token 编号。ViT
位置编码帮助识别二维位置;没有位置且没有其他非对称结构的全注意力对排列具有置换等变性。ViT 仍有 patch 局部性等归纳偏置,无法用“零偏置”概括。卷积常提供局部性与平移等变结构,Transformer 的跨区域关系依赖注意力、位置和训练。
视觉编码器还需要确定学习目标。CLIP 分别编码图像与文字,将归一化后的全局向量放进共同空间;在同一批图文对中,两个方向的交叉熵促使正确配对得分高于其他配对。分类时可以编码候选类别的文字描述,再按图文相似度选择。SigLIP 改用逐图文对的 sigmoid 损失,无需对整批相似度做 softmax 归一化;负例与数据配对仍影响学习。这样的全局对应提供了视觉表征,接入语言模型还需学习如何保留、转换和使用局部信息。CLIP、SigLIP
视觉编码器的输出需要与语言模型隐藏空间连接。线性/MLP 投影逐位置转换表示;Q-Former 等可学习查询通过交叉注意力形成较短表示。固定查询数限制输出长度,也能控制上下文成本。哪种连接器更好取决于两端是否冻结、数据、分辨率与任务,复杂连接器没有普遍淘汰定律。BLIP-2、LLaVA
早融合路线让图像、文字等表示在较早的共同序列中交互。采用离散图像 tokenizer 时,可把图像码和文本 token 放进统一自回归目标;采用连续视觉特征时,仍需定义输入投影和生成目标。Chameleon 是离散混合模态早融合的一项公开研究,模型需要处理不同模态的尺度、训练混合与稳定性。Chameleon
API 宣称“原生多模态”无法单独揭示闭源模型的完整训练配方。共同架构下,各模态拥有不同数据量与预测难度。某一模态的梯度可能主导共享参数,损伤其他模态;训练采样、损失权重、归一化和专门模块分别调整这个问题。只看综合分数可能掩盖文字能力退化或细粒度视觉能力未提升。验证时保持纯文本、视觉理解和跨模态关系的独立用例。
分辨率、压缩与细粒度错误
固定缩小图像可能丢失小字和细线。多 tile、动态分辨率与 patch packing 保留更多细节,也增大表示长度、注意力和缓存成本。合并或剪枝视觉位置减少成本,是否冗余取决于任务:描述场景不需要的一个角落,可能恰好含待识别编号。
grounding 将词语与区域关联,例如定位“右上角的蓝色按钮”。全局图文对比目标未必充分监督区域对应;坐标离散化、区域监督与分辨率共同影响结果。OCR、计数和图表理解还需保持数字、单位、标签及空间关系,单一整体图像分数无法测量这些能力。
构造反例:缩小后的两个编号只差最后一位,视觉表示不能辨出差别。语言模型即使根据上下文补出合理编号,也没有恢复真实像素证据。应保留裁剪、原分辨率或独立识别路径,并在回答中区分读到的内容与推断。
本专题的 扩散、流匹配与图像生成 建立生成数学,视频、语音与交互模型 说明时序约束与世界模型的用途。
最后更新于