今天聊聊BLIP3:BLIP-3 是 Salesforce AI Research 联合华盛顿大学等机构推出的新一代多模态大模型框架也被称为 xGen-MM。随着技术的发展BLIP-3 已经从一个单纯的图像理解模型演进为包含视频理解、原生图像生成等能力的统一多模态模型家族。基础架构革新xGen-MM (BLIP-3).作为 BLIP-3 的基础版本xGen-MM 在架构和训练流程上进行了大幅简化与优化轻量化视觉采样器摒弃了 BLIP-2 中复杂的 Q-Former 架构采用更具可扩展性的感知器重采样器Perceiver Resampler。该结构通过单层注意力机制将视觉 Token 高效降采样大幅降低了大规模训练的计算障碍。底层语言模型采用phi3-mini作为预训练的大型语言模型结合感知器重采样器使整个模型参数量保持在轻量级的 4B 左右。统一自回归损失简化了训练目标专注于多模态上下文中文本 Token 的自回归损失Language Modeling实现视觉与语言标记的无缝整合。动态高分辨率编码引入分块编码策略在保持图像高分辨率的同时减少视觉 Token 序列长度增强了模型对富含文本图像如 OCR 任务的处理能力。视频理解拓展BLIP-3-Video为了高效处理视频中的时序信息BLIP-3-Video 引入了创新的时序压缩算法时序编码器Temporal Encoder在传统视觉 Tokenizer 的基础上增加了时序编码器如可学习的时池化或 Token Turing Machines。极致 Token 压缩能够将多帧视频的时序信息映射为极其紧凑的视觉 Token 集合例如仅用 32 个 Token 即可代表一段视频在保持与 34B 级别大模型相当的问答准确率的同时极大地降低了显存占用与计算开销。 原生图像生成BLIP3-o 与 BLIP3o-NEXT.BLIP3-o 将模型能力从“图像理解”拓展到了“原生图像生成与编辑”其核心算法设计如下自回归 扩散AR Diffusion混合架构自回归模型负责理解指令并生成中间视觉特征捕捉语义随后扩散模型Diffusion Model基于这些特征生成高保真图像像素。CLIP 特征扩散摒弃了传统的 VAE 像素级特征采用 CLIP 模型将图像编码为语义丰富且紧凑的特征向量固定为 64 维。自回归模型预测 CLIP 特征再由扩散解码器将其还原为真实图像大幅提升了生成质量与多样性。流匹配损失Flow Matching Loss在训练扩散模型时采用流匹配损失函数相比传统的 MSE 损失能更好地捕捉图像特征的底层分布使生成的图像具有更高的多样性。顺序预训练策略Late Fusion采用“先理解、后生成”的顺序训练。先训练图像理解能力随后冻结自回归主干网络仅训练扩散生成模块。这有效避免了联合训练中的任务冲突保留了强大的图像理解能力。训练流程与安全对齐.BLIP-3 在训练配方上进行了精细的阶段划分多阶段训练涵盖大规模数据预训练、监督微调SFT、多图像微调以及后训练阶段6。DPO 安全对齐在后训练阶段引入直接偏好优化DPO有效减轻了模型的幻觉问题提升了事实准确性与输出安全性。总体而言BLIP-3 算法的核心思想是“做减法与做融合”通过感知器重采样和极致的视频 Token 压缩降低计算复杂度同时通过 ARDiffusion 的架构将理解与生成能力完美统一.