Skip to content

多模态大模型核心技术解析:CLIP、BLIP2与Stable Diffusion

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

1. 多模态视觉大模型:CLIP 与 DALL·E

多模态视觉大模型是指可以处理多种感知模态数据(如图像和文本)的大型深度学习模型。CLIP 和 DALL·E 是这方面的重要研究。

模型类型核心能力
CLIP对比学习模型将图像和文本嵌入空间连接,理解图像与文本之间的语义关系
DALL·E生成模型根据文本描述生成与之相关的图像

CLIP(Contrastive Language-Image Pretraining)通过对比学习将图像与文本映射到统一的语义空间,是多模态领域的基础性工作。

2. BLIP2 的架构与优势

BLIP2 是图像-语言多模态模型的预训练方法,于 2023 年提出。

2.1 核心架构

BLIP2 的关键设计是在冻结的图像模型冻结的语言模型之间放入一个 Q-Former:

  • 冻结的图像模型:负责从图像中提取特征(如 ViT)
  • 冻结的语言模型:负责生成语言
  • Q-Former:训练目标,包含图像 Transformer 和语言 Transformer

2.2 Q-Former 工作机制

图像 → 冻结图像模型(ViT) → 图像特征

                         Q-Former(待训练)
                          ├── 图像Transformer(CA + SA)
                          └── 语言Transformer(共享SA参数)

                         冻结语言模型 → 输出
组件功能
SA(自注意力)查询值在 SA 中与自己交互,与语言 Transformer 共享参数
CA(交叉注意力)只接受图像模型提取的图像特征,查询值与图像特征交互
语言 Transformer训练时做编码器,预测时做解码器

2.3 两阶段训练

  1. 第一阶段:训练 Q-Former 与图像模型的交互
  2. 第二阶段:将 Q-Former 的结果与语言模型连接(中间可加入全连接、前缀词等操作)

BLIP2 优势:通过冻结已有的大模型,仅训练轻量级 Q-Former,大幅降低了训练成本。

3. 多模态融合后如何判断模态影响权重?

在多模态融合后,了解最终结果受哪种模态影响更大,可以使用特征重要性分析方法:

方法说明
SHAP 值基于博弈论的特征贡献分配方法
Permutation Importance通过打乱某一模态特征观察性能变化

4. 多模态中常见的 SOTA 模型

模型核心特点
ViT(Vision Transformer)将自注意力引入计算机视觉,图像补丁 + Transformer,在分类和检测任务上表现出色
CLIP图像和文本的对比学习,实现图像与文本的联合理解和表示学习
UNITER使用 Transformer 联合学习图像和文本表示,提供通用特征提取框架
LXMERT结合视觉和语言信息的跨模态 Transformer,可用于 VQA、图像描述生成
CoCa融合单编码器、双编码器和编码器-解码器三种结构,在多个任务上取得 SOTA

5. Stable Diffusion 的原理

Stable Diffusion 是一种生成模型,其原理基于 Langevin 动力学扩散过程。核心思想是通过多次迭代,逐渐将噪声信号演化为目标分布所对应的样本。

5.1 核心步骤

  1. 初始化噪声信号为服从高斯分布的随机向量
  2. 通过一系列演化步骤,将噪声信号迭代地转化为目标分布的样本
  3. 每一步中,将当前噪声信号与目标分布的梯度信息结合,通过 Langevin 动力学方程进行更新
  4. 迭代次数越多,噪声信号越接近目标分布,最终生成目标分布的样本

关键:Stable Diffusion 通过合理选择演化步长和迭代次数,在生成样本的质量和速度之间取得平衡。