外观
多模态大模型核心技术解析:CLIP、BLIP2与Stable Diffusion
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
1. 多模态视觉大模型:CLIP 与 DALL·E
多模态视觉大模型是指可以处理多种感知模态数据(如图像和文本)的大型深度学习模型。CLIP 和 DALL·E 是这方面的重要研究。
| 模型 | 类型 | 核心能力 |
|---|---|---|
| CLIP | 对比学习模型 | 将图像和文本嵌入空间连接,理解图像与文本之间的语义关系 |
| DALL·E | 生成模型 | 根据文本描述生成与之相关的图像 |
CLIP(Contrastive Language-Image Pretraining)通过对比学习将图像与文本映射到统一的语义空间,是多模态领域的基础性工作。
2. BLIP2 的架构与优势
BLIP2 是图像-语言多模态模型的预训练方法,于 2023 年提出。
2.1 核心架构
BLIP2 的关键设计是在冻结的图像模型和冻结的语言模型之间放入一个 Q-Former:
- 冻结的图像模型:负责从图像中提取特征(如 ViT)
- 冻结的语言模型:负责生成语言
- Q-Former:训练目标,包含图像 Transformer 和语言 Transformer
2.2 Q-Former 工作机制
图像 → 冻结图像模型(ViT) → 图像特征
↓
Q-Former(待训练)
├── 图像Transformer(CA + SA)
└── 语言Transformer(共享SA参数)
↓
冻结语言模型 → 输出| 组件 | 功能 |
|---|---|
| SA(自注意力) | 查询值在 SA 中与自己交互,与语言 Transformer 共享参数 |
| CA(交叉注意力) | 只接受图像模型提取的图像特征,查询值与图像特征交互 |
| 语言 Transformer | 训练时做编码器,预测时做解码器 |
2.3 两阶段训练
- 第一阶段:训练 Q-Former 与图像模型的交互
- 第二阶段:将 Q-Former 的结果与语言模型连接(中间可加入全连接、前缀词等操作)
BLIP2 优势:通过冻结已有的大模型,仅训练轻量级 Q-Former,大幅降低了训练成本。
3. 多模态融合后如何判断模态影响权重?
在多模态融合后,了解最终结果受哪种模态影响更大,可以使用特征重要性分析方法:
| 方法 | 说明 |
|---|---|
| SHAP 值 | 基于博弈论的特征贡献分配方法 |
| Permutation Importance | 通过打乱某一模态特征观察性能变化 |
4. 多模态中常见的 SOTA 模型
| 模型 | 核心特点 |
|---|---|
| ViT(Vision Transformer) | 将自注意力引入计算机视觉,图像补丁 + Transformer,在分类和检测任务上表现出色 |
| CLIP | 图像和文本的对比学习,实现图像与文本的联合理解和表示学习 |
| UNITER | 使用 Transformer 联合学习图像和文本表示,提供通用特征提取框架 |
| LXMERT | 结合视觉和语言信息的跨模态 Transformer,可用于 VQA、图像描述生成 |
| CoCa | 融合单编码器、双编码器和编码器-解码器三种结构,在多个任务上取得 SOTA |
5. Stable Diffusion 的原理
Stable Diffusion 是一种生成模型,其原理基于 Langevin 动力学和扩散过程。核心思想是通过多次迭代,逐渐将噪声信号演化为目标分布所对应的样本。
5.1 核心步骤
- 初始化噪声信号为服从高斯分布的随机向量
- 通过一系列演化步骤,将噪声信号迭代地转化为目标分布的样本
- 每一步中,将当前噪声信号与目标分布的梯度信息结合,通过 Langevin 动力学方程进行更新
- 迭代次数越多,噪声信号越接近目标分布,最终生成目标分布的样本
关键:Stable Diffusion 通过合理选择演化步长和迭代次数,在生成样本的质量和速度之间取得平衡。