外观
主流大语言模型横向对比
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
1. 主流开源大模型训练数据与数据量对比
以下是主流开源大语言模型在训练数据和数据量方面的对比:
| 模型 | 参数量 | 训练数据量 | 训练数据来源 | 上下文长度 | 位置编码 | 开源协议 |
|---|---|---|---|---|---|---|
| LLaMA | 7B/13B/33B/65B | 1.0T/1.0T/1.4T tokens | 公开网页、书籍、论文、代码等 | 2048 | RoPE | 非商用 |
| LLaMA 2 | 7B/13B/70B | 2.0T tokens | 公开数据集(比LLaMA1多40%) | 4096 | RoPE | 可商用 |
| Baichuan-7B | 7B | 1.2T tokens | 开源中英文数据+自行抓取中文互联网数据 | 4096 | RoPE | 可商用 |
| Baichuan-13B | 13B | 1.4T tokens | 高质量语料 | 4096 | ALiBi | 可商用 |
| Baichuan-53B | 53B | 未公开 | 搜索引擎增强数据 | 未公开 | 未公开 | API服务 |
| Baichuan 2 | 7B/13B | 2.6T/3.0T tokens | 高质量多源数据 | 4096 | RoPE | 可商用 |
| ChatGLM-6B | 6B | 1.0T tokens | 中英双语数据 | 2048 | RoPE | 可商用 |
| Qwen | 7B/14B/72B | 3.0T+ tokens | 多语言多领域数据 | 8192 | RoPE | 可商用 |
| Mistral | 7B | 未公开 | 多样化数据 | 8192 | RoPE | Apache 2.0 |
2. LLaMA vs LLaMA 2 对比
| 维度 | LLaMA | LLaMA 2 |
|---|---|---|
| 训练数据量 | 1.0T~1.4T tokens | 2.0T tokens(多40%) |
| 上下文长度 | 2048 | 4096(翻倍) |
| 注意力机制 | MHA | GQA(34B/70B模型) |
| 微调方式 | SFT | SFT + RLHF |
| 对话模型 | 无官方对话版 | LLaMA 2-Chat |
| 开源协议 | 非商用 | 可商用 |
提示:LLaMA 2 在数据质量、上下文长度、模型架构和微调方法四个方面均有显著改进。
3. Baichuan 系列对比
| 维度 | Baichuan-7B | Baichuan-13B | Baichuan-53B | Baichuan 2 |
|---|---|---|---|---|
| 参数量 | 7B | 13B | 53B | 7B/13B |
| 训练tokens | 1.2T | 1.4T | 未公开 | 2.6T/3.0T |
| 位置编码 | RoPE | ALiBi | 未公开 | RoPE |
| 上下文长度 | 4096 | 4096 | 未公开 | 4096 |
| 量化支持 | 否 | int8/int4 | API | int8/int4 |
| 搜索增强 | 否 | 否 | 是 | 是 |
4. 各模型特点总结
4.1 LLaMA 系列
- 优势:社区生态丰富,工具链完善,可商用(LLaMA 2)
- 劣势:中文能力较弱,需额外适配
4.2 Baichuan 系列
- 优势:原生中英双语支持,中文能力强,同时开源预训练和对齐模型
- 特色:Baichuan-53B 具备搜索增强能力,Baichuan 2 在数学/代码/安全/逻辑方面显著提升
4.3 ChatGLM 系列
- 优势:中英双语,部署友好,量化支持好
- 特色:GLM 架构,不同于标准 Transformer
4.4 Qwen 系列
- 优势:长上下文支持(8192),多语言多领域
- 特色:多尺寸覆盖,工具调用能力强
5. 选型建议
| 使用场景 | 推荐模型 | 原因 |
|---|---|---|
| 中文场景 | Baichuan / Qwen | 原生中文支持 |
| 英文场景 | LLaMA 2 | 社区生态丰富 |
| 长文本处理 | Qwen | 8192 上下文长度 |
| 低资源部署 | Mistral 7B / Baichuan-13B int4 | 量化支持好 |
| 商用项目 | LLaMA 2 / Baichuan / Qwen | 可商用协议 |
6. 总结
选择大语言模型时需要综合考虑以下因素:
- 语言支持:是否需要中文能力
- 参数规模:与部署资源匹配
- 上下文长度:与业务场景匹配
- 开源协议:是否允许商用
- 社区生态:工具链和微调资源丰富程度
- 量化支持:降低部署门槛