Skip to content

主流大语言模型横向对比

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

1. 主流开源大模型训练数据与数据量对比

以下是主流开源大语言模型在训练数据和数据量方面的对比:

模型参数量训练数据量训练数据来源上下文长度位置编码开源协议
LLaMA7B/13B/33B/65B1.0T/1.0T/1.4T tokens公开网页、书籍、论文、代码等2048RoPE非商用
LLaMA 27B/13B/70B2.0T tokens公开数据集(比LLaMA1多40%)4096RoPE可商用
Baichuan-7B7B1.2T tokens开源中英文数据+自行抓取中文互联网数据4096RoPE可商用
Baichuan-13B13B1.4T tokens高质量语料4096ALiBi可商用
Baichuan-53B53B未公开搜索引擎增强数据未公开未公开API服务
Baichuan 27B/13B2.6T/3.0T tokens高质量多源数据4096RoPE可商用
ChatGLM-6B6B1.0T tokens中英双语数据2048RoPE可商用
Qwen7B/14B/72B3.0T+ tokens多语言多领域数据8192RoPE可商用
Mistral7B未公开多样化数据8192RoPEApache 2.0

2. LLaMA vs LLaMA 2 对比

维度LLaMALLaMA 2
训练数据量1.0T~1.4T tokens2.0T tokens(多40%)
上下文长度20484096(翻倍)
注意力机制MHAGQA(34B/70B模型)
微调方式SFTSFT + RLHF
对话模型无官方对话版LLaMA 2-Chat
开源协议非商用可商用

提示:LLaMA 2 在数据质量、上下文长度、模型架构和微调方法四个方面均有显著改进。

3. Baichuan 系列对比

维度Baichuan-7BBaichuan-13BBaichuan-53BBaichuan 2
参数量7B13B53B7B/13B
训练tokens1.2T1.4T未公开2.6T/3.0T
位置编码RoPEALiBi未公开RoPE
上下文长度40964096未公开4096
量化支持int8/int4APIint8/int4
搜索增强

4. 各模型特点总结

4.1 LLaMA 系列

  • 优势:社区生态丰富,工具链完善,可商用(LLaMA 2)
  • 劣势:中文能力较弱,需额外适配

4.2 Baichuan 系列

  • 优势:原生中英双语支持,中文能力强,同时开源预训练和对齐模型
  • 特色:Baichuan-53B 具备搜索增强能力,Baichuan 2 在数学/代码/安全/逻辑方面显著提升

4.3 ChatGLM 系列

  • 优势:中英双语,部署友好,量化支持好
  • 特色:GLM 架构,不同于标准 Transformer

4.4 Qwen 系列

  • 优势:长上下文支持(8192),多语言多领域
  • 特色:多尺寸覆盖,工具调用能力强

5. 选型建议

使用场景推荐模型原因
中文场景Baichuan / Qwen原生中文支持
英文场景LLaMA 2社区生态丰富
长文本处理Qwen8192 上下文长度
低资源部署Mistral 7B / Baichuan-13B int4量化支持好
商用项目LLaMA 2 / Baichuan / Qwen可商用协议

6. 总结

选择大语言模型时需要综合考虑以下因素:

  • 语言支持:是否需要中文能力
  • 参数规模:与部署资源匹配
  • 上下文长度:与业务场景匹配
  • 开源协议:是否允许商用
  • 社区生态:工具链和微调资源丰富程度
  • 量化支持:降低部署门槛