Skip to content

LLM 基础概念与架构面试题

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

1. 目前主流的开源大模型体系有哪些?

面试里说的「开源大模型」,多数其实是 开放权重(open weights):权重可下载、可本地部署,但许可证未必是 OSI 意义上的开源(例如 Meta 的 Llama Community License)。选型时要同时看 能力、架构、许可证、中文/代码/推理场景

截至 2025–2026,主流体系大致如下(代表型号会迭代,以各厂商官网 / Hugging Face 当前页为准):

1.1 当前第一梯队(开放权重)

系列代表型号(举例)机构特点(面试口径)
Llama 系列Llama 3.x;Llama 4 Scout / MaverickMetaDecoder-only;Llama 4 起采用 MoE,原生多模态;Scout 主打超长上下文,Maverick 更偏综合能力;Llama Community License(大规模商用有条款,答题时要提)
Qwen(通义千问)Qwen2.5;Qwen3 系列(含稠密与 MoE)阿里中英与多语言强,工具调用 / Agent 友好;常见 Apache 2.0,HF 下载量长期靠前,工程默认选项之一
DeepSeek 系列DeepSeek-V3;DeepSeek-R1(及蒸馏版);后续 V 系迭代深度求索大规模 MoE;R1 以可复现的强化学习推理路线闻名;许可偏宽松(多为 MIT 类,以仓库 LICENSE 为准);性价比与本地/自建推理讨论多
GLM / ChatGLM 系列ChatGLM3;GLM-4 / GLM-4.x 及更新代际智谱中文场景常见;早期 ChatGLM 以 Prefix Decoder 著称,后续代际能力与形态以官方说明为准;自主可控叙事常见
Kimi 系列Kimi K2;Kimi K3月之暗面长上下文 / 长程任务与 Agent、编程场景叙事强;K3 宣称超大规模稀疏 MoE(以官方技术报告与权重发布为准)
Mistral 系列Mistral Small / Large 等;Codestral、Devstral 等Mistral AI欧洲阵营;多型号 Apache 2.0;偏高效部署与企业友好许可
Gemma 系列Gemma 2;Gemma 3 等Google偏可落地的中小尺寸与多模态;许可为 Gemma 条款(非标准 Apache)
Phi 系列Phi-3 / Phi-4 及 mini 变体Microsoft小参数、强效果 路线;适合端侧 / 资源受限;许可多为 MIT 类

1.2 仍常考的「奠基 / 经典」系列(偏架构史)

系列代表模型为何还考
GPT 系列GPT、GPT-2、GPT-3Decoder-only + 大规模预训练范式的标杆(闭源演进,但概念必考)
BERT 系列BERT、RoBERTaEncoder 双向理解范式;和生成式 LLM 对照
T5 系列T5、Flan-T5Encoder-Decoder、「统一文本到文本」
BLOOMBLOOM早期大规模多语言开源 Decoder-only 代表

百川(Baichuan) 等也曾是国内开源主流之一;面试若被问到可答「早期国产开源代表」,但 2025 年后讨论热度多被 Qwen / DeepSeek / GLM / Kimi 等分流。

1.3 答题时可补的三点趋势

  1. MoE 常态化:同参数量级下降低激活参数,兼顾质量与推理成本(Llama 4、DeepSeek、Qwen MoE、Kimi 等)。
  2. 推理模型单独成类:如 DeepSeek-R1 一类,强调长链推理 /「思考」轨迹,和普通 Chat 基座区分。
  3. 许可 > 榜单:Apache 2.0 / MIT 与「社区许可 + MAU 限制」商用风险不同;面试官很爱追问「能商用吗」。

1.4 极简选型口令(方便口述)

  • 宽松许可 + 工程默认:优先看 Qwen / Mistral 等 Apache 系
  • 推理 / 数学代码性价比:优先看 DeepSeek
  • 超长上下文 / Meta 生态:看 Llama 4 Scout 等,并声明许可限制
  • 中文产品化 / 自主可控叙事:看 Qwen、GLM、Kimi 等国产开放权重
  • 端侧小模型:看 Phi、Gemma 中小规格

2. Prefix Decoder、Causal Decoder 与 Encoder-Decoder 的区别?

三种架构的核心区别在于 Attention Mask 的设计不同:

Causal Decoder(因果解码器)

  • 机制:从左到右的单向注意力,每个 token 只能看到自身及之前的 token
  • 代表模型:GPT 系列、Llama 系列、Qwen、DeepSeek、Mistral 等当代主流生成式 LLM
  • 优点:预训练与下游任务高度一致;Zero-shot 能力出色,具有涌现能力;训练效率高
  • 适用场景:文本生成、对话、Agent / 工具调用等

Prefix Decoder(前缀解码器)

  • 机制:Prefix 部分采用双向注意力,生成部分采用单向注意力
  • 代表模型:ChatGLM、ChatGLM2、U-PaLM
  • 特点:Causal Decoder 与 Encoder-Decoder 的折中方案
  • 缺点:训练效率相对较低(仅对输出部分计算损失)

Encoder-Decoder(编码器-解码器)

  • 机制:Encoder 端采用双向注意力,Decoder 端采用单向注意力
  • 代表模型:T5、Flan-T5、BART
  • 优点:对输入编码理解更充分,在偏理解的 NLP 任务上效果突出
  • 缺点:长文本生成效果较差;训练效率较低;需要 Multi-task Fine-tuning 才能激发最佳性能

训练效率对比

Prefix Decoder < Causal Decoder:Causal Decoder 在所有 token 上计算损失,而 Prefix Decoder 仅对输出部分计算损失。

3. 大模型的训练目标是什么?

大语言模型主要采用两种训练目标:

语言模型(Language Modeling) 根据已有的上文词序列预测下一个词,训练目标为最大化似然函数。这是当前 Decoder-only 架构的主流训练方式,代表模型包括 GPT 系列和 LLaMA 系列。

去噪自编码器(Denoising Autoencoder) 随机替换或掩盖部分文本片段,训练模型恢复原始文本。采用该目标的模型有 GLM-130B、T5 等。实现难度高于语言模型方式。

4. 涌现能力的原因是什么?

涌现能力(Emergent Capabilities)指模型规模达到一定阈值后,突然展现出之前不具备的能力。关于其原因,目前学术界主要提出两个猜想:

猜想一:评价指标不够平滑 某些复杂任务的评价指标本身是非线性的。假设任务 T 由 5 个子任务构成,每个子任务随模型规模增长从 40% 提升至 60%,但最终任务指标可能仅从 1.1% 提升至 7%。宏观上观察到涌现现象,但子任务层面其实是平滑增长的。

猜想二:复杂任务的非线性组合 多个子能力的组合可能导致表现的非线性跃升,当模型规模跨越关键阈值时,这些子能力之间产生协同效应。

5. 为何当前大模型大多采用 Decoder-only 架构?

原因可以从以下维度分析:

  1. Zero-shot 表现:Decoder-only 架构在无任何微调数据的情况下,Zero-shot 性能最优。Encoder-Decoder 则需要一定量的标注数据进行 Multi-task Fine-tuning 才能激发最佳性能。

  2. 训练范式匹配:当前大模型的训练范式是在大规模语料上进行自监督学习,Decoder-only 架构能更好地利用无标注数据。

  3. 低秩问题:Encoder 的双向注意力机制可能导致注意力矩阵低秩,削弱模型表达能力。对生成任务而言,引入双向注意力并无实质优势。

  4. 参数效率:Encoder-Decoder 架构之所以在某些场景表现更好,主要得益于参数量翻倍。在同等参数量和推理成本下,Decoder-only 架构是最优选择。

6. 请简要介绍大语言模型(LLM)

大语言模型(Large Language Model,LLM)是参数量达到亿级以上的语言模型(当前业界标准已提升至十亿甚至万亿级别)。它基于 Transformer 架构,通过在大规模无标注文本上进行预训练,学习语言的深层模式和知识表示,然后在特定任务上通过微调或提示工程(Prompt Engineering)完成各种自然语言处理任务。

核心特征:大规模参数量、自监督预训练、通过上下文引导产生生成式内容。

7. 175B、60B、540B 等参数表示什么?

这些数字表示模型的参数规模,其中 B 代表 Billion(十亿):

  • 175B = 1,750 亿参数(GPT-3 的规模)
  • 60B = 600 亿参数(量级示例;具体模型以官方参数量为准,如历史上的部分 60B 级开源模型)
  • 540B = 5,400 亿参数(PaLM 的规模)

参数量直接反映了模型的容量和计算资源需求。

8. 大模型的主要优点

  1. 预训练-微调范式:利用大量无标注数据预训练通用模型,再用少量有标注数据微调适应特定任务,大幅降低标注成本,提升泛化能力。

  2. 生成能力:能够产生新颖且有价值的内容(文本、图像、音乐等),在创意、娱乐、教育等领域提供优秀的体验。

  3. 涌现能力:能够完成此前难以处理的复杂任务,如数学应用题、常识推理、符号操作等,体现出较高的智能水平和推理能力。

9. 大模型的主要缺点

  1. 资源消耗:训练和推理需要大量的计算和存储资源。训练 GPT-3 级别模型约需 30 万美元成本,并产生约 284 吨二氧化碳排放。

  2. 数据质量与安全:面临数据偏见、数据泄露、数据滥用等问题,可能导致模型产生不准确或不道德的输出,影响用户和社会利益。

  3. 可解释性与可靠性:模型行为的可解释性、输出的正确性和稳定性、效益与风险的平衡等仍是重要的研究挑战。

10. 什么是生成式大模型?

生成式大模型是一类能够创造新内容(文本、图片、音频、视频等)的深度学习模型。相比普通深度学习模型,其核心差异在于:

  • 参数量巨大:通常在 Billion 级别
  • 生成式产出:通过条件或上下文引导,利用 Prompt Engineering 产生多样化内容