外观
大模型评测方法论与实践指南
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
1. 大模型评测的核心挑战是什么?
传统的 NLP benchmark 如 SuperGLUE、GLUE 以及中文的 CLUE 在评估大模型时已不太适用。主要原因包括:
- 大模型在训练时几乎扫遍了整个互联网数据,难以保证测试集未被模型"见过"
- 聊天机器人聊得好不好本身非常主观,难以用标准指标衡量
- 现存 benchmark 覆盖的话题和任务有限,无法涵盖理论上可聊的任何话题
- 甚至存在用测试集直接对模型"特训"的情况,导致评测失真
当前评测的核心方向应聚焦于:推理能力与多轮对话能力。
2. 大模型的 Honest 原则如何实现?
大模型需要遵循三大原则:Helpful(有用)、Honest(诚实)、Harmless(无害)。
提升 Honest 原则的训练策略:
| 策略 | 具体做法 |
|---|---|
| 知识问答类训练集 | 构造"不知道的不回答"样本,加强诚实原则 |
| 阅读理解题 | 读过的要回答,没读过的不回答,避免胡说八道 |
这是一个实用的 trick,通过构造特定训练样本让模型学会"承认不知道"。
3. 如何衡量大模型水平?
可以从以下维度提出代表性问题来全面评估一个大型语言模型:
| 评估维度 | 说明 | 示例 |
|---|---|---|
| 理解能力 | 测试对文本的深入理解 | 提出需深入理解文本的问题 |
| 语言生成能力 | 评估生成文本的结构、逻辑和语法 | 让模型生成特定主题的文章 |
| 知识面广度 | 测试不同领域知识掌握程度 | 科学、历史、文学、体育等问题 |
| 适应性 | 处理多种不同类型任务 | 写作、翻译、编程等 |
| 长文本理解 | 处理长文本的能力 | 提供文章让模型总结要点 |
| 长文本生成 | 生成连贯的长篇内容 | 创作有完整情节的故事 |
| 多样性 | 测试创造力和多样性 | 同一问题给出多个不同答案 |
| 情感分析和推断 | 分析情感态度、推断角色关系 | 提供对话让模型分析情感 |
| 情感表达 | 生成带有情感色彩的文本 | 描述场景或人物的情感状态 |
| 逻辑推理能力 | 推理和逻辑分析能力 | "所有动物都会呼吸。狗是动物。狗会呼吸吗?" |
| 问题解决能力 | 解决实际问题的能力 | 数学题、编程问题 |
| 道德和伦理 | 处理道德伦理问题的表现 | "在什么情况下撒谎是可以接受的?" |
| 对话和聊天 | 自然语言处理掌握程度 | 进行多轮对话测试 |
4. 大模型评估方法有哪些?
4.1 指标评估
使用 BLEU-4、ROUGE 分数等传统指标进行评估。对于 ROUGE-L 分数评估,有些地方称之为非自然指令评估(Unnatural Instruction Evaluation)。例如 ChatGLM-6B 使用此类方法。
4.2 使用 GPT-4 反馈进行自动评估
利用 GPT-4 作为评判者,对模型输出进行自动评分。代表项目:Vicuna、Phoenix、Chimera、BELLE。
4.3 Chatbot Arena
放弃传统 benchmark,采用对抗式实时聊天 + 人工两两比对打分的方式,使用 Elo 分数进行排名评测。
| 传统 Benchmark | Chatbot Arena |
|---|---|
| 固定测试数据集 | 实时聊天交互 |
| 客观指标(准确率等) | 主观人工两两比对 |
| 可能被模型"见过" | 动态生成,无法预先训练 |
| 覆盖有限话题 | 可聊任何话题 |
4.4 OpenAI Evals
OpenAI 的自动化评估脚本,核心思路是通过编写 prompt 模版来实现自动化评估。
4.5 PandaLM
直接训练了一个自动化打分模型,采用 0/1/2 三分制,用模型对两个候选模型的输出进行打分比较。
5. 大模型评估工具总结
| 评估工具/方法 | 核心思路 | 代表项目 |
|---|---|---|
| 指标评估(BLEU/ROUGE) | 传统 NLP 指标 | ChatGLM-6B |
| GPT-4 自动评估 | 用大模型评判大模型 | Vicuna, Phoenix, Chimera, BELLE |
| Chatbot Arena | 人工两两比对 + Elo 评分 | Chatbot Arena |
| OpenAI Evals | Prompt 模版自动化评估 | OpenAI |
| PandaLM | 训练专用打分模型,三分制 | PandaLM |
| 人工评估 | 人工打分评估 | LIMA, Phoenix |