外观
LLM 评测方法
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
一、大模型怎么评测?
传统的 SuperGLUE、GLUE、中文 CLUE 等 benchmark 已不太适合评估大模型。评估推理能力、多轮对话能力是核心。
二、评估维度
| 维度 | 说明 |
|---|---|
| 理解能力 | 提出需要深入理解文本的问题,看模型是否能准确回答 |
| 语言生成能力 | 让模型生成特定主题的文章或故事,评估结构、逻辑和语法质量 |
| 知识面广度 | 回答不同主题问题(科学、历史、文学、体育等),测试领域知识掌握程度 |
| 适应性 | 处理各种不同类型任务(写作、翻译、编程等)的灵活性 |
| 长文本理解 | 提供长文章让模型总结要点 |
| 长文本生成 | 创作完整故事,无明显逻辑矛盾或结构错误 |
| 多样性 | 对同一问题给出多个不同答案或解决方案,测试创造力 |
| 情感分析 | 分析对话或文本中的情感、态度、角色关系 |
| 逻辑推理 | 回答需要推理或逻辑分析的问题 |
| 问题解决 | 数学题、编程问题等实际问题解答 |
| 道德伦理 | 处理道德和伦理问题的表现 |
| 对话能力 | 多轮对话中的自然语言理解与应答 |
三、Honest 原则的实现
大模型需遵循 Helpful(有用)、Honest(诚实)、Harmless(无害) 三原则。
Honest 原则的训练技巧:
- 微调时构造知识问答类训练集,教模型"不知道就不回答"
- 阅读理解题,读过的要回答,没读过的不胡说八道
四、评估方法
4.1 Chatbot Arena(竞技场模式)
放弃传统 benchmark,采用对抗 + 实时聊天 + 两两对比 + 人工打分的 Elo 评分机制。
为什么传统 benchmark 不好用?
- 聊天质量评判高度主观,现有方法难以衡量
- 大模型训练时几乎扫遍互联网数据,难以保证测试集未被"见过"
- 很多聊天话题或任务在现有 benchmark 中根本不存在
4.2 自动评估
| 方法 | 说明 |
|---|---|
| GPT-4 反馈评估 | Vicuna、Phoenix、Chimera 等使用 GPT-4 进行自动评估 |
| BELLE 指标 | BLEU-4、ROUGE 分数等传统 NLG 指标(非自然指令评估) |
| OpenAI Evals | OpenAI 自动化评估脚本,通过 Prompt 模板自动化评估 |
| PandaLM | 训练自动化打分模型(0/1/2 三分制),用于两个候选模型对比打分 |
4.3 人工评估
LIMA、Phoenix 等工作采用人工评估方式衡量模型表现。
五、评估工具
- Chatbot Arena:对抗式实时聊天 + Elo 评分
- OpenAI Evals:Prompt 模板驱动的自动化评估框架
- PandaLM:训练专门打分模型进行自动化对比评估