Skip to content

LLM 评测方法

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

一、大模型怎么评测?

传统的 SuperGLUE、GLUE、中文 CLUE 等 benchmark 已不太适合评估大模型。评估推理能力、多轮对话能力是核心。


二、评估维度

维度说明
理解能力提出需要深入理解文本的问题,看模型是否能准确回答
语言生成能力让模型生成特定主题的文章或故事,评估结构、逻辑和语法质量
知识面广度回答不同主题问题(科学、历史、文学、体育等),测试领域知识掌握程度
适应性处理各种不同类型任务(写作、翻译、编程等)的灵活性
长文本理解提供长文章让模型总结要点
长文本生成创作完整故事,无明显逻辑矛盾或结构错误
多样性对同一问题给出多个不同答案或解决方案,测试创造力
情感分析分析对话或文本中的情感、态度、角色关系
逻辑推理回答需要推理或逻辑分析的问题
问题解决数学题、编程问题等实际问题解答
道德伦理处理道德和伦理问题的表现
对话能力多轮对话中的自然语言理解与应答

三、Honest 原则的实现

大模型需遵循 Helpful(有用)Honest(诚实)Harmless(无害) 三原则。

Honest 原则的训练技巧:

  • 微调时构造知识问答类训练集,教模型"不知道就不回答"
  • 阅读理解题,读过的要回答,没读过的不胡说八道

四、评估方法

4.1 Chatbot Arena(竞技场模式)

放弃传统 benchmark,采用对抗 + 实时聊天 + 两两对比 + 人工打分的 Elo 评分机制。

为什么传统 benchmark 不好用?

  1. 聊天质量评判高度主观,现有方法难以衡量
  2. 大模型训练时几乎扫遍互联网数据,难以保证测试集未被"见过"
  3. 很多聊天话题或任务在现有 benchmark 中根本不存在

4.2 自动评估

方法说明
GPT-4 反馈评估Vicuna、Phoenix、Chimera 等使用 GPT-4 进行自动评估
BELLE 指标BLEU-4、ROUGE 分数等传统 NLG 指标(非自然指令评估)
OpenAI EvalsOpenAI 自动化评估脚本,通过 Prompt 模板自动化评估
PandaLM训练自动化打分模型(0/1/2 三分制),用于两个候选模型对比打分

4.3 人工评估

LIMA、Phoenix 等工作采用人工评估方式衡量模型表现。


五、评估工具

  • Chatbot Arena:对抗式实时聊天 + Elo 评分
  • OpenAI Evals:Prompt 模板驱动的自动化评估框架
  • PandaLM:训练专门打分模型进行自动化对比评估