Skip to content

大模型评测方法论与实践指南

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

1. 大模型评测的核心挑战是什么?

传统的 NLP benchmark 如 SuperGLUEGLUE 以及中文的 CLUE 在评估大模型时已不太适用。主要原因包括:

  • 大模型在训练时几乎扫遍了整个互联网数据,难以保证测试集未被模型"见过"
  • 聊天机器人聊得好不好本身非常主观,难以用标准指标衡量
  • 现存 benchmark 覆盖的话题和任务有限,无法涵盖理论上可聊的任何话题
  • 甚至存在用测试集直接对模型"特训"的情况,导致评测失真

当前评测的核心方向应聚焦于:推理能力与多轮对话能力。

2. 大模型的 Honest 原则如何实现?

大模型需要遵循三大原则:Helpful(有用)Honest(诚实)Harmless(无害)

提升 Honest 原则的训练策略:

策略具体做法
知识问答类训练集构造"不知道的不回答"样本,加强诚实原则
阅读理解题读过的要回答,没读过的不回答,避免胡说八道

这是一个实用的 trick,通过构造特定训练样本让模型学会"承认不知道"。

3. 如何衡量大模型水平?

可以从以下维度提出代表性问题来全面评估一个大型语言模型:

评估维度说明示例
理解能力测试对文本的深入理解提出需深入理解文本的问题
语言生成能力评估生成文本的结构、逻辑和语法让模型生成特定主题的文章
知识面广度测试不同领域知识掌握程度科学、历史、文学、体育等问题
适应性处理多种不同类型任务写作、翻译、编程等
长文本理解处理长文本的能力提供文章让模型总结要点
长文本生成生成连贯的长篇内容创作有完整情节的故事
多样性测试创造力和多样性同一问题给出多个不同答案
情感分析和推断分析情感态度、推断角色关系提供对话让模型分析情感
情感表达生成带有情感色彩的文本描述场景或人物的情感状态
逻辑推理能力推理和逻辑分析能力"所有动物都会呼吸。狗是动物。狗会呼吸吗?"
问题解决能力解决实际问题的能力数学题、编程问题
道德和伦理处理道德伦理问题的表现"在什么情况下撒谎是可以接受的?"
对话和聊天自然语言处理掌握程度进行多轮对话测试

4. 大模型评估方法有哪些?

4.1 指标评估

使用 BLEU-4ROUGE 分数等传统指标进行评估。对于 ROUGE-L 分数评估,有些地方称之为非自然指令评估(Unnatural Instruction Evaluation)。例如 ChatGLM-6B 使用此类方法。

4.2 使用 GPT-4 反馈进行自动评估

利用 GPT-4 作为评判者,对模型输出进行自动评分。代表项目:VicunaPhoenixChimeraBELLE

4.3 Chatbot Arena

放弃传统 benchmark,采用对抗式实时聊天 + 人工两两比对打分的方式,使用 Elo 分数进行排名评测。

传统 BenchmarkChatbot Arena
固定测试数据集实时聊天交互
客观指标(准确率等)主观人工两两比对
可能被模型"见过"动态生成,无法预先训练
覆盖有限话题可聊任何话题

4.4 OpenAI Evals

OpenAI 的自动化评估脚本,核心思路是通过编写 prompt 模版来实现自动化评估。

4.5 PandaLM

直接训练了一个自动化打分模型,采用 0/1/2 三分制,用模型对两个候选模型的输出进行打分比较。

5. 大模型评估工具总结

评估工具/方法核心思路代表项目
指标评估(BLEU/ROUGE)传统 NLP 指标ChatGLM-6B
GPT-4 自动评估用大模型评判大模型Vicuna, Phoenix, Chimera, BELLE
Chatbot Arena人工两两比对 + Elo 评分Chatbot Arena
OpenAI EvalsPrompt 模版自动化评估OpenAI
PandaLM训练专用打分模型,三分制PandaLM
人工评估人工打分评估LIMA, Phoenix