Skip to content

文本摘要技术:抽取式、生成式与评估指标

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

1. 抽取式摘要和生成式摘要的问题

1.1 抽取式摘要

抽取式摘要在语法、句法上有一定的保证,但也面临以下问题:

问题说明
内容选择错误可能选取了不重要的句子
连贯性差抽取的句子之间缺乏逻辑衔接
灵活性差只能从原文中选取,无法改写

1.2 生成式摘要

生成式摘要的优点是相比抽取式用词更加灵活,因为所产生的词可能从未在原文中出现过。但存在以下问题:

问题说明
OOV 问题源文档语料词量大,但常用词固定,词表过滤后生成摘要会遇到 UNK 词
可读性差贪心算法或 beam search 方法生成的句子可能不通顺
重复性模型在某段连续 timesteps 生成重复的词
长文本难度大源文本与目标文本长度相差大,encoder 需很好归纳信息并传递给 decoder

2. Pointer-Generator Network 解决了什么问题

指针生成网络(PGN)从两方面针对 seq-to-seq 模型在生成式文本摘要中的应用做了改进:

2.1 解决 OOV 问题

通过指向从源文本中复制单词,有助于准确复制信息,同时保留 generator 的生成能力。PGN 可以看作是抽取式和生成式摘要之间的平衡——通过一个门控机制选择产生的单词是来自于词汇表还是来自输入序列复制。

2.2 解决重复问题

使用 coverage 机制跟踪摘要的内容,不断更新注意力,从而阻止文本不断重复。利用注意力分布追踪目前应该被覆盖的单词,当网络再次注意同一部分时予以惩罚。

总结:PGN 巧妙结合了抽取式(复制原文)和生成式(生成新词)的优势,通过门控机制在两者之间动态切换。

3. 文本摘要的应用场景

领域应用
新闻报道快速生成新闻摘要,使读者快速了解新闻内容
市场调查对大量用户反馈进行快速分析,提取关键信息
医学领域从海量医学文献中快速找到相关研究成果,辅助诊疗决策

4. ROUGE 指标之间的区别

ROUGE 是将待审摘要和参考摘要的 n 元组共现统计量作为评价依据。

指标计算方式说明
ROUGE-Nn-gram 共现次数之和 / 参考摘要中 n-gram 出现次数之和基于 n-gram 的召回率
ROUGE-L最长公共子序列(LCS)的匹配率L 代表 Longest Common Subsequence
ROUGE-W加权最长公共子序列连续最长公共子序列拥有更大权重,是 ROUGE-L 的改进版

如果两个句子包含的最长公共子序列越长,说明两个句子越相似。

5. BLEU 和 ROUGE 的不同

5.1 核心差异

对比维度BLEUROUGE
提出时间2002 年2003 年
计算依据精确率召回率
适用场景机器翻译文本摘要、机器翻译

5.2 BLEU 的设计初衷

  • SMT 时代:机器翻译效果差,需要同时评价翻译的准确度流畅度
  • NMT 时代:神经网络脑补能力强,翻译结果通顺,但容易瞎翻译

ROUGE 最初广泛用于自动摘要评测(侧重召回/覆盖);BLEU 更常见于机器翻译。二者都基于 n-gram 重叠,都不能单独保证「流畅性」,也不宜简单说「只适合 NMT、不适合 SMT」。

5.3 BLEU 计算要点

要素说明
Pnn-gram 的精确率(N 一般设为 4)
Wnn-gram 的权重(一般设为均匀权重,即 Wn = 1/N)
BP惩罚因子,译文长度小于最短参考译文时 BP < 1
1-gram 精确率表示译文忠于原文的程度
其他 n-gram表示翻译的流畅程度