BLEU 翻译质量指标

BLEU(双语替换评测)是一项用于评估机器翻译文本的指标。BLEU 得分是一个介于 0 到 1 之间的数值,用于衡量机器翻译文本与一组高质量参考译文的相似度:

  • 得分为 0 表示机器翻译的输出与参考译文没有任何重叠,这表明翻译质量较低。
  • 得分为 1 表示与参考译文完全重叠,即翻译质量很高。

BLEU 限制

  • BLEU 是一个基于语料库的指标。当用于评估单个句子时,BLEU 指标表现不佳。即使单个句子翻出了大部分含义,其 BLEU 得分仍可能很低。因为单个句子的 n-gram 统计信息意义不大,所以 BLEU 的设计是一个基于语料库的指标;也就是说,在计算得分时,统计信息在整个语料库中进行累积。BLEU 指标不能针对单个句子进行分解。

  • BLEU 不区分实词和功能词。 BLEU 指标不区分实词和功能词。漏掉像 a 这样的功能词与 NASA 被错误替换为 ESA 一样会受到同样的惩罚。

  • BLEU 不善于捕捉句子的含义和语法。 漏掉“not”这样的单词会改变句子的极性。此外,仅考虑 n≤4 的 n 元语法忽略了长程依赖性,因此 BLEU 通常只会为不符合语法的句子应用一个较小的惩罚因子。

  • BLEU 依赖于归一化和词法单元化。在计算 BLEU 得分之前,参考翻译和候选翻译都会进行归一化和词法单元化处理。这些流程中的步骤选择对最终 BLEU 得分有显著的影响。

如何解读 BLEU 得分

以下是大致的参考,可帮助您解读以百分比而非小数表示的 BLEU 得分:

BLEU 得分(百分比) 解读
< 10 几乎没用
10 - 19 很难理解要点
20 - 29 要点很清晰,但有明显的语法错误
30 - 40 从可以理解到质量良好的翻译
40 - 50 高质量的翻译
50 - 60 质量极高、理解充分、语言流畅的翻译
> 60 质量经常高于人工翻译

以下颜色渐变可用作 BLEU 分数解释的一般量表:

量表的一般可解释性

数学细节

在数学上,BLEU 得分的定义为:

$$ \text{BLEU} = \underbrace{\vphantom{\prod_i^4}\min\Big(1, \exp\big(1-\frac{\text{reference-length}} {\text{output-length}}\big)\Big)}_{\text{brevity penalty}} \underbrace{\Big(\prod_{i=1}^{4} precision_i\Big)^{1/4}}_{\text{n-gram overlap}} $$

以及