BLEU 翻译质量指标
BLEU(双语替换评测)是一项用于评估机器翻译文本的指标。BLEU 得分是一个介于 0 到 1 之间的数值,用于衡量机器翻译文本与一组高质量参考译文的相似度:
- 得分为 0 表示机器翻译的输出与参考译文没有任何重叠,这表明翻译质量较低。
- 得分为 1 表示与参考译文完全重叠,即翻译质量很高。
BLEU 限制
BLEU 是一个基于语料库的指标。当用于评估单个句子时,BLEU 指标表现不佳。即使单个句子翻出了大部分含义,其 BLEU 得分仍可能很低。因为单个句子的 n-gram 统计信息意义不大,所以 BLEU 的设计是一个基于语料库的指标;也就是说,在计算得分时,统计信息在整个语料库中进行累积。BLEU 指标不能针对单个句子进行分解。
BLEU 不区分实词和功能词。 BLEU 指标不区分实词和功能词。漏掉像 a 这样的功能词与 NASA 被错误替换为 ESA 一样会受到同样的惩罚。
BLEU 不善于捕捉句子的含义和语法。 漏掉“not”这样的单词会改变句子的极性。此外,仅考虑 n≤4 的 n 元语法忽略了长程依赖性,因此 BLEU 通常只会为不符合语法的句子应用一个较小的惩罚因子。
BLEU 依赖于归一化和词法单元化。在计算 BLEU 得分之前,参考翻译和候选翻译都会进行归一化和词法单元化处理。这些流程中的步骤选择对最终 BLEU 得分有显著的影响。
如何解读 BLEU 得分
以下是大致的参考,可帮助您解读以百分比而非小数表示的 BLEU 得分:
| BLEU 得分(百分比) | 解读 |
|---|---|
| < 10 | 几乎没用 |
| 10 - 19 | 很难理解要点 |
| 20 - 29 | 要点很清晰,但有明显的语法错误 |
| 30 - 40 | 从可以理解到质量良好的翻译 |
| 40 - 50 | 高质量的翻译 |
| 50 - 60 | 质量极高、理解充分、语言流畅的翻译 |
| > 60 | 质量经常高于人工翻译 |
以下颜色渐变可用作 BLEU 分数解释的一般量表:

数学细节
在数学上,BLEU 得分的定义为:
$$
\text{BLEU} = \underbrace{\vphantom{\prod_i^4}\min\Big(1,
\exp\big(1-\frac{\text{reference-length}}
{\text{output-length}}\big)\Big)}_{\text{brevity penalty}}
\underbrace{\Big(\prod_{i=1}^{4}
precision_i\Big)^{1/4}}_{\text{n-gram overlap}}
$$
以及