Enterprise Document OCR

您可以将 Enterprise Document OCR 用作 Document AI 的一部分,以检测和提取各种文档中的文本和布局信息。借助可配置的功能,您可以根据特定的文档处理要求量身定制系统。

概览

您可以使用 Enterprise Document OCR 来执行基于算法或机器学习的数据输入等任务,并提高和验证数据准确性。您还可以使用 Enterprise Document OCR 来处理以下任务:

  • 文本数字化:从文档中提取文本和布局数据,以用于搜索、基于规则的文档处理流水线或自定义模型创建。
  • 使用大语言模型应用:利用 LLM 的上下文理解能力和 OCR 的文本及布局提取能力,自动生成问题和答案。从数据中挖掘数据洞见,并简化工作流程。
  • 归档:将纸质文档数字化为机器可读文本,以提高文档的可访问性。

为您的使用场景选择最佳 OCR

解决方案 产品 说明 用例
Document AI Enterprise Document OCR 专门针对文档使用场景的模型。高级功能包括图片质量得分、语言提示和旋转校正。 建议在从文档中提取文本时使用。用例包括 PDF、图片扫描文档或 Microsoft DocX 文件。
Document AI OCR 加购项 满足特定需求的付费功能。仅与 Enterprise Document OCR 版本 2.0 及更高版本兼容。 需要检测和识别数学公式、接收字体样式信息或启用复选框提取功能。
Cloud Vision API 文本检测 基于 Google Cloud 标准 OCR 模型构建的全球可用 REST API。默认配额为每分钟 1,800 次请求。 需要低延迟和高容量的常规文本提取使用场景。
Cloud Vision OCR Google Distributed Cloud(已弃用) Google Cloud Marketplace 应用,可作为容器部署到任何 GKE 集群(使用 GKE Enterprise)。 满足数据驻留或合规性要求。

检测和提取

Enterprise Document OCR 可以检测 PDF 和图片中的文本块、段落、行、字词和符号,还可以对文档进行倾斜校正,以提高准确性。

支持的布局检测和提取属性:

Printed text 手写 段落 屏蔽 Line 文字 符号级 页码
默认 默认 默认 默认 默认 默认 可配置 默认

可配置的 Enterprise Document OCR 功能包括:

  • 从数字 PDF 中提取嵌入式文本或原生文本:此功能可提取文本和符号,并确保其与源文档中的显示内容完全一致,即使是旋转的文本、极端的字体大小或样式以及部分隐藏的文本也能提取。

  • 旋转校正:使用 Enterprise Document OCR 对文档图片进行预处理,以校正可能会影响提取质量或处理的旋转问题。

  • 图片质量得分:接收有助于文档路由的质量指标。图片质量得分可提供八个方面的网页级质量指标,包括模糊度、是否存在比正常字体小的字体以及眩光。

  • 指定网页范围:指定输入文档中要进行 OCR 的网页范围。这样可以节省不必要网页的支出和处理时间。

  • 语言检测:检测提取的文本中使用的语言。

  • 语言和手写提示:根据数据集的已知特征,为 OCR 模型提供语言或手写提示,从而提高准确性。

如需了解如何启用 OCR 配置,请参阅启用 OCR 配置

OCR 加购项

Enterprise Document OCR 提供可选的分析功能,可根据需要在各个处理请求中启用。

以下附加功能适用于稳定版 pretrained-ocr-v2.0-2023-06-02pretrained-ocr-v2.1-2024-08-07 以及候选版本 pretrained-ocr-v2.1.1-2025-01-31

  • 数学 OCR:以 LaTeX 格式识别和提取文档中的公式。
  • 复选框提取:在 Enterprise Document OCR 响应中检测复选框并提取其状态(选中/未选中)。
  • 字体样式检测:识别字词级字体属性,包括字体类型、字体样式、手写体、粗细和颜色。

如需了解如何启用所列的插件,请参阅启用 OCR 插件

支持的文件格式

Enterprise Document OCR 支持 PDF、GIF、TIFF、JPEG、PNG、BMP 和 WebP 文件格式。如需了解详情,请参阅支持的文件

Enterprise Document OCR 还支持同步处理最多 15 页的 DocX 文件 ,以及异步处理最多 30 页的 DocX 文件。如需提出配额增加申请 (QIR),请按照申请配额调整中的步骤操作。DocX 支持目前为非公开预览版。如要申请访问权限,请与您的 Google 客户支持团队联系。

高级版本控制

高级版本控制目前为预览版。对底层 AI/机器学习 OCR 模型的升级可能会导致 OCR 行为发生变化。如果需要严格的一致性,请使用冻结的模型版本,将行为固定到旧版 OCR 模型,最长可固定 18 个月。这可确保获得相同的图片转文字功能结果。请参阅有关处理器版本的表格。

处理器版本

以下处理器版本与此功能兼容。如需了解详情,请参阅管理处理器版本

版本 ID 发布渠道 说明
pretrained-ocr-v1.2-2022-11-10 稳定 冻结模型版本 v1.0:在容器映像中冻结的版本快照的模型文件、配置和二进制文件,最长可冻结 18 个月。
pretrained-ocr-v2.0-2023-06-02 稳定 专门针对文档应用场景而打造的可用于生产环境用途的模型。包括对所有 OCR 插件的访问权限。
pretrained-ocr-v2.1-2024-08-07 稳定 v2.1 的主要改进方面包括:更好地识别印刷文字、更精确地检测复选框以及更准确的阅读顺序。
pretrained-ocr-v2.1.1-2025-01-31 候选版本 v2.1.1 与 v2.1 类似,可在所有地区使用,但以下地区除外:USEUasia-southeast1

使用 Enterprise Document OCR 处理文档

本快速入门为您介绍 Enterprise Document OCR。本文档将介绍如何通过启用或停用任何可用的 OCR 配置来优化工作流的文档 OCR 结果。

  1. 登录您的 Google Cloud 账号。如果您是 Google Cloud新手,请 创建一个账号来评估我们的产品在实际场景中的表现。新客户还可获享 $300 赠金,用于运行、测试和部署工作负载。
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. Enable the Document AI API.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  5. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  6. Verify that billing is enabled for your Google Cloud project.

  7. Enable the Document AI API.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

创建 Enterprise Document OCR 处理器

首先,创建 Enterprise Document OCR 处理器。如需了解详情,请参阅创建和管理处理器

OCR 配置

您可以在 ProcessDocumentRequestBatchProcessDocumentsRequest 中通过设置 ProcessOptions.ocrConfig 中的相应字段来启用所有 OCR 配置。

如需了解详情,请参阅发送处理请求

图片质量分析

智能文档质量分析使用机器学习技术,根据文档内容的可读性来评估文档质量。 此质量评估结果以质量得分 [0, 1] 的形式返回,其中 1 表示质量完美。 如果检测到的质量得分低于 0.5,系统还会返回负面质量原因列表(按可能性排序)。 如果似然大于 0.5,则视为检测到。

如果文档被视为有缺陷,API 会返回以下 8 种文档缺陷类型:

  • quality/defect_blurry
  • quality/defect_noisy
  • quality/defect_dark
  • quality/defect_faint
  • quality/defect_text_too_small
  • quality/defect_document_cutoff
  • quality/defect_text_cutoff
  • quality/defect_glare

当前文档质量分析存在一些限制:

  • 对于没有缺陷的数字文档,它可能会返回假正例检测结果。此功能最适合用于扫描或拍摄的文档。
  • 眩光缺陷是局部的。它们的存在可能不会影响文档的总体可读性。

输入

在处理请求中将 ProcessOptions.ocrConfig.enableImageQualityScores 设置为 true 即可启用该功能。 此附加功能会增加与流程调用中的 OCR 处理相当的延迟。

  {
    "rawDocument": {
      "mimeType": "MIME_TYPE",
      "content": "IMAGE_CONTENT"
    },
    "processOptions": {
      "ocrConfig": {
        "enableImageQualityScores": true
      }
    }
  }

输出

缺陷检测结果会显示在 Document.pages[].imageQualityScores[] 中。

  {
    "pages": [
      {
        "imageQualityScores": {
          "qualityScore": 0.7811847,
          "detectedDefects": [
            {
              "type": "quality/defect_document_cutoff",
              "confidence": 1.0
            },
            {
              "type": "quality/defect_glare",
              "confidence": 0.97849524
            },
            {
              "type": "quality/defect_text_cutoff",
              "confidence": 0.5
            }
          ]
        }
      }
    ]
  }

如需查看完整的输出示例,请参阅处理器输出示例

语言提示

OCR 处理器支持您定义的语言提示,以提高 OCR 引擎性能。应用语言提示后,OCR 可以针对所选语言(而非推断出的语言)进行优化。

输入

通过使用 BCP-47 语言代码列表设置 ProcessOptions.ocrConfig.hints[].languageHints[] 来启用。

  {
    "rawDocument": {
      "mimeType": "MIME_TYPE",
      "content": "IMAGE_CONTENT"
    },
    "processOptions": {
      "ocrConfig": {
        "hints": {
          "languageHints": ["en", "es"]
        }
      }
    }
  }

如需查看完整的输出示例,请参阅处理器输出示例

符号检测

在文档响应中填充符号(或单个字母)级数据。

输入

在处理请求中将 ProcessOptions.ocrConfig.enableSymbol 设置为 true 即可启用。

  {
    "rawDocument": {
      "mimeType": "MIME_TYPE",
      "content": "IMAGE_CONTENT"
    },
    "processOptions": {
      "ocrConfig": {
        "enableSymbol": true
      }
    }
  }

输出

如果此功能已启用,则会填充 Document.pages[].symbols[] 字段。

如需查看完整的输出示例,请参阅处理器输出示例

内置 PDF 解析

从数字 PDF 文件中提取嵌入的文本。启用后,如果有数字文本,系统会自动使用内置的数字 PDF 模型。如果存在非数字文本,系统会自动使用光学 OCR 模型。用户会收到合并在一起的两个文本结果。

输入

在处理请求中将 ProcessOptions.ocrConfig.enableNativePdfParsing 设置为 true 即可启用。

  {
    "rawDocument": {
      "mimeType": "MIME_TYPE",
      "content": "IMAGE_CONTENT"
    },
    "processOptions": {
      "ocrConfig": {
        "enableNativePdfParsing": true
      }
    }
  }

盒子中的字符检测

默认情况下,Enterprise Document OCR 会启用一个检测器,以提高方框内字符的文本提取质量。示例如下:

enterprise-document-ocr-1

如果您在识别方框内的字符时遇到 OCR 质量问题,可以停用此功能。

输入

在处理请求中将 ProcessOptions.ocrConfig.disableCharacterBoxesDetection 设置为 true 即可停用。

  {
    "rawDocument": {
      "mimeType": "MIME_TYPE",
      "content": "IMAGE_CONTENT"
    },
    "processOptions": {
      "ocrConfig": {
        "disableCharacterBoxesDetection": true
      }
    }
  }

旧版布局

如果您需要启发式布局检测算法,可以启用旧版布局,作为当前基于机器学习的布局检测算法的替代方案。这不是推荐的配置。客户可以根据自己的文档工作流程选择最合适的布局算法。

输入