Enterprise Document OCR

您可以將 Enterprise Document OCR 納入 Document AI,偵測及擷取各種文件中的文字和版面配置資訊。透過可設定的功能,您可以根據特定文件處理需求調整系統。

總覽

您可以使用 Enterprise Document OCR 執行資料輸入等工作 (根據演算法或機器學習),以及提升和驗證資料準確度。您也可以使用 Enterprise Document OCR 處理下列工作:

  • 數位化文字:從文件中擷取文字和版面配置資料,用於搜尋、以規則為基礎的文件處理管道,或建立自訂模型。
  • 使用大型語言模型應用程式:運用 LLM 的情境理解能力和 OCR 的文字與版面配置擷取功能,自動生成問題和答案。從資料中取得洞察資訊,並簡化工作流程。
  • 歸檔:將紙本文件數位化為機器可讀的文字,提升文件可存取性。

根據用途選擇最佳 OCR

解決方案 產品 說明 用途
Document AI Enterprise Document OCR 專為文件用途開發的模型。進階功能包括圖片品質分數、語言提示和旋轉修正。 建議用於從文件中擷取文字。用途包括 PDF、掃描成圖片的文件或 Microsoft DocX 檔案。
Document AI OCR 附加元件 進階功能可滿足特定需求。僅適用於 Enterprise Document OCR 2.0 以上版本。 需要偵測及辨識數學公式、接收字型樣式資訊,或啟用核取方塊擷取功能。
Cloud Vision API 文字偵測 以 Google Cloud 標準 OCR 模型為基礎的全球可用 REST API。預設配額為每分鐘 1,800 項要求。 需要低延遲和高容量的一般文字擷取用途。
Cloud Vision OCR Google Distributed Cloud (已淘汰) Google Cloud Marketplace 應用程式,可使用 GKE Enterprise 當做容器部署至任何 GKE 叢集。 符合資料落地或法規遵循要求。

偵測和擷取

Enterprise Document OCR 可偵測 PDF 和圖片中的區塊、段落、行、字詞和符號,並修正文件傾斜問題,提高準確度。

支援的版面配置偵測和擷取屬性:

印刷文字 手寫 段落 封鎖 Line 依單字 符號層級 頁碼
預設 預設 預設 預設 預設 預設