您可以將 Enterprise Document OCR 納入 Document AI,偵測及擷取各種文件中的文字和版面配置資訊。透過可設定的功能,您可以根據特定文件處理需求調整系統。
總覽
您可以使用 Enterprise Document OCR 執行資料輸入等工作 (根據演算法或機器學習),以及提升和驗證資料準確度。您也可以使用 Enterprise Document OCR 處理下列工作:
- 數位化文字:從文件中擷取文字和版面配置資料,用於搜尋、以規則為基礎的文件處理管道,或建立自訂模型。
- 使用大型語言模型應用程式:運用 LLM 的情境理解能力和 OCR 的文字與版面配置擷取功能,自動生成問題和答案。從資料中取得洞察資訊,並簡化工作流程。
- 歸檔:將紙本文件數位化為機器可讀的文字,提升文件可存取性。
根據用途選擇最佳 OCR
| 解決方案 | 產品 | 說明 | 用途 |
|---|---|---|---|
| Document AI | Enterprise Document OCR | 專為文件用途開發的模型。進階功能包括圖片品質分數、語言提示和旋轉修正。 | 建議用於從文件中擷取文字。用途包括 PDF、掃描成圖片的文件或 Microsoft DocX 檔案。 |
| Document AI | OCR 附加元件 | 進階功能可滿足特定需求。僅適用於 Enterprise Document OCR 2.0 以上版本。 | 需要偵測及辨識數學公式、接收字型樣式資訊,或啟用核取方塊擷取功能。 |
| Cloud Vision API | 文字偵測 | 以 Google Cloud 標準 OCR 模型為基礎的全球可用 REST API。預設配額為每分鐘 1,800 項要求。 | 需要低延遲和高容量的一般文字擷取用途。 |
| Cloud Vision | OCR Google Distributed Cloud (已淘汰) | Google Cloud Marketplace 應用程式,可使用 GKE Enterprise 當做容器部署至任何 GKE 叢集。 | 符合資料落地或法規遵循要求。 |
偵測和擷取
Enterprise Document OCR 可偵測 PDF 和圖片中的區塊、段落、行、字詞和符號,並修正文件傾斜問題,提高準確度。
支援的版面配置偵測和擷取屬性:
| 印刷文字 | 手寫 | 段落 | 封鎖 | Line | 依單字 | 符號層級 | 頁碼 |
|---|---|---|---|---|---|---|---|
| 預設 | 預設 | 預設 | 預設 | 預設 | 預設 |