אתם יכולים להשתמש ב-Enterprise Document OCR כחלק מ-Document AI כדי לזהות ולחלץ טקסט ומידע על פריסה ממסמכים שונים. בעזרת תכונות שניתנות להגדרה, אפשר להתאים את המערכת לדרישות ספציפיות של עיבוד מסמכים.
סקירה כללית
אתם יכולים להשתמש ב-Enterprise Document OCR למשימות כמו הזנת נתונים שמבוססת על אלגוריתמים או על למידת מכונה, ולשיפור ולאימות של דיוק הנתונים. אתם יכולים גם להשתמש ב-Enterprise Document OCR כדי לבצע משימות כמו:
- הפיכת טקסט לדיגיטלי: חילוץ טקסט ונתוני פריסה ממסמכים לחיפוש, לצינורות לעיבוד מסמכים שמבוססים על כללים או ליצירת מודלים בהתאמה אישית.
- שימוש באפליקציות של מודלים גדולים של שפה: אפשר להשתמש בהבנה ההקשרית של LLM וביכולות החילוץ של טקסט ופריסה של OCR כדי להפוך שאלות ותשובות לאוטומטיות. לקבל תובנות מהנתונים ולייעל את תהליכי העבודה.
- ארכיון: המרת מסמכים מנייר לטקסט שניתן לקריאה על ידי מכונה כדי לשפר את הנגישות למסמכים.
בחירת ה-OCR המתאים ביותר לתרחיש השימוש
| הפתרון | Product | תיאור | תרחיש לדוגמה |
|---|---|---|---|
| Document AI | Enterprise Document OCR | מודל ייעודי לתרחישי שימוש במסמכים. התכונות המתקדמות כוללות ציון איכות התמונה, רמזים לגבי השפה ותיקון הסיבוב. | מומלץ כשמחפשים טקסט במסמכים. תרחישי שימוש לדוגמה כוללים קובצי PDF, מסמכים סרוקים כתמונות או קובצי Microsoft DocX. |
| Document AI | תוספים ל-OCR | תכונות פרימיום לצרכים ספציפיים. התכונה הזו תואמת רק לגרסה 2.0 ואילך של Enterprise Document OCR. | צריך לזהות נוסחאות מתמטיות, לקבל מידע על סגנון הגופן או להפעיל חילוץ של תיבות סימון. |
| Cloud Vision API | זיהוי טקסט | API בארכיטקטורת REST שזמין בכל העולם ומבוסס על Google Cloud מודל OCR רגיל. מכסת ברירת המחדל היא 1,800 בקשות לדקה. | תרחישי שימוש כלליים בחילוץ טקסט שדורשים חביון נמוך וקיבולת גבוהה. |
| Cloud Vision | OCR Google Distributed Cloud (הוצא משימוש) | אפליקציה של Google Cloud Marketplace שאפשר לפרוס כקונטיינר לכל אשכול GKE באמצעות GKE Enterprise. | כדי לעמוד בדרישות של מיקום אחסון הנתונים או בדרישות התאימות. |
זיהוי וחילוץ
Enterprise Document OCR יכול לזהות בלוקים, פסקאות, שורות, מילים וסמלים בקובצי PDF ובתמונות, וגם ליישר מסמכים כדי לשפר את הדיוק.
מאפיינים נתמכים לזיהוי פריסה ולחילוץ:
| טקסט מודפס | כתב יד | פסקה | חסימה | Line | מילה | ברמת הסמל | מספר הדף |
|---|---|---|---|---|---|---|---|
| ברירת מחדל | ברירת מחדל | ברירת מחדל | ברירת מחדל | ברירת מחדל | ברירת מחדל | ניתן להגדרה | ברירת מחדל |
התכונות של Enterprise Document OCR שאפשר להגדיר כוללות:
חילוץ טקסט מוטמע או טקסט חי מקובצי PDF דיגיטליים: התכונה הזו מחלצת טקסט וסמלים בדיוק כמו שהם מופיעים במסמכי המקור, גם אם מדובר בטקסט מסובב, בגדלים או בסגנונות קיצוניים של גופנים ובטקסט מוסתר חלקי.
תיקון סיבוב: אפשר להשתמש ב-Enterprise Document OCR כדי לבצע עיבוד מקדים של תמונות מסמכים ולתקן בעיות סיבוב שעלולות להשפיע על איכות החילוץ או העיבוד.
ציון איכות התמונה: מקבלים מדדי איכות שיכולים לעזור בניתוח מסמכים. ציון איכות התמונה מספק מדדי איכות ברמת הדף בשמונה מימדים, כולל טשטוש, נוכחות של גופנים קטנים מהרגיל ובוהק.
ציון טווח דפים: מציינים את טווח הדפים במסמך קלט ל-OCR. כך תוכלו לחסוך בהוצאות ובזמן העיבוד של דפים לא נחוצים.
זיהוי שפה: זיהוי השפות שבהן כתוב הטקסט שחולץ.
רמזים לגבי שפה וכתב יד: כדי לשפר את הדיוק, אפשר לספק למודל ה-OCR רמז לגבי שפה או כתב יד על סמך המאפיינים הידועים של מערך הנתונים.
כדי ללמוד איך להפעיל הגדרות OCR, אפשר לעיין במאמר הפעלת הגדרות OCR.
תוספים ל-OCR
Enterprise Document OCR מציע יכולות ניתוח אופציונליות שאפשר להפעיל לפי הצורך בבקשות עיבוד ספציפיות.
היכולות הבאות של התוסף זמינות בגרסאות היציבות pretrained-ocr-v2.0-2023-06-02 ו-pretrained-ocr-v2.1-2024-08-07, ובגרסת Release Candidate pretrained-ocr-v2.1.1-2025-01-31.
- OCR מתמטי: זיהוי וחילוץ של נוסחאות ממסמכים בפורמט LaTeX.
- חילוץ תיבות סימון: זיהוי תיבות סימון וחילוץ הסטטוס שלהן (מסומנות או לא מסומנות) בתגובה של Enterprise Document OCR.
- זיהוי סגנון גופן: זיהוי מאפייני גופן ברמת המילה, כולל סוג הגופן, סגנון הגופן, כתב יד, עובי וצבע.
במאמר הפעלה של תוספי OCR מוסבר איך להפעיל את התוספים שמופיעים ברשימה.
פורמטים נתמכים של קבצים
Enterprise Document OCR תומך בפורמטים של קבצים: PDF, GIF, TIFF, JPEG, PNG, BMP ו-WebP. מידע נוסף זמין במאמר בנושא קבצים נתמכים.
Enterprise Document OCR תומך גם בקובצי DocX של עד 15 עמודים בסנכרון ו-30 עמודים באסינכרון. כדי לבקש הגדלה של המכסה (QIR), פועלים לפי השלבים לבקשת שינוי במכסה. התמיכה ב-DocX נמצאת בתצוגה מקדימה פרטית. כדי לבקש גישה, צריך לפנות לצוות התמיכה בחשבונות Google.
ניהול גרסאות מתקדם
התכונה 'ניהול גרסאות מתקדם' נמצאת בגרסת טרום-השקה (Preview). שדרוגים של מודלים בסיסיים של AI/ML OCR עשויים להוביל לשינויים בהתנהגות של OCR. אם נדרשת עקביות מלאה, אפשר להשתמש בגרסה קפואה של המודל כדי להצמיד את ההתנהגות למודל OCR מדור קודם למשך עד 18 חודשים. כך תוכלו לוודא שתוצאת הפונקציה OCR תתבסס על אותה תמונה. ראו את הטבלה בנושא גרסאות המעבד.
גרסאות המעבד
התכונה הזו תואמת לגרסאות המעבד הבאות. מידע נוסף מופיע במאמר בנושא ניהול גרסאות של מעבדים.
| מזהה גרסה | ערוץ הפצה | תיאור |
|---|---|---|
pretrained-ocr-v1.2-2022-11-10 |
יציב | גרסה קפואה של מודל v1.0: קבצים, הגדרות וקובצי הפעלה של מודל בגרסת snapshot קפואה בקובץ אימג' של קונטיינר למשך עד 18 חודשים. |
pretrained-ocr-v2.0-2023-06-02 |
יציב | מודל מוכן לייצור שמתמחה בתרחישי שימוש במסמכים. כולל גישה לכל תוספי ה-OCR. |
pretrained-ocr-v2.1-2024-08-07 |
יציב | השיפורים העיקריים בגרסה 2.1 הם: זיהוי טוב יותר של טקסט מודפס, זיהוי מדויק יותר של תיבות סימון וסדר קריאה מדויק יותר. |
pretrained-ocr-v2.1.1-2025-01-31 |
גרסה מועמדת להפצה | גרסה v2.1.1 דומה לגרסה V2.1, והיא זמינה בכל האזורים חוץ מאלה: US, EU ו-asia-southeast1. |
שימוש ב-Enterprise Document OCR לעיבוד מסמכים
במדריך למתחילים הזה נסביר על Enterprise Document OCR. במאמר הזה מוסבר איך לשפר את תוצאות ה-OCR של המסמכים בתהליך העבודה שלכם, על ידי הפעלה או השבתה של אחת מהגדרות ה-OCR הזמינות.
- נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
יצירת מעבד Enterprise Document OCR
קודם יוצרים מעבד Enterprise Document OCR. מידע נוסף זמין במאמר בנושא יצירה וניהול של מעבדים.
הגדרות OCR
כדי להפעיל את כל הגדרות ה-OCR, צריך להגדיר את השדות המתאימים ב-ProcessOptions.ocrConfig ב-ProcessDocumentRequest או ב-BatchProcessDocumentsRequest.
מידע נוסף זמין במאמר בנושא שליחת בקשת עיבוד.
ניתוח איכות התמונה
ניתוח איכות מסמכים חכם משתמש בלמידת מכונה כדי לבצע הערכת איכות של מסמך על סמך קלות הקריאה של התוכן שלו.
הערכת האיכות הזו מוחזרת כציון איכות [0, 1], כאשר 1 מציין איכות מושלמת.
אם ציון האיכות שזוהה נמוך מ-0.5, מוחזרת גם רשימה של סיבות שליליות לאיכות (ממוינות לפי הסבירות).
סבירות גבוהה מ-0.5 נחשבת לזיהוי חיובי.
אם המסמך נחשב לפגום, ה-API מחזיר את שמונת סוגי הפגמים הבאים במסמך:
quality/defect_blurryquality/defect_noisyquality/defect_darkquality/defect_faintquality/defect_text_too_smallquality/defect_document_cutoffquality/defect_text_cutoffquality/defect_glare
יש כמה מגבלות בניתוח הנוכחי של איכות המסמך:
- הוא יכול להחזיר תוצאות חיוביות כוזבות לגבי מסמכים דיגיטליים ללא פגמים. התכונה הזו מתאימה במיוחד למסמכים שנסרקו או צולמו.
פגמים של בוהק הם מקומיים. הנוכחות שלהם לא בהכרח תפגע בקריאות הכוללת של המסמך.
קלט
כדי להפעיל את התכונה, צריך להגדיר את ProcessOptions.ocrConfig.enableImageQualityScores לערך true בבקשת העיבוד.
התכונה הנוספת הזו מוסיפה לשיחה זמן אחזור שדומה לזמן האחזור של עיבוד OCR.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"enableImageQualityScores": true
}
}
}
תשובה
תוצאות זיהוי הפגמים מופיעות ב-Document.pages[].imageQualityScores[].
{
"pages": [
{
"imageQualityScores": {
"qualityScore": 0.7811847,
"detectedDefects": [
{
"type": "quality/defect_document_cutoff",
"confidence": 1.0
},
{
"type": "quality/defect_glare",
"confidence": 0.97849524
},
{
"type": "quality/defect_text_cutoff",
"confidence": 0.5
}
]
}
}
]
}
דוגמאות מלאות של פלט זמינות במאמר פלט לדוגמה של מעבד.
רמזים לגבי שפה
מעבד ה-OCR תומך ברמזים לשפה שאתם מגדירים כדי לשפר את הביצועים של מנוע ה-OCR. הוספת רמז לשפה מאפשרת ל-OCR לבצע אופטימיזציה לשפה שנבחרה במקום לשפה שהמערכת הסיקה.
קלט
כדי להפעיל את ההגדרה, צריך להגדיר את ProcessOptions.ocrConfig.hints[].languageHints[] עם רשימה של קודי שפה בתקן BCP-47.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"hints": {