התנהגות של כלי לפיצול מסמכים

הפלט של מעבד הפיצול מכיל מידע על הפיצול של מסמך הקלט, כולל ציון רמת הביטחון. הפלט של Document AI API הוא אובייקט JSON ‏Document, ובפורמט הפלט נעשה שימוש בשדה entities כדי לייצג פיצולים של מסמכים. מידע נוסף תלוי בסוג הספציפי של מפצל.

  • Entity.type מציין את סיווג המסמך. רשימה מלאה של סוגי המסמכים שאפשר לזהות מופיעה כאן.

  • Entity.pageAnchor.pageRefs[] מציין את הדפים שמכילים כל מסמך משנה. שימו לב שהערך pageRefs[].page מבוסס על אפס והוא האינדקס בשדה document.pages[].

גרסאות של מפצל המסמכים שמשתמשות ב-AI גנרטיבי לא מיועדות לפיצול מסמכים לוגיים שאורכם יותר מ-500 עמודים. אתם יכולים לפצל באופן ידני מסמכים לוגיים שאורכם יותר מ-500 עמודים לשני מסמכים או יותר, ולהפעיל את הכלי לפיצול לכל אחד מהם בנפרד כדי לסווג אותם.

התוכנות לפיצול מזהות את הגבולות של הדפים, אבל לא מפצלות את מסמך הקלט בפועל. ערכת ה-SDK של Document AI Toolbox מספקת פונקציות שירות שיכולות לפצל את מסמך הקלט על סמך הפלט של מעבד פיצול.

סוגי המסמכים שזוהו

[1] מנתח התוכן המתאים לטופס הזה לא תומך בסוג המסמך הזה. המשמעות היא שהכלי לפיצול מסמכים יכול לזהות ולסווג מסמכים מהסוג הזה, אבל Document AI לא מספק כלי לניתוח מסמכים כדי לחלץ מידע.

דוגמאות לפלט

מעבדים דוגמאות לפלט

דוגמאות קוד

הכלי לפיצול מזהה את הגבולות בין הדפים, אבל הוא לא מפצל את מסמך הקלט בפועל. אתם יכולים להשתמש בארגז הכלים של Document AI כדי לפצל פיזית קובץ PDF באמצעות גבולות הדפים. בדוגמאות הקוד הבאות מודפסים טווחי הדפים בלי לפצל את קובץ ה-PDF:

Java

למידע נוסף, קראו את מאמרי העזרה של Document AI Java API.

כדי לבצע אימות ב-Document AI, צריך להגדיר את Application Default Credentials. מידע נוסף זמין במאמר הגדרת אימות לסביבת פיתוח מקומית.


import com.google.cloud.documentai.v1beta3.Document;
import com.google.cloud.documentai.v1beta3.DocumentProcessorServiceClient;
import com.google.cloud.documentai.v1beta3.DocumentProcessorServiceSettings;
import com.google.cloud.documentai.v1beta3.ProcessRequest;
import com.google.cloud.documentai.v1beta3.ProcessResponse;
import com.google.cloud.documentai.v1beta3.RawDocument;
import com.google.protobuf.ByteString;
import java.io.IOException;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.util.List;
import java.util.concurrent.ExecutionException;
import java.util.concurrent.TimeoutException;

public class ProcessSplitterDocument {
  public static void processSplitterDocument()
      throws IOException, InterruptedException, ExecutionException, TimeoutException {
    // TODO(developer): Replace these variables before running the sample.
    String projectId = "your-project-id";
    String location = "your-project-location"; // Format is "us" or "eu".
    String processerId = "your-processor-id";
    String filePath = "path/to/input/file.pdf";
    processSplitterDocument(projectId, location, processerId, filePath);
  }

  public static void processSplitterDocument(
      String projectId, String