Set data berlabel dokumen diperlukan untuk melatih, melatih ulang, atau mengevaluasi versi pemroses.
Halaman ini menjelaskan cara menerapkan label dari skema pemroses ke dokumen yang diimpor dalam set data Anda.
Halaman ini mengasumsikan bahwa Anda telah membuat pemroses yang mendukung pelatihan, pelatihan ulang, atau evaluasi. Jika prosesor Anda didukung, Anda akan melihat tab Train di konsol Google Cloud . Panduan ini juga mengasumsikan bahwa Anda telah membuat set data, mengimpor dokumen, dan menentukan skema prosesor.
Menamai kolom untuk ekstraksi AI generatif
Cara penamaan kolom memengaruhi akurasi ekstraksi kolom menggunakan AI generatif. Kami merekomendasikan praktik terbaik berikut saat memberi nama kolom:
Beri nama kolom dengan bahasa yang sama yang digunakan untuk mendeskripsikannya dalam dokumen: Misalnya, jika dokumen memiliki kolom yang dideskripsikan sebagai
Employer Address, maka beri nama kolom tersebutemployer_address. Jangan gunakan singkatan sepertiemplr_addr.Spasi saat ini tidak didukung dalam nama kolom: Daripada menggunakan spasi, gunakan
_. Misalnya:First Nameakan diberi namafirst_name.Melakukan iterasi pada nama untuk meningkatkan akurasi: Document AI memiliki batasan yang tidak mengizinkan perubahan nama kolom. Untuk menguji nama yang berbeda, gunakan alat mengganti nama entitas untuk memperbarui nama entitas lama dengan nama yang lebih baru dalam set data, impor set data, aktifkan entitas baru di pemroses, dan nonaktifkan atau hapus kolom yang ada.
Pemelajaran zero-shot dan few-shot
Model dengan Gemini memiliki pembelajaran zero-shot dan few-shot, yang dapat membuat model berperforma tinggi dengan sedikit atau tanpa data pelatihan.
Zero-shot learning adalah contoh machine learning di mana model terlatih tanpa pelatihan ulang apa pun belajar mengenali dan mengklasifikasikan kelas dan entity yang belum pernah ditemuinya sebelumnya selama pengujian.
Pembelajaran sedikit contoh (few-shot learning) adalah tempat model belajar mengenali dan mengklasifikasikan class dan entitas baru hanya dengan beberapa contoh pelatihan per class. Model ini memanfaatkan pengetahuan dari model terlatih pada set data besar yang diberi label dengan baik untuk meningkatkan performa pada tugas few-shot.
Pembelajaran sedikit contoh menjadi lebih efektif jika set data pelatihan rapi dan diberi label dengan cermat. Biasanya, ini berarti harus ada minimal 10 contoh pengujian dan 10 contoh pelatihan yang tersedia agar model dapat mempelajarinya.
Opsi pelabelan
Berikut adalah opsi Anda untuk memberi label pada dokumen:
Manual: memberi label pada dokumen Anda secara manual di konsol Google Cloud
Pemberian label otomatis: menggunakan versi pemroses yang ada untuk membuat label
Mengimpor dokumen yang telah diberi label sebelumnya: menghemat waktu jika Anda sudah memiliki dokumen yang diberi label
Memberi label secara manual di konsol Google Cloud
Di tab Train, pilih dokumen untuk membuka alat pelabelan.
Dari daftar label skema di sisi kiri alat pelabelan, pilih simbol 'Tambahkan' untuk memilih alat Kotak pembatas guna menandai entitas dalam dokumen dan menetapkannya ke label.
Pada screenshot berikut, kolom EMPL_SSN EMPLR_ID_NUMBER, EMPLR_NAME_ADDRESS,
FEDERAL_INCOME_TAX_WH, SS_TAX_WH, SS_WAGES, dan WAGES_TIPS_OTHER_COMP
dalam dokumen telah diberi label.

Saat Anda memilih entitas kotak centang dengan alat Kotak pembatas, pilih hanya kotak centang itu sendiri, dan bukan teks terkait. Pastikan bahwa entitas kotak centang yang ditampilkan di sebelah kiri dipilih atau tidak dipilih agar sesuai dengan yang ada di dokumen.

Saat memberi label pada entity induk-turunan, jangan beri label pada entity induk. Entitas induk hanyalah penampung entitas turunan. Hanya beri label pada entitas turunan. Entitas induk diperbarui secara otomatis.
Saat memberi label pada entity turunan, beri label pada entity turunan pertama, lalu kaitkan entity turunan terkait dengan garis tersebut. Anda akan melihatnya di entitas anak kedua saat pertama kali memberi label pada entitas tersebut. Misalnya, dengan invoice, jika Anda memberi label description, sepertinya entity lain. Namun, jika Anda melabeli jumlah berikutnya, Anda akan diminta untuk memilih induk.
Ulangi langkah ini untuk setiap item baris dengan memilih Entitas Induk Baru untuk setiap item baris baru.
Entitas induk-turunan didukung untuk tabel dengan hingga tiga lapisan bertingkat. Model dasar mendukung tiga tingkat kolom (kakek/nenek, orang tua, anak), sehingga entitas anak dapat memiliki satu tingkat turunan. Untuk mempelajari lebih lanjut penyusunan bertingkat, lihat Penyusunan bertingkat tiga tingkat.
Tabel cepat
Saat memberi label pada tabel, memberi label pada setiap baris berulang kali bisa menjemukan. Ada alat yang sangat praktis yang dapat mereplikasi struktur entity baris. Perhatikan bahwa fitur ini hanya berfungsi pada baris yang disusun secara horizontal.
- Pertama, beri label pada baris pertama seperti biasa.
Kemudian, arahkan kursor ke entity induk yang merepresentasikan baris. Pilih Tambahkan baris lainnya. Baris tersebut menjadi template untuk membuat lebih banyak baris.

Pilih area tabel lainnya.

Alat ini menebak anotasi, dan biasanya berhasil. Untuk tabel yang tidak dapat ditangani, beri anotasi secara manual.
Menggunakan pintasan keyboard di konsol
Untuk melihat pintasan keyboard yang tersedia, pilih menu di kanan atas konsol pelabelan. Daftar pintasan keyboard akan ditampilkan, seperti yang ditunjukkan dalam tabel berikut.
| Tindakan | Pintasan |
|---|---|
| Perbesar | Alt + = (Option + = di macOS) |
| Perkecil | Alt + - (Option + - di macOS) |
| Zoom agar sesuai | Alt + 0 (Option + 0 di macOS) |
| Scroll untuk memperbesar/memperkecil | Alt + Scroll (Option + Scroll di macOS) |
| Menggeser | Scroll |
| Geser terbalik | Shift + Scroll |
| Tarik untuk menggeser | Spasi + Tarik mouse |
| Urungkan | Ctrl + Z (Control + Z di macOS) |
| Ulangi | Ctrl + Shift + Z (Control + +Shift + Z di macOS) |
Label otomatis
Jika tersedia, Anda dapat menggunakan versi prosesor yang ada untuk mulai memberi label.
Pemberian label otomatis dapat dimulai selama impor. Semua dokumen diberi anotasi menggunakan versi pemroses yang ditentukan.

Pelabelan otomatis dapat dimulai setelah pengimporan untuk dokumen dalam kategori tidak berlabel atau berlabel otomatis. Semua dokumen yang dipilih diberi anotasi menggunakan versi pemroses yang ditentukan.

Anda tidak dapat melatih atau meningkatkan kualitas pelatihan pada dokumen berlabel otomatis, atau menggunakannya dalam set pengujian, tanpa menandainya sebagai berlabel. Tinjau dan koreksi secara manual anotasi yang diberi label otomatis, lalu pilih Tandai sebagai Berlabel untuk menyimpan koreksi. Kemudian, Anda dapat menetapkan dokumen sesuai kebutuhan.