Pubblico
Lo scopo di questo tutorial è aiutarti a sviluppare applicazioni utilizzando il rilevamento del testo dei documenti dell'API Google Cloud Vision. Si presuppone che tu abbia familiarità con i costrutti e le tecniche di programmazione di base, ma anche se sei un programmatore principiante, dovresti essere in grado di seguire ed eseguire questo tutorial senza difficoltà, quindi utilizzare la documentazione di riferimento dell'API Vision per creare applicazioni di base.
Prerequisiti
- Configura un progetto dell'API Vision nella Google Cloud console.
Configura l'ambiente per l'utilizzo delle Credenziali predefinite dell'applicazione.
Python
- Installa Python.
- Installa pip.
- Installa la libreria client Google Cloud e la libreria Python Imaging.
Annotare un'immagine utilizzando l'OCR del testo del documento
Questo tutorial ti guida attraverso un'applicazione di base dell'API Cloud Vision che effettua una
DOCUMENT_TEXT_DETECTION richiesta, quindi elabora la fullTextAnnotation
risposta.
Un fullTextAnnotation è una risposta gerarchica strutturata per il testo UTF-8 estratto dall'immagine, organizzato come Pagine→Blocchi→Paragrafi→Parole→Simboli:
Pageè una raccolta di blocchi, oltre a metainformazioni sulla pagina: dimensioni, risoluzioni (la risoluzione X e la risoluzione Y possono essere diverse).Blockrappresenta un elemento "logico" della pagina, ad esempio un' area coperta da testo, un'immagine o un separatore tra le colonne. I blocchi di testo e tabella contengono le informazioni principali necessarie per estrarre il testo.Paragraphè un'unità strutturale di testo che rappresenta una sequenza ordinata di parole. Per impostazione predefinita, le parole sono considerate separate da interruzioni di parole.Wordè l'unità di testo più piccola. È rappresentata come un array di simboli.Symbolrappresenta un carattere o un segno di punteggiatura.
Il fullTextAnnotation può anche fornire URL a immagini web che corrispondono parzialmente o completamente all'immagine nella richiesta.
Elenco completo del codice
Durante la lettura del codice, ti consigliamo di fare riferimento al riferimento Python dell'API Vision.