L'indicizzazione avanzata dei siti web comporta addebiti mensili per l'archiviazione dei dati in base alle dimensioni dei dati web che importi nel datastore. Per ottenere una stima delle dimensioni dei dati web prima di importarli, puoi
chiamare il estimateDataSize metodo e specificare le pagine
web che vuoi importare. Il metodo estimateDataSize è un'operazione a lunga esecuzione che viene eseguita finché non viene completato il processo di stima
delle dimensioni dei dati. A seconda del numero di pagine web specificate, l'operazione può richiedere da pochi minuti a più di un'ora. Dopo aver ottenuto una stima delle dimensioni dei dati web, puoi ottenere una stima dei costi mensili di archiviazione dei dati utilizzando la paginadei prezzi di Agent Search.
Prima di iniziare
Determina i pattern URL per i siti web che intendi includere (e facoltativamente escludere) quando importi i dati web nel datastore. Specifichi questi pattern URL quando chiami il metodo estimateDataSize.
Procedura
Per ottenere una stima delle dimensioni dei dati web:
Chiama il
estimateDataSizemetodo.curl -X POST \ -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \ -H "Content-Type: application/json" \ "https://discoveryengine.googleapis.com/v1alpha/projects/PROJECT_ID/locations/global:estimateDataSize" \ -d '{ "website_data_source": { "estimator_uri_patterns": [ { "provided_uri_pattern": "URI_PATTERN_TO_INCLUDE", "exact_match": EXACT_MATCH_BOOLEAN_1 }, { "provided_uri_pattern": "URI_PATTERN_TO_EXCLUDE", "exact_match": EXACT_MATCH_BOOLEAN_2, "exclusive": EXCLUSIVE_BOOLEAN } ] } }'Sostituisci quanto segue:
PROJECT_ID: l'ID progetto.URI_PATTERN_TO_INCLUDE: i pattern URL per i siti web che vuoi includere nella stima delle dimensioni dei dati.URI_PATTERN_TO_EXCLUDE: (facoltativo) i pattern URL per i siti web che vuoi escludere dalla stima delle dimensioni dei dati.Per
URI_PATTERN_TO_INCLUDEeURI_PATTERN_TO_EXCLUDE, puoi utilizzare pattern simili ai seguenti:- Sito web completo:
www.mysite.com - Parti di un sito web:
www.mysite.com/faq - Dominio completo:
mysite.como*.mysite.com
- Sito web completo:
EXCLUSIVE_BOOLEAN: (facoltativo) setrue, il pattern URI fornito rappresenta le pagine web escluse dalla stima delle dimensioni dei dati. Il valore predefinito èfalse, il che significa che il pattern URI fornito rappresenta le pagine web incluse nella stima delle dimensioni dei dati.EXACT_MATCH_BOOLEAN: (facoltativo) setrue, il pattern URI fornito rappresenta una singola pagina web, anziché la pagina web e tutti i relativi elementi secondari. Il valore predefinito èfalse, il che significa che il pattern URI fornito rappresenta la pagina web e tutti i relativi elementi secondari.
L'output include il campo
name, che è il nome dell'operazione a lunga esecuzione. Salva il valorenameda utilizzare nel passaggio successivo.Fai clic per visualizzare un esempio di comando curl e risposta.
curl -X POST \ -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \ -H "Content-Type: application/json" \ "https://discoveryengine.googleapis.com/v1alpha/projects/my-project-123/locations/global:estimateDataSize" \ -d '{ "website_data_source": { "estimator_uri_patterns": [ { "provided_uri_pattern": "docs.cloud.google.com/generative-ai-app-builder", "exact_match": false }, { "provided_uri_pattern": "docs.cloud.google.com/generative-ai-app-builder/apis", "exact_match": false, "exclusive": true } ] } }' { "name": "projects/my-project-123/locations/global/operations/estimate-data-size-4312594881427311412", "metadata": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.EstimateDataSizeMetadata" } }
Esegui il polling del
operations.getmetodo.curl -X GET \ -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \ "https://discoveryengine.googleapis.com/v1/OPERATION_NAME"Sostituisci
OPERATION_NAMEcon il valorenameche hai salvato nel passaggio precedente. Puoi anche ottenere il nome dell'operazione elencando le operazioni a lunga esecuzione.Valuta ogni risposta.
Se una risposta non contiene
"done": true, il processo per la stima delle dimensioni dei dati non è stato completato. Continua a eseguire il polling.L'output è simile al seguente:
{ "name": "projects/PROJECT_ID/locations/global/operations/estimate-data-size-4312594881427311412", "metadata": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.EstimateDataSizeMetadata", "createTime": "2026-07-14T18:40:39.365840Z" } }Se una risposta contiene
"done": true, il processo per la stima delle dimensioni dei dati è stato completato. Salva il valoreDATA_SIZE_BYTESdella risposta da utilizzare nel passaggio successivo.L'output è simile al seguente:
{ "name": "projects/PROJECT_ID/locations/global/operations/estimate-data-size-4312594881427311412", "metadata": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.EstimateDataSizeMetadata", "createTime": "2026-07-14T18:40:39.365840Z" }, "done": true, "response": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.EstimateDataSizeResponse", "dataSizeBytes": DATA_SIZE_BYTES, "documentCount": DOCUMENT_COUNT } }Questo output include i seguenti valori:
DATA_SIZE_BYTES: le dimensioni stimate dei dati web, in byte.DOCUMENT_COUNT: il numero stimato di pagine web nei dati web.
Dividi il valore
DATA_SIZE_BYTESdel passaggio precedente per 1.000.000.000 per ottenere i gigabyte. Salva questo valore per il passaggio successivo.Per ottenere una stima dei costi mensili di archiviazione dei dati:
Fai clic su Aggiungi alla stima.
Cerca
Agent Searche poi fai clic sulla casella Agent Search.Nella casella Indice dati, inserisci le dimensioni stimate dei dati web, in gigabyte, dal passaggio precedente.
Nella casella Costo stimato è indicato il costo stimato dell'archiviazione dei dati.