Use o Datastream e o Dataflow para fazer stream de dados para o BigQuery

Nesta página, encontra práticas recomendadas para usar o Datastream e o Dataflow para fazer stream de dados para o BigQuery.

Divida os conjuntos de dados de réplicas em chaves definidas pelo utilizador

O conjunto de dados de preparação no BigQuery é particionado automaticamente. No entanto, por predefinição, o conjunto de dados da réplica não é particionado porque as chaves de partição nas tabelas da réplica têm de ser definidas com base na lógica empresarial específica, em vez de serem aplicadas pelo Datastream e Dataflow.

Para cada tabela no conjunto de dados da réplica que precisa de partição:

  1. Pare e esvazie a tarefa do Dataflow

  2. Use o editor de SQL no BigQuery para executar o seguinte script SQL para cada tabela no conjunto de dados da réplica. Para este exemplo, a tabela actor no conjunto de dados datastream_cdc tem uma coluna last_update que queremos definir como a nossa chave de partição. Ao executar o script, recria a tabela com a chave de partição correta.

    create table '[BigQuery_PROJECT_ID].datastream_cdc.actor_new' partition by date(last_update)
    as SELECT * FROM '[BigQuery_PROJECT_ID].datastream_cdc.actor'
    
    drop table