Nesta página, encontra práticas recomendadas para usar o Datastream e o Dataflow para fazer stream de dados para o BigQuery.
Divida os conjuntos de dados de réplicas em chaves definidas pelo utilizador
O conjunto de dados de preparação no BigQuery é particionado automaticamente. No entanto, por predefinição, o conjunto de dados da réplica não é particionado porque as chaves de partição nas tabelas da réplica têm de ser definidas com base na lógica empresarial específica, em vez de serem aplicadas pelo Datastream e Dataflow.
Para cada tabela no conjunto de dados da réplica que precisa de partição:
Use o editor de SQL no BigQuery para executar o seguinte script SQL para cada tabela no conjunto de dados da réplica. Para este exemplo, a tabela
actorno conjunto de dadosdatastream_cdctem uma colunalast_updateque queremos definir como a nossa chave de partição. Ao executar o script, recria a tabela com a chave de partição correta.create table '[BigQuery_PROJECT_ID].datastream_cdc.actor_new'
partition by date(last_update) as SELECT * FROM '[BigQuery_PROJECT_ID].datastream_cdc.actor' drop table