Importar metadatos mediante una canalización personalizada

En este documento se describe cómo importar metadatos de un sistema de terceros a Universal Catalog de Dataplex mediante los métodos de la API de importación de metadatos y tu propia canalización. Los metadatos de Dataplex Universal Catalog se componen de entradas y sus aspectos.

Si prefieres usar una canalización de orquestación gestionada por Google Cloudpara extraer e importar metadatos, te recomendamos que utilices una canalización de conectividad gestionada. Con una canalización de conectividad gestionada, puedes usar tu propio conector para extraer metadatos y generar resultados en un formato que se pueda usar como entrada en los métodos de la API de importación de metadatos (el archivo de importación de metadatos). Después, usa Workflows para orquestar las tareas de la canalización.

Puede ejecutar los siguientes tipos de trabajos de importación de metadatos:

  • Sincronización completa de las entradas con importación incremental de sus aspectos. Se admiten entradas personalizadas.
  • Importación incremental solo de aspectos. Se admite en aspectos que pertenecen a entradas personalizadas y entradas del sistema. En el caso de las entradas personalizadas, puedes modificar tanto los aspectos opcionales como los obligatorios. En el caso de las entradas del sistema, puedes modificar aspectos opcionales.

Pasos generales

Para importar metadatos mediante la API de importación de metadatos, sigue estos pasos generales:

  1. Determina el ámbito del trabajo.

    También debes saber cómo aplica Dataplex Universal Catalog la lógica de comparación y el modo de sincronización de las entradas y los aspectos.

  2. Crea uno o varios archivos de importación de metadatos que definan los datos que se van a importar.

  3. Guarda los archivos de importación de metadatos en un segmento de Cloud Storage.

  4. Ejecuta una tarea de importación de metadatos.

En los pasos de esta página se da por hecho que conoces los conceptos de metadatos de Dataplex Universal Catalog, como los grupos de entradas, los tipos de entradas y los tipos de aspectos. Para obtener más información, consulta el artículo Acerca de la gestión de metadatos en Dataplex Universal Catalog.

Antes de empezar

Antes de importar metadatos, completa las tareas de esta sección.

Roles obligatorios

Para asegurarte de que la cuenta de servicio de Universal Catalog de Dataplex tenga los permisos necesarios para acceder al bucket de Cloud Storage, pide a tu administrador que le asigne el rol de gestión de identidades y accesos de lector de objetos de almacenamiento (roles/storage.objectViewer) y el permiso storage.buckets.get en el bucket.

Para obtener los permisos que necesitas para gestionar los trabajos de importación de metadatos, pide a tu administrador que te conceda los siguientes roles de gestión de identidades y accesos:

Para obtener más información sobre cómo conceder roles, consulta el artículo Gestionar acceso a proyectos, carpetas y organizaciones.

También puedes conseguir los permisos necesarios a través de roles personalizados u otros roles predefinidos.

Crear Google Cloud recursos

Prepara los siguientes recursos: Google Cloud

  1. Crea grupos de entradas para las entradas que quieras importar.
  2. Crea tipos de aspectos para los aspectos que quieras importar.
  3. Crea tipos de entrada para las entradas que quieras importar.
  4. Si vas a ejecutar un trabajo de metadatos de solo aspectos, crea entradas para los aspectos que quieras importar.
  5. Crea un segmento de Cloud Storage para almacenar los archivos de importación de metadatos.

Componentes de una tarea de importación de metadatos

Cuando importe metadatos, tenga en cuenta los siguientes componentes de una tarea de metadatos:

  • Ámbito del trabajo: los grupos de entradas, los tipos de entradas y los tipos de aspectos que se incluirán en el trabajo.
  • Modo de sincronización: cómo se actualizan las entradas y los aspectos del trabajo.
  • Archivo de importación de metadatos: archivo que define los valores que se deben asignar a las entradas y los aspectos del trabajo. Puedes proporcionar varios archivos de importación de metadatos en el mismo trabajo de metadatos. Guardas los archivos en Cloud Storage.
  • Lógica de comparación: cómo determina Dataplex Universal Catalog qué entradas y aspectos se deben modificar.

Ámbito de trabajo

El ámbito del trabajo define los grupos de entradas, los tipos de entradas y los tipos de aspectos que quieres incluir en un trabajo de importación de metadatos. Cuando importa metadatos, modifica las entradas y los aspectos que pertenecen a los recursos del ámbito del trabajo.

Para definir el ámbito del trabajo, sigue estas directrices:

  • Grupos de entradas: especifica uno o varios grupos de entradas que se incluirán en el trabajo. El trabajo solo modifica las entradas y los aspectos que pertenecen a estos grupos de entradas. Los grupos de entradas y el trabajo deben estar en la misma región.

  • Tipos de entrada: especifica uno o varios tipos de entrada que se incluirán en el trabajo. El trabajo solo modifica las entradas y los aspectos que pertenecen a estos tipos de entrada. La ubicación de un tipo de entrada debe coincidir con la de la tarea o el tipo de entrada debe ser global.

  • Tipos de aspectos: especifica uno o varios tipos de aspectos que se incluirán en la tarea. El trabajo solo modifica los aspectos que pertenecen a estos tipos de aspectos. La ubicación de un tipo de aspecto debe coincidir con la de la tarea o el tipo de aspecto debe ser global.

El ámbito del trabajo debe incluir todos los tipos de entrada y de aspecto que especifique en el archivo de importación de metadatos.

El ámbito de la tarea se especifica al crear una tarea de metadatos.

Modo de sincronización

El modo de sincronización especifica cómo se actualizan las entradas y los aspectos de un trabajo de importación de metadatos. Proporciona un modo de sincronización para las entradas y los aspectos. En función de los recursos que quieras importar, se admiten las siguientes combinaciones de modos de sincronización.

Objetivo Modo de sincronización de entradas Modo de sincronización de la relación de aspecto Resultados
Importar entradas y sus aspectos FULL INCREMENTAL

Se modifican todas las entradas del ámbito del trabajo.

Si una entrada existe en Dataplex Universal Catalog, pero no se incluye en el archivo de importación de metadatos, se elimina cuando ejecutas el trabajo de metadatos.

Un aspecto solo se modifica si el archivo de importación de metadatos incluye una referencia al aspecto en el campo updateMask y en el campo aspectKeys. Consulta la estructura de un elemento de importación.

Importar solo aspectos NONE INCREMENTAL

Los aspectos se modifican si forman parte del ámbito del trabajo y si el archivo de importación de metadatos incluye una referencia a los aspectos en el campo aspectKeys. Consulta la estructura de un elemento de importación.

El resto de los metadatos que pertenecen a las entradas del ámbito de la tarea no se modifican.

El modo de sincronización se especifica al crear un trabajo de metadatos.

Archivo de importación de metadatos

El archivo de importación de metadatos es una colección de las entradas y los aspectos que quieres modificar. Define los valores que se deben asignar a todos los campos que pertenecen a estas entradas y aspectos. Prepara el archivo antes de ejecutar un trabajo de importación de metadatos.

Se aplican las siguientes directrices generales:

  • Puede proporcionar varios archivos de importación de metadatos en el mismo trabajo de metadatos.
  • Cuando ejecutas una tarea de metadatos de sincronización de entradas completa, las entradas que proporcionas en el archivo sustituyen por completo a todas las entradas de los recursos que se encuentren en el ámbito de la tarea. Esto significa que debes incluir valores para todas las entradas de un trabajo, no solo los valores que quieras añadir o actualizar. Para obtener una lista de las entradas actuales de tu proyecto y usarla como punto de partida, utiliza el método de la API entries.list.

  • Debes proporcionar un archivo de importación de metadatos como parte de una tarea de metadatos. Si quieres eliminar todos los datos de las entradas que están dentro del ámbito del trabajo, proporciona un archivo de importación de metadatos vacío.

  • Todas las entradas y los aspectos que incluyas en el archivo deben pertenecer a los grupos de entradas, los tipos de entradas y los tipos de aspectos que definas en el ámbito del trabajo.

Siga las directrices detalladas de las secciones siguientes para crear un archivo de importación de metadatos.

Estructura del archivo

Cada línea del archivo de importación de metadatos contiene un objeto JSON que corresponde a un elemento de importación. Un elemento de importación es un objeto que describe los valores que se van a modificar de una entrada y sus aspectos adjuntos.

Puedes proporcionar varios elementos de importación en un solo archivo de importación de metadatos. Sin embargo, no proporciones el mismo elemento de importación más de una vez en una tarea de metadatos. Usa un carácter de salto de línea (0x0a) para separar cada elemento de importación.

Un archivo de importación de metadatos con un carácter de salto de línea entre cada elemento de importación tiene el siguiente aspecto:

{ "entry": { "name": "entry 1", #Information about entry 1 }
{ "entry": { "name": "entry 2", #Information about entry 2 }

Estructura de un elemento de importación

Cada elemento de importación del archivo de importación de metadatos puede incluir los siguientes campos (consulta ImportItem). El siguiente ejemplo tiene saltos de línea para que sea más fácil de leer, pero cuando guardes el archivo, incluye un carácter de nueva línea solo después de cada elemento de importación. No incluya saltos de línea entre los campos de un mismo elemento de importación.

{
  "entry": {
    "name": "ENTRY_NAME",
    "entryType": "ENTRY_TYPE",
    "entrySource": {
      "resource": "RESOURCE",
      "system": "SYSTEM",
      "platform": "PLATFORM",
      "displayName": "DISPLAY_NAME",
      "description": "DESCRIPTION",
      "createTime": "ENTRY_CREATE_TIMESTAMP",
      "updateTime": "ENTRY_UPDATE_TIMESTAMP"
    },
    "aspects": {
      "ASPECT": {
        "data": {
          "KEY": "VALUE"
        },
        "aspectSource": {
          "createTime": "ASPECT_CREATE_TIMESTAMP",
          "updateTime": "ASPECT_UPDATE_TIMESTAMP"
        }
      },
      # Additional aspect maps
    },
    "parentEntry": "PARENT_ENTRY",
    "fullyQualifiedName": "FULLY_QUALIFIED_NAME"
  },
  "updateMask": "UPDATE_MASK_FIELDS",
  "aspectKeys": [
    "ASPECT_KEY",
    # Additional aspect keys
  ],
}

Haz los cambios siguientes:

  • entry: información sobre una entrada y sus aspectos adjuntos. En un trabajo de importación de metadatos de solo aspectos, Dataplex Universal Catalog ignora todos los campos opcionales de una entrada, excepto los mapas de aspectos.

    • ENTRY_NAME: nombre de recurso relativo de la entrada, con el formato projects/