Profiler des données BigQuery dans une organisation ou un dossier

Cette page explique comment configurer la découverte de données BigQuery au niveau d'une organisation ou d'un dossier. Le résultat de cette tâche est une configuration de découverte au niveau de l'organisation qui, si elle est active, indique à Sensitive Data Protection de profiler vos données selon un calendrier défini.

Pour profiler des données au niveau du projet, consultez Profiler des données BigQuery dans un seul projet.

Pour en savoir plus sur le service de découverte, consultez Profils de données.

Pour commencer à profiler des données, vous devez créer une configuration d'analyse de découverte.

Avant de commencer

  1. Confirmez que vous disposez des autorisations IAM requises pour configurer des profils de données au niveau de l'organisation.

    Si vous ne disposez pas du rôle Administrateur de l'organisation (roles/resourcemanager.organizationAdmin) ni du rôle Administrateur de sécurité (roles/iam.securityAdmin), vous pouvez quand même créer une configuration d'analyse. Toutefois, une fois la configuration d'analyse créée, une personne disposant de l'un de ces rôles doit accorder l'accès au profilage des données à votre agent de service.

  2. Vous devez disposer d'un modèle d'inspection dans chaque région où vous avez des données à profiler. Si vous souhaitez utiliser un seul modèle pour plusieurs régions, vous pouvez utiliser un modèle stocké dans la région global. Si des règles d'administration vous empêchent de créer un modèle d'inspection dans la région global, vous devez définir un modèle d'inspection dédié pour chaque région. Pour en savoir plus, consultez Considérations relatives à la résidence des données.

    Cette tâche vous permet de créer un modèle d'inspection uniquement dans la région global. Si vous avez besoin de modèles d'inspection dédiés pour une ou plusieurs régions, vous devez créer ces modèles avant d'effectuer cette tâche.

  3. Pour envoyer des notifications Pub/Sub à un sujet lorsque certains événements se produisent (par exemple, lorsqu'un profil de protection des données sensibles est appliqué à une nouvelle table), créez un sujet Pub/Sub avant d'effectuer cette tâche.

  4. Vous pouvez configurer Sensitive Data Protection pour qu'il associe automatiquement des tags à vos ressources. Cette fonctionnalité vous permet d'accorder l'accès à ces ressources de manière conditionnelle en fonction de leur niveau de sensibilité calculé. Si vous souhaitez utiliser cette fonctionnalité, vous devez d'abord effectuer les tâches décrites dans Contrôler l'accès IAM aux ressources en fonction de la sensibilité des données.

Pour générer des profils de données, vous avez besoin d'un conteneur d'agent de service et d'un agent de service à l'intérieur. Cette tâche vous permet de les créer automatiquement.

Créer une configuration d'analyse

  1. Accédez à la page Créer une configuration d'analyse.

    Accéder à la page "Créer une configuration d'analyse"

  2. Accédez à votre organisation. Dans la barre d'outils, cliquez sur le sélecteur de projet, puis sélectionnez votre organisation.

Les sections suivantes fournissent plus d'informations sur les étapes de la page Créer une configuration d'analyse. À la fin de chaque section, cliquez sur Continuer.

Sélectionner un type de détection

Sélectionnez BigQuery.

Sélectionner un niveau d'accès

Effectuez l'une des opérations suivantes :

  • Pour configurer le profilage au niveau de l'organisation, sélectionnez Analyser toute l'organisation.
  • Pour configurer le profilage au niveau d'un dossier, sélectionnez Analyser le dossier sélectionné. Cliquez sur Parcourir, puis sélectionnez le dossier.

Gérer les planifications

Si la fréquence de profilage par défaut répond à vos besoins, vous pouvez ignorer cette section de la page Créer une configuration d'analyse.

Configurez cette section pour les raisons suivantes :

  • Pour ajuster précisément la fréquence de profilage de toutes vos données ou de certains sous-ensembles de données.
  • Pour spécifier les tables que vous ne souhaitez pas profiler.
  • Pour spécifier les tables que vous ne souhaitez pas profiler plusieurs fois.

Pour ajuster précisément la fréquence de profilage, procédez comme suit :

  1. Cliquez sur Ajouter une programmation.
  2. Dans la section Filtres, vous définissez un ou plusieurs filtres qui spécifient les tables incluses dans le champ d'application du programme. Une table est considérée comme faisant partie du champ d'application de la programmation si elle correspond à au moins l'un des filtres définis.

    Pour configurer un filtre, spécifiez au moins l'un des éléments suivants :

    • ID de projet ou expression régulière spécifiant un ou plusieurs projets
    • ID d'un ensemble de données ou expression régulière spécifiant un ou plusieurs ensembles de données
    • ID de table ou expression régulière spécifiant une ou plusieurs tables

    Les expressions régulières doivent suivre la syntaxe RE2.

    Par exemple, si vous souhaitez inclure toutes les tables d'un projet dans le filtre, spécifiez l'ID de ce projet et laissez les deux autres champs vides.

    Pour correspondre à un filtre, une table doit répondre à toutes les expressions régulières spécifiées dans ce filtre.

    Pour ajouter d'autres filtres, cliquez sur Ajouter un filtre et répétez cette étape.

  3. Cliquez sur Fréquence.

  4. Dans la section Fréquence, indiquez si Sensitive Data Protection doit profiler les tables que vous avez définies dans vos filtres et, le cas échéant, à quelle fréquence :

    • Si vous ne souhaitez jamais que les tables soient profilées, désactivez l'option Profiler les tables.

    • Si vous souhaitez que les tables soient profilées au moins une fois, laissez l'option Profiler les tables activée.

      Dans les champs suivants de cette section, vous indiquez si le système doit reprofiler vos données et quels événements doivent déclencher une opération de reprofilage. Pour en savoir plus, consultez Fréquence de génération des profils de données.

      1. Pour En cas de modification du schéma, spécifiez la fréquence à laquelle Sensitive Data Protection doit vérifier si les schémas des tables sélectionnées ont été modifiés depuis leur dernier profilage. Seules les tables dont le schéma a été modifié seront reprofilées.
      2. Pour Types de modifications du schéma, spécifiez les types de modifications du schéma qui doivent déclencher une opération de re-profilage. Sélectionnez l'une des options suivantes :
        • Nouvelles colonnes : reprofilez les tables qui ont gagné de nouvelles colonnes.
        • Colonnes supprimées : reprofilez les tables dont des colonnes ont été supprimées.

        Par exemple, supposons que vous ayez des tables qui gagnent de nouvelles colonnes chaque jour et que vous deviez profiler leur contenu à chaque fois. Vous pouvez définir Lors des modifications du schéma sur Reprofiler tous les jours et Types de modifications du schéma sur Nouvelles colonnes.

      3. Pour Lorsque la table change, spécifiez la fréquence à laquelle Sensitive Data Protection doit vérifier si les tables sélectionnées ont subi des modifications depuis leur dernier profilage. Seules les tables ayant subi des modifications seront reprofilées. Les modifications de table incluent par exemple la suppression de lignes et les modifications de schéma.

        Vous devez sélectionner une valeur identique ou moins fréquente que celle que vous avez définie dans le champ En cas de modification du schéma.

      4. Pour Fréquence d'inspection des modifications apportées au modèle, indiquez si vous souhaitez que vos données soient reprofilées lorsque le modèle d'inspection associé est mis à jour, et si oui, à quelle fréquence.

        Une modification de modèle d'inspection est détectée lorsque l'un des événements suivants se produit :

        • Le nom d'un modèle d'inspection change dans votre configuration d'analyse.
        • Le updateTime d'un modèle d'inspection est modifié.

      5. Par exemple, si vous définissez un modèle d'inspection pour la région us-west1 et que vous le mettez à jour, seules les données de cette région seront reprofilées.us-west1

  5. Cliquez sur Conditions.

  6. Dans la section Conditions, spécifiez les conditions que les tables définies dans vos filtres doivent remplir pour que Sensitive Data Protection les profile. Si vous définissez des conditions minimales et la condition temporelle, Sensitive Data Protection ne profile que les tables qui répondent aux deux types de conditions.

    • Conditions minimales : ces conditions sont utiles si vous souhaitez retarder le profilage d'une table jusqu'à ce qu'elle contienne suffisamment de lignes ou qu'elle ait atteint un certain âge. Activez les conditions que vous souhaitez appliquer, puis spécifiez le nombre minimal de lignes ou la durée.
    • Condition temporelle : cette condition est utile si vous ne souhaitez jamais profiler d'anciennes tables. Activez la condition temporelle, puis sélectionnez une date et une heure. Toute table créée à cette date ou avant est exclue du profilage.

    Exemples de conditions

    Supposons que vous ayez la configuration suivante :

    • Conditions minimales

      • Nombre minimal de lignes : 10
      • Durée minimale : 24 heures
    • Condition temporelle

      • Timestamp : 04/05/2022, 23:59

    Dans ce cas, Sensitive Data Protection exclut toutes les tables créées le 4 mai 2022 à 23h59 ou avant. Parmi les tables créées après cette date et heure, la protection des données sensibles ne profile que celles qui comportent 10 lignes ou qui ont au moins 24 heures.

  7. Dans la section Tables à profiler, sélectionnez l'une des options suivantes, en fonction des types de tables que vous souhaitez profiler :

    • Profiler toutes les tables : sélectionnez cette option si vous souhaitez que la protection des données sensibles profile tous les types de tables qui correspondent à vos filtres et conditions.

      Pour les types de tables non compatibles, la protection des données sensibles ne génère que des profils partiellement renseignés. Ces profils affichent des erreurs indiquant que les tables auxquelles ils se rapportent ne sont pas compatibles. Sélectionnez cette option si vous souhaitez afficher les profils partiels malgré les messages d'erreur.

      Lorsque la protection des données sensibles prend en charge un nouveau type de table, elle reprofile complètement les tables de ce type lors de la prochaine exécution planifiée.

    • Profiler les tables compatibles : sélectionnez cette option si vous souhaitez que Sensitive Data Protection profile uniquement les tables compatibles qui correspondent à vos filtres et conditions. Les tables non compatibles ne disposeront pas de profils partiels.

    • Profiler des types de tables spécifiques : sélectionnez cette option si vous souhaitez que Sensitive Data Protection profile uniquement les types de tables que vous sélectionnez. Dans la liste qui s'affiche, sélectionnez un ou plusieurs types.

      Lorsque la protection des données sensibles prend en charge un nouveau type de table, elle ne profile pas automatiquement les tables de ce type. Pour profiler les types de tables nouvellement compatibles, vous devez modifier votre configuration d'analyse et sélectionner ces types.

    Si vous ne sélectionnez aucune option, Sensitive Data Protection profile uniquement les tables BigQuery et affiche des erreurs pour les tables non compatibles.

    Le prix du profilage des données varie en fonction des types de tables profilées. Pour en savoir plus, consultez la page Tarifs du profilage de données.

  8. Cliquez sur OK.

  9. Facultatif : Pour ajouter d'autres programmations, cliquez sur Ajouter une programmation et répétez les étapes précédentes.

  10. Pour spécifier la priorité entre les plannings, réorganisez-les à l'aide des flèches vers le haut  et vers le bas .

    L'ordre des plannings spécifie la façon dont les conflits entre les plannings sont résolus. Si une table correspond aux filtres de deux plannings différents, la fréquence de profilage de cette table est déterminée par le planning qui apparaît le plus haut dans la liste des plannings.

  11. Facultatif : Modifiez ou désactivez la programmation globale.

    Le dernier programme de la liste est le programme général. Cette programmation couvre les tables de votre champ d'application sélectionné qui ne correspondent à aucune des programmations que vous avez créées. La programmation globale suit la fréquence de profilage par défaut du système.

    • Pour ajuster la programmation par défaut, cliquez sur Modifier la programmation, puis ajustez les paramètres si nécessaire.
    • Pour empêcher Sensitive Data Protection de profiler les ressources couvertes par la programmation globale, désactivez l'option Profiler les ressources qui ne correspondent à aucune programmation personnalisée.

Sélectionner un modèle d'inspection

Selon la façon dont vous souhaitez fournir une configuration d'inspection, choisissez l'une des options suivantes. Quelle que soit l'option choisie, Sensitive Data Protection analyse vos données dans la région où elles sont stockées. Autrement dit, vos données ne quittent pas leur région d'origine.

Option 1 : Créer un modèle d'inspection

Choisissez cette option si vous souhaitez créer un modèle d'inspection dans la région global.

  1. Cliquez sur Créer un modèle d'inspection.
  2. Facultatif : Pour modifier la sélection par défaut des infoTypes, cliquez sur Gérer les infoTypes.

    Pour savoir comment gérer les infoTypes intégrés et personnalisés, consultez Gérer les infoTypes dans la consoleGoogle Cloud .