Passer au contenu principal
Google Cloud Documentation
Documentation
  • Débuter
  • Premiers pas avec Google Cloud
  • Liste des produits
  • Cloud Customer Care
  • Sélection de produits
  • Agent Platform
  • Apigee API Management
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • Google Kubernetes Engine
  • Looker
  • Outils multiproduits
  • Gestion des accès et des ressources
  • Gestion des coûts et de l'utilisation
  • Infrastructure as Code
  • SDK, langages, frameworks et outils
  • Domaines technologiques
  • IA et ML
  • Développement d'applications
  • Hébergement d'applications
  • Calcul
  • Analyses de données et pipelines
  • Bases de données
  • Solutions distribuées, hybrides et multicloud
  • Solutions par secteur d'activité
  • Migration
  • Mise en réseau
  • Observabilité et surveillance
  • Sécurité
  • Storage
/
Console
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
Connexion
  • Managed Service for Apache Spark
Commencer l'essai gratuit
Aperçu Guides Référence Exemples Ressources
Google Cloud Documentation
  • Documentation
    • Plus
    • Aperçu
    • Guides
    • Référence
    • Exemples
    • Ressources
  • Console
  • Aperçu
  • Concepts clés
  • Managed Service pour Apache Spark sans serveur
    • Aperçu
    • Niveaux sans serveur Managed Service pour Apache Spark
  • Managed Service pour Apache Spark sur les clusters
  • Comparer les déploiements sans serveur et de cluster
  • Managed Service pour Apache Spark sur GKE
  • Premiers pas
  • Sans serveur
    • Créer une charge de travail par lot Spark sans serveur
  • Clusters
    • Créer un cluster
    • Envoyer une tâche Spark à un cluster
    • Tutoriels Spark
      • Utiliser Gemini pour développer des applications Spark
      • Analyser des ensembles de données publics avec Spark
      • Analyse des sentiments avec Spark MLlib
  • GKE
    • Exécuter un job Spark sur Kubernetes
  • Développer
  • Sans serveur
    • Configurer sans serveur
      • Utiliser des conteneurs personnalisés
      • Utiliser les GPU
      • Utiliser le planificateur de charges de travail dynamique
      • Configuration du réseau
      • Versions d'exécution Spark
        • Aperçu
        • Version 3.0 du runtime Spark
        • Version d'exécution Spark 2.3
        • Version 2.2 du runtime Spark
        • Version 1.2 du runtime Spark
      • Service Accounts
      • Propriétés Spark
      • Bucket de préproduction
    • Créer des charges de travail et des sessions par lot
      • Créer une charge de travail par lot Spark sans serveur
      • Créer des sessions interactives et des modèles de session sans serveur
      • Utiliser le client Spark Connect sans serveur
      • Utiliser JupyterLab pour les sessions de notebook et par lot sans serveur
      • Utiliser des modèles sans serveur
        • Aperçu
        • Cloud Spanner vers Cloud Storage
        • Cloud Storage vers BigQuery
        • Cloud Storage vers Cloud Spanner
        • Cloud Storage vers Cloud Storage
        • Cloud Storage vers JDBC
        • Hive vers BigQuery
        • Hive vers Cloud Storage
        • JDBC vers BigQuery
        • JDBC vers Cloud Spanner
        • JDBC vers Cloud Storage
        • JDBC vers JDBC
        • Pub/Sub vers Cloud Storage
    • Créer une table Apache Iceberg avec des métadonnées dans le catalogue du runtime Lakehouse
    • Utiliser le connecteur BigQuery avec Spark
      • Aperçu
      • Interroger des tables BigQuery
    • Exécuter du code PySpark dans les notebooks BigQuery Studio
    • Optimiser
      • Autoscaler les ressources de charge de travail
      • Régler automatiquement les charges de travail Spark
      • Utiliser Lightning Engine
        • Accélérer les charges de travail et les sessions par lot avec Lightning Engine
        • Exécuter l'outil de qualification pour l'exécution de requêtes natives
      • Accélérateurs de solution Spark sans serveur
  • Clusters
    • Traitement des données
      • Configurer Spark
        • Gérer les dépendances Spark
        • Personnaliser l'environnement Spark
        • Activer les écritures simultanées
        • Améliorer les performances de Spark
        • Tune Spark
        • Utiliser Lightning Engine
      • Exécuter des jobs Spark
        • Utiliser la console
        • Utiliser la ligne de commande
        • Utiliser l'explorateur d'API REST
          • Créer un cluster
          • Exécuter un job Spark
          • Mettre à jour un cluster
          • Supprimer un cluster
        • Utiliser des bibliothèques clientes
      • Exécuter des tâches Hadoop
      • Écrire et exécuter des tâches Spark Scala
      • Exécuter Trino
      • Exécuter Flink
      • Exécuter Hive
      • Exécuter Pig
      • Exécuter HBase
      • Exécuter Python
        • Configurer l'environnement Python
        • Utiliser les bibliothèques clientes Cloud pour Python
      • Utiliser des connecteurs de données
        • Utiliser le connecteur Spark BigQuery
          • Aperçu
          • Exemples de code de connecteur BigQuery
        • Utiliser le connecteur Cloud Storage
        • Utiliser le connecteur Spark Spanner
    • Lacs de données et lakehouses
      • Explorer et extraire des données
      • Transformer les données
      • Charger des données dans BigQuery
      • Créer un lakehouse avec Spark et BigQuery
      • Configurer les metastores
      • Créer une table Apache Iceberg avec des métadonnées dans BigLake Metastore
      • Utiliser Iceberg
      • Utiliser Delta
      • Utiliser Hudi
    • Notebooks et UI de data science
      • Utiliser des notebooks
        • Aperçu
        • Exécuter un notebook Jupyter sur un cluster
        • Exécuter une analyse génomique dans un notebook
        • Utiliser l'extension JupyterLab pour développer des charges de travail Spark sans serveur
      • Utiliser la passerelle des composants
    • Sources de données et stockage
      • Se connecter à des sources de données
      • Se connecter à Cloud Storage
      • Se connecter à BigQuery
      • Connecter Hive à BigQuery
      • Se connecter à Bigtable
      • Se connecter à Pub/Sub Lite
    • Administration et gouvernance des données
      • Gestion de parc
      • Traçabilité
        • Activer la traçabilité des données Spark
        • Activer la traçabilité des données Hive
    • Configurer les clusters
      • Composants
        • Aperçu
        • Delta Lake
        • Docker
        • Flink
        • HBase
        • Hive WebHCat
        • Hudi
        • Iceberg
        • Jupyter
        • Pig
        • Presto
        • Ranger
          • Installer Ranger
          • Utiliser Ranger
            • Utiliser Ranger avec Kerberos
            • Utiliser Ranger avec la mise en cache et la réduction du champ d'application
            • Sauvegarder et restaurer un schéma Ranger
        • Solr
        • Trino
        • Zeppelin
        • ZooKeeper