Passer au contenu principal
Documentation
close
Débuter
Premiers pas avec Google Cloud
Liste des produits
Cloud Customer Care
Sélection de produits
Agent Platform
Apigee API Management
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
Google Kubernetes Engine
Looker
Outils multiproduits
Gestion des accès et des ressources
Gestion des coûts et de l'utilisation
Infrastructure as Code
SDK, langages, frameworks et outils
Domaines technologiques
IA et ML
Développement d'applications
Hébergement d'applications
Calcul
Analyses de données et pipelines
Bases de données
Solutions distribuées, hybrides et multicloud
Solutions par secteur d'activité
Migration
Mise en réseau
Observabilité et surveillance
Sécurité
Storage
/
Console
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Connexion
Managed Service for Apache Spark
Commencer l'essai gratuit
Aperçu
Guides
Référence
Exemples
Ressources
Documentation
Plus
Aperçu
Guides
Référence
Exemples
Ressources
Console
Aperçu
Concepts clés
Managed Service pour Apache Spark sans serveur
Aperçu
Niveaux sans serveur Managed Service pour Apache Spark
Managed Service pour Apache Spark sur les clusters
Comparer les déploiements sans serveur et de cluster
Managed Service pour Apache Spark sur GKE
Premiers pas
Sans serveur
Créer une charge de travail par lot Spark sans serveur
Clusters
Créer un cluster
Envoyer une tâche Spark à un cluster
Tutoriels Spark
Utiliser Gemini pour développer des applications Spark
Analyser des ensembles de données publics avec Spark
Analyse des sentiments avec Spark MLlib
GKE
Exécuter un job Spark sur Kubernetes
Développer
Sans serveur
Configurer sans serveur
Utiliser des conteneurs personnalisés
Utiliser les GPU
Utiliser le planificateur de charges de travail dynamique
Configuration du réseau
Versions d'exécution Spark
Aperçu
Version 3.0 du runtime Spark
Version d'exécution Spark 2.3
Version 2.2 du runtime Spark
Version 1.2 du runtime Spark
Service Accounts
Propriétés Spark
Bucket de préproduction
Créer des charges de travail et des sessions par lot
Créer une charge de travail par lot Spark sans serveur
Créer des sessions interactives et des modèles de session sans serveur
Utiliser le client Spark Connect sans serveur
Utiliser JupyterLab pour les sessions de notebook et par lot sans serveur
Utiliser des modèles sans serveur
Aperçu
Cloud Spanner vers Cloud Storage
Cloud Storage vers BigQuery
Cloud Storage vers Cloud Spanner
Cloud Storage vers Cloud Storage
Cloud Storage vers JDBC
Hive vers BigQuery
Hive vers Cloud Storage
JDBC vers BigQuery
JDBC vers Cloud Spanner
JDBC vers Cloud Storage
JDBC vers JDBC
Pub/Sub vers Cloud Storage
Créer une table Apache Iceberg avec des métadonnées dans le catalogue du runtime Lakehouse
Utiliser le connecteur BigQuery avec Spark
Aperçu
Interroger des tables BigQuery
Exécuter du code PySpark dans les notebooks BigQuery Studio
Optimiser
Autoscaler les ressources de charge de travail
Régler automatiquement les charges de travail Spark
Utiliser Lightning Engine
Accélérer les charges de travail et les sessions par lot avec Lightning Engine
Exécuter l'outil de qualification pour l'exécution de requêtes natives
Accélérateurs de solution Spark sans serveur
Clusters
Traitement des données
Configurer Spark
Gérer les dépendances Spark
Personnaliser l'environnement Spark
Activer les écritures simultanées
Améliorer les performances de Spark
Tune Spark
Utiliser Lightning Engine
Exécuter des jobs Spark
Utiliser la console
Utiliser la ligne de commande
Utiliser l'explorateur d'API REST
Créer un cluster
Exécuter un job Spark
Mettre à jour un cluster
Supprimer un cluster
Utiliser des bibliothèques clientes
Exécuter des tâches Hadoop
Écrire et exécuter des tâches Spark Scala
Exécuter Trino
Exécuter Flink
Exécuter Hive
Exécuter Pig
Exécuter HBase
Exécuter Python
Configurer l'environnement Python
Utiliser les bibliothèques clientes Cloud pour Python
Utiliser des connecteurs de données
Utiliser le connecteur Spark BigQuery
Aperçu
Exemples de code de connecteur BigQuery
Utiliser le connecteur Cloud Storage
Utiliser le connecteur Spark Spanner
Lacs de données et lakehouses
Explorer et extraire des données
Transformer les données
Charger des données dans BigQuery
Créer un lakehouse avec Spark et BigQuery
Configurer les metastores
Créer une table Apache Iceberg avec des métadonnées dans BigLake Metastore
Utiliser Iceberg
Utiliser Delta
Utiliser Hudi
Notebooks et UI de data science
Utiliser des notebooks
Aperçu
Exécuter un notebook Jupyter sur un cluster
Exécuter une analyse génomique dans un notebook
Utiliser l'extension JupyterLab pour développer des charges de travail Spark sans serveur
Utiliser la passerelle des composants
Sources de données et stockage
Se connecter à des sources de données
Se connecter à Cloud Storage
Se connecter à BigQuery
Connecter Hive à BigQuery
Se connecter à Bigtable
Se connecter à Pub/Sub Lite
Administration et gouvernance des données
Gestion de parc
Traçabilité
Activer la traçabilité des données Spark
Activer la traçabilité des données Hive
Configurer les clusters
Composants
Aperçu
Delta Lake
Docker
Flink
HBase
Hive WebHCat
Hudi
Iceberg
Jupyter
Pig
Presto
Ranger
Installer Ranger
Utiliser Ranger
Utiliser Ranger avec Kerberos
Utiliser Ranger avec la mise en cache et la réduction du champ d'application
Sauvegarder et restaurer un schéma Ranger
Solr
Trino
Zeppelin
ZooKeeper