Langsung ke konten utama
Dokumentasi
close
Mulai
Mulai Menggunakan Google Cloud
Daftar Produk
Cloud Customer Care
Produk Unggulan
Agent Platform
Pengelolaan API Apigee
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
Google Kubernetes Engine
Looker
Alat Lintas Produk
Pengelolaan akses dan resource
Pengelolaan biaya dan penggunaan
Infrastruktur sebagai kode
SDK, bahasa, framework, dan alat
Area Teknologi
AI dan ML
Pengembangan aplikasi
Hosting aplikasi
Compute
Pipeline dan analisis data
Database
Terdistribusi, hybrid, dan multicloud
Solusi industri
Migrasi
Jaringan
Kemampuan observasi dan pemantauan
Keamanan
Storage
/
Konsol
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Masuk
Managed Service for Apache Spark
Mulai gratis
Ringkasan
Panduan
Referensi
Contoh
Referensi
Dokumentasi
Lainnya
Ringkasan
Panduan
Referensi
Contoh
Referensi
Konsol
Ringkasan
Konsep Utama
Managed Service untuk Apache Spark serverless
Ringkasan
Paket serverless Managed Service untuk Apache Spark
Managed Service untuk Apache Spark di cluster
Membandingkan deployment serverless dan cluster
Managed Service untuk Apache Spark di GKE
Mulai
Serverless
Membuat workload batch serverless Spark
Cluster
Membuat cluster
Mengirimkan tugas Spark ke cluster
Tutorial Spark
Menggunakan Gemini untuk mengembangkan aplikasi Spark
Menganalisis set data publik dengan Spark
Analisis sentimen dengan Spark MLlib
GKE
Menjalankan tugas Spark di Kubernetes
Mengembangkan aplikasi
Serverless
Mengonfigurasi serverless
Menggunakan container kustom
Menggunakan GPU
Menggunakan Dynamic Workload Scheduler
Konfigurasi jaringan
Versi runtime Spark
Ringkasan
Versi runtime Spark 3.0
Versi runtime Spark 2.3
Versi runtime Spark 2.2
Versi runtime Spark 1.2
Akun layanan
Properti Spark
Bucket staging
Membuat workload dan sesi batch
Membuat workload batch serverless Spark
Membuat sesi interaktif serverless dan template sesi
Menggunakan klien Spark Connect serverless
Menggunakan JupyterLab untuk sesi notebook dan batch serverless
Menggunakan template serverless
Ringkasan
Cloud Spanner ke Cloud Storage
Cloud Storage ke BigQuery
Cloud Storage ke Cloud Spanner
Cloud Storage ke Cloud Storage
Cloud Storage ke JDBC
Hive ke BigQuery
Beralih ke Cloud Storage
JDBC ke BigQuery
JDBC ke Cloud Spanner
JDBC ke Cloud Storage
JDBC ke JDBC
Pub/Sub ke Cloud Storage
Membuat tabel Apache Iceberg dengan metadata di katalog runtime Lakehouse
Menggunakan konektor BigQuery dengan Spark
Ringkasan
Membuat kueri tabel BigQuery
Menjalankan kode PySpark di notebook BigQuery Studio
Optimalkan
Melakukan penskalaan otomatis resource workload
Menyesuaikan workload Spark secara otomatis
Menggunakan Lightning Engine
Mempercepat workload dan sesi batch dengan Lightning Engine
Menjalankan alat kualifikasi Eksekusi Kueri Native
Akselerator solusi Serverless Spark
Cluster
Pemrosesan data
Mengonfigurasi Spark
Mengelola dependensi Spark
Menyesuaikan lingkungan Spark
Mengaktifkan penulisan serentak
Meningkatkan performa Spark
Menyesuaikan Spark
Menggunakan Lightning Engine
Menjalankan tugas Spark
Menggunakan konsol
Menggunakan command line
Menggunakan REST API Explorer
Membuat cluster
Menjalankan tugas Spark
Memperbarui cluster
Hapus cluster
Menggunakan library klien
Menjalankan tugas Hadoop
Menulis dan menjalankan tugas Spark Scala
Menjalankan Trino
Menjalankan Flink
Menjalankan Hive
Run Pig
Menjalankan HBase
Jalankan Python
Mengonfigurasi lingkungan Python
Menggunakan Library Klien Cloud untuk Python
Menggunakan konektor data
Menggunakan konektor Spark BigQuery
Ringkasan
Contoh kode konektor BigQuery
Menggunakan konektor Cloud Storage
Menggunakan konektor Spark Spanner
Data lake dan lake house
Menjelajahi dan mengekstrak data
Mentransformasi data
Memuat data ke BigQuery
Membuat lakehouse dengan Spark dan BigQuery
Mengonfigurasi metastore
Membuat tabel Apache Iceberg dengan metadata di metastore BigLake
Menggunakan Iceberg
Menggunakan Delta
Menggunakan Hudi
Notebook dan UI data science
Menggunakan notebook
Ringkasan
Menjalankan notebook Jupyter di cluster
Menjalankan analisis genomik di notebook
Menggunakan ekstensi JupyterLab untuk mengembangkan workload Spark serverless
Menggunakan Gateway Komponen
Sumber dan penyimpanan data
Menghubungkan ke sumber data
Menghubungkan ke Cloud Storage
Menghubungkan ke BigQuery
Menghubungkan Hive ke BigQuery
Menghubungkan ke Bigtable
Menghubungkan ke Pub/Sub Lite
Administrasi dan tata kelola data
Manajemen fleet
Silsilah
Mengaktifkan silsilah data Spark
Mengaktifkan silsilah data Hive
Konfigurasi cluster
Komponen
Ringkasan
Delta Lake
Docker
Flink
HBase
WebHCat Hive
Hudi
Iceberg
Jupyter
Pig
Presto
Ranger
Menginstal Ranger
Menggunakan Ranger
Menggunakan Ranger dengan Kerberos
Menggunakan Ranger dengan caching dan downscoping
Mencadangkan dan memulihkan skema Ranger
Solr
Trino
Zeppelin
Zookeeper
Gambar cluster
Ringkasan
Layanan
Versi image cluster
Ringkasan
Versi image rilis 3.0.x
Versi image rilis 2.3.x
Versi image rilis 2.2.x
Versi image rilis 2.1.x
Opsi Compute
Jenis mesin
GPU
Platform CPU minimal
VM Fleksibel
Pekerja sekunder
Solid State Drive lokal
Boot disk
Hyperdisk yang terpasang
Membuat cluster
Ringkasan
Mengonfigurasi jaringan
Ringkasan
Menggunakan tag aman
Mengonfigurasi Private Service Connect
Pilih wilayah cluster
Mengaktifkan penempatan zona otomatis
Menjadwalkan penghapusan cluster
Menggunakan tindakan inisialisasi
Menetapkan metadata cluster
Menetapkan properti cluster
Mengaktifkan antarmuka web cluster
Membuat cluster dengan ketersediaan tinggi
Membuat cluster grup node
Membuat cluster parsial
Membuat cluster skala nol
Membuat cluster node tunggal
Membuat sole-tenant cluster
Membuat image kustom
Mengelola cluster
Menetapkan label untuk pemfilteran
Menskalakan cluster
Menskalakan cluster secara manual
Melakukan penskalaan otomatis cluster
Memulai dan menghentikan cluster
Memulai dan menghentikan cluster
Menjadwalkan penghentian cluster
Membuat ulang cluster
Rotasi cluster
Memperbarui dan menghapus cluster
Menggunakan SSH untuk terhubung ke cluster
Mengikuti praktik terbaik
Ringkasan
Memaksimalkan fleksibilitas dan efisiensi cluster dan tugas
Mengelola data cluster
Penyimpanan data Hadoop
Pilih jenis penyimpanan
Menyimpan data cluster dalam cache
Mengurangi beban data shuffle
Melihat log cluster
Mengelola dan mengatur tugas
Fungsi sebuah tugas
Memulai ulang tugas
Menggunakan template alur kerja
Ringkasan
Parameterisasi
Menggunakan file YAML
Menggunakan pemilih cluster
Menggunakan alur kerja inline
Mengorkestrasi alur kerja
Template GitHub
Solusi penjadwalan alur kerja
Menggunakan template alur kerja
Menggunakan Cloud Composer
Menggunakan Cloud Functions
Menggunakan Cloud Scheduler
GKE
Membuat node pool
Membuat ulang cluster virtual GKE
Membuat image container kustom GKE
Menskalakan cluster GKE
Menghapus virtualcluster GKE
Versi rilis
Mengelola dan mengatur
Serverless
Izin dan peran
Menggunakan CMEK dengan Serverless untuk Apache Spark
Tindakan keamanan default
Menggunakan Secret Manager
Membuat batasan kustom
Cluster
Praktik keamanan terbaik
Mengautentikasi pengguna
Melakukan Autentikasi ke Managed Service for Apache Spark
Mengautentikasi cluster pribadi
Workforce identity federation
Tetapkan peran
Izin dan peran
Prinsipal Managed Service for Apache Spark
IAM terperinci
Menetapkan peran untuk Kubernetes
Akun layanan
Mengamankan cluster
Mengamankan multi-tenancy menggunakan Kerberos
Mengamankan multi-tenancy menggunakan akun layanan
Mengenkripsi memori
Mengelola kunci enkripsi data
Mengaktifkan layanan otorisasi Ranger
Menggunakan penyedia kredensial Secret Manager
Membuat dan mengamankan cluster metastore Hive
Membuat batasan kustom
Assured Workloads
Kepatuhan terhadap FedRAMP
Menggunakan Kerberos
Kontrol Layanan VPC
Menetapkan akses Tenaga Kerja
Memantau dan memecahkan masalah
Serverless
Menyelidiki beban kerja dengan Gemini Cloud Assist yang didukung AI
Memantau workload dan sesi serverless
Memantau workload batch
Memantau sesi interaktif
Metrik Spark
Mengaktifkan silsilah data
Penggunaan resource profil
Log audit Resource Manager
Memecahkan masalah workload dan sesi serverless
Memecahkan masalah kegagalan pembuatan batch dan sesi
Memecahkan masalah konektivitas batch dan sesi
Cluster
Menyelidiki cluster dan tugas dengan Gemini Cloud Assist yang didukung AI
Memantau cluster dan tugas
Ringkasan
Metrik Managed Service for Apache Spark
Membuat pemberitahuan metrik
Penggunaan resource profil
Analisis log
Log Managed Service for Apache Spark
Log output tugas
Log audit
Memecahkan masalah cluster
Melihat data diagnostik cluster
Memecahkan masalah pembuatan cluster
Memecahkan masalah tugas
Memecahkan masalah tugas
Memecahkan masalah error memori
Memecahkan masalah penundaan tugas
Melihat histori tugas