跳至主要内容
文档
close
开始使用
Google Cloud 使用入门
商品列表
Cloud Customer Care
精选产品
Agent Platform
Apigee API Management
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
交互的能力
Looker
跨产品工具
访问权限和资源管理
费用和用量管理
基础设施即代码
SDK、语言、框架和工具
技术领域
AI 和机器学习
应用开发
应用托管
计算
数据分析和流水线
数据库
分布式云、混合云和多云
行业解决方案
迁移
网络
可观测性和监控
安全
Storage
/
控制台
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
登录
Managed Service for Apache Spark
免费开始使用吧
概览
指南
参考文档
示例
资源
文档
更多
概览
指南
参考文档
示例
资源
控制台
概览
主要概念
Managed Service for Apache Spark 无服务器
概览
Managed Service for Apache Spark 无服务器层级
集群上的 Managed Service for Apache Spark
比较无服务器部署和集群部署
GKE 上的 Managed Service for Apache Spark
开始使用
无服务器
创建无服务器 Spark 批量工作负载
集群
创建集群
将 Spark 作业提交到集群
Spark 教程
使用 Gemini 开发 Spark 应用
使用 Spark 分析公开数据集
使用 Spark MLlib 进行情感分析
GKE
在 Kubernetes 上运行 Spark 作业
开发
无服务器
配置无服务器
使用自定义容器
使用 GPU
使用动态工作负载调度器
网络配置
Spark 运行时版本
概览
Spark 运行时版本 3.0
Spark 运行时版本 2.3
Spark 运行时版本 2.2
Spark 运行时版本 1.2
服务账号
Spark 属性
暂存存储桶
创建批处理工作负载和会话
创建无服务器 Spark 批量工作负载
创建无服务器交互式会话和会话模板
使用无服务器 Spark Connect 客户端
使用 JupyterLab 进行无服务器批处理会话和笔记本会话
使用无服务器模板
概览
Cloud Spanner 到 Cloud Storage
Cloud Storage 到 BigQuery
Cloud Storage 到 Cloud Spanner
Cloud Storage 到 Cloud Storage
Cloud Storage 到 JDBC
Hive to BigQuery
从 Hive 迁移到 Cloud Storage
JDBC to BigQuery
JDBC 到 Cloud Spanner
JDBC 到 Cloud Storage
JDBC 到 JDBC
Pub/Sub 到 Cloud Storage
在 Lakehouse 运行时目录中创建包含元数据的 Apache Iceberg 表
将 BigQuery 连接器与 Spark 搭配使用
概览
查询 BigQuery 表
在 BigQuery Studio 笔记本中运行 PySpark 代码
优化
自动扩缩工作负载资源
自动微调 Spark 工作负载
使用 Lightning Engine
使用 Lightning Engine 加速批处理工作负载和会话
运行原生查询执行资格认证工具
无服务器 Spark 解决方案加速器
集群
数据处理
配置 Spark
管理 Spark 依赖项
自定义 Spark 环境
启用并发写入
提升 Spark 性能
Tune Spark
使用 Lightning Engine
运行 Spark 作业
使用控制台
使用命令行
使用 REST APIs Explorer
创建集群
运行 Spark 作业
更新集群
删除集群
使用客户端库
运行 Hadoop 作业
编写及运行 Spark Scala 作业
运行 Trino
运行 Flink
运行 Hive
Run Pig
运行 HBase
运行 Python
配置 Python 环境
使用 Python 版 Cloud 客户端库
使用数据连接器
使用 Spark BigQuery 连接器
概览
BigQuery 连接器代码示例
使用 Cloud Storage 连接器
使用 Spark Spanner 连接器
数据湖和湖仓
探索和提取数据
转换数据
将数据加载到 BigQuery 中
使用 Spark 和 BigQuery 创建湖仓一体
配置 metastore
在 BigLake metastore 中创建包含元数据的 Apache Iceberg 表
使用 Iceberg
使用 Delta
使用 Hudi
数据科学笔记本和界面
使用笔记本
概览
在集群上运行 Jupyter 笔记本
在笔记本上运行基因组分析
使用 JupyterLab 扩展程序开发无服务器 Spark 工作负载
使用组件网关
数据源和存储
连接到数据源
连接到 Cloud Storage
连接到 BigQuery
将 Hive 连接到 BigQuery
连接到 Bigtable
连接到 Pub/Sub Lite
管理和数据治理
舰队管理
沿袭
启用 Spark 数据沿袭
启用 Hive 数据沿袭
配置集群
组件
概览
Delta Lake
Docker
Flink
HBase
Hive WebHCat
Hudi
Iceberg
Jupyter
猪
Presto
Ranger
安装 Ranger
使用 Ranger
将 Ranger 与 Kerberos 搭配使用
将 Ranger 与缓存和缩小范围搭配使用
备份和恢复 Ranger 架构
Solr
Trino
Zeppelin
ZooKeeper
聚类图片
概览
服务
集群映像版本
概览
3.0.x 发布版映像版本
2.3.x 发布版本映像
2.2.x 发布版映像版本
2.1.x 发布版本映像
计算选项
机器类型
GPU
满足最低 CPU 要求的平台
灵活的虚拟机
辅助工作器
本地固态硬盘
启动磁盘
已挂接的 Hyperdisk
创建集群
概览
配置网络
概览
使用安全标记
配置 Private Service Connect
选择集群区域
启用自动选择地区功能
安排集群删除
使用初始化操作
设置集群元数据
设置集群属性