跳至主要内容
Google Cloud Documentation
文档
  • 开始使用
  • Google Cloud 使用入门
  • 商品列表
  • Cloud Customer Care
  • 精选产品
  • Agent Platform
  • Apigee API Management
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • 交互的能力
  • Looker
  • 跨产品工具
  • 访问权限和资源管理
  • 费用和用量管理
  • 基础设施即代码
  • SDK、语言、框架和工具
  • 技术领域
  • AI 和机器学习
  • 应用开发
  • 应用托管
  • 计算
  • 数据分析和流水线
  • 数据库
  • 分布式云、混合云和多云
  • 行业解决方案
  • 迁移
  • 网络
  • 可观测性和监控
  • 安全
  • Storage
/
控制台
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
登录
  • Managed Service for Apache Spark
免费开始使用吧
概览 指南 参考文档 示例 资源
Google Cloud Documentation
  • 文档
    • 更多
    • 概览
    • 指南
    • 参考文档
    • 示例
    • 资源
  • 控制台
  • 概览
  • 主要概念
  • Managed Service for Apache Spark 无服务器
    • 概览
    • Managed Service for Apache Spark 无服务器层级
  • 集群上的 Managed Service for Apache Spark
  • 比较无服务器部署和集群部署
  • GKE 上的 Managed Service for Apache Spark
  • 开始使用
  • 无服务器
    • 创建无服务器 Spark 批量工作负载
  • 集群
    • 创建集群
    • 将 Spark 作业提交到集群
    • Spark 教程
      • 使用 Gemini 开发 Spark 应用
      • 使用 Spark 分析公开数据集
      • 使用 Spark MLlib 进行情感分析
  • GKE
    • 在 Kubernetes 上运行 Spark 作业
  • 开发
  • 无服务器
    • 配置无服务器
      • 使用自定义容器
      • 使用 GPU
      • 使用动态工作负载调度器
      • 网络配置
      • Spark 运行时版本
        • 概览
        • Spark 运行时版本 3.0
        • Spark 运行时版本 2.3
        • Spark 运行时版本 2.2
        • Spark 运行时版本 1.2
      • 服务账号
      • Spark 属性
      • 暂存存储桶
    • 创建批处理工作负载和会话
      • 创建无服务器 Spark 批量工作负载
      • 创建无服务器交互式会话和会话模板
      • 使用无服务器 Spark Connect 客户端
      • 使用 JupyterLab 进行无服务器批处理会话和笔记本会话
      • 使用无服务器模板
        • 概览
        • Cloud Spanner 到 Cloud Storage
        • Cloud Storage 到 BigQuery
        • Cloud Storage 到 Cloud Spanner
        • Cloud Storage 到 Cloud Storage
        • Cloud Storage 到 JDBC
        • Hive to BigQuery
        • 从 Hive 迁移到 Cloud Storage
        • JDBC to BigQuery
        • JDBC 到 Cloud Spanner
        • JDBC 到 Cloud Storage
        • JDBC 到 JDBC
        • Pub/Sub 到 Cloud Storage
    • 在 Lakehouse 运行时目录中创建包含元数据的 Apache Iceberg 表
    • 将 BigQuery 连接器与 Spark 搭配使用
      • 概览
      • 查询 BigQuery 表
    • 在 BigQuery Studio 笔记本中运行 PySpark 代码
    • 优化
      • 自动扩缩工作负载资源
      • 自动微调 Spark 工作负载
      • 使用 Lightning Engine
        • 使用 Lightning Engine 加速批处理工作负载和会话
        • 运行原生查询执行资格认证工具
      • 无服务器 Spark 解决方案加速器
  • 集群
    • 数据处理
      • 配置 Spark
        • 管理 Spark 依赖项
        • 自定义 Spark 环境
        • 启用并发写入
        • 提升 Spark 性能
        • Tune Spark
        • 使用 Lightning Engine
      • 运行 Spark 作业
        • 使用控制台
        • 使用命令行
        • 使用 REST APIs Explorer
          • 创建集群
          • 运行 Spark 作业
          • 更新集群
          • 删除集群
        • 使用客户端库
      • 运行 Hadoop 作业
      • 编写及运行 Spark Scala 作业
      • 运行 Trino
      • 运行 Flink
      • 运行 Hive
      • Run Pig
      • 运行 HBase
      • 运行 Python
        • 配置 Python 环境
        • 使用 Python 版 Cloud 客户端库
      • 使用数据连接器
        • 使用 Spark BigQuery 连接器
          • 概览
          • BigQuery 连接器代码示例
        • 使用 Cloud Storage 连接器
        • 使用 Spark Spanner 连接器
    • 数据湖和湖仓
      • 探索和提取数据
      • 转换数据
      • 将数据加载到 BigQuery 中
      • 使用 Spark 和 BigQuery 创建湖仓一体
      • 配置 metastore
      • 在 BigLake metastore 中创建包含元数据的 Apache Iceberg 表
      • 使用 Iceberg
      • 使用 Delta
      • 使用 Hudi
    • 数据科学笔记本和界面
      • 使用笔记本
        • 概览
        • 在集群上运行 Jupyter 笔记本
        • 在笔记本上运行基因组分析
        • 使用 JupyterLab 扩展程序开发无服务器 Spark 工作负载
      • 使用组件网关
    • 数据源和存储
      • 连接到数据源
      • 连接到 Cloud Storage
      • 连接到 BigQuery
      • 将 Hive 连接到 BigQuery
      • 连接到 Bigtable
      • 连接到 Pub/Sub Lite
    • 管理和数据治理
      • 舰队管理
      • 沿袭
        • 启用 Spark 数据沿袭
        • 启用 Hive 数据沿袭
    • 配置集群
      • 组件
        • 概览
        • Delta Lake
        • Docker
        • Flink
        • HBase
        • Hive WebHCat
        • Hudi
        • Iceberg
        • Jupyter
        • 猪
        • Presto
        • Ranger
          • 安装 Ranger
          • 使用 Ranger
            • 将 Ranger 与 Kerberos 搭配使用
            • 将 Ranger 与缓存和缩小范围搭配使用
            • 备份和恢复 Ranger 架构
        • Solr
        • Trino
        • Zeppelin
        • ZooKeeper
      • 聚类图片
        • 概览
        • 服务
        • 集群映像版本
          • 概览
          • 3.0.x 发布版映像版本
          • 2.3.x 发布版本映像
          • 2.2.x 发布版映像版本
          • 2.1.x 发布版本映像
      • 计算选项
        • 机器类型
        • GPU
        • 满足最低 CPU 要求的平台
        • 灵活的虚拟机
        • 辅助工作器
        • 本地固态硬盘
        • 启动磁盘
        • 已挂接的 Hyperdisk
    • 创建集群
      • 概览
      • 配置网络
        • 概览
        • 使用安全标记
        • 配置 Private Service Connect
      • 选择集群区域
      • 启用自动选择地区功能
      • 安排集群删除
      • 使用初始化操作
      • 设置集群元数据
      • 设置集群属性