跳至主要内容
Google Cloud Documentation
文档
  • 开始使用
  • Google Cloud 使用入门
  • 商品列表
  • Cloud Customer Care
  • 精选产品
  • Agent Platform
  • Apigee API Management
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • 交互的能力
  • Looker
  • 跨产品工具
  • 访问权限和资源管理
  • 费用和用量管理
  • 基础设施即代码
  • SDK、语言、框架和工具
  • 技术领域
  • AI 和机器学习
  • 应用开发
  • 应用托管
  • 计算
  • 数据分析和流水线
  • 数据库
  • 分布式云、混合云和多云
  • 行业解决方案
  • 迁移
  • 网络
  • 可观测性和监控
  • 安全
  • Storage
/
控制台
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
登录
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
免费开始使用吧
概览 指南
Google Cloud Documentation
  • 文档
    • 更多
    • 概览
    • 指南
  • 控制台
  • Discover
  • GKE 上的 AI/机器学习工作负载简介
  • 探索 GKE 文档
    • 概览
    • 主要 GKE 文档
    • GKE AI/机器学习文档
    • GKE 网络文档
    • GKE 安全文档
    • GKE 舰队管理文档
  • 选择如何在 GKE 上获取和使用加速器
  • 使用 Gemini 设计资源可获取性
  • GKE AI/机器学习一致性
  • 开始使用
  • 为何使用 GKE 进行 AI/机器学习推理
  • GKE 中 AI/机器学习工作负载的简化自动扩缩概念
  • 快速入门:在 GKE 上部署您的第一个 AI 模型
  • 部署 AI 模型以进行推理
  • GKE 上的 AI/机器学习模型推理简介
  • 使用 GKE 推理快速入门分析模型部署性能和费用
  • 使用 GKE 推理网关公开 AI 应用
  • 推理最佳实践
    • 概览
    • 为推理选择负载均衡策略
    • 自动扩缩 GPU 上的推理工作负载
    • 自动扩缩 TPU 上的 LLM 推理工作负载
    • 优化 GPU 上的 LLM 推理工作负载
    • 优化批处理推理工作负载
  • 试用推理示例
    • GPU
      • 通过 vLLM 使用 GPU 部署 Gemma 开放模型
      • 部署 DeepSeek-R1 671B 或 Llama 3.1 405B 等 LLM
      • 使用 GKE 推理网关提供 LLM
      • 通过多个 GPU 提供 LLM
      • 使用 Torch Serve 部署 T5
    • TPU
      • 通过 vLLM 在 TPU 上部署 Llama
      • 通过 JetStream 和 Pathways 使用多主机 TPU 部署 LLM
      • 通过 MaxDiffusion 在 TPU 上部署 Stable Diffusion XL
      • 使用 Terraform 在 TPU 上部署开放模型
  • 大规模训练 AI 模型
  • 使用多层级检查点训练大规模模型
  • 尝试训练样本
    • 在 GKE Standard 模式下使用 GPU 训练模型
    • 在 GKE Autopilot 模式下使用 GPU 训练模型
    • 使用 Megatron-LM 在 GPU 上训练 Llama 模型
    • 使用 JAX 在 GKE 上通过 TPU 微调 LLM
  • 在 GKE 上运行强化学习工作负载
    • 使用 verl 微调和扩缩强化学习
    • 使用 NeMo RL 微调和扩缩强化学习
    • 使用 OpenTelemetry 监控强化学习工作负载
  • 部署和编排 AI 代理
  • 使用 ADK 和 Agent Platform API 部署 AI 代理
  • 使用 ADK 和自托管 LLM 部署 AI 代理
  • 利用 Agent Substrate 扩缩 AI 智能体工作负载
    • Agent Substrate 简介
    • 在 GKE 上安装 Agent Substrate
  • 使用智能体沙盒保护 AI 智能体工作负载
    • Agent Sandbox 简介
    • 为 AI 智能体工作负载选择存储
    • 在 GKE 上启用 Agent Sandbox
    • 使用 Agent Sandbox 隔离 AI 代码执行
    • 管理 Agent Sandbox 存储空间
    • 保存和恢复 Agent Sandbox 环境
    • 从集群内部触发 Agent Sandbox 快照
  • 使用 Ray 开发分布式 AI/机器学习应用
  • Ray on GKE 简介
  • 快速入门:在 GKE 上部署您的第一个 Ray 应用
  • 通过 Ray Operator 插件启用托管式 KubeRay
  • 在 GKE 上使用 Ray 部署 AI/机器学习工作负载
    • 在 GKE 上使用 Ray Serve 部署 AI 模型
      • 使用 Ray Serve 在 GPU 上部署 LLM
      • 使用多集群 Ray Serve 和推理网关部署 LLM
      • 使用 Ray Serve 在 TPU 上部署 LLM
      • 通过 Ray 使用 GKE 中的多主机 TPU 应用 Gemma 开放模型
      • 使用 Ray 在 GPU 上部署 diffusion 模型
      • 使用 Ray 在 TPU 上部署 diffusion 模型
    • 在 GKE 上使用 Ray 训练 AI 模型
      • 使用 PyTorch、Ray 和 GKE 进行训练
      • 使用 GKE 中的 TPU 通过 Jax 和 Ray Train 训练 LLM
      • 在 GKE 上使用 Ray Train 在 TPU 上进行多切片训练和弹性训练
    • 使用 Kueue 在团队之间共享计算资源
      • 在多种计算选项中更快地启动 RayJob
  • 将 GPU 与 Ray on GKE 搭配使用
    • 使用 A4X 和 GB200 设置 GKE 上的 Ray
  • 在 GKE 上将 TPU 与 Ray 搭配使用
    • 使用 TPU Trillium 在 GKE 上设置 Ray
    • 使用 DWS 和 Kueue 在 TPU 上优化 AI 训练
  • 监控 GKE 上的 Ray
    • 查看 GKE 上 Ray Operator 的日志
    • 查看 GKE 上 Ray 集群的日志和指标
    • 使用 Ray History Server 调试已完成的 Ray 作业
  • 针对 HPC 和 AI/机器学习工作负载使用 Slurm Operator
  • GKE 上的 Slurm 简介
  • 快速入门:在 GKE 上部署 Slurm 集群
  • 启用 Slurm Operator 插件
  • 构建自定义 Slurm Docker 映像
  • 使用指标自动扩缩 Slurm 集群
  • 为 GKE 上的 Slurm 配置共享存储空间
    • 为 Slurm 配置 Filestore
    • 适用于 Slurm 的 Managed Lustre
  • 管理 GKE 上的 GPU
  • GPU 简介
  • 为 AI/机器学习工作负载配置 GPU
    • 使用 AI Hypercomputer 配置 A3 或 A4 虚拟机
    • 在 Standard 集群中部署 GPU 工作负载
    • 在 Autopilot 集群中部署 GPU 工作负载
    • 为 GPU 上的 LLM 工作负载配置自动扩缩
    • 使用 NVIDIA GPU Operator 管理 GPU 栈
    • 就地加密 GPU 工作负载
  • 为高性能计算 (HPC) 预配资源
    • 部署 AI Hypercomputer 集群(A3、A4 虚拟机)
  • 通过 GPU 共享策略优化 GPU 利用率
    • GKE 上的 GPU 共享策略简介
    • 使用多实例 GPU
    • 配置分时 GPU
    • 使用 NVIDIA MPS
  • 使用灵活启动优化 GPU 预配
    • 概览
    • 使用灵活启动运行大规模工作负载
    • 使用 GPU 和灵活启动运行小型批量工作负载
  • 管理 GKE 上的 TPU
  • TPU 简介
  • 版本
    • Ironwood (TPU7x)
  • 规划 GKE 上的 TPU
  • 为 AI/机器学习工作负载配置 TPU
    • 在 Standard 集群上部署 TPU 工作负载
    • 在 Autopilot 集群上部署 TPU 工作负载
    • 通过自动联网部署高性能 TPU 工作负载
    • 在 GKE 上部署 TPU 多切片
    • 使用 JobSet 和 Kueue 编排 TPU 多切片工作负载
  • 为 TPU 上的 LLM 工作负载配置自动扩缩
  • 使用灵活启动优化 TPU 预配
    • 概览
    • 使用 TPU 和灵活启动运行小型批量工作负载
    • 在日历模式下请求具有未来预留的 TPU
  • 通过动态切分优化 TPU 利用率
    • TPU 全容量模式简介
    • TPU 动态切片简介
      • 概览
      • 将动态切片与自定义调度器搭配使用
      • 使用 Kueue 和 TAS 调度动态切片
  • 管理 GPU 和 TPU 的 GKE 节点中断
  • GPU 和 TPU 的节点中断简介
  • 使用 Kueue 进行作业排队和资源优化
    • 在 GKE 上运行批处理工作负载的最佳实践
    • 使用 Kueue 部署批处理系统
    • 使用配额共享实现 Job 排队系统
    • 针对混合 AI/机器学习训练和推理工作负载优化资源利用率