跳至主要内容
文档
close
开始使用
Google Cloud 使用入门
商品列表
Cloud Customer Care
精选产品
Agent Platform
Apigee API Management
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
交互的能力
Looker
跨产品工具
访问权限和资源管理
费用和用量管理
基础设施即代码
SDK、语言、框架和工具
技术领域
AI 和机器学习
应用开发
应用托管
计算
数据分析和流水线
数据库
分布式云、混合云和多云
行业解决方案
迁移
网络
可观测性和监控
安全
Storage
/
控制台
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
登录
Google Kubernetes Engine (GKE)
GKE AI/ML
免费开始使用吧
概览
指南
文档
更多
概览
指南
控制台
Discover
GKE 上的 AI/机器学习工作负载简介
探索 GKE 文档
概览
主要 GKE 文档
GKE AI/机器学习文档
GKE 网络文档
GKE 安全文档
GKE 舰队管理文档
选择如何在 GKE 上获取和使用加速器
使用 Gemini 设计资源可获取性
GKE AI/机器学习一致性
开始使用
为何使用 GKE 进行 AI/机器学习推理
GKE 中 AI/机器学习工作负载的简化自动扩缩概念
快速入门:在 GKE 上部署您的第一个 AI 模型
部署 AI 模型以进行推理
GKE 上的 AI/机器学习模型推理简介
使用 GKE 推理快速入门分析模型部署性能和费用
使用 GKE 推理网关公开 AI 应用
推理最佳实践
概览
为推理选择负载均衡策略
自动扩缩 GPU 上的推理工作负载
自动扩缩 TPU 上的 LLM 推理工作负载
优化 GPU 上的 LLM 推理工作负载
优化批处理推理工作负载
试用推理示例
GPU
通过 vLLM 使用 GPU 部署 Gemma 开放模型
部署 DeepSeek-R1 671B 或 Llama 3.1 405B 等 LLM
使用 GKE 推理网关提供 LLM
通过多个 GPU 提供 LLM
使用 Torch Serve 部署 T5
TPU
通过 vLLM 在 TPU 上部署 Llama
通过 JetStream 和 Pathways 使用多主机 TPU 部署 LLM
通过 MaxDiffusion 在 TPU 上部署 Stable Diffusion XL
使用 Terraform 在 TPU 上部署开放模型
大规模训练 AI 模型
使用多层级检查点训练大规模模型
尝试训练样本
在 GKE Standard 模式下使用 GPU 训练模型
在 GKE Autopilot 模式下使用 GPU 训练模型
使用 Megatron-LM 在 GPU 上训练 Llama 模型
使用 JAX 在 GKE 上通过 TPU 微调 LLM
在 GKE 上运行强化学习工作负载
使用 verl 微调和扩缩强化学习
使用 NeMo RL 微调和扩缩强化学习
使用 OpenTelemetry 监控强化学习工作负载
部署和编排 AI 代理
使用 ADK 和 Agent Platform API 部署 AI 代理
使用 ADK 和自托管 LLM 部署 AI 代理
利用 Agent Substrate 扩缩 AI 智能体工作负载
Agent Substrate 简介
在 GKE 上安装 Agent Substrate
使用智能体沙盒保护 AI 智能体工作负载
Agent Sandbox 简介
为 AI 智能体工作负载选择存储
在 GKE 上启用 Agent Sandbox
使用 Agent Sandbox 隔离 AI 代码执行
管理 Agent Sandbox 存储空间
保存和恢复 Agent Sandbox 环境
从集群内部触发 Agent Sandbox 快照
使用 Ray 开发分布式 AI/机器学习应用
Ray on GKE 简介
快速入门:在 GKE 上部署您的第一个 Ray 应用
通过 Ray Operator 插件启用托管式 KubeRay
在 GKE 上使用 Ray 部署 AI/机器学习工作负载
在 GKE 上使用 Ray Serve 部署 AI 模型
使用 Ray Serve 在 GPU 上部署 LLM
使用多集群 Ray Serve 和推理网关部署 LLM
使用 Ray Serve 在 TPU 上部署 LLM
通过 Ray 使用 GKE 中的多主机 TPU 应用 Gemma 开放模型
使用 Ray 在 GPU 上部署 diffusion 模型
使用 Ray 在 TPU 上部署 diffusion 模型
在 GKE 上使用 Ray 训练 AI 模型
使用 PyTorch、Ray 和 GKE 进行训练
使用 GKE 中的 TPU 通过 Jax 和 Ray Train 训练 LLM
在 GKE 上使用 Ray Train 在 TPU 上进行多切片训练和弹性训练
使用 Kueue 在团队之间共享计算资源
在多种计算选项中更快地启动 RayJob
将 GPU 与 Ray on GKE 搭配使用
使用 A4X 和 GB200 设置 GKE 上的 Ray
在 GKE 上将 TPU 与 Ray 搭配使用
使用 TPU Trillium 在 GKE 上设置 Ray
使用 DWS 和 Kueue 在 TPU 上优化 AI 训练
监控 GKE 上的 Ray
查看 GKE 上 Ray Operator 的日志
查看 GKE 上 Ray 集群的日志和指标
使用 Ray History Server 调试已完成的 Ray 作业
针对 HPC 和 AI/机器学习工作负载使用 Slurm Operator
GKE 上的 Slurm 简介
快速入门:在 GKE 上部署 Slurm 集群
启用 Slurm Operator 插件
构建自定义 Slurm Docker 映像
使用指标自动扩缩 Slurm 集群
为 GKE 上的 Slurm 配置共享存储空间
为 Slurm 配置 Filestore
适用于 Slurm 的 Managed Lustre
管理 GKE 上的 GPU
GPU 简介
为 AI/机器学习工作负载配置 GPU
使用 AI Hypercomputer 配置 A3 或 A4 虚拟机
在 Standard 集群中部署 GPU 工作负载
在 Autopilot 集群中部署 GPU 工作负载
为 GPU 上的 LLM 工作负载配置自动扩缩
使用 NVIDIA GPU Operator 管理 GPU 栈
就地加密 GPU 工作负载
为高性能计算 (HPC) 预配资源
部署 AI Hypercomputer 集群(A3、A4 虚拟机)
通过 GPU 共享策略优化 GPU 利用率
GKE 上的 GPU 共享策略简介
使用多实例 GPU
配置分时 GPU
使用 NVIDIA MPS
使用灵活启动优化 GPU 预配
概览
使用灵活启动运行大规模工作负载
使用 GPU 和灵活启动运行小型批量工作负载
管理 GKE 上的 TPU
TPU 简介
版本
Ironwood (TPU7x)
规划 GKE 上的 TPU
为 AI/机器学习工作负载配置 TPU
在 Standard 集群上部署 TPU 工作负载
在 Autopilot 集群上部署 TPU 工作负载
通过自动联网部署高性能 TPU 工作负载
在 GKE 上部署 TPU 多切片
使用 JobSet 和 Kueue 编排 TPU 多切片工作负载
为 TPU 上的 LLM 工作负载配置自动扩缩
使用灵活启动优化 TPU 预配
概览
使用 TPU 和灵活启动运行小型批量工作负载
在日历模式下请求具有未来预留的 TPU
通过动态切分优化 TPU 利用率
TPU 全容量模式简介
TPU 动态切片简介
概览
将动态切片与自定义调度器搭配使用
使用 Kueue 和 TAS 调度动态切片
管理 GPU 和 TPU 的 GKE 节点中断
GPU 和 TPU 的节点中断简介
使用 Kueue 进行作业排队和资源优化
在 GKE 上运行批处理工作负载的最佳实践
使用 Kueue 部署批处理系统
使用配额共享实现 Job 排队系统
针对混合 AI/机器学习训练和推理工作负载优化资源利用率