跳至主要内容
文档
close
开始使用
Google Cloud 使用入门
商品列表
Cloud Customer Care
精选产品
Agent Platform
Apigee API Management
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
交互的能力
Looker
跨产品工具
访问权限和资源管理
费用和用量管理
基础设施即代码
SDK、语言、框架和工具
技术领域
AI 和机器学习
应用开发
应用托管
计算
数据分析和流水线
数据库
分布式云、混合云和多云
行业解决方案
迁移
网络
可观测性和监控
安全
Storage
/
控制台
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
登录
AI Hypercomputer
免费开始使用吧
概览
指南
资源
文档
更多
概览
指南
资源
控制台
Discover
概览
选择加速器基础设施
选择编排器和部署选项
加速器
GPU 加速器简介
通用 GPU
集群 GPU
性能优化型基础架构
网络服务
GPU 网络概览
部署的网络服务
网络最佳实践
存储服务
开源软件
操作系统映像和 Docker 映像
选择使用选项
集群管理
集群管理概览
集群管理配置
术语
开始使用
规划和创建 AI 基础架构
在通用 GPU 和集群 GPU 之间进行选择
使用 Gemini 设计 AI 基础设施
获取容量和配额
概览
预留容量
查看预留容量
快速入门
创建具有 A4 虚拟机的全代管式 Slurm 集群
创建具有 A4 虚拟机的自行管理的 Slurm 集群
部署基础架构
部署选项概览
紧凑布置政策和工作负载政策概览
部署 AI 优化型虚拟机和集群
创建 GKE 集群
创建具有默认配置的 AI 优化型 GKE 集群
创建使用 A4X Max 的自定义 AI 优化型 GKE 集群
创建使用 A4X 的自定义 AI 优化型 GKE 集群
创建使用 A4 或 A3 Ultra 的自定义 AI 优化型 GKE 集群
创建使用 A3 Mega 或 A3 High 的 GKE Standard 集群
创建使用 A3 Mega 或 A3 High 的 GKE Autopilot 集群
创建使用 A3 Edge 的自定义 AI 优化型 GKE 集群
创建使用 A2 的自定义 AI 优化型 GKE 集群
创建使用 G2 或 G4 的自定义 AI 优化型 GKE 集群
创建使用 N1 的自定义 AI 优化型 GKE 集群
创建 Slurm 集群
创建全代管式集群
创建自行管理的集群
创建实例
创建 A4X Max
创建 A4X
创建 A4 或 A3 Ultra
创建 A3 High 或 A3 Mega
创建 A3 Edge
创建 A2
创建 G4
创建 G2
创建具有 GPU 的 N1
批量创建实例
创建 A4X Max
创建 A4X
创建 A4 或 A3 Ultra
创建 A3 High 或 A3 Mega
创建 A3 Edge
创建 A2
创建 G4
创建 G2
创建具有 GPU 的 N1
创建一个托管式实例组 (MIG)
创建 A4X Max
创建 A4X
创建 A4 或 A3 Ultra
创建 A3 High 或 A3 Mega
创建 A3 Edge
创建 A2
创建 G4
创建 G2
创建具有 GPU 的 N1
运行工作负载
通过 Cloud 上的 Pathway 运行工作负载
Pathways on Cloud 简介
通过 Pathway 创建 GKE 集群
使用 Pathways 运行批量工作负载
使用 Pathways 运行交互式工作负载
使用 Pathways 执行多主机推理
通过 Pathways 进行弹性训练
将 JAX 工作负载移植到 Pathways
排查 Pathways on Cloud 问题
调度 GKE 工作负载
使用拓扑感知调度 (TAS) 安排工作负载
启用节点健康状况预测
使用 Kueue 编排工作负载
AI 工作负载教程
概览
GPU
在 GKE 上使用 vLLM 运行推理
DeepSeek V3.1
DeepSeek V3.2-Speciale
Gemma 3
GPT-OSS
Llama 4
Qwen3
运行微调
GKE 集群上的 Gemma 3
多主机 GKE 集群上的 Gemma 3
Slurm 集群上的 Gemma 3
GKE 上用于视觉任务的 Gemma 3
Slurm 集群上的 Llama 4
Slurm 集群上的 Mixtral-8x7b
运行训练
Slurm 集群上的 Qwen2
TPU
提供工作负载
通过 vLLM 在 TPU 上部署 Qwen2-7B
通过 vLLM 在 TPU 上部署 Qwen2-7B-Instruct
通过 vLLM 在 TPU 上部署 Qwen3-8B-Base
通过 vLLM 在 TPU 上部署 Llama-3.1-8B
运行微调
在多主机 TPU v6e 上针对 Gemma 4 31B 运行 SFT
在搭载 MaxText 的 TPU 虚拟机上运行监督式微调
在 v6e-8 TPU 虚拟机上运行强化学习训练
在 TPU v6e 上运行 Gemma 4 26B 的多主机强化学习训练
在 TPU v6e 上的 Qwen3-30B-A3B 上运行多主机强化学习训练
管理基础架构
管理 GKE 集群
查看 GKE 节点拓扑
管理 AI 优化型 GKE 集群
管理实例和 Slurm 集群
查看实例的拓扑
管理主机活动
实例中的主机事件
预留中的主机事件
报告有故障的主机
测试和优化
使用 NCCL/gIB 优化集群网络
将 NCCL/gIB 集成到工作负载中
安装 gIB NCCL 插件
在 NVIDIA NGC 容器中使用 gIB NCCL 插件
运行 NCCL 测试
在 Compute Engine 实例上运行 NCCL
在采用默认配置的 GKE 集群上运行 NCCL
在采用 A4X Max 的自定义 GKE 集群上运行 NCCL
在采用 A4X 的自定义 GKE 集群上运行 NCCL
在采用 A4 或 A3 Ultra 的自定义 GKE 集群上运行 NCCL
在使用 A3 Mega 或 A3 High 的自定义 GKE 集群上运行 NCCL