跳至主要内容
技术领域
close
AI 和机器学习
应用开发
应用托管
计算
数据分析和流水线
数据库
分布式云、混合云和多云
行业解决方案
迁移
网络
可观测性和监控
安全
Storage
跨产品工具
close
访问权限和资源管理
费用和用量管理
基础设施即代码
SDK、语言、框架和工具
/
控制台
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
登录
AI Hypercomputer
免费开始使用吧
概览
指南
资源
技术领域
更多
概览
指南
资源
跨产品工具
更多
控制台
Discover
概览
性能优化型基础架构
GPU 机器
网络服务
GPU 网络概览
部署的网络服务
网络最佳实践
存储服务
开源软件
操作系统映像和 Docker 映像
选择使用选项
集群管理
概览
配置
术语
开始使用
集群创建概览
使用 Gemini 设计基础架构
建议的配置
获取容量和配额
概览
预留容量
查看预留容量
快速入门
创建具有 A4 虚拟机的全代管式 Slurm 集群
创建具有 A4 虚拟机的自行管理的 Slurm 集群
部署基础架构
部署选项概览
紧凑布置政策和工作负载政策概览
部署 AI 优化型虚拟机和集群
创建 GKE 集群
创建具有默认配置的 AI 优化型 GKE 集群
创建使用 A4X Max 的自定义 AI 优化型 GKE 集群
创建使用 A4X 的自定义 AI 优化型 GKE 集群
创建使用 A4 或 A3 Ultra 的自定义 AI 优化型 GKE 集群
创建使用 A3 Mega 或 A3 High 的 GKE Standard 集群
创建使用 A3 Mega 或 A3 High 的 GKE Autopilot 集群
创建 Slurm 集群
创建全代管式集群
创建自行管理的集群
创建实例
创建 A4X Max
创建 A4X
创建 A4 或 A3 Ultra
创建 A3 High 或 A3 Mega
批量创建实例
创建 A4X Max
创建 A4X
创建 A4 或 A3 Ultra
创建 A3 High 或 A3 Mega
创建一个托管式实例组 (MIG)
创建 A4X Max
创建 A4X
创建 A4 或 A3 Ultra
创建 A3 High 或 A3 Mega
运行工作负载
通过 Cloud 上的 Pathway 运行工作负载
Pathways on Cloud 简介
通过 Pathway 创建 GKE 集群
使用 Pathways 运行批量工作负载
使用 Pathways 运行交互式工作负载
使用 Pathways 执行多主机推理
通过 Pathways 进行弹性训练
将 JAX 工作负载移植到 Pathways
排查 Pathways on Cloud 问题
调度 GKE 工作负载
使用拓扑感知调度 (TAS) 安排工作负载
启用节点健康状况预测
使用 Kueue 编排工作负载
AI 工作负载教程
概览
GPU
在 GKE 上使用 vLLM 运行推理
DeepSeek V3.1
DeepSeek V3.2-Speciale
Gemma 3
GPT-OSS
Llama 4
Qwen3
运行微调
GKE 集群上的 Gemma 3
Slurm 集群上的 Gemma 3
GKE 上用于视觉任务的 Gemma 3
Slurm 集群上的 Llama 4
Slurm 集群上的 Mixtral-8x7b
运行训练
Slurm 集群上的 Qwen2
TPU
提供工作负载
通过 vLLM 在 TPU 上部署 Qwen2-7B
通过 vLLM 在 TPU 上部署 Qwen2-7B-Instruct
通过 vLLM 在 TPU 上部署 Qwen3-8B-Base
通过 vLLM 在 TPU 上部署 Llama-3.1-8B
运行微调
在搭载 MaxText 的 TPU 虚拟机上运行监督式微调
在 v6e-8 TPU 虚拟机上运行强化学习训练
管理基础架构
管理 GKE 集群
查看 GKE 节点拓扑
管理 AI 优化型 GKE 集群
管理实例和 Slurm 集群
查看实例的拓扑
管理主机活动
实例中的主机事件
预留中的主机事件
报告有故障的主机
测试和优化
使用 NCCL/gIB 优化集群网络
将 NCCL/gIB 集成到工作负载中
安装 gIB NCCL 插件
在 NVIDIA NGC 容器中使用 gIB NCCL 插件
运行 NCCL 测试
在 Compute Engine 实例上运行 NCCL
在采用默认配置的 GKE 集群上运行 NCCL
在采用 A4X Max 的自定义 GKE 集群上运行 NCCL
在采用 A4X 的自定义 GKE 集群上运行 NCCL
在采用 A4 或 A3 Ultra 的自定义 GKE 集群上运行 NCCL
在具有 A3 Mega 或 A3 High 的自定义 GKE 集群上运行 NCCL
在 Slurm 集群上运行 NCCL
收集并了解 NCCL 日志以进行问题排查
使用配方测试工作负载
基准化分析方案
Goodput 优化方法
测试集群
NCCL/gIB 版本说明
NCCL/gIB 版本说明(x86 64 位)
NCCL/gIB 版本说明(ARM 64 位)
监控
监控虚拟机和 Slurm 集群