GPU 概览

通用 GPU 针对以下人工智能 (AI) 和机器学习 (ML) 工作负载进行了优化:优先考虑运营灵活性、资源独立性和成本效益。

借助通用 GPU,团队可以完全自主地部署和扩缩 NVIDIA 加速器,从而绕过协调式超级计算集群的架构复杂性。它们非常适合优先考虑高可用性、自助服务配置和独立伸缩的工作负载。常见用例包括实时推理、RAG、原型设计以及中小型模型训练。

通用 GPU 的主要特征

  • 操作灵活性:您可以使用标准 GKE(Autopilot 和 Standard)和 Compute Engine 接口来管理资源,从而简化部署和伸缩。
  • 高可用性: Google Cloud 独立更新各个实例,以帮助确保一个节点上的更新不会影响其他节点的可用性,从而使负载均衡器能够重定向流量,而不会导致服务舰队停滞。
  • 网络简单易用:工作负载使用标准虚拟私有云 (VPC) 服务和标准 TCP/IP over Google 虚拟 NIC (gVNIC) 接口,无需复杂的硬件级光纤交换结构。
  • 费用优化:您可以将 Spot 虚拟机用于容错型研究,与标准按需费率相比,可节省高达 90% 的费用。
  • 自助获取:您可以直接通过标准预留和按需请求获取容量,而无需使用由客户服务团队管理的工作流。

常规 GPU 系列和技术规格

查看通用 GPU 机器系列的工作负载和硬件规格。如需实现高吞吐量服务,请使用 A3 Edge 系列。

A3 系列(High,具有 1 个、2 个或 4 个 GPU;Edge)

A3 High(1、2 或 4 个 GPU)

如果您运行的推理或标准训练工作负载需要高性能,但不需要完整的 8-GPU 同步集群,请使用附加了 1 个、2 个或 4 个 GPU 的 A3 High 机器系列。

A3 High 机器类型配备 NVIDIA H100 SXM GPU,非常适合大型模型推理和模型微调。

挂接了 NVIDIA H100 GPU
机器类型 vCPU 数量1 实例内存 (GB) 已挂接的本地 SSD (GiB) 物理 NIC 数量 网络带宽上限 (Gbps)2 GPU 数量 GPU 内存3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1,500 1 50 2 160
a3-highgpu-4g 104 936 3000 1 100 4 320
a3-highgpu-8g 208 1,872 6000 5 1000 8 640

1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。

A3 Edge

如果您要在多个主机上运行高吞吐量分布式推理工作负载,但没有协调的集群结构,请使用 A3 Edge 系列来简化通过标准虚拟专用网络的部署。