通用 GPU 针对以下人工智能 (AI) 和机器学习 (ML) 工作负载进行了优化:优先考虑运营灵活性、资源独立性和成本效益。
借助通用 GPU,团队可以完全自主地部署和扩缩 NVIDIA 加速器,从而绕过协调式超级计算集群的架构复杂性。它们非常适合优先考虑高可用性、自助服务配置和独立伸缩的工作负载。常见用例包括实时推理、RAG、原型设计以及中小型模型训练。
通用 GPU 的主要特征
- 操作灵活性:您可以使用标准 GKE(Autopilot 和 Standard)和 Compute Engine 接口来管理资源,从而简化部署和伸缩。
- 高可用性: Google Cloud 独立更新各个实例,以帮助确保一个节点上的更新不会影响其他节点的可用性,从而使负载均衡器能够重定向流量,而不会导致服务舰队停滞。
- 网络简单易用:工作负载使用标准虚拟私有云 (VPC) 服务和标准 TCP/IP over Google 虚拟 NIC (gVNIC) 接口,无需复杂的硬件级光纤交换结构。
- 费用优化:您可以将 Spot 虚拟机用于容错型研究,与标准按需费率相比,可节省高达 90% 的费用。
- 自助获取:您可以直接通过标准预留和按需请求获取容量,而无需使用由客户服务团队管理的工作流。
常规 GPU 系列和技术规格
查看通用 GPU 机器系列的工作负载和硬件规格。如需实现高吞吐量服务,请使用 A3 Edge 系列。
A3 系列(High,具有 1 个、2 个或 4 个 GPU;Edge)
A3 High(1、2 或 4 个 GPU)
如果您运行的推理或标准训练工作负载需要高性能,但不需要完整的 8-GPU 同步集群,请使用附加了 1 个、2 个或 4 个 GPU 的 A3 High 机器系列。
A3 High 机器类型配备 NVIDIA H100 SXM GPU,非常适合大型模型推理和模型微调。
| 挂接了 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6000 | 5 | 1000 | 8 | 640 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
A3 Edge
如果您要在多个主机上运行高吞吐量分布式推理工作负载,但没有协调的集群结构,请使用 A3 Edge 系列来简化通过标准虚拟专用网络的部署。