2026年8月26日,AWS与英伟达宣布扩大长期合作,计划在2027年至2028年向AWS全球基础设施新增部署200万块英伟达GPU。此次合作还覆盖Vera CPU、NVLink Fusion、高带宽内存、网络、安全、开放模型、数据处理和机器人技术。需要特别说明的是,这200万块GPU是未来两年的部署计划,并非已经全部上线。AWS公告[1]与英伟达公告[2]对部署规模和时间范围的表述一致。
GPU供给增加,不等于训练价格立即下降
从企业视角看,新增200万块GPU最直接的意义是缓解高端加速计算资源的供给约束。当可用容量扩大后,企业更容易申请到大规模训练集群,排队等待、跨区域迁移以及为锁定稀缺实例而提前预留资源的压力都有望降低。但是,两家公司目前并未公布具体GPU型号组合、实例价格、区域投放节奏或折扣方案,因此不能简单推导出“训练成本将下降多少”。可以合理预期的是,成本结构会先从资源稀缺导致的额外支出,逐渐转向对利用率、工程效率和采购方式的精细管理。AWS公告[1]英伟达公告[2]
企业真正需要关注的是单位有效算力成本
模型训练账单并不只取决于单块GPU每小时的价格,还取决于集群通信效率、故障恢复时间、数据读取速度、GPU空闲比例以及完成一次训练所需的总时长。假设实例单价不变,如果网络和软件优化让同一批GPU更长时间处于有效计算状态,企业完成相同训练任务所需的总GPU小时数仍可能减少。此次合作提出将英伟达平台与AWS Nitro System、Elastic Fabric Adapter结合,并扩展NVLink Fusion相关能力,这表明双方希望优化的不只是芯片数量,也包括大规模集群的连接、安全与可靠性。AWS发布资料[1]英伟达发布资料[2]
网络效率可能成为隐藏的降本杠杆
大模型训练规模扩大后,GPU之间需要频繁交换梯度和参数。一旦网络吞吐不足,昂贵的加速器就会等待通信,账单继续累积,却没有产生等比例的训练进展。因此,对企业而言,判断新一代AWS集群是否更便宜,不能只比较GPU实例标价,还应比较每个训练步骤耗时、集群扩展效率、通信等待占比和失败重跑频率。双方公布的合作范围包括高级网络及EFA集成,但尚无足够公开基准证明具体任务能节省多少成本,企业仍需通过自己的模型与数据进行测试。AWS公告说明[1]英伟达公告说明[2]
更充足的容量将改变企业的采购策略
在GPU紧缺时期,企业往往倾向于提前锁定较长周期的资源,以换取确定性,但这也可能造成预留过多和利用率不足。如果AWS按计划扩大容量,企业可以把训练任务拆分为更灵活的资源组合:稳定的基础训练使用长期容量,阶段性扩容使用按需资源,可中断或容错性较高的任务则探索更低成本的实例。供给改善有望降低企业为了“确保有卡可用”而承担的容量保险成本,不过最终效果仍取决于AWS未来公布的实例类型、区域可用性和计费机制。Amazon合作解读[3]英伟达公告[2]
英伟达GPU与AWS自研芯片将形成组合选择
AWS并未把企业训练路径限定在英伟达GPU上。Amazon的合作解读明确提到,新增英伟达资源将与AWS自研Trainium芯片形成互补,使客户可以根据工作负载选择英伟达GPU、Trainium或混合方案。对企业来说,这种选择权可能比单纯增加GPU数量更重要:成熟的CUDA工作流可以继续运行在英伟达平台上,而能够承担迁移和适配工作的团队,则可以评估Trainium在特定训练任务中的成本表现。竞争和异构计算选择增加,有助于降低对单一硬件路线的依赖,但软件迁移、算子兼容与团队学习成本也必须纳入总拥有成本。Amazon官方解读[3]AWS新闻稿[1]
训练之外,数据管道也会影响最终账单
此次合作还涉及在Amazon EMR和Amazon OpenSearch中使用英伟达cuDF、cuVS等CUDA-X库,加速数据处理和向量索引。模型训练项目的成本并不只发生在训练阶段,数据清洗、特征处理、检索索引构建和实验准备同样消耗大量计算时间。如果这些环节能够使用统一的加速基础设施,企业可能缩短端到端项目周期,并减少GPU等待数据的情况。不过,官方目前只公布了合作方向,没有提供适用于所有客户的统一成本收益数字,实际节省程度会受到数据规模、存储架构和工作负载特征影响。AWS合作清单[1]英伟达合作清单[2]
企业现在可以做的四项准备
- 建立基准账本:记录现有训练任务的GPU小时数、平均利用率、通信等待时间、失败重跑次数和数据准备时长,以便未来比较新实例的真实收益。
- 按工作负载分类:将预训练、微调、强化学习、推理和向量检索分别评估,避免用同一种实例承担全部任务。
- 保留多硬件路线:优先使用可移植的训练框架和容器化环境,同时测试英伟达GPU与Trainium,防止采购策略被单一平台锁定。
- 关注上线节奏:持续跟踪2027年至2028年的区域、实例型号、容量与价格公告,在正式信息发布前不要把尚未上线的GPU计入预算节省。
总结
AWS与英伟达新增部署200万块GPU,短期内不会自动转化为统一降价,但可能从三个层面改变企业模型训练成本:增加供给并减少资源等待,提高网络与集群效率以降低单位有效算力成本,以及通过英伟达GPU、AWS Trainium和配套数据工具提供更多架构选择。企业不应只盯着每小时实例价格,而应把完成一次可用模型训练所需的总时间、数据处理、迁移投入、故障风险和容量承诺放在同一张成本表中。最终谁能真正受益,取决于是否具备持续测量利用率、灵活调度工作负载和比较不同硬件路线的能力。
事件及资料日期:2026年8月26日。部署计划覆盖2027年至2028年,信息经AWS官方新闻稿[1]、英伟达官方新闻稿[2]及Amazon官方解读[3]交叉核验。