导语:2026年8月26日,AWS与英伟达宣布扩大合作,计划于2027年至2028年在AWS全球基础设施中额外部署200万块英伟达GPU。此次扩容不仅涉及GPU,还覆盖Vera CPU、高速互连、开放模型、数据处理和机器人平台。AWS联合公告[1]与英伟达新闻稿[2]披露的信息一致。对云服务用户而言,更值得关注的问题是:如此大规模的算力投入,最终会不会让AI云服务明显降价?
扩容不等于GPU租金立即下降
新增200万块GPU首先解决的是供给能力和可用性,而不是直接承诺降价。根据双方公布的时间表,这批GPU将在2027年至2028年部署,包含Blackwell Ultra、Rubin和Rubin Ultra等不同代际产品。也就是说,扩容计划从公告到形成稳定、可售的云端资源仍需经历芯片交付、数据中心改造、联网测试和集群上线等环节。亚马逊官方说明[3]同样明确了部署周期和产品范围。
因此,短期内热门实例的按需价格未必会快速下调。对AWS而言,机房、电力、冷却、高速网络和运维都是GPU之外的重要成本。新一代芯片性能更高,但采购成本和配套基础设施投入也可能同步上升。更现实的变化可能是资源排队时间缩短、区域覆盖扩大,以及企业更容易获得长期容量,而不是单块GPU的标价立刻大幅下降。
定价竞争将转向“单位任务成本”
AI云服务的价格比较正在从“每小时租一块GPU多少钱”,转向“完成一次训练、生成一定数量Token或处理一批数据需要多少钱”。如果新平台能在更短时间内完成相同任务,即使实例小时单价没有降低,企业的总账单仍可能下降。AWS与英伟达还计划将GPU能力扩展至Amazon EMR和OpenSearch的数据处理与向量索引环节,并继续通过Bedrock和SageMaker提供Nemotron开放模型。英伟达投资者关系公告[4]对这些合作方向作出了说明。
这意味着未来的价格竞争可能围绕端到端效率展开。云厂商可以把计算、存储、网络、模型托管和推理优化打包报价,也可能推出按Token、按任务或按吞吐量计费的服务。用户看到的GPU单价不一定最低,但如果数据搬运更少、集群利用率更高,综合成本可能更有竞争力。
自研芯片将成为价格分层的重要工具
此次合作并不意味着AWS放弃自研芯片。相反,双方计划让AWS下一代Trainium与英伟达NVLink Fusion及定制高带宽内存技术进一步结合。联合公告[1]显示,AWS希望同时提供英伟达GPU和自研加速器,为不同负载提供更多选择。
这种异构策略有望形成更清晰的价格分层:需要CUDA生态、前沿模型训练或复杂并行计算的客户,可以选择高端英伟达实例;对成本敏感、模型结构相对稳定的训练和推理任务,则可能转向Trainium等方案。云平台也可以通过智能调度,把不同阶段的任务分配到更合适的硬件,从而减少昂贵GPU的空闲时间。
企业采购算力需要改变比较方法
面对超大规模扩容,企业不宜只等待公开价格下降,而应根据自身负载重新设计采购策略。
- 比较完整任务成本:同时测算训练时间、推理吞吐量、存储、网络流量和工程维护成本。
- 区分稳定负载与突发负载:长期稳定任务可考虑预留容量或长期承诺,实验性项目更适合按需或竞价实例。
- 避免绑定单一芯片:通过容器化、开放模型格式和可移植推理框架,降低在英伟达GPU、自研芯片及其他云平台之间迁移的难度。
- 关注区域差异:200万块GPU是全球部署计划,不代表所有区域会同时获得相同型号、容量和价格。
价格下降仍受三个变量制约
第一是部署兑现速度。200万块GPU属于未来两年的计划,实际供给还受芯片产能、先进封装、内存、电力和数据中心建设进度影响。第二是需求增长速度,如果智能体、企业自动化和物理AI的需求继续快速扩大,新增供给可能首先被新需求吸收。第三是云市场竞争,如果微软Azure、Google Cloud及其他服务商同步扩容,价格优惠和计费创新才更可能加速出现。
总结
AWS与英伟达新增部署200万块GPU,最先改变的可能不是公开价目表,而是AI算力的可获得性、产品分层和计费方式。未来云服务商更可能用更高吞吐量、异构芯片组合、长期容量折扣及按任务计费来降低客户的单位工作负载成本。对企业来说,判断算力是否真正变便宜,不能只看GPU每小时价格,而应看完成同一业务目标需要支付的总成本。
事件或资料日期:2026年8月26日。核心事实经AWS官方新闻稿[1]、英伟达官方新闻室[2]及亚马逊官方报道[3]交叉核验。双方公布的是2027年至2028年的部署计划,并未在公告中承诺具体降价幅度或统一降价时间。