2026年8月27日,英伟达更新官方信息称,面向自主智能体工作负载的Vera CPU已开始规模出货,AWS收到首台Vera CPU服务器。此前一天,AWS与英伟达宣布将合作把Vera CPU基础设施引入AWS。两项进展说明,Vera正在从样机验证走向云端部署,但“开始规模出货”并不等同于各地区、各型号服务器已经全面商用。英伟达8月27日更新 AWS 8月26日公告
变化一:服务器将从“GPU主导”转向CPU与GPU分工协同
传统生成式AI服务器主要关注GPU数量、显存容量和互联带宽,但自主智能体并非只进行一次模型推理。它还要拆解任务、调用工具、检索长上下文、运行代码、访问数据库,并在多个步骤之间校验结果。这些环节往往由CPU承担。如果CPU侧响应慢,即使GPU计算能力充足,也可能因等待数据、工具返回或调度指令而出现利用率下降。
Vera的架构意义正在于重新强化CPU在AI服务器中的位置。英伟达披露,Vera配置88个自研Olympus核心,内存带宽为1.2TB/s,并宣称其在自主智能体工作负载中的单核性能最高可达对比平台的1.8倍。相关数字来自厂商测试,实际收益仍取决于智能体框架、并发量、数据库类型及软件适配情况,因此不能直接视为所有业务的普遍提升。Vera出货说明 Vera产品资料
变化二:自主智能体可能采用“计算分区”而非整机混跑
Vera规模部署后,一台服务器内部的任务划分可能更清晰:GPU负责大模型推理、张量计算和批量生成,CPU负责沙箱执行、工作流编排、数据预处理及工具调用。运维团队也可能把智能体运行环境拆成独立资源池,让不同租户或不同任务拥有隔离的CPU执行空间,再通过高速互联访问GPU推理服务。
这种设计有望减少大量轻量任务对GPU资源的挤占。例如,智能体生成一段代码后,需要在隔离环境中编译、测试并读取结果。如果这些步骤全部占用昂贵的GPU节点,成本和调度复杂度都会增加。将其放到高性能CPU侧执行,可以让GPU更多时间用于模型计算。不过,企业必须同步解决容器隔离、权限控制、敏感数据访问和工具调用审计问题,不能为了提高吞吐量而允许智能体获得不受限制的系统权限。
变化三:能效评价将从芯片功耗转向“每个任务的总能耗”
自主智能体通常包含多轮推理和多次外部操作,只比较CPU或GPU的额定功耗,难以反映真实效率。更有价值的指标将是完成一次有效任务消耗多少电力、需要多少秒,以及期间GPU有多少时间处于等待状态。更快的CPU即使瞬时功耗并不低,只要能缩短任务时间、减少重复推理并提高GPU利用率,整套系统的单位任务能耗就可能下降。
Vera采用高带宽LPDDR5X内存,厂商希望通过提高每核可获得的内存带宽,缓解并发沙箱、检索和数据处理中的瓶颈。对服务器设计而言,这意味着能效优化不再只是降低单颗芯片功率,还包括减少CPU与GPU之间的数据搬运、压缩闲置时间,以及让网络、存储和内存按照智能体实际负载协同运行。最终效果需要第三方基准和生产环境数据验证,现阶段不宜把厂商标称性能直接换算成固定比例的机房节电量。
变化四:机架设计会更重视液冷、内存带宽与高速互联
当大量自主智能体并发运行时,CPU侧的持续负载会明显上升,服务器不再只是GPU产生高热量。高密度CPU、内存和网络设备共同工作,将推动液冷覆盖范围从GPU模块扩展到更完整的机架。与此同时,智能体频繁调用向量数据库、对象存储和远程工具,网络延迟与存储吞吐也会成为系统能效的一部分。
AWS在2026年8月26日的公告中表示,双方将把Vera CPU基础设施引入AWS,并进一步整合英伟达平台与AWS Nitro System和Elastic Fabric Adapter。这说明云端Vera服务器不会作为孤立主机存在,而会进入安全隔离、弹性网络和集群管理体系。对企业用户而言,未来采购重点应从“买哪颗CPU”转为“该平台是否具备成熟的驱动、虚拟化、监控、备件和服务支持”。AWS与英伟达合作公告 AWS首台Vera服务器交付信息
企业部署前应重点验证什么
- 测量CPU等待时间:先确认代码执行、检索、数据库查询和任务编排是否已经限制GPU利用率。
- 检查软件兼容性:Vera基于Arm架构,现有x86容器、商业软件、驱动程序和内部工具可能需要重新构建或验证。
- 建立任务级能效指标:同时记录任务成功率、完成时间、CPU与GPU利用率以及整机功耗,避免只看单项峰值性能。
- 验证安全边界:对智能体的工具权限、网络访问、代码沙箱和操作日志设置最小权限与人工接管机制。
- 区分出货与可采购性:要求供应商明确服务器型号、交付周期、地区可用性、保修范围和生产环境支持清单。
总结
Vera CPU规模出货带来的核心变化,不只是服务器更换一颗处理器,而是自主智能体基础设施开始围绕“CPU执行与编排、GPU模型计算、网络和存储协同”重新设计。其潜在价值是减少GPU等待、提高并发沙箱处理能力,并以更短的任务完成时间改善整体能效。但在第三方实测和大规模生产数据充分出现之前,企业应把厂商指标视为选型线索,而非确定收益。最稳妥的路径是从真实智能体流程中寻找CPU瓶颈,再通过小规模测试比较单位成功任务的成本、延迟与能耗。