亚马逊云科技(AWS)正在重建其云服务的部分架构,其前提是:最活跃的用户很快将不再是人,而是AI智能体。AWS首席执行官马特·加曼表示,编程智能体如今已能自行编写代码、选择数据库并部署基础设施,而从账户设置、数据库持久性到权限,那些为人类工程师所做的设计已不再适用。他还介绍了AWS如何分配紧缺的GPU,以及自研芯片Graviton和Trainium目前扮演的角色。

增长仍处于早期阶段

AWS的年营收规模约为$1690亿-1700亿,增速约为37%。加曼认为,云计算仍处于早期阶段:全球大部分企业工作负载仍留在本地数据中心,而AWS正同时乘着两股浪潮,一是这些工作负载持续向云端迁移,二是生成式AI带来的需求激增。

初创企业仍是这一进程的核心。2005年,加曼在商学院就读期间到AWS实习,研究哪类客户会最先看重云基础设施,并得出结论:按用量付费免去了服务器的前期投入,因此初创企业将是最早的客户。他估计,如今AWS营收的30%至40%来自最初在AWS上起步的初创企业。初创企业对AWS服务的要求比银行、医院或政府机构更高、更急,它们的需求往往预示着大型企业三到五年后会提出的要求。

变化在于初创企业的规模。过去,创始人大约融资$1000万,然后慢慢打磨一款应用。如今,头部AI初创企业起步时就拥有$2亿融资和$10亿估值,主要原因是训练模型和采购GPU的成本极高。但加曼指出,它们面临的基本难题依旧相同:扩展性、性能、安全和访问管理。

智能体对云的需求

几秒钟即可使用的账户

以往开通AWS,需要先配置虚拟私有云(VPC,即AWS内部的私有网络)、子网、路由表以及决定谁能做什么的IAM角色。当开发者把云凭证交给Cursor、Claude或Codex等编程智能体,让它构建并部署应用时,这些繁琐步骤就成了障碍。

AWS正在逐步推出一种新的注册方式:用户可以使用Gmail账户等常见身份登录,起初无需填写信用卡,不到30秒就能获得一个可用账户,网络和安全的默认设置会在后台自动完成。这并不是功能受限的试用账户。企业发展壮大后,如需建立正式的组织架构或进行精细设置,可以直接在同一账户中修改,无需迁移。该功能仍在推广中,因此可能尚未在所有地区可用。

用完即弃的资源

长期以来,AWS一直按照“五个九”(99.999%)的持久性和可用性来设计Amazon Aurora等服务。但智能体需要的往往完全不同:为某个中间步骤创建一个临时数据库,几秒钟后就将其丢弃。在加曼看来,为此配置多区域复制属于过度设计。AWS正在探索能够以毫秒级创建和销毁、同时在需要时仍可长期保存的资源,目标是让智能体在三秒内完成数据库的创建和查询。

范围有限的临时权限与沙箱

为人类或固定服务角色设计的IAM权限并不适合智能体,因为智能体不应持有范围宽泛、长期有效的凭证。AWS正在构建有时限的权限机制,只为智能体提供完成某一项子任务所需的工具和范围。

智能体还需要隔离。它们生成的代码应在能够即时启动、同时边界牢固的沙箱中运行。AWS使用的是约十年前自主开发的microVM(一种非常轻量的虚拟机)技术Firecracker,它启动速度快、隔离性强。AI领域新涌现的许多沙箱初创企业也直接基于Firecracker构建服务。

小型机器人智能体各自在透明立方体中工作,周围环绕着逐渐消失的计时圈

▲ 限时权限与隔离沙箱

可预测的尾部延迟

智能体工作流会按顺序串联数百个操作,因此偶尔出现的慢响应会不断累积。这被称为尾部延迟,用Amazon S3的p99.9等指标来衡量。人可以容忍偶尔的延迟,但在智能体的循环中,延迟会层层叠加。加曼认为,AWS多年来致力于降低尾部延迟,这对智能体工作负载而言是一项实实在在的优势。

AWS还提供面向智能体的服务。Amazon Bedrock和AgentCore负责编排、记忆、网关以及模型与工具之间的权限边界,S3等核心服务也在针对非人类的访问模式进行调整。新推出的预览服务AWS Context在S3和Aurora等分散的数据存储之上增加了一层元数据,让智能体可以通过同一个接口进行查询。

AWS如何分配GPU

获取高端GPU是AI初创企业面临的最大瓶颈。AWS表示,客户提出的GPU需求中约有60%能以某种形式得到满足,通常是通过调整区域、时间或集群配置来实现。

AWS也避免把整个集群交给Anthropic、OpenAI和Meta等顶尖前沿AI实验室,而是与Salesforce、摩根大通等企业客户保持平衡,并为早期初创企业预留容量。任何单一客户在营收中的占比都被控制在个位数百分比。加曼将此与专门提供GPU的云服务商(即所谓“新云”)作对比,后者一两家AI企业就可能占到营收的30%至60%。

投入规模极其庞大。AWS计划在未来几年新增约200万块英伟达GPU,2026年的资本支出规模据称约为$2200亿。加曼否认存在泡沫,称企业客户在生产环境的AI工作负载上获得了正向回报。

决定扩张速度的是物理限制:电力、数据中心建设、内存与芯片,以及熟练人力。加曼援引了艾利·高德拉特所著《目标》一书中的约束理论,即解决一个瓶颈后,下一个瓶颈就会出现。解决了电力问题,约束就会转移到内存、台积电的封装、高带宽内存(HBM)或网络设备上。AWS如今会提前多年规划服务器容量,覆盖2026年至2028年,而发电和输电的规划则最长着眼于20年之后。

自研芯片战略

AWS的芯片研发始于13至14年前,当时服务器虚拟化正在大量占用计算资源。AWS将网络和存储虚拟化转移到专用卡上,并收购了生产搭载ARM内核板卡的初创公司Annapurna Labs。这催生了Nitro System和裸金属实例,而将这些ARM内核进一步扩展后,便诞生了服务器CPU Graviton。

芯片 用途 要点
Graviton 基于ARM的服务器CPU 成本降低约20%,性能提升约20%;AWS前100大客户中超过90%在使用
Inferentia AI推理 属于五到六年前启动的AI芯片计划
Trainium 3 AI训练与推理 第三代;容量到明年年底已基本被预订
Trainium 4 下一代AI芯片 已提前发布

在AWS每年部署的服务器处理器中,Graviton的数量最多,一些客户在整体迁移服务器集群后,服务器数量减少了一半。加曼称,迁移到Graviton是降低AWS账单最简单的方法。

据AWS介绍,Trainium虽名为“训练”,却已成为推理领域性价比最高的芯片之一。Amazon Bedrock的大部分推理都运行在Trainium上,Anthropic和OpenAI也都在使用Trainium。加曼甚至承认AWS不擅长给产品起名,并以Inferentia和Trainium容易混淆为例。

电路板上的定制芯片与周围的内存模块,远处可见发电厂和风力发电机

▲ 自研芯片与电力瓶颈

企业部署智能体的真正障碍是信任

如今大多数企业智能体仍保留人工审批环节,只是一步步照搬员工原有的流程。加曼建议企业从期望的结果出发重新设计,让智能体并行尝试数十条路径。

他表示,实现完全自主的最大障碍不是模型能力,而是信任。企业担心权限设置错误的智能体会删除生产数据库,这种顾虑合情合理,因此必须先建立护栏、细粒度的访问控制和严格的评估机制。AWS会派遣前置部署工程师参与为期45天的合作,帮助客户搭建评估体系和数据标注流程,随后将主导权交还给客户自己的团队,而不是用多年的咨询合同把客户绑住。

在数据方面,AWS强调,客户在Amazon Bedrock上的提示词和输入始终留在客户自己的VPC内,不会与模型提供商共享。加曼称Bedrock增长强劲,其中包括从OpenAI API迁移过来的工作负载,以及Anthropic的Claude模型和开放权重模型被迅速采用。在安全方面,AWS推出了Continuum,利用先进模型发现漏洞,并结合客户环境的实际情况为其排定优先级,其依据是防御也必须以机器的速度运行。

在亚马逊内部,所有公司员工都在使用Amazon Q。人力资源团队过去需要数周的规划工作如今几小时即可完成,财务团队用智能体审查税务和监管规则,工程师则越来越多地指挥成群的编程智能体。过去需要10名工程师完成的工作,现在由三四人的小团队承担。

开发者应关注什么

AWS押注智能体将成为云的主要用户。如果你在AWS上构建服务,可以参考以下几个实际步骤:

  • 给编程智能体授予范围有限、短期有效的权限,而不是宽泛的管理员权限,并在沙箱中运行它们的代码。
  • 对于智能体短时间使用的临时数据,不必配置生产级别的复制。
  • 对于多步骤智能体,应按p99和p99.9延迟而非平均值来比较服务。
  • 需要GPU时,在区域和硬件配置上保持灵活。
  • 想要降低成本,先检查哪些工作负载可以迁移到Graviton。
  • 在企业中部署智能体时,围绕结果重新设计流程,并在投入生产前建立评估机制和护栏。