全新的 AgentCore 运行时:弹性、优化且启动速度一致 | Amazon Web Services

📌 One-Sentence Summary AWS 为 Amazon Bedrock 推出全新的 AgentCore 运行时,通过动态内存回收和基于快照的冷启动,为生产环境中的 AI 智能体提供一致的性能和成本效率。 📝 Summary 全新的 AgentCore 运行时解决了生产级 AI 智能体在基础设施方面的关键瓶颈:昂贵的峰值内存计费和不稳定的冷启动延迟。通过实现按需内存分页和「快照与恢复」机制,该运行时将启动时间与镜像大小解耦,并确保计费追踪实际使用量而非最高水位线。基准测试显示,对于 200 MB 到 2 GB 的镜像,P75 冷启动延迟稳定在约 2 秒,显著改善了原运行时延迟随镜像大小线性增加的问题。此次更新支持从交互式聊天机器人到长期运行的自主工作负载等更广泛的智能体场景,同时减轻了管理备用环境的运维负担。 💡 Main Points 动态内存管理与成本优化 新运行时通过按需分页和对冷内存的积极回收,取代了「按峰值付费」模式,确保计费反映会话生命周期内的实际资源消耗。 通过环境快照实现一致的冷启动 通过捕获健康且已初始化的环境快照并在新实例中恢复,平台消除了重复的启动和初始化工作,使启动时间不再依赖于容器镜像的大小。 大幅降低大镜像的延迟 实测证明,对于高达 2 GB 的镜像,P75 冷启动延迟保持在 2 秒左右,而原运行时的延迟则从 5.4 秒一直攀升至近 30 秒。 支持多样化的智能体工作负载 基础设施已演进以支持从简单的问答机器人向「环境」智能体(Ambient Agents)的转变,这类智能体能够常驻、由事件触发并在无人值守的情况下长时间运行。 💬 Key Quotes 「由于镜像大小不再产生影响,新运行时在 200 MB 到 2 GB 的镜像范围内,均能提供约 2 秒的 P75 冷启动延迟。」 「内存会在会话结束的瞬间释放,无论规模或并发量如何,启动时间始终保持一致,且账单将追踪智能体实际完成的工作。」 「昂贵的启动工作仅需支付一次,每个实例都能立即继承该结果。」 📊 Article Meta AI Screening: 88 Source: AWS Artificial Intelligence Author: Evandro Franco Category: 人工智能 Language: 英文 Read Time: 11 min Word Count: 2560 Tags: AI 与智能应用 , 性能优化 , AI 工程 , AI Agent , Agent编排 Read Full Article
暂无评论,快来抢沙发~