据报道,AWS 要求工程师关注并关闭不再使用的 EC2 实例,同时通过计算优化器识别利用率较低的虚拟机。AI 应用对 GPU 和云计算资源的需求持续增加,也让企业重新审视算力使用效率、成本控制与合规管理。
今日技术观察 IT之家 8 月 7 日消息,据《The Information》今日报道,亚马逊 AWS 最近对工程师提出一项颇为“朴素”的要求,让他们关闭不再使用的云计算机。据报道,亚马逊此番要求主要针对闲置的 EC2 实例。随着 AI 正以越来越快的速度消耗计算资源,全球最大的云服务供应商也开始感受到算力紧缺的压力。数据显示,AWS 的资源利用低下问题非常严重,大约 65% 的 EC2 实例在 30 天测量周期内,平均 CPU 利用率低于 20% 01 背景速览 据《The Information》报道,AWS 近期要求工程师检查并关闭闲置的云计算机,重点涉及 EC2 实例。报道提到,在一个 30 天测量周期内,约 65% 的 EC2 实例平均 CPU 利用率低于 20%。AWS 还升级了计算优化器,通过分析 14 天内的 CPU 使用率和 IO 数据,标记峰值 CPU 利用率低于 15% 且网络流量较低的虚拟机,帮助识别可能被闲置的资源。 02 趋势影响 这一动向反映出,AI 训练和大语言模型运行正在增加对 GPU 及其他云计算资源的需求。报道同时提到,AWS 过去一年新增了 3.8 吉瓦的电力容量。对于云服务商和使用云基础设施的企业而言,算力供给、资源利用率、能源投入和服务成本之间的关系,可能会成为数字化建设中需要长期关注的问题。 03 企业应用启发 企业在推进智能客服、数据分析、软件开发辅助和业务自动化时,可以将资源管理纳入项目设计阶段。例如,根据业务负载设置实例启停策略,定期检查测试环境和临时环境,结合实际使用情况调整计算资源配置。对于涉及模型训练或推理的项目,也应记录资源使用情况,评估不同部署方式对成本、性能和业务连续性的影响,避免因缺少管理机制形成长期闲置。 04 合规观察 资源自动识别和关闭操作也需要充分考虑业务风险。企业应明确实例、数据、账号和应用之间的依赖关系,在执行停机或缩容前完成权限审核、备份验证和变更审批,并保留必要的操作记录。对于承载生产业务、重要数据或安全监测能力的资源,不能仅依据 CPU、IO 或网络流量等单一指标判断是否可以关闭,还应结合数据保护、访问控制、服务等级和应急恢复要求进行综合评估。 05 开放讨论 值得讨论的是:企业应如何建立云资源闲置识别、审批和回收的责任机制?在 AI 项目中,成本、性能、能源使用和数据合规应如何平衡?自动化关停策略需要设置哪些例外条件和回滚措施?对于软件开发团队而言,资源使用监控应由云平台团队统一负责,还是应纳入各项目团队的日常管理? 公开来源参考 AI 需求挤爆云计算,消息称 AWS 要求工程师关闭闲置服务器减少资源浪费