- FlexSysAI 和 ResetData 正与 CSIRO、University of Queensland 合作,在一套实际运行中的 Nvidia H200 集群上测试可灵活调度的 AI 工作负载
- 该试点将检验,能否在不影响重要工作负载的情况下,将紧迫性较低的计算任务移至电网承压时段之外
事实
FlexSysAI 已与 ResetData、CSIRO 和 University of Queensland 在澳大利亚启动一项试点,以测试 AI 计算需求能否随电网状况变化作出响应。
该平台运行在 ResetData 的 AI-F1 设施内的一套 Nvidia H200 集群上。它按可调度程度对工作负载分组,在保护关键任务的同时,允许在电网承压时降低紧迫性较低的训练任务负载,或将这些任务转移到其他时段。CSIRO 和 University of Queensland 将独立分析试验数据。
FlexSysAI 的初步建模显示,在收到电网信号后的数秒内,ResetData 的 GPU 工作负载调整幅度可能达到 20% 至 50%。这一数字指计算工作负载的变化,并不代表已测得该设施总用电量出现同等幅度的下降。
合作方表示,目前仍缺少实际运行数据来说明 AI 设施提供这类灵活性的可靠程度。该试点旨在帮助填补这一空白。
分析
这项试验的思路很简单:并非每项 AI 任务都必须在同一时间运行。如果能在电网承压时延后或转移紧迫性较低的任务,数据中心就可能在维持重要任务运行的同时,降低部分用电需求。
更难的问题在于之后会发生什么。暂停的任务最终仍须完成,因此试验需要证明,转移这些任务不会给客户造成延误,也不会只是把大量用电需求整体推迟到另一个时段。这正是研究人员考察实际运行数据、而非仅依赖建模的原因。
对 BTW 读者而言,真正有用的结果将是能够说明以下问题的证据:实际可转移多少需求、设施能多快作出响应,以及延后的工作负载能否仍按预期完成。只有获得这些证据,电网运营方才能判断可灵活调度的 AI 计算在电网规划中是否有用。
后续关注
关注 CSIRO 和 University of Queensland 是否会发布结果,说明在电网响应事件期间转移了多少工作负载,以及之后发生了什么。如果有证据表明,延后的任务可以在不影响服务的情况下完成,这将构成比目前单靠建模更有力的检验。
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance
