• FlexSysAI 和 ResetData 正与 CSIRO、University of Queensland 合作,在一套实际运行中的 Nvidia H200 集群上测试可灵活调度的 AI 工作负载
  • 该试点将检验,能否在不影响重要工作负载的情况下,将紧迫性较低的计算任务移至电网承压时段之外

事实

FlexSysAI 已与 ResetData、CSIRO 和 University of Queensland 在澳大利亚启动一项试点,以测试 AI 计算需求能否随电网状况变化作出响应。

该平台运行在 ResetData 的 AI-F1 设施内的一套 Nvidia H200 集群上。它按可调度程度对工作负载分组,在保护关键任务的同时,允许在电网承压时降低紧迫性较低的训练任务负载,或将这些任务转移到其他时段。CSIRO 和 University of Queensland 将独立分析试验数据。

FlexSysAI 的初步建模显示,在收到电网信号后的数秒内,ResetData 的 GPU 工作负载调整幅度可能达到 20% 至 50%。这一数字指计算工作负载的变化,并不代表已测得该设施总用电量出现同等幅度的下降。

合作方表示,目前仍缺少实际运行数据来说明 AI 设施提供这类灵活性的可靠程度。该试点旨在帮助填补这一空白。

分析

这项试验的思路很简单:并非每项 AI 任务都必须在同一时间运行。如果能在电网承压时延后或转移紧迫性较低的任务,数据中心就可能在维持重要任务运行的同时,降低部分用电需求。

更难的问题在于之后会发生什么。暂停的任务最终仍须完成,因此试验需要证明,转移这些任务不会给客户造成延误,也不会只是把大量用电需求整体推迟到另一个时段。这正是研究人员考察实际运行数据、而非仅依赖建模的原因。

对 BTW 读者而言,真正有用的结果将是能够说明以下问题的证据:实际可转移多少需求、设施能多快作出响应,以及延后的工作负载能否仍按预期完成。只有获得这些证据,电网运营方才能判断可灵活调度的 AI 计算在电网规划中是否有用。

后续关注

关注 CSIRO 和 University of Queensland 是否会发布结果,说明在电网响应事件期间转移了多少工作负载,以及之后发生了什么。如果有证据表明,延后的任务可以在不影响服务的情况下完成,这将构成比目前单靠建模更有力的检验。