摘要

  • Alibaba Cloud 和 Cambricon 以白金会员身份加入 PyTorch Foundation,Ant Group 则以金级会员身份加入
  • 白金会员身份使 Alibaba Cloud 和 Cambricon 在 Governing Board 和 Technical Advisory Council 获得席位

事实

Alibaba Cloud 和中国 AI 芯片制造商 Cambricon 于 9 月 8 日以白金会员身份加入 PyTorch Foundation,Ant Group 则以金级会员身份加入。该消息在上海举行的 PyTorch Conference China 期间公布。

白金会员身份使 Alibaba Cloud 和 Cambricon 各自在 PyTorch Foundation 的 Governing Board 和 Technical Advisory Council 拥有一个席位。PyTorch Foundation 表示,两家公司将与社区合作推进硬件和加速器支持。Huawei 也以现有会员和贡献者身份参加了此次活动,并非首次加入。

PyTorch 被广泛用于在不同处理器和加速器上构建及运行 AI 模型。其加速器集成文档显示,供应商需要在设备运行时、算子及相关软件层面提供支持。分布式训练还增加了另一项要求:分布在多个设备上的工作负载需要通信后端来协调设备之间的工作。

这些是 PyTorch 集成的一般要求,并不构成任何新会员产品存在特定兼容性问题的证据。

评估

会员身份使 Alibaba Cloud 和 Cambricon 得以正式参与 PyTorch 治理,但并不能告诉客户某个模型在特定系统上的运行效果。这仍取决于连接 PyTorch 与加速器的软件,以及更广泛的计算环境。

模型使用的算子需要得到加速器支持。若某个算子无法原生运行,软件可能采用其他执行路径,包括由 CPU 执行;这可以让模型继续运行,但会改变性能表现。更大规模的训练任务还增加了另一项要求:通信软件必须协调多个设备上的工作负载。因此,在单个加速器上测试成功,并不能说明同一工作负载在集群中的表现。

对 BTW 读者而言,有用的证据将来自已发布的软件和可重复的工作负载测试。原生算子支持、分布式训练集成以及代表性模型的测试结果,将表明新会员围绕 PyTorch 的工作是否正在改善实际部署。董事会席位表明参与;实际可运行的软件则说明客户能够使用什么。

后续关注

后续应关注 Alibaba Cloud 和 Cambricon 的新 PyTorch 集成、算子支持及分布式训练版本发布。可复现的工作负载测试应显示哪些算子可以原生运行、是否使用回退路径,以及任务在多个加速器上的表现。这些结果比单凭会员身份更能清楚衡量实际支持水平。

来源

  1. https://www.linuxfoundation.org/press/alibaba-cloud-ant-group-cambricon-and-huawei-come-together-in-shanghai-to-advance-the-open-source-ai-stack-at-pytorch-conference-china

  2. https://docs.pytorch.org/docs/2.14/accelerator/operators.html

  3. https://docs.pytorch.org/docs/main/accelerator/distributed.html