Кратко

  • Alibaba Cloud и Cambricon стали платиновыми участниками PyTorch Foundation, а Ant Group — золотым участником
  • Платиновый статус даёт Alibaba Cloud и Cambricon места в Governing Board и Technical Advisory Council

Факт

8 сентября Alibaba Cloud и китайский производитель чипов для ИИ Cambricon присоединились к PyTorch Foundation как платиновые участники, а Ant Group — как золотой участник. Об этом объявили во время PyTorch Conference China в Шанхае.

Платиновый статус даёт Alibaba Cloud и Cambricon по одному месту в Governing Board и Technical Advisory Council при PyTorch Foundation. По заявлению фонда, обе компании будут вместе с сообществом работать над поддержкой оборудования и ускорителей. Huawei также участвовала в мероприятии как уже действующий член и участник разработки, а не вступала в фонд впервые.

PyTorch широко используется для создания и запуска моделей ИИ на разных процессорах и ускорителях. Документация по интеграции ускорителей показывает, что поставщики должны поддерживать среду выполнения устройств, вычислительные операторы и связанное ПО. Распределённое обучение добавляет ещё одно требование: рабочим нагрузкам, распределённым между несколькими устройствами, нужен коммуникационный бэкенд для координации их работы.

Это общие требования к интеграции с PyTorch, а не свидетельство конкретной проблемы совместимости с продуктами кого-либо из новых участников.

Оценка

Членство обеспечивает Alibaba Cloud и Cambricon официальное представительство в системе управления PyTorch, но само по себе не говорит заказчику, насколько хорошо модель будет работать на конкретной системе. Это по-прежнему зависит от ПО, которое связывает PyTorch с ускорителем, и от всей вычислительной среды.

Операции, которые использует модель, должны поддерживаться ускорителем. Если операция не может выполняться нативно, ПО может выбрать другой путь выполнения, в том числе перенести её на CPU: модель продолжит работать, но производительность может измениться. Для более крупных задач обучения возникает ещё одно требование: коммуникационное ПО должно координировать нагрузку между несколькими устройствами. Поэтому успешный тест на одном ускорителе ещё не показывает, как та же нагрузка будет работать в кластере.

Для читателей BTW наиболее полезными доказательствами станут выпущенное ПО и воспроизводимые тесты рабочих нагрузок. Нативная поддержка вычислительных операторов, интеграция распределённого обучения и результаты на репрезентативных моделях покажут, ведёт ли работа новых участников над PyTorch к улучшениям в реальных развёртываниях. Места в советах показывают участие; работающее ПО показывает, что заказчики действительно могут использовать.

За чем следить

Следите за новыми интеграциями PyTorch, поддержкой вычислительных операторов и релизами средств распределённого обучения от Alibaba Cloud и Cambricon. Воспроизводимые тесты рабочих нагрузок должны показать, какие операции выполняются нативно, используются ли альтернативные пути выполнения и как задачи работают на нескольких ускорителях. Эти результаты дадут более ясную оценку практической поддержки, чем сам по себе статус участника.

Источники

  1. https://www.linuxfoundation.org/press/alibaba-cloud-ant-group-cambricon-and-huawei-come-together-in-shanghai-to-advance-the-open-source-ai-stack-at-pytorch-conference-china

  2. https://docs.pytorch.org/docs/2.14/accelerator/operators.html

  3. https://docs.pytorch.org/docs/main/accelerator/distributed.html