Resumo

  • Alibaba Cloud e Cambricon ingressaram na PyTorch Foundation como membros Platinum, enquanto Ant Group ingressou no nível Gold
  • O status Platinum concede à Alibaba Cloud e à Cambricon assentos no Governing Board e no Technical Advisory Council

O fato

Alibaba Cloud e a fabricante chinesa de chips de IA Cambricon ingressaram na PyTorch Foundation como membros Platinum em 8 de setembro, enquanto Ant Group ingressou como membro Gold. O anúncio foi feito durante a PyTorch Conference China, em Xangai.

O status Platinum concede à Alibaba Cloud e à Cambricon um assento para cada uma tanto no Governing Board quanto no Technical Advisory Council da PyTorch Foundation. A fundação afirmou que ambas as empresas trabalharão com a comunidade no suporte a hardware e aceleradores. A Huawei também participou do evento como membro e colaboradora já existente, em vez de ingressar pela primeira vez.

O PyTorch é amplamente usado para criar e executar modelos de IA em diferentes processadores e aceleradores. Sua documentação de integração com aceleradores mostra que os fornecedores precisam dar suporte ao ambiente de execução do dispositivo, aos operadores e aos softwares relacionados. O treinamento distribuído acrescenta outro requisito: cargas de trabalho distribuídas por vários dispositivos precisam de um backend de comunicação para coordenar o trabalho entre eles.

Esses são requisitos gerais de integração com o PyTorch, não evidências de um problema específico de compatibilidade com os produtos de qualquer um dos novos membros.

A avaliação

A condição de membro dá à Alibaba Cloud e à Cambricon um lugar formal na governança do PyTorch, mas não informa ao cliente qual será o desempenho de um modelo em determinado sistema. Isso ainda depende do software que conecta o PyTorch ao acelerador e ao ambiente computacional mais amplo.

As operações usadas por um modelo precisam ter suporte no acelerador. Quando uma operação não pode ser executada nativamente, o software pode usar outro caminho de execução, inclusive por meio da CPU, o que pode manter o modelo funcionando, mas alterar o desempenho. Tarefas de treinamento de maior escala acrescentam outro requisito: o software de comunicação precisa coordenar a carga de trabalho entre vários dispositivos. Portanto, um teste bem-sucedido em um único acelerador não estabelece qual será o desempenho da mesma carga de trabalho em um cluster.

Para os leitores da BTW, as evidências úteis virão do software disponibilizado e de testes reproduzíveis de cargas de trabalho. O suporte nativo a operadores, a integração ao treinamento distribuído e os resultados com modelos representativos mostrariam se o trabalho dos novos membros com o PyTorch está melhorando implantações reais. Assentos no conselho mostram participação; software funcional mostra o que os clientes realmente podem usar.

O que acompanhar

Acompanhe novas integrações com o PyTorch, suporte a operadores e lançamentos para treinamento distribuído da Alibaba Cloud e da Cambricon. Testes reproduzíveis de cargas de trabalho devem mostrar quais operações são executadas nativamente, se caminhos alternativos são usados e qual é o desempenho das tarefas em vários aceleradores. Esses resultados ofereceriam uma medida mais clara do suporte prático do que a condição de membro, isoladamente.

Fontes

  1. https://www.linuxfoundation.org/press/alibaba-cloud-ant-group-cambricon-and-huawei-come-together-in-shanghai-to-advance-the-open-source-ai-stack-at-pytorch-conference-china

  2. https://docs.pytorch.org/docs/2.14/accelerator/operators.html

  3. https://docs.pytorch.org/docs/main/accelerator/distributed.html