• Alibaba Cloud y Cambricon se incorporaron a PyTorch Foundation como miembros de categoría Platino, mientras que Ant Group lo hizo como miembro de categoría Oro
  • La categoría Platino otorga tanto a Alibaba Cloud como a Cambricon un puesto en el Governing Board y otro en el Technical Advisory Council

El hecho

Alibaba Cloud y el fabricante chino de chips de IA Cambricon se incorporaron a PyTorch Foundation como miembros de categoría Platino el 8 de septiembre. Ant Group se incorporó como miembro de categoría Oro. El anuncio se realizó en PyTorch Conference China, en Shanghái.

La membresía de categoría Platino otorga tanto a Alibaba Cloud como a Cambricon un puesto en el Governing Board y otro en el Technical Advisory Council de la fundación. Se espera que ambas empresas contribuyan a los trabajos sobre infraestructura de IA y compatibilidad con aceleradores. Huawei también asistió a la conferencia y ya era miembro y colaborador de PyTorch.

PyTorch se utiliza para crear y ejecutar modelos de IA en distintos tipos de hardware informático. Para que un acelerador funcione con PyTorch, el software que le da soporte debe ser capaz de reconocer el dispositivo y ejecutar las operaciones que requiere un modelo.

Ejecutar un modelo en varios dispositivos es más complicado. Esos dispositivos también necesitan software que les permita comunicarse y trabajar conjuntamente. Se trata de requisitos generales de PyTorch y no indican que Alibaba Cloud o Cambricon tengan un problema concreto de compatibilidad.

La evaluación

La membresía da a Alibaba Cloud y Cambricon un lugar formal en la gobernanza de PyTorch, pero no permite a un cliente saber con qué rendimiento se ejecutará un modelo en un sistema concreto. Eso sigue dependiendo del software que conecta PyTorch con el acelerador y del entorno informático más amplio.

Las operaciones utilizadas por un modelo deben ser compatibles con el acelerador. Cuando una operación no puede ejecutarse de forma nativa, el software puede recurrir a otra vía de ejecución, incluida una ejecución en la CPU, lo que puede mantener el modelo en funcionamiento aunque altere el rendimiento. Los trabajos de entrenamiento de mayor escala añaden otro requisito: el software de comunicación debe coordinar la carga de trabajo entre varios dispositivos. Por tanto, una prueba satisfactoria en un solo acelerador no permite establecer cómo rendirá la misma carga de trabajo en todo un clúster.

Para los lectores de BTW, la membresía solo importa si se traduce en un mejor soporte para cargas de trabajo reales. Eso implica que más operaciones se ejecuten de forma nativa en los aceleradores, que el entrenamiento distribuido sea estable en varios dispositivos y que el software siga funcionando a medida que evoluciona PyTorch. Los puestos en el Governing Board dan a Alibaba Cloud y Cambricon voz en el proyecto; los clientes juzgarán el resultado según lo que puedan ejecutar de manera fiable en sus sistemas.

Qué observar

Hay que estar atentos a las nuevas integraciones de PyTorch, la compatibilidad con operadores y las versiones de entrenamiento distribuido de Alibaba Cloud y Cambricon. Las pruebas reproducibles de cargas de trabajo deberían mostrar qué operaciones se ejecutan de forma nativa, si se emplean rutas de ejecución alternativas y cómo rinden los trabajos en varios aceleradores. Esos resultados ofrecerían una medida más clara del soporte práctico que la mera categoría de membresía.