Zusammenfassung

  • Alibaba Cloud und Cambricon traten der PyTorch Foundation als Platinmitglieder bei, während Ant Group als Goldmitglied beitrat
  • Der Platinstatus verschafft Alibaba Cloud und Cambricon Sitze im Governing Board und im Technical Advisory Council

Die Fakten

Alibaba Cloud und der chinesische KI-Chiphersteller Cambricon traten am 8. September der PyTorch Foundation als Platinmitglieder bei, während Ant Group als Goldmitglied beitrat. Die Bekanntgabe erfolgte während der PyTorch Conference China in Shanghai.

Der Platinstatus verschafft Alibaba Cloud und Cambricon jeweils einen Sitz im Governing Board und einen im Technical Advisory Council der PyTorch Foundation. Die PyTorch Foundation teilte mit, beide Unternehmen würden gemeinsam mit der Community an der Unterstützung von Hardware und Beschleunigern arbeiten. Huawei nahm ebenfalls an der Veranstaltung teil, allerdings als bereits bestehendes Mitglied und beitragendes Unternehmen, statt erstmals beizutreten.

PyTorch wird weithin eingesetzt, um KI-Modelle auf unterschiedlichen Prozessoren und Beschleunigern zu entwickeln und auszuführen. Die Dokumentation von PyTorch zur Beschleunigerintegration zeigt, dass Anbieter Unterstützung auf Ebene der Gerätelaufzeitumgebung, der Operatoren und der zugehörigen Software bereitstellen müssen. Verteiltes Training bringt eine weitere Anforderung mit sich: Auf mehrere Geräte verteilte Workloads benötigen ein Kommunikations-Backend, das die Arbeit zwischen ihnen koordiniert.

Dies sind allgemeine Anforderungen an die PyTorch-Integration und keine Belege für ein konkretes Kompatibilitätsproblem mit einem Produkt eines der neuen Mitglieder.

Die Einschätzung

Die Mitgliedschaft verschafft Alibaba Cloud und Cambricon eine formelle Rolle in der Governance von PyTorch, gibt Kunden jedoch keinen Aufschluss darüber, wie gut ein Modell auf einem bestimmten System läuft. Das hängt weiterhin von der Software ab, die PyTorch mit dem Beschleuniger und der übrigen Rechenumgebung verbindet.

Die von einem Modell verwendeten Operationen müssen auf dem Beschleuniger unterstützt werden. Kann eine Operation nicht nativ ausgeführt werden, kann die Software einen anderen Ausführungspfad nutzen, einschließlich einer Ausführung auf der CPU. Das kann das Modell funktionsfähig halten, zugleich aber seine Leistung verändern. Bei größeren Trainingsläufen kommt eine weitere Anforderung hinzu: Kommunikationssoftware muss den Workload über mehrere Geräte hinweg koordinieren. Ein erfolgreicher Test auf einem einzelnen Beschleuniger belegt daher nicht, wie derselbe Workload in einem Cluster abschneiden wird.

Für BTW-Leser werden veröffentlichte Software und reproduzierbare Workload-Tests die relevanten Belege liefern. Native Operatorunterstützung, die Integration von verteiltem Training und Ergebnisse mit repräsentativen Modellen würden zeigen, ob die Arbeit der neuen Mitglieder an PyTorch reale Produktiveinsätze verbessert. Sitze im Governing Board zeigen Beteiligung; funktionsfähige Software zeigt, was Kunden tatsächlich nutzen können.

Worauf zu achten ist

Achten Sie auf neue PyTorch-Integrationen, Operatorunterstützung und Veröffentlichungen für verteiltes Training von Alibaba Cloud und Cambricon. Reproduzierbare Workload-Tests sollten zeigen, welche Operationen nativ ausgeführt werden, ob Ausweichpfade genutzt werden und wie Trainingsläufe über mehrere Beschleuniger hinweg abschneiden. Diese Ergebnisse wären ein klarerer Maßstab für die praktische Unterstützung als der Mitgliedsstatus allein.

Quellen

  1. https://www.linuxfoundation.org/press/alibaba-cloud-ant-group-cambricon-and-huawei-come-together-in-shanghai-to-advance-the-open-source-ai-stack-at-pytorch-conference-china

  2. https://docs.pytorch.org/docs/2.14/accelerator/operators.html

  3. https://docs.pytorch.org/docs/main/accelerator/distributed.html