Der Technologieriese Tencent veranstaltete am 14. Dezember im Nationalen Kongresszentrum Chinas in Peking seinen Hi Tech Day und die Konferenz Digital Open Things 2023 unter dem Motto „Intelligenz entsteht und öffnet alle Dinge“. Jiang Chunyu erklärte, dass die Entwicklung der KI in China dringend trainierbare und hochwertige Datensätze benötigt. Jiang verriet, dass bald ein Weißbuch zur KI-Datenverwaltung veröffentlicht wird, um ein System von Methoden und Regeln in diesem Bereich zu etablieren.
China beschleunigt seine digitale Transformation und schließt die digitale Kluft, mit starker Unterstützung für die Anwendung neuer Technologien wie Daten, Cloud Computing, künstliche Intelligenz und Quantencomputing. Der Technologieriese Tencent veranstaltete am 14. Dezember im Nationalen Kongresszentrum Chinas in Peking seinen Hi Tech Day und die Konferenz Digital Open Things 2023, um prominente Persönlichkeiten aus allen Bereichen einzuladen, über den Trend der künstlichen Intelligenz zu diskutieren.
Auf der Konferenz hielt Jiang Chunyu, Direktor der Abteilung Cloud Data und Blockchain der Chinesischen Akademie für Informations- und Kommunikationsforschung, eine Rede zum Thema „KI-Datenverwaltung weckt Nachdenken“. Die große, hochwertige Datenbasis ist das nächste Evolutionsziel. „Es gibt nicht viele trainierbare und hochwertige Datensätze auf dem Markt, insbesondere im chinesischen Kontext, wo viele hochwertige Daten verborgen sind.
Wir müssen dringend ein marktfähiges und offenes Modell finden oder bestimmen, welches Modell die Daten freigeben und von allen genutzt werden kann.“ Jiang Chunyu, Direktor der Abteilung Cloud Data und Blockchain der Chinesischen Akademie für Informations- und Kommunikationsforschung. Seit 2018 führt die allgemeine KI die technologische Welle an. Alle Beteiligten haben sich voll engagiert und Geld in das Training großer Modelle gesteckt, was einen enormen Wettbewerbstrend erzeugt.
Jiang Chunyu ist jedoch der Ansicht, dass sich die nationale Entwicklung auf die Verbesserung der Daten konzentrieren sollte, nicht nur in der Quantität, sondern auch in der Qualität. China, eine natürliche Datenmacht, sollte sich nicht auf die Lücke zwischen Algorithmen und Rechenleistung konzentrieren, die zwischen den Parteien nicht so groß ist, sondern auf die enormen Kosten der „Involution“ in diesem Bereich. Stattdessen könnte die Verbesserung der Datenqualität bessere Ergebnisse bringen.
Er zählte für das Publikum die großflächigen, diversifizierten und qualitativ hochwertigen Datensätze auf, die für das Training großer Modelle erforderlich sind: GPT-1 vor vier oder fünf Jahren benötigte 4,8 GB hochwertige Daten, GPT-2 lag bei 40 GB, GPT-3 bei 570 GB, und dieses Jahr hat Meta ein großes Modell veröffentlicht, dessen Datenbasis eine erstaunliche Größe von 4.000 GB erreicht hat. Jiang äußerte seine Besorgnis: „Es gibt nicht viele trainierbare und hochwertige Datensätze auf dem Markt, insbesondere im chinesischen Kontext, wo viele hochwertige Daten verborgen sind.
Wir müssen dringend ein marktfähiges und offenes Modell finden oder bestimmen, welches Modell die Daten freigeben und von allen genutzt werden kann.“ Lesen Sie auch: Amazon Q AI Assistant: AWS führt revolutionären Ansatz zur Datenabfrage ein. Jiang Chunyu: Datenmanagement, -sicherheit und -schutz müssen dringend etabliert werden. Jiang wies auf drei Probleme in der aktuellen Branchenentwicklung hin: Die Datenqualität ist generell verzerrt. Um minderwertige Datensätze in hochwertige umzuwandeln, betonte Jiang die Notwendigkeit, ein integriertes System aus Data Engineering und DevOps-F&E-Betrieb aufzubauen.
Von der F&E-Auslieferung, dem Datenbetrieb und der Wartung bis hin zur Wertschöpfung entsteht eine vollständige Datenproduktionskette oder Lieferkette, damit Daten geordnet ausgeliefert und schrittweise verbunden werden können, um einen veröffentlichten Produktionsnachweis zu bilden – anders als bei der traditionellen Verarbeitung strukturierter Daten in der Vergangenheit. Er warnte die anwesenden Unternehmen auch davor, nicht viel Zeit in das Training von Modellen zu investieren, bevor die Verbesserung der Datenqualität abgeschlossen ist, da ein Training Dutzende Millionen Dollar kosten kann, ohne Ergebnisse zu erzielen.
Überraschenderweise sortiert ihr Team derzeit die Methodik und den Rahmen der KI-Trainingsmethoden, vervollständigt ein Weißbuch zur KI-Datenverwaltung und etabliert ein System von Methoden und Regeln in diesem Bereich. Sicherheits- und Datenschutzprobleme. Jiang erklärte: „Es gibt eine Vielzahl von Sicherheits- und Datenschutzproblemen im gesamten Trainingsprozess, einschließlich Anwendungsrechten, Verstößen gegen die Erhebung personenbezogener Daten, unsicherer Datenübertragung, Datenfälschung sowie unsicherer Speicherung und Übertragung von Modellen.
Darüber hinaus gibt es auch Probleme wie Prompt-Angriffe und Verstöße gegen generierte Inhalte. Um einen Sicherheits- und Datenschutzschutz über den gesamten Lebenszyklus bei der Produktion, Nutzung und dem Betrieb von Modellen zu gewährleisten, müssen wir eine Vielzahl von Technologien beherrschen, geeignete Regeln erstellen und die Fähigkeiten von Prüfern und Aufsichtsbehörden insgesamt konfigurieren. Dies ist ein völlig neues Gebiet, das Aufmerksamkeit und Investitionen erfordert, um die sich entwickelnden Herausforderungen der Daten- und Modellsicherheit zu bewältigen.“ Verwaltung generierter und synthetischer Inhalte.
Selbst synthetische Daten dürfen keine Fälschung sein. Daher ist die Messung der Wahrhaftigkeit und Genauigkeit besonders kritisch. Darüber hinaus sind die Erkennung und Verhinderung von Schädlichkeit ebenfalls eine dringende Aufgabe. Derzeit werden viele große Modelle genau aufgrund von Problemen in den generierten Inhalten gemeldet, wie Belästigung, Gewalt und Diskriminierung. Diese Probleme müssen wirksam kontrolliert werden.
Getrennt davon können die Anforderungen an Authentizität und Genauigkeit durch Regeln gerahmt werden; die Anforderungen an die Inhaltsgenerierung, Überwachungsmechanismen und Bewertung der Authentizität können durch automatische Erkennung, Identifizierung und Filterung von Inhalten in Kombination mit manueller Überprüfung realisiert werden; und die Verhinderung von Schädlichkeitsproblemen kann durch die Verwendung von Regelbeschränkungen, Zeilenvorhersage, empirischer Datenschutzbewertung und Datenschutzangriffstests effektiv verwaltet werden.

