- OpenAI verzögert die breite Einführung von Voice Engine, einer KI zur Sprachsynthese, um ethischen Bedenken und Risiken des Missbrauchs Rechnung zu tragen.
- Die Technologie verspricht Hilfe beim Vorlesen und globale Reichweite, birgt jedoch Risiken des Identitätsdiebstahls und Sicherheitslücken.
- OpenAI hat strenge Bedingungen für die Nutzung von Voice Engine festgelegt, darunter Zustimmungserfordernisse und die Offenlegung KI-generierter Stimmen.
OpenAI stellt Voice Engine vor, ein KI-Modell, das menschliche Stimmen aus kurzen Audioausschnitten reproduzieren kann, verzögert jedoch die vollständige Veröffentlichung aufgrund ethischer und gesellschaftlicher Bedenken hinsichtlich möglichen Missbrauchs.
Das Potenzial von Voice Engine
Die Entwicklung der Sprachsynthese war bemerkenswert, besonders im Vergleich zum Speak & Spell-Spielzeug von 1978, das die Öffentlichkeit mit seiner bahnbrechenden elektronischen Stimme faszinierte. Heutzutage können KI-Modelle, die Deep Learning nutzen, nicht nur realistische Stimmen erzeugen, sondern auch vorhandene Stimmen mit bemerkenswerter Genauigkeit aus kurzen Audioproben nachahmen.
Lesen Sie auch:Der GPT-Store von OpenAI erfüllt die Erwartungen nicht.
In diesem Zusammenhang stellt die jüngste Präsentation von Voice Engine durch OpenAI einen bedeutenden Fortschritt dar. Das KI-Modell kann aus einer kurzen Audioaufnahme eine synthetische Stimme erstellen, und das Unternehmen hat auf seiner Website Beispiele geteilt. Benutzer können Text eingeben, den Voice Engine dann in eine KI-generierte Stimme umwandelt. OpenAI hat jedoch beschlossen, diese Technologie nicht in großem Umfang zu verbreiten, nachdem es ursprünglich für diesen Monat ein Pilotprogramm für Entwickler geplant hatte.
Nach reiflicher Überlegung der ethischen Aspekte hat sich das Unternehmen entschieden, seine Ambitionen vorerst zu zügeln.
OpenAI erklärte: „Im Einklang mit unserem Engagement für KI-Sicherheit und unseren freiwilligen Richtlinien haben wir uns entschieden, diese Technologie vorzustellen, ohne sie vorerst breit zu verbreiten. Wir glauben, dass dieser Einblick in Voice Engine sein Potenzial hervorheben wird, während er gleichzeitig die Bedeutung der Stärkung gesellschaftlicher Abwehrkräfte gegen die Herausforderungen durch immer überzeugendere generative Modelle unterstreicht.“
Lesen Sie auch:OpenAI erweitert Medienkooperationen mit Nachrichtenpartnern für Chatbot-Training
Die Sprachklontechnologie ist nicht neu; seit 2022 gibt es zahlreiche KI-Sprachsynthesemodelle, und diese Technologie ist in der Open-Source-Community mit Angeboten wie OpenVoice und XTTSv2 weit verbreitet. Die Aussicht, dass OpenAI seine Sprachtechnologie allgemein verfügbar macht, ist jedoch bedeutsam, und die Zurückhaltung des Unternehmens dies zu tun, ist wohl die auffälligste Frage.
Die potenziellen Vorteile der Sprachtechnologie von OpenAI sind vielfältig: Hilfe beim Vorlesen mit natürlichen Stimmen, globale Inhaltserstellung unter Beibehaltung muttersprachlicher Akzente, personalisierte Sprachoptionen für nicht verbale Menschen und Hilfe für Patienten, nach krankheitsbedingten Sprachbeeinträchtigungen ihre Stimme wiederzuerlangen.
Ethische und sicherheitstechnische Implikationen
Dennoch wirft die Möglichkeit, dass jeder mit nur 15 Sekunden Aufnahme eine Stimme klonen kann, Bedenken hinsichtlich Missbrauch auf. Selbst ohne eine vollständige Verbreitung von Voice Engine hat Sprachklonen bereits zu Problemen geführt, wie Telefonbetrug, der die Stimme von Angehörigen imitiert, und automatisierte Anrufe mit geklonten Stimmen von Politikern wie Joe Biden.
Darüber hinaus haben Forscher und Journalisten gezeigt, dass Sprachklontechnologie Bankkonten gefährden kann, die Sprachauthentifizierung verwenden. Dies veranlasste Senator Sherrod Brown aus Ohio, Vorsitzender des US-Senatsausschusses für Banken, Wohnungswesen und Stadtentwicklung, sich nach den Sicherheitsmaßnahmen zu erkundigen, die große Banken gegen KI-bezogene Bedrohungen ergriffen haben.
Angesichts der potenziellen Risiken einer breiten Verbreitung setzt OpenAI eine Reihe von Regeln um, um diese Probleme zu mindern. Das Unternehmen führt seit letztem Jahr Tests mit ausgewählten Partnern durch, wie HeyGen, das das Modell nutzt, um die Stimme von Sprechern in andere Sprachen zu übersetzen, während die ursprünglichen Stimmmerkmale erhalten bleiben.
Partnerschaften und Vorsichtsmaßnahmen
Für die Nutzung von Voice Engine müssen die Partner Bedingungen einhalten, die „die Identitätsanmaßung einer natürlichen oder juristischen Person ohne Zustimmung oder gesetzliches Recht“ verbieten. Sie sind außerdem verpflichtet, die informierte Einwilligung der Personen einzuholen, deren Stimmen reproduziert werden, und müssen klar angeben, dass die produzierten Stimmen KI-generiert sind. OpenAI integriert außerdem ein Wasserzeichen in jede Sprachprobe, um die Rückverfolgbarkeit jeder von seinem Modell generierten Stimme zu erleichtern.
Derzeit präsentiert OpenAI seine Technologie, ohne sich vollständig auf eine breite Verbreitung einzulassen, die möglicherweise soziale Umwälzungen verursachen könnte. Stattdessen passt das Unternehmen seine Marketingstrategie an, um als verantwortungsvoller Verwalter dieser aufstrebenden Technologie zu erscheinen.

