- Ein Interview mit Steve Jobs wurde kürzlich ausgestrahlt, oder zumindest eine Wiedergeburt seiner Stimme, die die Fortschritte der KI-Synchronisation zeigt.
- KI-Synchronisation kann Risiken und Kosten reduzieren und die Produktivität von Unternehmen steigern, wirft aber auch Kontroversen sowie ethische und regulatorische Herausforderungen auf.
- Die Zukunft der Synchronisation muss eine Balance zwischen Technologie und dem Wesen der menschlichen Leistung finden.
Die Überschneidung von KI und traditionellen Praktiken in der Unterhaltungsindustrie hat Debatten über die Zukunft der Synchronisation ausgelöst. Es bestehen jedoch weiterhin Bedenken hinsichtlich des Systems des Stimmenkaufs und der Fähigkeit der KI, Ton und menschliche Emotionen zu vermitteln.
KI-Synchronisation hat den Markt betreten
Überall auf der Welt ist es unbestreitbar, dass KI-Synchronisation auf dem Markt Wellen schlägt, viele Unternehmen erzielen sogar anständige Gewinne. Zu den wichtigsten Anbietern in der Branche gehören PlayHT, Captions und Rask AI.

PlayHT
In diesem Jahr war in der ersten Folge eines Podcasts namensPodcast.aider Moderator zu sehen, der unter anderem über seine College-Zeit, seine Ansichten über Computer, seinen beruflichen Status und seine Überzeugungen mitSteve Jobs, dem Gründer der Apple Group, diskutierte.
Der Podcast, der Jobs von den Toten zurückholt, ähnelt laut PlayHT stark der Stimme und Intonation von Jobs. PlayHT arbeitet an einer Sprachklontechnologie, die es Einzelpersonen und Unternehmen ermöglicht, Audioinhalte in großem Umfang zu erstellen. Am 23. November veröffentlichten sie ein KI-Sprachmodell namensOn-Premise. Sie behaupten, es handele sich um das Tool zur Spracherzeugung mit der geringsten Latenz, der höchsten Sicherheit und unbegrenzter Verfügbarkeit im Vergleich zu allen aktuellen Modellen.
Mahmoud Felfel, Gründer von PlayHT, sagte: „Wir haben PlayHT als generative Sprachsynthese- und Sprachklonplattform aufgebaut. Wir begannen mit der Entwicklung des anspruchsvollsten Sprach-Editors, um unseren Kunden die vollständige Kontrolle über die generierten Stimmen zu geben. Dann investierten wir in den Bau des ersten großen Sprachmodells für Sprachsynthese und Sprachklonen und erzieltenSOTA-Ergebnissein Bezug auf Sprachqualität und Ausdruckskraft.“
Captions
Captions, ein in New York ansässiges Video-Startup, bietet Untertitelungs-, Bearbeitungs- und Spezialeffektdienste für Content-Ersteller in sozialen Medien. Das Unternehmen erweiterte sein Angebot 2022 um Übersetzungsdienste und führte 2023 KI-Synchronisation ein. Mit innovativen Funktionen wie AI Eye Contact und automatisch generierten KI-Untertiteln hat Captions über 100.000 tägliche Nutzer und fünf Millionen Ersteller. Trotz der hohen Kosten für das KI-Training ist das Unternehmen profitabel und hat 40 Millionen US-Dollar an Finanzierung eingeworben. Seine neueste Innovation,Lipdub, wurde von großen Unternehmen wie ESPN und Twitch-Gründer Justin Kan übernommen.
Rask AI
Rask AI, ein KI-gestütztes Video- und Audio-Lokalisierungstool, übersetzt Inhalte in über 130 Sprachen und bietet eine Sprachklonfunktion. Es wurde am 20. März 2023 gestartet und gewann Anfang April den Preis „Produkt des Tages“ auf Product Hunt. Mittlerweile hat es weltweit über 750.000 Nutzer. Zu den wichtigsten Projekten gehört die Synchronisation des französischen Films „THE LEGEND OF AKAM“ ins Portugiesische für die Veröffentlichung in Brasilien. Darüber hinaus nutzt PodcastOne Rask AI, um seine Podcast-Bibliothek ins Spanische zu übersetzen, beginnend mit Barbara Schroeders erstem Podcast „Bad Bad Thing“.
Dank Prozessen wie Übersetzung, kultureller Anpassung, Voice-Over oder Synchronisation vereinfacht Rask AI den Lokalisierungsprozess von Videoinhalten erheblich und hilft Unternehmen und Kreativen, lokalisierte Videos effizient und kostengünstig zu produzieren.
Auch lesen:Vom Abchasischen zum Zulu: Amazon Transcribe erkennt jetzt 100 Sprachen
Derzeit verwendete Technologien
Tatsächlich wurden bei der Anwendung von KI im Bereich der Synchronisation erhebliche Fortschritte erzielt, die sich derzeit auf zwei Haupttechnologien konzentrieren. Fast alle KI-Sprachmodelle von Unternehmen basieren auf der Forschung und Entwicklung dieser beiden Kerntechnologien.
Die erste ist die Sprachkonvertierungstechnologie (VC,Voice Conversion), die es der KI ermöglicht, Text in Audio umzuwandeln, indem sie Klangfarbe, Tonhöhe, Sprache und andere Attribute anpasst, während der ursprüngliche Inhalt erhalten bleibt, aber sie kann keine Mehrpersonen-Interaktionen oder emotionale Ausdrücke berücksichtigen. Diese Technologie ähnelt dem Vorlesen und eignet sich für Szenarien, in denen nur die Stimmmerkmale geändert werden müssen, während der ursprüngliche Inhalt erhalten bleibt.
Zweitens ist die Sprachsynthesetechnologie (TTS,Text-to-Speech) in der Lage, geschriebenen Text in interaktive Sprache umzuwandeln. In den letzten Jahren ist es der TTS-Technologie gelungen, emotionale Ausdrücke zu zeigen, was die KI-Synchronisation „menschlicher“ macht und nicht mehr den Eindruck einer kalten Mechanik erweckt.
Auswirkungen auf traditionelle Voice-Over-Praktiken

1. Effizienz steigern und Kosten senken
„Durch die Nutzung von Rask AI können Unternehmen ihre Lokalisierungsbemühungen beschleunigen, ein breiteres Publikum erreichen und ihre Markenbekanntheit auf globalen Märkten verbessern.“
Maria Chmir, CEO und Gründerin von Rask AI
Die Integration von KI in die Synchronisation verbessert die Arbeitseffizienz und senkt die Produktionskosten, indem sie schnell Stimmabdrücke analysiert, um präzise und kontextuell angemessene Sprachaufnahmen zu liefern. Dies ermöglicht eine schnellere Synchronisation und die Erstellung mehrsprachiger Versionen, was einen Paradigmenwechsel in der Herangehensweise von Produktionsfirmen an Synchronisationsprojekte darstellt.
Rikki Lee Travolta, ein talentierter Schauspieler, sagte: „Der größte Vorteil der KI beim Voice-Over sind die Kosten. Ein gewerkschaftlich organisierter Synchronsprecher kostet einen Stundensatz. Dazu kommen die Kosten für Ingenieure und die Studioraummiete. Mit der KI entfallen die meisten oder sogar alle dieser Kosten.“
Maria Chmir, CEO und Gründerin von Rask AI, betont ebenfalls, dass KI ein sehr praktisches Tool für Inhalte oder Unternehmen ist, die international expandieren. „Durch die Nutzung von Rask AI können Unternehmen ihre Lokalisierungsbemühungen beschleunigen, ein breiteres Publikum erreichen und ihre Markenbekanntheit auf globalen Märkten verbessern.“
2. Risikominderung
KI-Synchronisation kann Risiken für große Unternehmen mindern, wie das Spiel „Tears of Themis“ von Mihoyo zeigt. Als ein Synchronsprecher in einen Rechtsstreit verwickelt war, nutzteMihoyoDeep Synthesis, um die Stimme des Schauspielers aus früheren Aufnahmen zu lernen und zu reproduzieren, was eine automatische Synchronisation ermöglichte. Diese Lösung bewahrte das Spielerlebnis, ohne den Schauspieler ersetzen oder die Figur stumm lassen zu müssen.
3. Förderung der internationalen Verbreitung
Die fehlende Synchronisation zwischen Lippenbewegungen und Stimme in synchronisierten Inhalten ist ein großer Nachteil und trägt möglicherweise zu deren Unbeliebtheit in englischsprachigen Ländern bei. KI kann verwendet werden, um die Lippenbewegungen einer Figur zu verändern, wodurch lokalisierte Inhalte authentischer und für die Zuschauer ansprechender wirken. Chmir sagte im Interview: „Durch die Nutzung von Rask AI können Unternehmen ihre Lokalisierungsbemühungen beschleunigen, ein breiteres Publikum erreichen und ihre Markenbekanntheit auf globalen Märkten verbessern.“
4. Panik wegen der Ersetzung von Menschen durch KI
„Jetzt haben wir genauso viel Angst wie damals, als COVID-19 kam; wir wissen nicht, was passieren wird.“
Daniel Hamvas, Synchronsprecher
Die Anwendung von künstlicher Intelligenz beim Voice-Over beschränkt sich nicht auf eine einzige Branche; Unternehmen untersuchen die Möglichkeit, KI zur Synthese verschiedener Sprachaufnahmen zu nutzen. Traditionell wählen Film-, Fernseh- und Videospielfirmen Monate im Voraus geeignete Synchronsprecher aus, stellen den Text bereit und nehmen offline auf. Erfahrene Synchronsprecher werden nach der Anzahl der Wörter und der für die Aufnahme benötigten Zeit bezahlt. Das Aufkommen der künstlichen Intelligenz hat jedoch eine neue Dynamik gebracht.
Einige Unternehmen neigen dazu, die Stimmen der Synchronsprecher aufzuzeichnen und dann KI zu verwenden, um zusätzliche Sprachaufnahmen zu synthetisieren, während andere sogar versuchen, die Stimmen der Synchronsprecher durch eine einmalige Vereinbarung zu kaufen, um ein unternehmenseigenes Sprach-IP zu schaffen.
Dies wirft Fragen zur Zukunft der Voice-Over-Branche auf. Der berühmte Synchronsprecher Daniel Hamvas hat im Laufe der Jahre viele Figuren in ungarischen Inhalten synchronisiert und ist jetzt Leiter der ungarischen Gewerkschaft der Synchronsprecher.Er ist an vorderster Front des Kampfesund lehnt den Einsatz von KI-Synchronisation entschieden ab, um Fachleute zu schützen, deren Lebensunterhalt durch die Automatisierung bedroht ist. Hamvas äußerte ihre Bedenken mit den Worten: „Jetzt haben wir genauso viel Angst wie damals, als COVID-19 kam; wir wissen nicht, was passieren wird.“
Herausforderungen und Kontroversen
„Keine noch so große Anzahl von Algorithmen kann die Unvollkommenheiten erzeugen, die eine menschliche Leistung perfekt machen. KI kann eine gute Nachahmung liefern, aber ein Elvis-Imitator wird niemals Elvis sein.“
Rikki Lee Travolta, talentierter Schauspieler
Trotz der Fortschritte der KI kann es ihr schwerfallen, die Tiefe und Authentizität einzufangen, die menschliche Schauspieler in ihre Leistungen einbringen. Die Gefahr, dass die Synchronisation die menschliche Note verliert, gibt Anlass zur Sorge hinsichtlich des Publikumsengagements und des gesamten Seherlebnisses.
Phil Siegel, Gründer der KI-Non-Profit-OrganisationCAPTRS, sagte: „Die Modelle sind in der Lage, die charakteristischen Tonalitäten der Stimme zu identifizieren; sie können dies mit sehr wenigen Daten tun, aber wenn Sie ihm mehrere Sätze einer Stimme geben, wäre es wahrscheinlich in der Lage, eine Stimme zu produzieren, die die meisten Menschen nicht von der echten Person unterscheiden könnten.“
Travolta betont auch, dass KI Menschen letztendlich nicht ersetzen kann. „Und ich erwarte, dass KI sich weiterentwickeln wird. Aber sie wird niemals menschlich sein. Keine noch so große Anzahl von Algorithmen kann die Unvollkommenheiten erzeugen, die eine menschliche Leistung perfekt machen. KI kann eine gute Nachahmung liefern, aber ein Elvis-Imitator wird niemals Elvis sein“, sagte Travolta.
Urheberrechtsschutz für Stimmen
„Die wichtigste Regulierung, über die genannten rechtlichen und ethischen Fragen hinaus, ist, dass es einen wachsenden Konsens gibt, dass KI-generierte Inhalte als solche gekennzeichnet werden müssen. Sowohl die verwendeten Werkzeuge als auch die Inputs an ‚Rohmaterial‘.“
Phil Siegel, Gründer der KI-Non-Profit-OrganisationCAPTRS
Wie die KI-Synchronisation potenzielle ethische und rechtliche Probleme bei der Modellierung angeht, bleibt ein Rätsel. Die meisten Unternehmen gewährleisten derzeit die Konformität und Sicherheit der Stimmerfassung. Maschinen können nur den Text reproduzieren, der von Personen persönlich gelesen wurde, was auch die Zustimmung der Person selbst erfordert. Siegel betont auch die Bedeutung von Wasserzeichen: „Die wichtigste Regulierung, über die genannten rechtlichen und ethischen Fragen hinaus, ist, dass es einen wachsenden Konsens gibt, dass KI-generierte Inhalte als solche gekennzeichnet werden müssen.
Sowohl die verwendeten Werkzeuge als auch die Inputs an ‚Rohmaterial‘. So hätte das Synchronisieren von Taylor Swifts Stimme mit Speechify ein spezifisches Identifikationswasserzeichen.“
Leider gibt es bisher eine Lücke im rechtlichen Schutz von KI-generierten Klängen in Bezug auf Urheberrechte. Auch die Definition von Klangfälschung ist sehr vage. Einige Tonprofis sind sich des Wertes von Ton bewusst, aber sind sich normale Menschen, die müde Software verwenden, der Risiken im Zusammenhang mit Tonlizenzen bewusst?
„Weil die meisten aktuellen Gesetzgebungen tatsächlich auf irrationaler Angst beruhen, und wir sind eine Industrie, die sich in erster Linie selbst regulieren muss.“
Maria Chmir, CEO und Gründerin von Rask AI
Als Entwickler von KI-Synchronisationsprodukten äußerte Chmir auch ihre Einstellung: „Wir verpflichten uns, mit Medienunternehmen, Regierungen und KI-Forschungseinrichtungen zusammenzuarbeiten, um das Bewusstsein zu schärfen und ethische Standards für die Authentizität von KI-Inhalten zu etablieren.“ Wir stehen also noch ganz am Anfang, und es ist wirklich wichtig, transparent darüber zu sein, was passiert. Denn die meisten aktuellen Gesetzgebungen beruhen tatsächlich auf irrationaler Angst, und wir sind eine Industrie, die sich in erster Linie selbst regulieren muss.
Unsere Produkte machen KI-Technologie für Kreative zugänglich und schränken gleichzeitig das Potenzial für unverantwortliche Nutzung ein.
Menschliche Faktoren in der Synchronisation

Voice-Over ist weit mehr als ein rein technischer Prozess. Es ist eine Kunstform, die auf der Fähigkeit eines Schauspielers beruht, Emotionen und Nuancen effektiv zu vermitteln. Menschliche Schauspieler bringen eine einzigartige Tiefe an Erfahrung und kulturellem Verständnis in ihre Leistungen ein, wodurch sie sich an die Nuancen verschiedener Charaktere und Szenen anpassen können. Obwohl KI menschliche Sprachmuster nachahmen kann, bleibt die Frage, ob sie wirklich die emotionale Tiefe und Verbindung reproduzieren kann, die ein menschlicher Schauspieler mit dem Publikum aufbaut.
Die Zukunft des Voice-Over: Die Balance finden

Während die Branche KI in die Voice-Over-Praktiken integriert, wird es entscheidend, eine Balance zwischen technologischer Innovation und der Bewahrung des Wesens der menschlichen Leistung zu finden. Die Zusammenarbeit zwischen KI und menschlichen Synchronsprechern könnte einen Mittelweg bieten, bei dem die Effizienz der KI die nuancierten Leistungen menschlicher Schauspieler ergänzt. Dieser hybride Ansatz würde nicht nur den Synchronisationsprozess beschleunigen, sondern auch sicherstellen, dass emotionale Resonanz und kulturelle Unterschiede nicht der Effizienz geopfert werden.
„Einige Experten glauben, dass KI-Synchronisation alle in der Branche ersetzen könnte, obwohl das weit von der Realität entfernt ist. Es ist fairer, die aktuelle Phase als Co-Kreation zu bezeichnen“, sagte Chmir ebenfalls.

