Voice Cloning
Erfahre, wie KI-Stimmenklonen funktioniert, welche Einsatzmöglichkeiten es in der unterstützten Kommunikation und beim Vorlesen gibt und welche Risiken mit Einwilligung, Deepfakes und Sicherheit verbunden sind.
Beim Stimmenklonen wird KI verwendet, um neue Sprache zu erzeugen, die wie die einer bestimmten Person klingt. Statt eine Aufnahme abzuspielen, lernt ein System erkennbare Merkmale der Stimme einer sprechenden Person und erzeugt Audio mit Wörtern, die diese Person vielleicht nie gesagt hat. Das kann jemandem helfen, mit einer vertrauten Stimme zu kommunizieren oder Inhalte einheitlich zu vertonen. Zugleich bedeutet es aber, dass eine überzeugend klingende Stimme kein Beweis dafür ist, wer spricht.
So funktioniert Stimmenklonen#
Ein System zum Stimmenklonen beginnt mit Aufnahmen der Zielperson. Es analysiert Merkmale wie Tonhöhe, Klangfarbe – also die Eigenschaft, durch die sich zwei Stimmen bei gleicher Tonhöhe unterschiedlich anhören – und Aussprache. Außerdem lernt es Aspekte der Prosodie: Rhythmus, Betonung und Intonation, durch die Sprache natürlich klingt. Die Aufnahmequalität ist wichtig. Hintergrundgeräusche, eine wechselnde Position des Mikrofons oder Samples, die nur einen Sprechstil enthalten, können die Zuverlässigkeit der erzeugten Stimme beeinträchtigen.
Das System bildet diese Stimmmerkmale in einer Form ab, die es beim Erzeugen von Audio verwenden kann und die oft als Sprechereinbettung bezeichnet wird. Dabei handelt es sich um eine kompakte numerische Beschreibung des Stimmklangs, nicht um eine gespeicherte Liste von Sätzen. Ein Workflow für benutzerdefinierte Stimmen kombiniert Aufnahmen der sprechenden Person mit einem Sprachgenerator: Der Text gibt vor, was gesagt werden soll, während die gelernten Stimmmerkmale beeinflussen, wie es klingt. Einige Workflows können sich an ein kurzes Sample anpassen, doch die Ausgabequalität hängt vom Sample und der Aufgabe ab. Die Dokumentation zu benutzerdefinierten Sofortstimmen veranschaulicht, wie wichtig eine geeignete Sprachaufnahme und die Einwilligung sind.
Anschließend erzeugt ein Generator eine Audio-Wellenform – ein sich veränderndes Signal, das ein Lautsprecher oder Kopfhörer wiedergibt. Ein überzeugendes Ergebnis erfordert sowohl verständliche Wörter als auch eine wiedererkennbare Stimme. Dieselbe Person kann beim Flüstern, Lachen oder Sprechen einer anderen Sprache anders klingen. Daher garantiert eine Übereinstimmung mit der Identität in einem kurzen Clip keine natürliche Sprache in jeder Situation.
Stimmenklonen und verwandte Begriffe#
Stimmenklonen ist eine spezielle Anwendung von Text-to-Speech, bei der geschriebene Wörter mit einer gelernten, identifizierbaren Stimme gesprochen werden. Gewöhnliches Text-to-Speech kann eine voreingestellte synthetische Stimme verwenden, ohne einer bestimmten Person zu ähneln. Beim Klonen kann auch gesprochene Sprache als Eingabe dienen, deren Wörter dann mit einer anderen Stimme wiedergegeben werden. Entscheidend ist die Zielstimme, nicht, ob die Eingabe ursprünglich aus Text oder Sprache bestand.
Speech-to-Text funktioniert in die entgegengesetzte Richtung und wandelt gesprochene Wörter in ein Transkript um. Die Tonhöhe oder Geschwindigkeit einer Aufnahme zu verändern, ist wiederum etwas anderes: Bei solchen Bearbeitungen wird vorhandenes Audio verändert, anstatt eine Äußerung aus einer gelernten Stimmidentität zu erzeugen. Stimmenklonen gehört zur generativen KI, weil dabei neues Audio entsteht.
Eine geklonte Stimme wird Teil eines Deepfakes, wenn synthetische Medien überzeugend den Eindruck erwecken, eine Person sage etwas, das sie nicht gesagt hat. Die beiden Begriffe sind nicht austauschbar: Wer einen autorisierten Klon der eigenen Stimme zur Kommunikation verwendet, versucht nicht zwangsläufig, jemanden zu täuschen.
Zwei reale Anwendungen#
Eine Anwendung ist die unterstützte Kommunikation. Eine Person, die voraussichtlich ihre Fähigkeit zu sprechen verlieren wird, kann ihre Stimme aufnehmen und später Nachrichten eintippen, die in einer synthetisierten Version ihrer Stimme gesprochen werden. Die Anleitung zu Apples Personal Voice beschreibt diesen Ansatz für die Kommunikation mit unterstützten Bedienungshilfen. Dabei kann es genauso wichtig sein, eine vertraute Stimme zu bewahren, wie die Wörter hörbar zu machen.
Eine weitere Anwendung ist die autorisierte Vertonung und Synchronisation. Eine Synchronsprecherin oder ein Synchronsprecher kann einem Produktionsteam erlauben, genehmigte Textpassagen oder übersetzte Erzähltexte mit einer gleichbleibenden Stimme zu erzeugen. Dadurch müssen nicht alle Änderungen erneut aufgenommen werden. Aussprache, emotionaler Ausdruck und sprachliche Anpassungen müssen jedoch weiterhin von Menschen überprüft werden. Einstellungen für Sprechtempo und Tonhöhe, wie sie in der Anleitung zur Prosodie von Amazon Polly beschrieben werden, passen die Sprechweise an; sie ersetzen nicht die Erlaubnis, die Stimme einer Person zu verwenden.
Wo Stimme und Bildverarbeitung zusammenkommen#
Stimmenklonen verarbeitet Audio, keine Bilder. In einer multimodalen KI-Anwendung kann es jedoch neben einer separaten Bildverarbeitungskomponente eingesetzt werden. Eine Person, die ein barrierefreies Video erstellt, könnte beispielsweise das Filmmaterial analysieren, um sichtbare Objekte zu erkennen, eine Beschreibung verfassen und überprüfen und diese anschließend von einer autorisierten geklonten Stimme vorlesen lassen. Ultralytics YOLO26 und der dokumentierte predict mode können Bilder oder Videos für den visuellen Teil verarbeiten. Sie klonen keine Stimmen und überprüfen nicht die Identität einer sprechenden Person. Wenn diese Aufgaben getrennt bleiben, können Entwickler jede Komponente danach beurteilen, was sie tatsächlich leistet.
Einwilligung, Authentizität und Sicherheit#
Die Stimme einer Person ist eng mit ihrer Identität verbunden. Hole deshalb eine eindeutige Einwilligung ein, bevor du einen Klon erstellst, und vereinbare, wo dessen Ausgabe verwendet werden darf. Die Einwilligungsrichtlinien für Sprachaufnahmen von Microsoft zeigen beispielhaft, wie ein ausdrückliches Einwilligungsverfahren aussehen kann. Schütze Aufnahmen und erzeugtes Audio im Rahmen des Datenschutzes und informiere Zuhörer, wenn Sprache synthetisch erzeugt wurde, sofern dieser Kontext relevant ist.
Cyberkriminelle können eine geklonte Stimme bei einem Anruf einsetzen, der scheinbar von einem Verwandten oder einer Führungskraft kommt, und jemanden dazu drängen, Geld zu überweisen. Die Hinweise der FTC zu fingierten Notfällen empfehlen, die Anfrage über eine Telefonnummer zu überprüfen, von der bereits bekannt ist, dass sie echt ist, statt dem Klang der Stimme des Anrufers zu vertrauen. Für veröffentlichte Audiodateien beschreibt die Erläuterung der C2PA zu Content Credentials eine Möglichkeit, die Herkunft von Medien zu dokumentieren. Angaben zur Herkunft liefern hilfreichen Kontext zur Geschichte einer Datei. Sie belegen jedoch für sich genommen nicht, dass jede gesprochene Behauptung wahr ist.









