Gemini TTS: KI-Stimme per Text, Klonen in Österreich gesperrt
Gemini 3.8 TTS baut dir eine KI-Stimme aus zwei Sätzen Beschreibung, das Klonen ist in Österreich gesperrt. Was geht, was es kostet, wofür es taugt.
Du beschreibst eine Stimme in zwei Sätzen, und Google baut sie dir. Alter, Akzent, Tempo, Stimmung. Deine eigene Stimme klonen? Geht auch. Nur nicht bei uns.
Google hat am 23. September zwei neue Sprachmodelle vorgestellt: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. In den englischsprachigen Berichten liest sich das wie ein Frontalangriff auf die Voiceover-Spezialisten, samt Klon-Funktion aus 30 Sekunden Audio. Was dort fast immer fehlt, steht bei Google in einer Fußnote: Das Klonen über AI Studio ist im EWR gesperrt. Österreich gehört dazu.
Hier bekommst du die Version für Creator in Österreich: was geht, was nicht, was eine Minute KI-Voiceover kostet und wofür ich das als Videograf überhaupt einsetzen würde.
Was Google am 23. September freigeschaltet hat
Beide Modelle sind allgemein verfügbar, über die Gemini API und in Google AI Studio direkt im Browser. Flash ist laut Google das Modell für Studioqualität, Schauspiel, regionale Dialekte und lange Texte. Flash-Lite ist die schnelle, günstigere Variante für große Mengen.
Die Eckdaten, die für dich zählen:
- Sprachen: laut Google-Doku 130 bei Flash und 101 bei Flash-Lite. Deutsch können beide.
- Fertige Stimmen: Google spricht von über 2.000.
- Eigene Stimmen: bis zu 200 pro Projekt, jede bleibt ein Jahr gespeichert.
- Dialoge: zwei Sprecher in einer einzigen Anfrage, mit den fertigen Stimmen.
- Lange Texte: laut Google stundenlanges Audio, bei dem die Stimme kaum wegdriftet. Pro Anfrage sind laut Modellseite maximal 16.384 Output-Tokens drin, rechnerisch knapp 11 Minuten Audio. Längere Texte schickst du in Teilen.
- Apps: Flash TTS kommt in Gemini Notebook, Flash-Lite in Google Vids.
AI Studio und die Gemini API sind in Österreich offiziell verfügbar. Das ist die gute Nachricht, und sie ist größer, als sie klingt.
Stimme beschreiben: Das geht in Österreich
Die Funktion heißt Voice Design. Du schreibst in Worten, wie die Stimme klingen soll, und Gemini legt daraus eine feste Stimme mit eigener ID an, inklusive Hörprobe. Googles Doku empfiehlt ein bis zwei klare Sätze statt langer Absätze, die sich widersprechen. Das offizielle Beispiel ist ein warmherziger Astronom Ende 60 mit sanftem britischem Akzent.
Dazu kommt die Regie pro Zeile. Du gibst Emotion, Tempo und Akzent als Anweisung mit, und für kleine Momente wie ein Seufzen, ein Husten oder eine kurze Pause gibt es eigene Tags.
Hier ist der Punkt, der für Video den Unterschied macht: Die Stimme bleibt. Folge 1 und Folge 12 deiner Erklärserie klingen nach demselben Sprecher, weil du jedes Mal dieselbe ID aufrufst und nicht jedes Mal „irgendwas Ähnliches" neu würfelst.
Eine Prompt-Idee für einen österreichischen Erzähler (ein Vorschlag, kein Testergebnis):
- „Ein ruhiger Erzähler Mitte 40 aus Wien, warme, leicht raue Stimme, spricht Hochdeutsch mit hörbarer österreichischer Färbung, gelassen und ohne Werbeton."
Ob die Färbung sitzt, kann ich dir nicht versprechen. Österreichisches Deutsch ist in der Doku nicht als eigene Variante ausgewiesen. Hör dir die Hörprobe an, bevor du zehn Minuten Sprechertext durchjagst.
Angekündigt, aber noch nicht freigeschaltet: Voice Remixing. Damit nimmst du laut Google eine fertige Stimme aus der Bibliothek und drehst per Prompt an Klangfarbe, Tonhöhe, Tempo und Akzent. Für die österreichische Färbung könnte das der einfachere Weg werden.
Stimme klonen: Bei Gemini in Österreich gesperrt
Bei Google heißt das Voice Replication. Die Doku verlangt 10 bis 30 Sekunden saubere Sprache als Vorlage. Dazu kommt eine zweite Aufnahme, in der dieselbe erwachsene Person einen festen Einwilligungssatz spricht. Auf Deutsch lautet er: „Ich bin der Eigentümer dieser Stimme und bin damit einverstanden, dass Google diese Stimme zur Erstellung eines synthetischen Stimmmodells verwendet." Das System prüft, ob beide Aufnahmen vom selben Sprecher stammen.
Und jetzt die Fußnote aus Googles Ankündigung, sinngemäß übersetzt: Voice Replication über AI Studio ist in Illinois, Texas, im EWR, in UK, in der Schweiz und in Indien nicht verfügbar. Damit ist der ganze DACH-Raum draußen.
Was ich daraus mache:
- Die API-Doku selbst nennt keine Länderliste. Eine Erlaubnis würde ich daraus trotzdem nicht ableiten. Wenn Google das Klonen im eigenen Browser-Tool für ganz Europa abdreht, baust du darauf keinen Kunden-Workflow.
- Google begründet die Sperre nicht. Die Liste liest sich wie eine Landkarte strenger Datenschutz-Regeln, das ist aber meine Vermutung.
- Solange das so bleibt, ist deine echte Stimme weiter das Original. Wie du sie ohne Studio sauber aufnimmst, steht in meiner Anleitung Voiceover mit dem iPhone aufnehmen.
- Wer seine Stimme trotzdem klonen will, landet derzeit bei Spezialisten wie ElevenLabs. Dort gibt es Voice Cloning, eine Länderbeschränkung wie bei Gemini nennt die Doku nicht. Welche deutschsprachigen Stimmen dort funktionieren, hab ich im ElevenLabs-Review auseinandergenommen.
Wofür ich Voice Design im Videoalltag einsetzen würde
Ich dreh seit rund zehn Jahren Hochzeiten und Firmenvideos. Einem Hochzeitsfilm einen KI-Erzähler unterzujubeln, wäre absurd. Aber es gibt Jobs, bei denen eine beschriebene Stimme sofort Arbeit spart:
- Erklärvideos und Tutorials, bei denen du nicht vor der Kamera stehst und sich der Text laufend ändert. Neue Version heißt neuer Text, gleiche Stimme, kein neuer Aufnahmetermin.
- Podcast- oder Kanal-Intros mit einer festen Stimme, die sich klar von deiner eigenen abhebt.
- Platzhalter-Sprecher im Rohschnitt. Der Kunde nimmt den Firmenfilm mit Sprechertext ab, der echte Sprecher geht erst nach der Freigabe ins Studio. Dafür reicht eine designte Stimme locker, und die Korrekturschleifen kosten dich keine Sprecherhonorare.
- Zweite Sprachfassung. Mein Kanal videowien läuft auf Englisch, die ContentWerk Community auf Deutsch. Genau für diesen Spagat ist ein Modell mit 130 Sprachen spannend. Ob eine designte Stimme in beiden Sprachen gleich klingt, würde ich vor jedem Kundenprojekt selbst gegenhören.
Wofür nicht: für alles, wo dein Gesicht und deine Glaubwürdigkeit das eigentliche Produkt sind.
Was eine Minute kostet, und warum es im Jänner teurer wird
Google rechnet in US-Dollar ab, pro Million Tokens. Laut offizieller Preisseite kostet die Audio-Ausgabe bei Flash 9 Dollar bis 31. Dezember 2026 und 18 Dollar ab 1. Jänner 2027. Flash-Lite geht von 6 auf 12 Dollar. Der Text, den du reinschickst, kostet 0,50 Dollar, ab Jänner 1 Dollar. Für beide Modelle gibt es zusätzlich ein kostenloses Kontingent.
Die Umrechnung liefert Google gleich mit: Eine Sekunde Audio entspricht 25 Tokens, zehn Sekunden Flash kosten also 0,00225 Dollar. Hochgerechnet auf die Minute:
- Flash bis Silvester: rund 1,35 US-Cent pro Minute.
- Flash ab Jänner: 2,7 US-Cent pro Minute.
- Flash-Lite bis Silvester: 0,9 US-Cent pro Minute.
- Flash-Lite ab Jänner: 1,8 US-Cent pro Minute.
Umgerechnet zum EZB-Referenzkurs vom 23. September (1 Euro = 1,1411 Dollar) sind das rund 1,2 Euro-Cent pro Minute bei Flash, ab Jänner rund 2,4. Bei Flash-Lite sind es rund 0,8 bzw. 1,6 Euro-Cent. Ein 10-Minuten-Erklärvideo mit Flash kostet also etwa 12 Euro-Cent Sprecher und passt gerade noch in eine einzige Anfrage.
Das ist die reine Audio-Ausgabe. In der Praxis wird es spürbar mehr: Entwickler Simon Willison zahlte mit Flash für 1 Minute 18 Sekunden Audio (ein Dialog mit zwei Stimmen) 2,74 US-Cent, rechnerisch wären es 1,76 gewesen. Gut die Hälfte mehr, aber immer noch unter 3 Cent.
Mein Take: Die Verdopplung klingt nach Drama, bei diesen Beträgen ist sie egal. Wichtiger ist die Laufzeit der Stimmen. Jede designte Stimme bleibt ein Jahr gespeichert. Wenn du eine Serie planst, speicher dir die Beschreibung und die Hörprobe irgendwo ab, wo du sie in zwölf Monaten wiederfindest.
Wasserzeichen: Jede Gemini-Stimme ist markiert
Laut Google trägt jeder generierte Clip ein unhörbares SynthID-Wasserzeichen. Geklonte Stimmen bekommen zusätzlich C2PA-Herkunftsdaten. Technisch lässt sich also erkennen, dass die Stimme von einer KI stammt, egal ob du es dazuschreibst oder nicht.
Das Wasserzeichen ist Googles Teil der Arbeit. Deiner ist die Frage, ob und wie du dein Publikum informierst. Was Selbstständige wirklich kennzeichnen müssen und was nicht, hab ich in KI-Inhalte kennzeichnen aufgeschlüsselt. Bei Erklärvideos mit KI-Sprecher würde ich es einfach in die Beschreibung schreiben. Kostet nichts, und keiner fühlt sich hinters Licht geführt.
Mein Urteil: Stimme beschreiben ja, Klonen abwarten
Voice Design ist das Werkzeug, das du in Österreich sofort einsetzen kannst, und für Erklärvideos, Intros und Rohschnitte ist es schon heute billiger als jeder Kaffee. Das Klonen mit Gemini ist für uns vorerst kein Thema. Ehrlich gesagt brauchst du für die meisten Creator-Videos auch keine Kopie deiner Stimme, sondern eine gute Aufnahme davon.
Dein erster Schritt: AI Studio öffnen, deinen Wunsch-Erzähler in zwei Sätzen beschreiben, Hörprobe anhören. Wenn du deine Beschreibungen und Ergebnisse mit anderen Selbstständigen vergleichen willst, komm in die ContentWerk Community.