"Schottischer Akzent, müde Stimme, leicht genervt" — so eine Anweisung reicht Gemini 3.8 Flash TTS (Text-to-Speech, also Text-zu-Sprache), um daraus eine passende KI-Stimme zu bauen. Kein Sprecher-Casting, kein Tonstudio. Nur ein Textfeld.
Google hat das neue Modell am 23. September vorgestellt, zusammen mit der schlankeren Variante Flash-Lite TTS. Beide sind ab sofort über die Gemini-API und in Google AI Studio nutzbar.
Von 30 auf über 2.000 Stimmen
Bisher hatte Gemini rund 30 vorgefertigte Stimmen im Angebot. Flash TTS macht daraus mehr als 2.000 — nicht als starre Liste zum Anklicken, sondern gestaltbar per natürlicher Sprache. Du beschreibst Rolle, Akzent und Charakter im Textfeld, und das Modell baut daraus eine passende Stimme. Über 100 Sprachen und Dialekte sind dabei, bis hin zu Regionalvarianten wie mexikanischem Spanisch, Québec-Französisch oder schottischem Englisch.
Neu ist die Grundidee nicht — Anbieter wie ElevenLabs machen künstliche Stimmen schon länger, und ordentliche KI-Sprecher sind seit Jahren Alltag in Hörbüchern und Werbespots. Neu ist, wie tief Google die Funktion jetzt ins eigene Ökosystem einbaut: AI Studio, Gemini-API, langfristig auch Gemini Enterprise.
Zwei Modelle, zwei Zwecke
Flash TTS zielt auf kreative Kontrolle: Charaktere für Games, aufwendig inszenierte Hörbücher, Podcast-Produktionen mit mehreren Stimmen. Flash-Lite TTS ist die günstigere, schnellere Variante für den Massenbetrieb — Synchronisation, automatisierte Sprachausgabe, Voice-Agenten, die am Telefon mit dir reden.
Für Einsteiger heißt das: Willst du einmal herumspielen, ist das egal — beide laufen über dieselbe Oberfläche. Erst wer täglich tausende Zeilen vertonen will, muss sich für eine Variante entscheiden.
Was kostet das?
Über AI Studio lässt sich beides derzeit kostenlos ausprobieren — mit den üblichen Grenzen eines Free-Tiers, wie bei praktisch jedem KI-Anbieter: begrenztes Kontingent, kein Anspruch auf durchgehende Verfügbarkeit. Wer die Modelle über die API produktiv einsetzt, zahlt nach Zeichen und erzeugter Audiolänge. Konkret sind das nach aktuellem Stand rund 1,35 US-Cent pro Minute erzeugter Sprache bei Flash TTS, bei Flash-Lite TTS rund 0,9 Cent. Das sind allerdings Einführungspreise: Laut Googles eigener Preisliste verdoppeln sie sich zum 1. Januar 2027.
Nichts Neues an dieser Front: kostenlos zum Reinschnuppern, wer regelmäßig nutzt, zahlt früher oder später. Das ist kein Skandal, sondern schlicht wie Rechenzentren finanziert werden.
Selbst ausprobieren
Ein kostenloser Google-Account reicht für den Einstieg in AI Studio — kein Abo, keine Kreditkarte nötig. Wer schon mit der Gemini-API gearbeitet hat, kann sofort loslegen; alle anderen finden im Studio eine Weboberfläche, die auch ohne Programmierkenntnisse funktioniert. Text eintippen, Stimme mit ein paar Worten beschreiben, abspielen — fertig. Entwickler-Kenntnisse braucht es hier ausdrücklich nicht, nur für die spätere Einbindung per API.
Eine Warnung gehört trotzdem dazu: Je besser KI-Stimmen werden, desto leichter lassen sie sich für Fake-Audios missbrauchen — Telefonbetrug mit geklonter Stimme ist längst kein Zukunftsszenario mehr. Google verspricht Wasserzeichen-Technik (ähnlich wie bei KI-Bildern) und Regeln gegen Missbrauch. Ob das reicht, zeigt sich erst in der Praxis — ein Totschlagargument gegen das Tool selbst ist es aber nicht, genauso wenig wie bei Bildgeneratoren.
Für wen lohnt sich das?
Zum Ausprobieren: für alle. Zum produktiven Einsatz eher für alle mit einem konkreten Projekt — ein Podcast, ein Erklärvideo, ein kleines Game, eine Voice-Automatisierung. Wer nur mal eine skurrile KI-Stimme hören will, ist mit dem kostenlosen Kontingent in AI Studio bestens bedient. Für alles, was dauerhaft läuft, lohnt sich vorher ein Blick auf die tatsächlichen API-Preise — die ändern sich bei praktisch jedem Anbieter schneller, als einem lieb ist.
