Hey, hier ist Hoda.
Wenn man an KI-Sprachsynthese-Tools denkt, fallen meistens zuerst die Namen ElevenLabs und Speechify – doch Fish Audio hat sich in letzter Zeit klammheimlich eine starke Position aufgebaut.
Das Unternehmen behauptet, dass seine Stimmen natürlicher klingen als die von ElevenLabs, und untermauert das mit Blindtest-Daten, die man kaum ignorieren kann. Zwei Dinge sind mir besonders aufgefallen: das System für Emotions-Tags und die beeindruckende Sprachqualität in anderen Sprachen als Englisch – dazu weiter unten mehr, da ich das Tool in meiner Muttersprache auf Herz und Nieren geprüft habe.
Ich habe ElevenLabs und Speechify bereits getestet (Links am Ende), und Fish Audio spielt in derselben Liga als echter Konkurrent, den es sich zu vergleichen lohnt – Zeit also, das Tool genaue unter die Lupe zu nehmen.
Was ist Fish Audio?

Fish Audio ist eine KI-Sprachplattform, die von Hanabi AI Inc. entwickelt und betrieben wird. Sie deckt eine breite Palette sprachbezogener Funktionen ab: Text-to-Speech (TTS), Sprachklonierung (Voice Cloning), Spracherkennung (STT), Sprachübersetzung und Audio-Trennung.
Das Herzstück ist das hauseigene Fish Audio S2-Modell, das in einem direkten öffentlichen Benchmark gegen ElevenLabs eine Siegquote von rund 60 % erzielte. Dieser Wert basiert auf mehr als 5.000 Blindtests – also Bewertungen, bei denen die Anwender nicht wussten, welches Tool welches Sample produziert hat.
Offiziell werden über 30 Sprachen unterstützt (einige Teile der Website sprechen von „über 80 Sprachen“ – das liegt vermutlich daran, dass das neueste Flaggschiffmodell, S2.1 Pro, gezielt 83 Sprachen abdeckt, während ältere Modelle ein kleineres Set von rund 30 Sprachen unterstützen). Die Stimmenbibliothek umfasst über 2 Millionen von der Community erstellte Stimmen. Und ja, Japanisch ist eine der unterstützten Sprachen – da ich selbst Japaner bin, habe ich das Tool ausgiebig auf Japanisch getestet, und es hat sich hervorragend geschlagen (dazu weiter unten mehr).
Ein praktisches Beispiel
Auf meinem YouTube-Kanal zeige ich, wie man die Fish Audio-API mit Google Sheets verbindet, um Text stapelweise in MP3-Audiodateien umzuwandeln (auf Japanisch erzählt, aber visuell auch ohne Sprachkenntnisse leicht nachvollziehbar).
Kernfunktionen
Text-to-Speech (TTS)

Die Grundfunktion besteht darin, getippten Text in natürlich klingende Sprache umzuwandeln. Hier stechen drei Dinge hervor.
Die feingranulare emotionale Steuerung durch Emotions-Tags ist das größte Alleinstellungsmerkmal. Du kannst Tags wie [excited], [whispering], [sad] oder [laughing] direkt in deinen Text einfügen, wodurch sich der emotionale Tonfall von Satz zu Satz ändert. Es stehen über 64 Tags zur Verfügung, was dir eine spürbar feinere Kontrolle gibt als der auf Reglern basierende Ansatz von ElevenLabs.
Streaming mit geringer Latenz ist eine weitere Stärke – die Latenz bis zur ersten Audioausgabe liegt unter 200 ms, was auf ein Design für Echtzeit-Sprachagenten und konversationelle KI hindeutet.
Die Sprachstabilität bei längeren Inhalten überzeugt ebenfalls – die Stimme des Charakters driftet über mehrere Minuten hinweg kaum ab und verliert nicht an Qualität, was für Hörbücher oder YouTube-Narrationen wichtig ist.
Sprachklonierung (Voice Cloning)

Du kannst eine Stimme aus nur 15 bis 30 Sekunden Sample-Audio klonen. Das ist eine kürzere Anforderung als bei den meisten Industriestandards, was ein echter Vorteil ist – allerdings beeinträchtigen Rauschen oder mehrere überスポ-chende Sprecher in der Aufnahme die Klon-Genauigkeit erheblich. Eine saubere, ruhige Aufnahme ist im Grunde Voraussetzung.
▼ Hier habe ich meine eigene Stimme geklont. Um mich nicht selbst zu loben, aber es ist schon ein wenig unheimlich, wie ähnlich es klingt.
Klonierte Stimmen funktionieren auch sprachübergreifend – du kannst beispielsweise ein Sample auf Japanisch aufnehmen und damit englische TTS-Ausgaben generieren, was ein wirklich nützlicher Multilingual-Trick ist.
Du kannst einen Klon deiner eigenen Stimme kostenlos erstellen, aber wenn du ihn unter der Einstellung „Typ“ auf privat oder ungelistet setzen möchtest, musst du auf einen kostenpflichtigen Tarif upgraden. Im kostenlosen Tarif muss jeder erstellte Klon öffentlich sein – das sollte man wissen, bevor man loslegt.

Spracherkennung (STT) und weitere Funktionen
Fish Audio bietet zudem Transkription, Audio-Trennung (Vocals von Instrumentals trennen), Sound-Effekt-Generierung und Sprachübersetzung. TTS und Sprachklonierung sind zwar die Hauptattraktion, aber es ist äußerst praktisch, dass ein Großteil des Audio-Workflows an einem Ort abgedeckt wird.
API

Fish Audio bietet eine REST-API sowie Python- und JavaScript-SDKs, flankiert von einer soliden Entwicklerdokumentation. Die API-Preise für TTS liegen bei 15 $ pro Million UTF-8-Bytes, was im Vergleich zu ElevenLabs bei gleichem Volumen deutlich günstiger ist.
Fish Audio stellt Entwicklern zudem sein Flaggschiffmodell S2.1 Pro über die API im Rahmen einer Fair-Use-Richtlinie kostenlos zur Verfügung – im Grunde eine unbegrenzte, kostenlose Text-to-Speech-API, zumindest vorerst. Das ist ein ungewöhnlicher Schritt in diesem Bereich, da hochmoderne Sprachqualität andernfalls fast immer kostenpflichtig ist.

Preise
Hier ist die Übersicht der Tarife basierend auf der offiziellen Preisseite von Fish Audio (USD, Stand: September 2026).
| Tarif | Monatlich | Jährlich (pro Mo.) | Jährliche Abrechnung | Credits/Mo. | Generierungszeit |
|---|---|---|---|---|---|
| Free | 0 $ | 0 $ | 0 $ | 8.000 | Bis zu 7 Min. |
| Plus | 15 $ | 11 $ | 132 $/Jahr | 250.000 | Bis zu 200 Min. |
| Pro | 100 $ | 75 $ | 900 $/Jahr | 2.000.000 | Bis zu 1.620 Min. |
| Max | 999 $ | 749 $ | 8.988 $/Jahr | 25.000.000 | Bis zu 6.250 Min. |
| Enterprise | Indiv. | Indiv. | — | — | — |
Zur kommerziellen Nutzung: Der kostenlose Tarif beschränkt dich auf die nicht-kommerzielle Nutzung. Wenn du einen monetarisierten YouTube-Channel betreibst oder das Tool für Firmen-Promos einsetzt, benötigst du mindestens den Plus-Tarif.
Zeichenlimit pro Generierung: 500 Zeichen im Free-Tarif, 15.000 bei Plus, 30.000 bei Pro. Wer lange Skripte in großen Mengen verarbeitet, kommt um Plus oder höher kaum herum.
-
Kostenloser Tarif erfordert keine Kreditkarte zum Testen
-
Plus-Tarif kostet 11 $/Monat bei jährlicher Abrechnung – starkes Preis-Leistungs-Verhältnis
-
Jährliche Abrechnung spart rund drei Monatsgebühren (ca. 27 % Rabatt)
-
API-Preise gehören zu den günstigsten der Branche (15 $ pro Million Bytes)
-
Kostenloser Tarif ist auf 7 Minuten/Monat limitiert – reicht gerade zum Reinschnuppern
-
Kommerzielle Nutzung setzt Plus oder höher voraus
-
Pro-Tarif kostet 75–100 $/Monat und ist für die meisten Einzel-Creator recht teuer
Ein ehrlicher Blick auf die Sprachqualität
Stärke: Emotionen und Natürlichkeit
Eine unabhängige Bewertungsseite (DIY AI) hat Fish Audio mit einem eigenen Datensatz getestet und dem Tool in der Kategorie emotionale Bandbreite die höchste Punkt aller getesteten Anbieter verliehen: 8,9/10. Die Gesamtpunktzahl (8,7/10) landete knapp hinter ElevenLabs, wobei auch Natürlichkeit und Stimmklon-Genauigkeit gut abschnitten.
Da ich Japaner bin, habe ich die japanische Ausgabe selbst einem Praxistest unterzogen – und sie hat sich überraschend gut geschlagen und klang an mehreren getesteten Stellen natürlicher als die japanische Ausgabe von ElevenLabs. Das ist für sich genommen ein starkes Signal: Japanisch ist eine extrem anspruchsvolle Sprache für TTS-Engines. Wenn das Tool damit gut zurechtkommt, stehen die Chancen gut, dass es auch in anderen Sprachen als Englisch überzeugend klingt. Dennoch variiert die Qualität je nach Stimme spürbar, weshalb es sich lohnt, vor der endgültigen Auswahl ein paar Stimmen zu testen.
Schwäche: Umgang mit Rauschen
Der Score für den Umgang mit Hintergrundgeräuschen fiel mit 7,8/10 etwas niedriger aus als in anderen Kategorien. Wenn deine Aufnahme für einen Stimmklon Rauschen oder Hall enthält, schlägt sich das tendenziell im generierten Ergebnis nieder. Es empfiehlt sich, Fish Audio mit einem Audio-Bereinigungstool (wie Adobe Podcast Enhancer, Rovoice o.ä.) zu kombinieren, anstatt rohe Aufnahmen einzuspeisen.
Fish Audio vs. ElevenLabs
| Kategorie | Fish Audio | ElevenLabs |
|---|---|---|
| Gesamtwertung (DIY AI) | 8,7/10 | 8,9/10 |
| Emotionale Ausdruckskraft | 8,9/10 (Klassenbeste) | 8,7/10 |
| Sprachliche Natürlichkeit | 8,8/10 | Branchenführend |
| Genauigkeit des Stimmklons | 8,8/10 | Vergleichbar |
| Qualität bei Nicht-Englisch | Stark (laut Praxistest) | Gemischt – variiert je nach Stimme |
| API-Preise | 15 $ / 1 Mio. Bytes (Bestwert) | 165 $ / 1 Mio. Bytes |
| Kostenloser Tarif | Keine Kreditkarte erforderlich | Restriktiver |
Für wen es sich eignet (und für wen nicht)
Fish Audio eignet sich besonders für Content Creator, die ausdrucksstarke, emotional aufgeladene Charakterstimmen oder Moderationen benötigen, Creator, die in anderen Sprachen als Englisch veröffentlichen und Wert auf Sprachqualität legen, sowie für Entwickler, die Sprachfunktionen in ein Produkt integrieren möchten, ohne ein Vermögen für die API zu zahlen.
Weniger geeignet ist das Tool in bestimmten Szenarien. Wenn du zuverlässig saubere Corporate-Narrationen im großen Stil massenproduzieren musst – etwa Compliance-Schulungen oder Markenstimmen-Inhalte –, lässt sich ElevenLabs einfacher steuern und verwalten. Es ist zudem nicht die richtige Wahl, wenn du Stimmklons aus in lauten Umgebungen aufgenommenen Samples erstellen möchtest.
Ein paar Dinge, die du beachten solltest
Rechte und Persönlichkeitsrechte: Das Klonen der Stimme einer Berühmtheit oder eines Synchronsprechers ohne Erlaubnis und die kommerzielle Nutzung werfen urheber- und persönlichkeitsrechtliche Fragen auf. Nicht jede Stimme aus der Community-Bibliothek ist automatisch für die kommerzielle Nutzung freigegeben – prüfe also vor dem Einsatz die Lizenzrechte.
Kennzeichnung von KI-Stimmen: Wenn du generierte Audios in Videos oder ähnlichen Inhalten verwendest, ist es guter Usus – und gilt gemeinhin als ethischer Standard –, offenzulegen, dass eine KI-Stimme eingesetzt wurde.
Löschung des Accounts: Alle von dir erstellten Sprachmodelle und nicht genutzten Credits verfallen, wenn du deinen Account löschst. Sichere vorher alles Notwendige und kündige eventuelle kostenpflichtige Abos.
FAQ
Kommt Fish Audio gut mit anderen Sprachen als Englisch klar? Ja. Offiziell werden über 30 Sprachen unterstützt, das neueste Flaggschiffmodell deckt sogar 83 ab. Da ich Japaner bin und das Tool intensiv auf Japanisch getestet habe, kann ich sagen, dass es sich hervorragend geschlagen hat. Japanisch gehört zu den schwereren Sprachen für TTS-Engines, was ein gutes Zeichen für die Qualität in anderen Nicht-Englisch-Sprachen ist. Wer in einer bestimmten Sprache arbeitet, sollte vorab dennoch ein paar Beispielstimmen testen, da die Qualität je nach Stimme etwas variiert.
Was kann man im kostenlosen Tarif tatsächlich machen? Du erhältst 8.000 Credits pro Monat, was etwa 7 Minuten Generierungszeit entspricht. Dass man keine Kreditkarte zum Testen braucht, ist ein Pluspunkt; allerdings ist keine kommerzielle Nutzung erlaubt, jede Generierung ist auf 500 Zeichen limitiert und erweiterte Klon-Funktionen sind eingeschränkt. Für alles, was über das Testen hinausgeht, empfiehlt sich der Plus-Tarif oder höher.
Ist es besser als ElevenLabs? Der allgemeine Feinschliff geht knapp an ElevenLabs, aber Fish Audio hat echte Vorteile bei den API-Preisen, der Qualität bei Nicht-Englisch und der Granularität der Emotions-Tags. Welches Tool gewinnt, hängt vom jeweiligen Anwendungsfall ab – beide kostenlosen Tarife erst einmal auszuprobieren, ist ein guter Weg zur Entscheidung.
Welche Art von Audio benötigt man für das Voice Cloning? Mindestens 15 bis 30 Sekunden Sample-Audio. Für bessere Ergebnisse nutzt man eine saubere Single-Sprecher-Aufnahme ohne Hintergrundgeräusche (MP3, WAV oder M4A).
Kann man das Tool kommerziell nutzen? Ja, ab dem Plus-Tarif und allen höheren Plänen. Der kostenlose Tarif ist ausschließlich für den persönlichen Gebrauch gedacht – ein monetarisierter YouTube-Kanal oder jegliche kommerzielle Nutzung erfordert ein Upgrade auf einen kostenpflichtigen Tarif.
Fish Audio gehört neben ElevenLabs und Speechify auf die engere Auswahlliste, besonders wenn du Inhalte in anderen Sprachen als Englisch erstellst. Die Kombination aus Preisen, Emotions-Tag-Steuerung und Sprachqualität bei Nicht-Englisch verschafft dem Tool in bestimmten Szenarien einen echten Vorsprung und könnte je nach Bedarf schnell zu deinem primären Werkzeug werden.
