Hola, soy Hoda.

Cuando la gente piensa en herramientas de síntesis de voz por inteligencia artificial, ElevenLabs y Speechify suelen ser los primeros nombres que vienen a la mente, pero Fish Audio se ha ganado un espacio real de forma silenciosa últimamente.

La compañía afirma que su voz suena más natural que la de ElevenLabs y respalda esto con datos de pruebas ciegas que son difíciles de ignorar. Dos cosas en particular llamaron mi atención: el sistema de etiquetas de emoción y lo buena que es la calidad de voz en idiomas distintos al inglés (más sobre esto abajo, ya que lo puse a prueba en mi propio idioma).

Ya he analizado ElevenLabs y Speechify (enlaces al final), y Fish Audio se encuentra en la misma categoría como una alternativa genuina que vale la pena sopesar frente a ambas, así que esta vez lo estoy examinando a fondo.


¿Qué es Fish Audio?

Sitio web oficial de Fish Audio

Fish Audio es una plataforma de voz por IA creada y operada por Hanabi AI Inc. Abarca una amplia gama de funciones relacionadas con la voz: texto a voz (TTS), clonación de voz, reconocimiento de voz (STT), traducción de voz y separación de audio.

En su núcleo se encuentra su propio modelo Fish Audio S2, el cual obtuvo una tasa de victorias de aproximadamente el 60% en una prueba comparativa pública cara a cara contra ElevenLabs. Esa cifra se basa en más de 5,000 pruebas ciegas, es decir, evaluaciones donde los usuarios no saben qué herramienta produjo cada muestra.

Compatible oficialmente con más de 30 idiomas (algunas partes del sitio afirman “más de 80 idiomas”, lo cual probablemente se deba a que su modelo insignia más reciente, el S2.1 Pro, cubre específicamente 83 idiomas, mientras que los modelos más antiguos de la gama cubren un conjunto menor cercano a 30). La biblioteca de voces contiene más de 2 millones de voces creadas por la comunidad. Y sí, el japonés es uno de los idiomas compatibles; yo mismo soy japonés, así que lo probé exhaustivamente en mi idioma nativo y funcionó muy bien (hablaré de esto más adelante).

Un ejemplo práctico

En mi canal de YouTube, muestro cómo conectar la API de Fish Audio a Google Sheets para convertir texto en archivos de audio MP3 por lotes (narrado en japonés, pero fácil de seguir visualmente incluso si no hablas el idioma).


Funciones Principales

Texto a Voz (TTS)

Texto a voz (TTS)

La función básica consiste en convertir texto escrito en voz que suene natural. Tres cosas destacan aquí.

El control emocional detallado mediante etiquetas de emoción es el factor diferenciador más importante. Puedes insertar etiquetas como [excited], [whispering], [sad] o [laughing] directamente en tu texto, y el tono emocional cambia frase por frase. Hay más de 64 etiquetas disponibles, lo que te otorga un control notablemente más preciso que el enfoque basado en controles deslizantes de ElevenLabs.

La transmisión de baja latencia es otro punto fuerte: la latencia de la primera salida es inferior a 200 ms, lo que apunta a un diseño creado para agentes de voz en tiempo real e IA conversacional.

La estabilidad de la voz en contenido de larga duración también se mantiene bien; la voz del personaje no se desvía ni se degrada demasiado durante varios minutos de narración, lo que importa para audiolibros o narraciones de YouTube.

Clonación de Voz

Crear una voz

Puedes clonar una voz a partir de solo 15 a 30 segundos de audio de muestra. Es un requisito más corto que la mayoría de los estándares de la industria, lo cual es una ventaja real, pero el ruido o la presencia de múltiples hablantes superpuestos en la grabación afectarán significativamente la precisión de la clonación. Una grabación limpia y silenciosa es prácticamente un requisito previo.

▼ Cloné mi propia voz aquí. Sin ánimo de presumir, resulta un poco inquietante lo mucho que se le parece.

Las voces clonadas también funcionan en diferentes idiomas; por ejemplo, puedes grabar una muestra en japonés y usarla para generar una salida TTS en inglés, lo cual es un truco intercultural verdaderamente útil.

Puedes crear un clon de tu propia voz de forma gratuita, pero si deseas configurarlo como privado o no listado en la opción de visibilidad (“Type”), necesitarás actualizar a un plan de pago. En el plan gratuito, cualquier clon que crees debe ser público, algo que vale la pena saber antes de empezar.

En el plan gratuito, las voces se establecen por defecto como "Públicas".

Reconocimiento de Voz (STT) y Otras Funciones

Fish Audio también incluye transcripción, separación de audio (separar voces de instrumentales), generación de efectos de sonido y traducción de voz. El TTS y la clonación de voz son el principal atractivo, pero tener una parte decente del flujo de trabajo de voz manejada en un solo lugar resulta realmente conveniente.

API

Fish Audio ofrece una API REST junto con SDKs para Python y JavaScript, respaldados por una sólida documentación para desarrolladores. Los precios de la API para TTS son de $15 por millón de bytes UTF-8, lo que es considerablemente más barato que ElevenLabs a una tasa equivalente.

Fish Audio también ha puesto su modelo insignia S2.1 Pro gratuito para desarrolladores a través de su API, bajo una política de uso justo; efectivamente, una API de texto a voz gratuita e ilimitada, al menos por ahora. Es un movimiento verdaderamente inusual en este espacio, ya que la calidad de voz de última generación casi siempre está detrás de un muro de pago en otros lugares.

Fish Audio S2.1 Pro


Precios

Así es como se dividen los planes, según la página oficial de precios de Fish Audio (en USD, verificado en septiembre de 2026).

PlanMensualAnual (por mes)Facturación anualCréditos/mesTiempo de generación
Gratis$0$0$08,000Hasta 7 min
Plus$15$11$132/año250,000Hasta 200 min
Pro$100$75$900/año2,000,000Hasta 1,620 min
Max$999$749$8,988/año25,000,000Hasta 6,250 min
EnterprisePersonalizadoPersonalizado

Sobre el uso comercial: el plan gratuito te limita a un uso no comercial. Si gestionas un canal de YouTube monetizado o lo utilizas para contenido promocional de una empresa, necesitarás el plan Plus o superior.

Límite de caracteres por generación: 500 caracteres en el plan Gratis, 15,000 en el Plus y 30,000 en el Pro. Si procesas guiones largos de forma masiva, el plan Plus o superior es el mínimo práctico.

Ventajas 4
  • El plan gratuito no requiere tarjeta de crédito para probarlo

  • El plan Plus cuesta $11/mes con facturación anual: un valor sólido

  • La facturación anual ahorra aproximadamente el equivalente a tres meses (alrededor de un 27% de descuento)

  • Los precios de la API se encuentran entre los más baratos de la industria ($15 por millón de bytes)

Desventajas 3
  • El plan gratuito tiene un límite de 7 minutos al mes; apenas suficiente para probar la herramienta

  • El uso comercial requiere el plan Plus o superior

  • El plan Pro cuesta entre $75 y $100 al mes, algo costoso para la mayoría de los creadores individuales


Una Mirada Honesta a la Calidad de Voz

Puntos fuertes: emoción y naturalidad

Un sitio de reseñas de terceros (DIY AI) evaluó Fish Audio frente a su propio conjunto de datos y le otorgó la puntuación más alta de cualquier categoría en gama emocional: 8.9/10. Su puntuación general (8.7/10) quedó justo por debajo de ElevenLabs, y tanto la naturalidad como la precisión de la clonación de voz también obtuvieron buenas calificaciones.

Soy japonés, así que puse a prueba la salida en japonés por mí mismo, y se mantuvo sorprendentemente bien, sonando más natural que la salida en japonés de ElevenLabs en varios intentos que realicé. Esa es una señal decente por sí sola: el japonés es un idioma genuinamente difícil para los motores de TTS, por lo que si puede manejarlo razonablemente bien, hay una gran probabilidad de que suene natural en otros idiomas además del inglés. Dicho esto, la calidad varía notablemente según la voz, por lo que vale la pena escuchar una vista previa de varias antes de elegir una para tu caso de uso.

Puntos débiles: gestión de ruido

La puntuación en el manejo de ruido fue más baja que en otras categorías, con un 7.8/10. Si tu grabación de origen para una voz clonada tiene ruido o reverberación, eso tiende a filtrarse en la salida generada. Vale la pena combinar Fish Audio con una herramienta de limpieza (como Adobe Podcast Enhancer, Rovoice o similar) en lugar de alimentarlo con grabaciones en bruto.

Fish Audio vs. ElevenLabs

CategoríaFish AudioElevenLabs
Puntuación general (DIY AI)8.7/108.9/10
Expresión emocional8.9/10 (la mejor de su clase)8.7/10
Naturalidad de la voz8.8/10Líder en la industria
Precisión en clonación de voz8.8/10Comparable
Calidad en idiomas no inglesesSólida, según pruebas prácticasMixta: varía según la voz
Precios de API$15 / 1M de bytes (mejor valor)$165 / 1M de bytes
Plan gratuitoNo requiere tarjeta de créditoMás restrictivo

Para Quién Es Ideal (y Para Quién No)

Fish Audio es especialmente adecuado para creadores de contenido que necesitan voces de personajes o narraciones expresivas y con gran carga emocional, creadores que publican en idiomas distintos al inglés y se preocupan por la calidad de la voz, e ingenieros que desean integrar funciones de voz en un producto sin incurrir en una factura de API enorme.

No encaja tan bien en un par de situaciones. Si necesitas producir en masa y de forma fiable narración corporativa limpia a gran escala (como capacitación en cumplimiento normativo o contenido con la voz de una marca), ElevenLabs es más fácil de gobernar y gestionar. Tampoco es la herramienta adecuada si planeas crear clones de voz a partir de muestras grabadas en entornos ruidosos.


Algunas Cosas a Tener en Cuenta

Derechos y likeness (imagen pública): clonar la voz de una celebridad o actor de voz sin permiso y usarla comercialmente plantea un problema real de derechos de imagen y publicidad. No todas las voces disponibles en la biblioteca comunitaria están necesariamente autorizadas para uso comercial, así que verifica los derechos antes de utilizar una.

Divulgación del uso de voz por IA: si utilizas audio generado en un video o contenido similar, es una buena práctica —y generalmente se considera la base ética— revelar que se empleó una voz de inteligencia artificial.

Eliminación de tu cuenta: cualquier modelo de voz que hayas creado y los créditos no utilizados se perderán si eliminas tu cuenta. Exporta todo lo que necesites y cancela cualquier plan de pago antes de hacerlo.


Preguntas Frecuentes

¿Fish Audio maneja bien otros idiomas además del inglés? Sí. Es compatible oficialmente con más de 30 idiomas, y su modelo insignia más reciente cubre 83. Soy japonés, y después de probarlo a fondo específicamente en japonés, puedo decir que funcionó de manera impresionante. El japonés es uno de los idiomas más difíciles para los motores de TTS, por lo que es una buena señal de calidad para otros idiomas que no sean el inglés. Si trabajas en un idioma en particular, aun así vale la pena previsualizar algunas voces de muestra primero, ya que la calidad varía un poco según la voz.

¿Cuánto se puede hacer realmente con el plan gratuito? Obtienes 8,000 créditos al mes, lo que equivale a unos 7 minutos de generación. No necesitar una tarjeta de crédito para probarlo es una ventaja, pero no se permite el uso comercial, cada generación está limitada a 500 caracteres y las funciones avanzadas de clonación de voz son limitadas. Para cualquier uso que vaya más allá de una simple prueba, querrás optar por el plan Plus o superior.

¿Es mejor que ElevenLabs? El pulido general se inclina ligeramente a favor de ElevenLabs, pero Fish Audio tiene ventajas reales en los precios de su API, la calidad en idiomas distintos al inglés y la granularidad de sus etiquetas de emoción. Cuál de las dos gana depende de tu caso de uso; probar ambas versiones gratuitas primero es una forma razonable de decidir.

¿Qué tipo de audio necesito para clonar una voz? De 15 a 30 segundos de audio de muestra como mínimo. Para obtener mejores resultados, utiliza una grabación limpia de un solo hablante sin ruido de fondo (en formato MP3, WAV o M4A).

¿Puedo usarlo con fines comerciales? Sí, en el plan Plus o en cualquier plan superior. El plan gratuito es exclusivamente para uso personal; un canal de YouTube monetizado o cualquier uso comercial requiere actualizar a un plan de pago.


Vale la pena incluir a Fish Audio en tu lista de opciones junto a ElevenLabs y Speechify, especialmente si creas contenido en un idioma diferente al inglés. Su combinación de precios, control mediante etiquetas de emoción y calidad de voz en idiomas extranjeros le otorga una ventaja genuina en casos de uso muy específicos y, según lo que necesites, podría convertirse fácilmente en tu herramienta principal.