Fish Audio recauda $52M para síntesis de voz con IA

⏱ Tiempo de lectura: 4 min
Fish Audio, startup especializada en síntesis de voz con inteligencia artificial, anunció la conclusión de una ronda de financiación de semilla por $52 millones liderada por Coreline Ventures y Capital Today. La plataforma, que comenzó como proyecto personal del cofundador Shijia Liao en su dormitorio, busca convertir la voz en la interfaz predeterminada para cada modelo de IA disponible.
De proyecto casero a plataforma de voz con 8 millones de usuarios
Shijia Liao, exinvestigador de video en Nvidia y fanático del anime japonés, decidió entrenar modelos de síntesis de voz porque estaba cansado de las voces robóticas y monótonas de los primeros sistemas de IA. Partiendo solo con una GPU en su laptop, desarrolló Fish Speech, un proyecto de código abierto que alcanzó más de 31,000 estrellas en GitHub. Desde su lanzamiento en 2023, la plataforma evolucionó hacia una de las soluciones más completas de síntesis y clonación de voz, con más de 8 millones de usuarios activos. Su ingresos recurrentes anuales superan los $21 millones.
Capacidades técnicas y alcance de idiomas
Fish Audio utiliza controles de emoción a nivel de palabra impulsados por más de 15,000 indicaciones en lenguaje natural para generar voces expresivas. El modelo S2.1 Pro, su versión insignia, puede clonar una voz desde un clip de audio de apenas 5 segundos en menos de 15 segundos. Soporta nativamente 83 idiomas. En pruebas de escucha ciega, el 67% de los oyentes prefirió las salidas de voz de Fish Audio sobre las de competidores. La plataforma ahora atiende a organizaciones en sectores regulados como salud y servicios financieros, con despliegues locales de cero retención de datos y cumplimiento HIPAA. Entre sus respaldadores figuran 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners e inversionistas ángeles no identificados.
Planes de expansión y disponibilidad
Fish Audio planea expandir su línea de modelos más allá de síntesis de texto a voz, construyendo un stack audio-nativo que incluya modelos de lenguaje nativos de voz y herramientas de traducción de voz en tiempo real. La empresa invertirá en equipos de ventas empresariales e integraciones de API con socios como Retell AI y LiveKit. A partir de finales de agosto, el modelo S2.1 Pro estará disponible sin costo para todos los desarrolladores a través de su API oficial. Fish Audio compite con startups establecidas como ElevenLabs, que recaudó $500 millones en una ronda que la valoró en $11 mil millones.
| Aspecto | Detalles |
|---|---|
| Financiación | $52 millones en ronda de semilla (julio 2026) |
| Líderes de ronda | Coreline Ventures y Capital Today |
| Otros inversionistas | 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners, ángeles sin nombrar |
| Fundador y Chief Scientist | Shijia Liao (exinvestigador de Nvidia) |
| CEO | Rissa Cao |
| Nombre oficial | Hanabi AI Inc. |
| Inicio del proyecto | 2023 (Fish Speech lanzado como código abierto) |
| Estrellas en GitHub | Más de 31,000 |
| Base de usuarios | Más de 8 millones |
| Ingresos recurrentes anuales (ARR) | Más de $21 millones |
| Clonación de voz | 5 segundos de audio → clonación en menos de 15 segundos (S2.1 Pro) |
| Idiomas soportados | 83 idiomas nativos |
| Controles de emoción | Más de 15,000 indicaciones en lenguaje natural a nivel de palabra |
| Pruebas de escucha ciega | 67% de oyentes prefirieron Fish Audio sobre competidores |
| Cumplimiento normativo | HIPAA, despliegues locales sin retención de datos |
| Disponibilidad S2.1 Pro gratis | API pública a partir de finales de agosto de 2026 |
| Próximas expansiones | Modelos de lenguaje nativos de voz, traducción de voz en tiempo real, integraciones con Retell AI y LiveKit |
Qué cambia con esta información
La inversión posiciona a Fish Audio como competidor directo de plataformas consolidadas de síntesis de voz. Con una base de usuarios que crece aceleradamente y un enfoque en hacer accesible la generación de voces expresivas, la startup busca democratizar una tecnología que históricamente ha estado concentrada en manos de empresas grandes. La disponibilidad gratuita del modelo S2.1 Pro a través de API podría acelerar adopción entre desarrolladores independientes y pequeños estudios creativos.
Preguntas frecuentes sobre Fish Audio
¿Qué es Fish Audio y cómo comenzó?
Fish Audio es una plataforma de síntesis y clonación de voz con IA fundada por Shijia Liao, quien comenzó el proyecto en 2023 como código abierto (Fish Speech) desde su dormitorio con una sola GPU. Hoy es una startup con más de 8 millones de usuarios y ARR superior a $21 millones.
¿Cuándo estará disponible el modelo S2.1 Pro de forma gratuita?
A partir de finales de agosto de 2026, Fish Audio ofrecerá su modelo insignia S2.1 Pro sin costo a todos los desarrolladores a través de su API oficial.
¿Qué idiomas soporta Fish Audio?
La plataforma soporta 83 idiomas de forma nativa, lo que la convierte en una opción multilingüe robusta para desarrolladores y empresas globales.
Nuestra lectura editorial
Fish Audio representa un patrón emergente en IA: startups que nacen de frustración técnica personal y escalan rápidamente mediante código abierto y una propuesta clara. Osuke Honda, socio gestor de Coreline Ventures, respalda la premisa de que la voz se está convirtiendo en la interfaz predeterminada de IA, algo que alinea con tendencias de mercado más amplias hacia interacción conversacional natural.
En Inteligencia Artificial creemos que la disponibilidad gratuita del modelo S2.1 Pro es una jugada estratégica inteligente para consolidar cuota de mercado antes de competidores más capitalizados. ¿Veremos a Fish Audio convertirse en el estándar de facto para síntesis de voz en aplicaciones independientes y pequeñas empresas?
Fuente: siliconangle.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.