Startups e inversión
Fish Audio recauda USD 52 millones para modelos de voz con IA
La empresa emergente de Palo Alto Fish Audio recaudó USD 52 millones en una ronda semilla para expandir sus modelos de voz con inteligencia artificial (IA) para creadores y empresas.
Fish Audio, una startup con sede en Palo Alto que desarrolla modelos de voz con IA, anunció el martes que recaudó USD 52 millones en una ronda semilla liderada por Coreline Ventures y Capital Today, con la participación de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0. La empresa afirmó que más de 8 millones de personas usan actualmente las versiones de código abierto o alojadas de sus modelos, lo que genera ingresos recurrentes anuales de USD 21 millones.
Fish Audio fue fundada por Shijia Liao, exinvestigador de Nvidia quien, frustrado por la falta de expresividad de las voces sintéticas disponibles en el mercado, entrenó un modelo de generación de voz en una sola GPU y lo publicó como código abierto. El repositorio resultante, Fish Speech, en GitHub, tiene ahora más de 31,000 estrellas y lo utilizan desarrolladores independientes, diseñadores de videojuegos y creadores. La startup lanzó cinco modelos en el último año —cuatro de generación de voz y uno de conversión de voz a texto— y liberó como código abierto tres de los modelos de generación de voz, mientras mantiene su modelo más reciente, S2.1 Pro, disponible únicamente mediante una API de pago. Su biblioteca abarca ahora más de 15,000 controles en lenguaje natural. Clientes empresariales como HeyGen y Sanas ya utilizan sus API y su plataforma, junto con planes mensuales de pago para creadores y equipos que incluyen funciones de clonación de voz.
“Cada empresa tiene casos de uso y preferencias distintas”, dijo Rissa Cao, directora ejecutiva y cofundadora de Fish Audio, al señalar que HeyGen busca realismo en sus avatares de IA, los estudios de videojuegos buscan voces expresivas para sus personajes y las empresas de agentes de voz necesitan voces naturales y de baja latencia para llamadas.
Fish Audio ha construido parte de su biblioteca de voces invitando a los usuarios a enviar sus propias voces para el entrenamiento, y les compensa cuando se utilizan. Hace unos meses, algunos creadores alegaron que sus voces habían sido subidas sin su consentimiento; la empresa contaba con un proceso de retiro por DMCA para atender estos casos, pero los retiros tardaban mucho tiempo. Cao declaró a TechCrunch que la empresa automatizó desde entonces ese proceso: los creadores que envían una muestra de voz o un contrato que demuestre la titularidad ahora pueden lograr que una voz subida sea retirada en menos de tres minutos. Eso no impide que alguien suba una voz sin el conocimiento de su dueño; la voz permanece activa hasta que el dueño se entera y solicita su retiro.
Cao dijo que los fondos de la ronda semilla respaldarán un modelo de comprensión de audio planeado y un modelo de voz a voz, ambos previstos para este año, mientras Fish Audio compite con ElevenLabs, WellSaid, Cartesia, Speechify, Async y Krisp por los presupuestos de creadores y empresas.
Por qué importa
La apuesta de Fish Audio es que las herramientas automatizadas de consentimiento, y no solo la calidad de los modelos, definirán en qué plataforma de voz con IA confían creadores y empresas para usar su semejanza vocal.