El mercado de modelos de voz generados por IA es enorme. Los casos de uso creativos requieren que los modelos de voz de IA sean más expresivos, mientras que las empresas que buscan automatizar la atención al cliente y las operaciones de ventas necesitan que sean más manejables.
Fish Audio, con sede en Palo Alto, quiere atender todos esos casos de uso con su biblioteca de más de 15.000 controles de lenguaje natural. Desde su lanzamiento el año pasado, la startup cuenta hoy con más de 8 millones de personas que utilizan las versiones de código abierto o alojadas de sus modelos, y ahora genera ingresos recurrentes anuales de 21 millones de dólares.
Para continuar aprovechando esa tracción, la startup dijo el martes que había recaudado 50 millones de dólares en una ronda inicial liderada por Coreline Ventures y Capital Today. La financiación también contó con la participación de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0.
Fish Audio comenzó como un pequeño proyecto del ex investigador de NVIDIA Shijia Liao, quien, frustrado por las voces sintéticas no expresivas disponibles en el mercado, entrenó un modelo de generación de voz en una sola GPU, que fue de código abierto. El repositorio Fish Speech en GitHub ahora tiene más de 31.000 estrellas y es utilizado por desarrolladores independientes, diseñadores y creadores de videojuegos.
La compañía lanzó cinco modelos el año pasado: cuatro modelos de generación de voz y un modelo de voz a texto. Tiene tres de sus modelos de generación de voz de código abierto, pero su último modelo S2.1 Pro sólo está disponible a través de su API paga.
Fish Audio ofrece planes mensuales pagos adecuados para creadores y equipos que desbloquean una cantidad determinada de minutos de generación, además de funciones de clonación de voz. La compañía también ofrece una versión empresarial de sus API y plataforma, y dice que organizaciones como HeyGen, Sanas y Plaud ya la están utilizando.
«Cada empresa tiene diferentes casos de uso y diferentes preferencias. Por ejemplo, empresas como HeyGen, que utilizan nuestras voces para impulsar avatares de IA, quieren realismo en las voces; un estudio de juegos querría voces expresivas para sus personajes; y empresas de agentes de voz como LiveKit quieren voces con un sonido más natural y de baja latencia que sean lo suficientemente expresivas para las llamadas», dijo Cao.
Una forma en que la startup ha construido su biblioteca de voces es simplemente pidiendo a los usuarios que envíen sus propias voces para entrenar sus modelos y compensándolos si se utilizan sus voces. Sin embargo, eso resultó en algunos problemas hace unos meses, ya que algunos creadores alegaron que sus voces se cargaron en Fish Audio sin su consentimiento. La startup contaba con un proceso de eliminación de contenido DMCA para abordar tales preocupaciones, pero la eliminación en sí llevó mucho tiempo.
La directora ejecutiva y cofundadora de Fish Audio, Rissa Cao, dijo a TechCrunch que la compañía ahora ha automatizado el proceso de eliminación. Los creadores pueden enviar fácilmente una breve muestra de voz o un contrato para demostrar que la voz cargada les pertenece, y su voz será eliminada de la plataforma de la startup en menos de 3 minutos, dijo.
Aún así, eso no impide que cualquiera pueda subir la voz de un artista sin su conocimiento. Y hasta que el artista se entere, su voz seguirá utilizándose en la plataforma hasta que solicite su retirada.
Oskue Honda, socio de Coreline Ventures, dijo que un modelo impulsado por la comunidad solo funciona cuando los creadores confían en la plataforma.
«Un enfoque centrado en la comunidad sólo puede convertirse en una ventaja duradera si los creadores confían en la plataforma. Eso significa que el consentimiento, la transparencia y la atribución deben incorporarse al producto en lugar de tratarse como algo secundario. Creo que la industria necesita avanzar hacia la propiedad de voz verificada, términos de licencia claros, procesos sencillos de presentación de informes y eliminación y, eventualmente, modelos de reparto de ingresos en los que los creadores se beneficien financieramente cuando sus voces tengan licencia o se utilicen comercialmente», afirmó.
Cao dijo que cuando la startup solo ofrecía su producto como un proyecto de código abierto con planes para creadores, funcionaba de manera eficiente y no necesitaba dinero. Pero quería desarrollar modelos más avanzados y también quería adaptarse a las empresas a medida que aumentaba el interés de los inversores, lo que la llevó a buscar capital.
De cara al futuro, Fish Audio planea lanzar un modelo de comprensión de audio este año. También está construyendo un modelo de voz a voz.
El mercado de generación de voz está abarrotado, con empresas como ElevenLabs, WellSaid, Cartesia, Speechify, Async (anteriormente Podcastle) y Krisp compitiendo por las billeteras de los creadores y las empresas.
Según Rico Mallozzi, socio de 359 Capital, los controles detallados para los desarrolladores y la capacitación de modelos rentable ayudarán a Fish Audio a competir mejor con los grandes laboratorios de inteligencia artificial.
«Creo que lo que han podido construir, modelos de última generación, con el equipo que tienen, en comparación con algunos de estos otros laboratorios o empresas de IA bien financiados, es increíble. Muestra su perspicacia técnica para cerrar la brecha entre el sonido artificial y las voces humanas», dijo Mallozzi a TechCrunch durante una llamada.
Cuando compra a través de enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.
