El sistema combina grandes modelos de lenguaje y síntesis por difusión
La empresa rusa Neuro.net ha presentado una nueva generación de la tecnología de síntesis de voz Neuro TTS para soluciones de IA de voz. El desarrollo está diseñado para integrarse en los servicios empresariales a través de una API y puede utilizarse en agentes de IA de voz.

Neuro TTS se basa en una arquitectura que combina grandes modelos de lenguaje y síntesis por difusión. Este enfoque permite tener en cuenta el contexto del texto y las características acústicas de la voz. Al integrarse, las empresas pueden personalizar el carácter del sonido del asistente virtual.
La tecnología se creó teniendo en cuenta la experiencia de Neuro.net en la automatización de centros de contacto, donde la síntesis de voz forma parte del ciclo completo del diálogo: el sistema reconoce la solicitud del cliente, determina su intención, formula una respuesta y la vocaliza.
Una de las características de Neuro TTS es la generación en tiempo real. Los primeros datos de audio comienzan a llegar aproximadamente 120 ms después de la solicitud, por lo que la reproducción de la réplica puede iniciarse incluso antes de que finalice su generación.
Neuro TTS ya está disponible para su uso en servicios operativos. Puede familiarizarse con las voces y probar la tecnología en la plataforma speech.neuro.net.