Российская компания Neuro.net представила новое поколение технологии синтеза речи Neuro TTS для голосовых ИИ-решений. Разработка рассчитана на интеграцию в сервисы бизнеса через API и может использоваться в голосовых ИИ-агентах.
В основе Neuro TTS — архитектура, объединяющая большие языковые модели и диффузионный синтез. Такой подход позволяет учитывать контекст текста и акустические особенности голоса. При интеграции компании могут настраивать характер звучания виртуального ассистента.
Технология создавалась с учётом опыта Neuro.net в автоматизации контакт-центров, где синтез речи является частью полного цикла диалога: система распознаёт запрос клиента, определяет его намерение, формирует ответ и озвучивает его.
Одной из особенностей Neuro TTS стала потоковая генерация. Первые аудиоданные начинают поступать примерно через 120 мс после запроса, поэтому воспроизведение реплики можно запускать ещё до завершения её генерации.
Neuro TTS уже доступна для использования в рабочих сервисах. Ознакомиться с голосами и протестировать технологию можно на платформе speech.neuro.net.