Кратко
Представлена новая открытая модель синтеза речи TADA от Hume AI, которая генерирует текст и аудио в одном потоке. Эта разработка устанавливает новые стандарты качества и эффективности в голосовых технологиях, обеспечивая высокую скорость и минимальный уровень ошибок.
- Модель TADA в пять раз быстрее аналогов и демонстрирует практически полное отсутствие галлюцинаций в генерируемом тексте.
- Поддерживается генерация до 700 секунд аудио на 2048 токенов, что удобно для создания подкастов и аудиокниг.
- TADA автоматически предоставляет транскрипт одновременно с аудио, устраняя потребность в сторонних сервисах.
- Модель имеет открытый исходный код, доступна для локального развертывания и не имеет подписок или лимитов.