GenVoice
Озвучка текста онлайн нейросетью: естественная интонация и клонирование голоса за 10 секунд

О проекте
GenVoice — веб-сервис синтеза и обработки голоса на нейросетях: превращает текст в речь на 70+ голосах, клонирует голос пользователя по образцу от 3 секунд, распознаёт аудио и видео в текст с субтитрами SRT/VTT и чистит записи от шума и эха. Работает по единому балансу: месячная подписка начисляет рубли на общий счёт, из которого списываются символы TTS, минуты ASR, диалоги и другие операции, а неизрасходованный остаток переносится на следующий месяц (максимум на две квоты). Сервис явно целится в русский рынок — оплата картами РФ, поддержка RU/EN и прямое сравнение себя с ElevenLabs, Zvukogram и Яндекс SpeechKit прямо на странице. Из честных ограничений: объём символов за один запрос и размер файла растут только вместе с более дорогим тарифом (от 1000 до 5000 символов за запрос), а бесплатный вход даёт всего 500 символов за запрос и один свой голос.
Со слов автора
genvoice.ru - сервис синтеза и распознавания речи Свой инференс, хостимся в РФ. Целимся в замену 11 labs. Есть realtime API поверх вебсокетов. В своем канале тестирую и щупаю open-source TTS модели, есть демки под каждым постом.
Что умеет
- Клонирование голоса по образцу от 3 секунд, готово примерно за 10 секунд
- Библиотека готовых голосов — дикторские, нейтральные, эмоциональные
- Распознавание речи в текст: транскрибация, субтитры и заметки
- Озвучка больших файлов — до 500 тыс. символов за раз
- Озвучка диалогов несколькими голосами в одном проекте
- Очистка аудио от шума, эха и помех