Короткий ответ на вопрос из заголовка: открываете сервис синтеза речи, вставляете текст, выбираете модель и голос, скачиваете файл. В 2026 году это занимает минуту. В синтезе речи BotHub весь процесс это одно поле, два выпадающих списка и к...
Короткий ответ на вопрос из заголовка: открываете сервис синтеза речи, вставляете текст, выбираете модель и голос, скачиваете файл. В 2026 году это занимает минуту. В синтезе речи BotHub весь процесс это одно поле, два выпадающих списка и кнопка.
Проблема в том, что первый файл почти всегда идёт в мусор.
Не потому, что модель слабая. С моделями как раз всё хорошо: они ставят паузы, тянут интонацию, отличают вопрос от утверждения, а некоторые ещё и принимают текстовую инструкцию вроде «прочитай устало, как будто это пятый созвон за день». Ломается другое. Синтез читает «замок» не в ту сторону, выговаривает «ГОСТ Р 34.10-2012» как «гост эр тридцать четыре точка десять тире две тысячи двенадцать», глотает букву ё и превращает 1 250 000 ₽ в невнятную цепочку цифр. Слушатель спотыкается на первой же ошибке, и дальше уже неважно, какая там была интонация.
Так что дальше по порядку: как готовить текст, чтобы этого не было, какую модель брать под какую задачу, сколько это стоит в рублях и что делать с правами, если аудио уходит в коммерческий проект. В конце сводная таблица по ценам, лимитам и длине куска, который модель проглатывает за один раз.