Есть ли в Fish Audio знак ударения
В документации Fish Audio описаны теги эмоций и пауз, но отдельной разметки ударений для русского языка там нет. Пользователи на vc.ru жалуются, что знаки ударения сервис чаще игнорирует и произносит слово по-своему.
Поэтому рецепт «поставьте плюс перед ударной гласной», который встречается в советах по другим синтезаторам, здесь не гарантирован. Можно пробовать, но рассчитывать стоит на приёмы, которые не зависят от разметки.
Что помогает с ударениями
Перепишите слово по произношению
Модель читает то, что видит. Иногда достаточно заменить «е» на «ё» там, где она нужна, или написать трудное название так, как его говорят.
Замените слово синонимом
«Звонит» и «договор» модель может прочитать неверно — проще перестроить фразу, чем бороться.
Перенесите слово в конец фразы
На сильной позиции ударение и интонация обычно выходят естественнее.
Смените голос
Голоса в библиотеке обучены на разных записях: у одного слово звучит верно, у другого нет.
Озвучьте проблемный кусок отдельно
Сгенерируйте короткую фразу несколько раз и вставьте удачный вариант при монтаже.
Паузы и темп
С паузами проще: в моделях S2 есть теги [break] для короткой паузы и [long-break] для длинной. Их ставят прямо в текст между фразами.
Работает и пунктуация: точка вместо запятой, многоточие, тире. Длинный абзац лучше разбить на короткие предложения — модель реже «проглатывает» окончания и держит ровный темп.
- [break] — короткая пауза
- [long-break] — длинная пауза
- многоточие — заметная пауза без тегов
- пустая строка между абзацами
Интонация и акцент на слове
Логическое ударение — выделение главного слова во фразе — удобнее задавать тегами эмоций и тона. В S2 тег в квадратных скобках ставится перед словом или фразой, на которую он влияет, например [emphasis] или [whispering]. Документация указывает, что теги работают и для русского текста.
Если выделение не срабатывает, помогает старый приём дикторов: поставить главное слово в конец предложения или отделить его запятыми.
Слова, на которых модель ошибается чаще всего
Главная беда — омографы, то есть слова с одинаковым написанием и разным ударением: «замок», «мука», «атлас», «хлопок». Модель угадывает по контексту и нередко промахивается. Второй источник ошибок — имена, фамилии, названия брендов и иностранные слова: их произношение модель восстанавливает по написанию.
Третья группа — буква «ё». Если в тексте «все» вместо «всё» и «слез» вместо «слёз», модель прочитает именно то, что написано. Поэтому перед озвучкой полезно пройтись по тексту и расставить «ё» везде, где она нужна, — это самый дешёвый способ снять часть ошибок.
- омографы — уточняйте контекстом или синонимом
- имена и бренды — пишите так, как произносятся
- буква «ё» — ставьте везде, где она есть
- цифры — только словами, с нужным падежом
Когда быстрее через ИИ-агента
ИИ-агент LeanTech (app.leantech.ai) озвучивает текст и отдаёт готовый MP3 без регистрации через зарубежные аккаунты и без VPN, оплата российской картой, кредит равен рублю. Вместе с озвучкой он может написать или сократить сценарий, перевести текст и сделать субтитры — одним запросом. Агент заранее подготовит текст к озвучке: распишет цифры, сокращения и трудные названия.
Чего агент не делает: не гарантирует идеальные ударения в каждом редком слове — это ограничение любого синтеза речи — и не клонирует голос по вашей записи. Он не работает внутри других программ, а видео делает только на тарифах Pro и Power.