Что умеет Fish Audio
Fish Audio — сервис синтеза речи на собственной модели. Весной 2026 года вышло поколение S2: по данным разработчика, оно обучено примерно на 80 языках, и русский входит в список языков с подтверждённо сильным качеством. Предыдущая модель S1 по-прежнему встречается в интерфейсе и API.
Главные сценарии — озвучка текста готовым голосом, клонирование голоса по короткой записи и работа через API. В библиотеке тысячи пользовательских голосов, в том числе русских, но качество у них разное: одни звучат как диктор, другие — как запись с телефона.
Как сделать озвучку: порядок действий
Войдите на fish.audio
Регистрация идёт через Google или GitHub. Без входа генерация недоступна.
Откройте раздел Text to Speech
Это основной экран: поле для текста и выбор голоса.
Выберите голос
В поиске библиотеки пишите «russian» или название героя. Послушайте 2–3 примера: голос, записанный в тишине, даст чистую озвучку.
Вставьте текст
Начните с одного абзаца, чтобы проверить голос, и только потом отправляйте весь сценарий.
Сгенерируйте и прослушайте
Если слово звучит неверно, правьте текст, а не жмите генерацию по кругу: результат будет похожим.
Скачайте файл
Готовую озвучку сохраняют в MP3 или WAV.
Как подготовить текст, чтобы звучало живо
Модель читает то, что написано, включая сокращения и цифры. «10 тыс. руб.» лучше заменить на «десять тысяч рублей», а английские названия — написать так, как их нужно произнести. Длинные предложения режьте на короткие: интонация от этого становится естественнее.
Паузы управляются пунктуацией: точка даёт заметную паузу, многоточие — длиннее, запятая — короткую. Абзацы лучше разделять пустой строкой.
- цифры, даты и сокращения — словами
- аббревиатуры — как читаются: «эс-эм-эм», а не «SMM»
- одно предложение — одна мысль
- проверка по абзацу, а не всем текстом сразу
Эмоции и паузы тегами
В моделях S2 эмоцию задают тегом в квадратных скобках прямо перед фразой: [whispering], [excited], [sad]. Документация Fish Audio указывает, что теги эмоций работают и для русского текста. Для пауз есть [break] и [long-break].
У старой модели S1 синтаксис другой — круглые скобки и фиксированный список: (happy), (angry). Если тег прочитался вслух, значит, выбрана модель с другим синтаксисом. Надёжнее писать сами теги по-английски, как в документации.
Бесплатный тариф и оплата
Бесплатно дают ограниченный месячный объём генерации, и, по условиям сервиса, только для личного некоммерческого использования. Платные планы начинаются примерно с 10–15 $ в месяц, Pro стоит около 100 $; цены менялись и зависят от способа оплаты — уточняйте на странице тарифов fish.audio.
Российской картой подписку не оплатить, а интерфейс только на английском. Если нужна озвучка для рекламы или канала с монетизацией, бесплатного тарифа по условиям недостаточно.
Типичные ошибки новичков
Первая ошибка — отправлять весь сценарий сразу. Если голос выбран неудачно, лимит уйдёт впустую, а переделывать придётся целиком. Проверяйте голос на одном абзаце и только потом озвучивайте остальное кусками по 2–3 абзаца.
Вторая — выбирать голос по названию, а не по звуку. Популярный голос из топа библиотеки может быть записан на английском и читать русский с акцентом. Третья — надеяться, что генерация по кругу исправит ошибку: если модель неверно читает слово, правьте текст. Про ударения — отдельная статья этого блога.
- проверка голоса на коротком куске
- русские голоса — по примеру звучания, не по рейтингу
- длинный текст — частями, потом склейка
- имена файлов с номерами фрагментов, чтобы не запутаться при монтаже
Когда быстрее через ИИ-агента
ИИ-агент LeanTech (app.leantech.ai) озвучивает текст и отдаёт готовый MP3 без регистрации через зарубежные аккаунты и без VPN, оплата российской картой, кредит равен рублю. Вместе с озвучкой он может написать или сократить сценарий, перевести текст и сделать субтитры — одним запросом.
Чего агент не делает: не повторяет голос конкретного человека по вашей записи и не открывает библиотеку голосов Fish Audio. Он не работает внутри других программ, а видео с озвучкой делает только на тарифах Pro и Power.