Как работает клонирование
Сервис берёт вашу запись, строит по ней модель голоса и дальше озвучивает любой текст этим тембром. По данным Fish Audio, минимальный образец — около 10 секунд чистой речи, а 30–60 секунд обычно дают заметно лучший результат.
Модель S2 умеет переносить голос между языками: записали образец по-русски — можно озвучить и английский текст. Качество перевода голоса на другой язык стоит проверять на своём материале.
Как записать образец
Качество клона почти целиком зависит от записи. Шум, музыка, эхо комнаты и чужие голоса попадут в модель, и потом их не убрать. Говорите естественно, как в обычном разговоре: актёрская подача даст утрированный клон.
- тихая комната без эха, мягкая мебель вокруг
- микрофон гарнитуры или телефон на расстоянии 15–20 см
- 30–60 секунд связной речи с вопросами и восклицаниями
- без музыки, фона и обработки
- формат MP3 или WAV
Создание голоса по шагам
Точные названия кнопок Fish Audio периодически меняет, поэтому ориентируйтесь на раздел клонирования голоса в меню. Число слотов под свои голоса зависит от тарифа.
Войдите в аккаунт
Клонирование доступно после регистрации через Google или GitHub.
Откройте создание голоса
В интерфейсе это раздел клонирования (Voice Clone / создание модели голоса).
Загрузите запись
Или запишите образец прямо в браузере, если микрофон хороший.
Дайте название и выберите доступ
Свой голос держите приватным, чтобы он не появился в общей библиотеке.
Дождитесь обработки и проверьте
Озвучьте тестовый абзац с числами и вопросами. Если звучит металлически — перезапишите образец в более тихом месте.
Чей голос можно клонировать
Сам Fish Audio прямо пишет: клонируйте только голоса, на которые у вас есть явное разрешение, — свой, голос человека, который дал согласие, или лицензированный голос. Ответственность за права на голос лежит на пользователе.
Озвучка чужим голосом без согласия — это риск и для вас: претензии правообладателя, блокировка аккаунта, а в случае обмана — уже не шутка, а мошенничество. Для роликов и мемов безопаснее брать готовые голоса из библиотеки с открытым доступом и не выдавать озвучку за слова реального человека.
Если клон звучит плохо
Помните, что клон повторяет не только тембр, но и манеру записи. Если образец начитан сонно и тихо, модель будет так же вялой на любом тексте. Перед записью разомнитесь: прочитайте вслух пару абзацев, выпейте воды, держите ровную громкость. Лучше сделать три дубля и загрузить самый живой, чем склеивать куски разного настроения — склейка даёт неровный голос.
Если свой голос нужен для регулярных роликов, сохраните исходную запись: при обновлении модели или переносе на другой сервис её можно будет загрузить заново.
- запишите образец длиннее — 45–60 секунд
- уберите паузы и шумы в начале и в конце
- не используйте запись из видео с музыкой
- говорите в своём обычном темпе
- проверяйте на коротком тексте, а не на всём сценарии
Свой голос и эмоции
К клону применимы те же теги эмоций, что и к голосам из библиотеки: в S2 — квадратные скобки перед фразой, например [excited] или [whispering]. Но диапазон эмоций ограничен образцом: если вы записали только спокойную речь, крик или шёпот клона могут звучать неестественно. Для выразительных голосов разработчик советует более длинную запись с разными интонациями.
Когда быстрее через ИИ-агента
ИИ-агент LeanTech (app.leantech.ai) озвучивает текст и отдаёт готовый MP3 без регистрации через зарубежные аккаунты и без VPN, оплата российской картой, кредит равен рублю. Вместе с озвучкой он может написать или сократить сценарий, перевести текст и сделать субтитры — одним запросом.
Чего агент не делает: не клонирует голос по вашей записи — если нужен именно ваш тембр, это задача Fish Audio или похожих сервисов. Агент не работает внутри других программ, а видео делает только на тарифах Pro и Power.