Перейти к основному содержимому

Шаг 2. Генерация озвучки

02 · Голос — второй производственный этап FOXI Studio. Он берёт готовый сценарий из 01 · Текст и превращает его в аудиодорожку для будущего видео.

Хорошая озвучка сильно влияет на удержание. Даже сильный сценарий будет восприниматься плохо, если диктор говорит не тем тоном, слишком быстро, слишком монотонно или звучит синтетически.

Вкладка 02 · Голос в FOXI Studio

Что делает Шаг 2

На этом этапе FOXI:

  • берёт финальный сценарий после Шага 1;
  • очищает текст от технических пометок и лишнего форматирования;
  • отправляет текст в выбранный движок озвучки;
  • получает аудиодорожку;
  • при необходимости применяет пост-обработку;
  • сохраняет результат в файлы проекта;
  • передаёт звук дальше в этапы кадров, видео и Builder.

Процесс генерации озвучки

Что выбрать новичку

Если вы только начинаете, не перебирайте десятки голосов. Выберите понятный шаблон голоса, сделайте короткий тест и оцените результат в готовом ролике.

Для первого теста проверьте:

  • выбран правильный проект;
  • Шаг 1 уже создал сценарий;
  • язык голоса совпадает с языком текста;
  • выбран шаблон голоса;
  • скорость не слишком высокая;
  • Anti-Detect озвучки включён, если доступен на тарифе;
  • баланс FX достаточный.

Основные настройки озвучки

Провайдер озвучки

В проекте может быть несколько вариантов озвучки. Доступность зависит от тарифа и текущих подключений.

ПровайдерКогда подходит
GeminiКогда нужен быстрый старт и простая настройка голоса
ElevenLabs/Lumean templateКогда нужен более живой и стабильный диктор по шаблону
Запасные ElevenLabs-моделиКогда нужен альтернативный путь или другой характер голоса
Внутренние модели FOXIКогда сервис сам обслуживает подключение и списывает стоимость с FX

Если вы не понимаете разницу, оставьте рекомендованный вариант или спросите AI-помощника.

Пример запроса:

Подбери голос для англоязычного канала про мистическую историю: серьёзный документальный тон, мужской диктор, аудитория США 30–60 лет.

Шаблон голоса ElevenLabs

Шаблон голоса — это сохранённая настройка диктора. В нём может быть выбран голос, модель, скорость, стабильность и другие параметры.

Обычно шаблон создают на этапе быстрой настройки или в базовых настройках проекта. После создания шаблона его можно выбрать в Шаге 2.

Шаблон голоса ElevenLabs

Хорошая практика: назвать шаблон понятно, например US documentary male, Calm doctor 50plus, Mystery narrator female.

Gemini и режиссёрские указания

Если используется Gemini-озвучка, важны не только голос и язык, но и режиссёрские указания. Это текстовое описание того, как диктор должен читать сценарий.

Пример:

Ты опытный документальный рассказчик. Голос спокойный, уверенный, немного мрачный. Читай без рекламной интонации, делай паузы перед важными фактами, не переигрывай.

Настройки Gemini TTS

Не делайте указания слишком длинными и противоречивыми. Если попросить одновременно «очень быстро», «очень драматично» и «спокойно», результат может быть нестабильным.

Скорость, стабильность и стиль

Некоторые провайдеры позволяют настраивать скорость, стабильность, сходство и стиль.

Простые рекомендации:

ПараметрЧто выбрать для первого теста
СкоростьОколо 1.0, если аудитория взрослая — чуть медленнее
СтабильностьСреднее значение, чтобы голос не был слишком монотонным или хаотичным
СтильПовышать осторожно, если нужна эмоциональность
СходствоНе ставить максимум без теста, чтобы избежать артефактов

Если диктор звучит слишком быстро, лучше снизить скорость и проверить ещё раз, чем сразу менять весь голос.

Словарь ударений и замены слов

Если голос неправильно произносит отдельные слова, используйте словарь замен или ударений.

Пример:

замок=замо́к
творог=творо́г
Lead=leed

Словарь ударений

Добавляйте только слова, которые действительно произносятся неправильно. Слишком большой словарь может создать новые ошибки.

Anti-Detect AI озвучки

Anti-Detect AI озвучки — это пост-обработка, которая помогает сделать звук менее стерильным и более естественным. Она может включать эквализацию, компрессию, лимитер и другие аудио-фильтры.

Anti-Detect AI озвучки

Функция полезна, если голос звучит:

  • слишком синтетически;
  • слишком идеально и стерильно;
  • плоско;
  • без ощущения студийной обработки;
  • слишком резко на высоких частотах.

Доступность функции может зависеть от тарифа.

Вырезание длинных пауз

Опция Вырезать длинные паузы после озвучки сокращает пустые промежутки уже после того, как голосовая дорожка создана и скачана. Это полезно, если диктор делает слишком длинные остановки и итоговый ролик получается медленнее, чем нужно.

Когда галочка включена, появляется поле Сила вырезания пауз:

  • Мягко — осторожно сокращает только заметные паузы, если важно сохранить спокойный темп.
  • Нормально — рекомендуемый режим для большинства роликов; делает речь плотнее без ощущения резкой склейки.
  • Сильно — сильнее сжимает паузы, если нужен быстрый динамичный ролик.

Начинайте с режима Нормально. Если голос стал слишком плотным, переключите на Мягко. Если пауз всё ещё много, выберите Сильно.

Запуск озвучки

Запускайте Шаг 2 отдельно, если хотите проверить только голос до генерации изображений и видео.

Это удобно, когда:

  • вы выбираете новый голос;
  • меняете скорость;
  • проверяете словарь ударений;
  • хотите понять стоимость озвучки;
  • не хотите тратить FX на следующие этапы до проверки звука.

Запуск генерации озвучки

После запуска смотрите журнал. Там видно, принята ли задача сервером, какой этап выполняется и где произошла ошибка, если она есть.

Что проверить после завершения

После генерации прослушайте аудио или проверьте его в готовом превью.

Проверьте:

  • диктор подходит аудитории;
  • нет неправильных ударений;
  • темп не слишком быстрый;
  • голос не звучит слишком рекламно;
  • эмоции не переиграны;
  • паузы стоят естественно;
  • звук не хрипит и не клиппует;
  • длительность примерно соответствует сценарию.

Готовая аудиодорожка

Если голос не понравился

Не перезапускайте весь полный цикл. Сначала исправьте только Шаг 2.

Что можно сделать:

  • выбрать другой шаблон;
  • снизить или повысить скорость;
  • изменить режиссёрские указания;
  • добавить слово в словарь ударений;
  • включить или отключить Anti-Detect;
  • попросить AI-помощника подобрать параметры.

Пример запроса:

Озвучка звучит слишком рекламно и быстро. Подбери более спокойные настройки для документального канала и объясни, что изменить.

Частые ошибки

ОшибкаПочему плохоКак правильно
Менять голос без проверки сценарияПроблема может быть не в голосе, а в текстеСначала проверить Шаг 1
Ставить скорость слишком высокоЗрителю сложно воспринимать информациюНачинать с нормальной скорости
Не проверять язык голосаДиктор может неправильно читать текстВыбирать голос под язык канала
Игнорировать словарь ударенийОдни и те же ошибки повторяютсяДобавлять проблемные слова в словарь
Запускать полный цикл ради теста голосаЛишние расходы FXЗапускать только Шаг 2

Что спросить у AI-помощника

  • «Подбери голос для моей аудитории и ниши».
  • «Почему озвучка звучит слишком синтетически?»
  • «Как сделать диктора спокойнее и документальнее?»
  • «Какие слова добавить в словарь ударений?»
  • «Стоит ли включать Anti-Detect озвучки для этого проекта?»
  • «Сравни два варианта голоса и скажи, какой лучше для удержания».

Куда идти дальше

Если озвучка звучит хорошо, переходите к Шагу 3 · Кадры. На следующем этапе FOXI подготовит изображения, обложки и визуальную основу будущего ролика.