Настройки «Перевод аудио»: голос, модели и клонирование
Распознавание речи, модели перевода, поставщики услуг озвучивания, стили Qwen и оценки количества токенов.
Автор Umakhan Magomedov
Последнее обновление 1 день назад
Откройте вкладку «Настройки» в приложении «Translate Audio», чтобы настроить распознавание речи, качество перевода и озвучивание. В этой статье подробно описаны все параметры и случаи их применения.
Где найти настройки
Откройте «Перевести аудио» на вкладке «Инструменты».
Нажмите значок «Настройки» в правом верхнем углу.
Измените параметры распознавания, перевода или озвучивания. Оценки токенов обновляются мгновенно.
ℹ️ Изменения в настройках распознавания речи и модели перевода вступают в силу при следующей загрузке файла, а не влияют на текущий результат. Настройки озвучивания влияют на следующий раз, когда вы будете генерировать аудио.
Распознавание (преобразование речи в текст)
Выберите движок для транскрибирования загруженного аудио. По умолчанию используется ElevenLabs Scribe.
Перевод
Выберите модель ИИ для повторного перевода при смене языка перевода или редактировании исходного текста.
⚠️ Автоматический конвейер при первой загрузке всегда использует Gemini 3 на сервере, независимо от выбранной здесь модели. Настройки влияют только на повторный перевод.
Озвучка без клонирования
Стандартные синтетические голоса. Образец голоса из исходного аудио не используется.
Если ElevenLabs не поддерживает нужный вам язык, приложение автоматически переключается на OpenAI.
Озвучивание с клонированием
Эти провайдеры клонируют голос говорящего из загруженного вами аудиофайла или сохраненного пользовательского голоса.
MiniMax (рекомендуется)
Qwen
HeyGen
Поведение TTS
Редактирование перевода: изменение переведенного текста приводит к очистке текущего озвучивания. Нажмите кнопку воспроизведения, чтобы сгенерировать его заново.
Задания в процессе выполнения или завершенные: задания MiniMax, Qwen и HeyGen продолжают выполняться в фоновом режиме. Повторное открытие из «Истории» возобновляет воспроизведение или опрос.
Смена языка: если текущий провайдер клонирования не поддерживает новый язык или аудиозапись слишком короткая, приложение автоматически переключается на ElevenLabs.
Изменение настроек: при смене провайдера, скорости, эмоции или стиля кэшированный аудиофайл для текущего результата очищается.
Часто задаваемые вопросы
Для чего нужна регулировка скорости в MiniMax?
Для чего нужна регулировка скорости в MiniMax?
Скорость варьируется от 0,5x (медленнее) до 2,0x (быстрее). Она изменяет темп воспроизведения сгенерированного голосового сопровождения без повторной загрузки файла. Изменение скорости очищает текущий аудиофайл.
Можно ли использовать предустановки стиля Qwen с сохраненным пользовательским голосом?
Можно ли использовать предустановки стиля Qwen с сохраненным пользовательским голосом?
Нет. Предустановки стилей («Медленно», «Быстро», «Спокойно», «Энергично» и другие) работают только в режиме auto_clone, когда голос клонируется из загруженного файла. Сохраненные пользовательские голоса игнорируют предустановки стилей.
HeyGen или MiniMax: что выбрать?
HeyGen или MiniMax: что выбрать?
MiniMax работает быстрее (~1 минута), дешевле (0,13,67 токена/сек) и поддерживает регулировку скорости и эмоций. HeyGen занимает больше времени (~10 минут), но часто звучит более естественно. HeyGen стоит 3,67 токена/сек.
Почему мой голос исчез после редактирования перевода?
Почему мой голос исчез после редактирования перевода?
Отредактированный текст больше не совпадает с сгенерированным аудио. Плеер сбрасывается до тех пор, пока вы не нажмете «Воспроизвести» снова. Это предотвращает воспроизведение аудио, которое не соответствует тексту на экране.
Мой аудиофайл слишком короткий для клонирования голоса. Какова минимальная длительность?
Мой аудиофайл слишком короткий для клонирования голоса. Какова минимальная длительность?
MiniMax требует, чтобы загруженный файл содержал не менее 10 секунд речи. Qwen требует не менее 3 секунд. Более короткие файлы вызывают автоматический переход на ElevenLabs.
ElevenLabs или OpenAI для стандартного озвучивания?
ElevenLabs или OpenAI для стандартного озвучивания?
ElevenLabs используется по умолчанию: он быстрее (~2 секунды) и дешевле (0,01 токена/сек) для большинства языков. OpenAI (0,03 токена/сек) используется в качестве запасного варианта, если ElevenLabs не поддерживает ваш целевой язык.
Когда взимается плата в размере 150 токенов за MiniMax?
Когда взимается плата в размере 150 токенов за MiniMax?
Плата за активацию клона в размере 150 токенов взимается при первом клонировании конкретного голоса (auto_clone из файла или при первом использовании сохраненного пользовательского голоса). Повторное генерация с тем же активированным голосом оплачивается по ставке всего 0,13,67 токена/сек.
Можно ли использовать пользовательский голос HeyGen из моей учётной записи?
Можно ли использовать пользовательский голос HeyGen из моей учётной записи?
Нет. HeyGen в Translate Audio клонирует голос непосредственно из загруженного аудиофайла. Только MiniMax поддерживает сохраненные голоса с сайта Пользовательские голоса.
Связанные статьи
Ещё в разделе Перевести аудио
Как работает функция «Перевод аудио»Нужна помощь? Предложить идею