Перейти к основному содержимому
Перевести аудио

Настройки «Перевод аудио»: голос, модели и клонирование

Распознавание речи, модели перевода, поставщики услуг озвучивания, стили Qwen и оценки количества токенов.

Автор Umakhan Magomedov

Последнее обновление 1 день назад

Откройте вкладку «Настройки» в приложении «Translate Audio», чтобы настроить распознавание речи, качество перевода и озвучивание. В этой статье подробно описаны все параметры и случаи их применения.

Где найти настройки

  1. Откройте «Перевести аудио» на вкладке «Инструменты».

  2. Нажмите значок «Настройки» в правом верхнем углу.

  3. Измените параметры распознавания, перевода или озвучивания. Оценки токенов обновляются мгновенно.

ℹ️ Изменения в настройках распознавания речи и модели перевода вступают в силу при следующей загрузке файла, а не влияют на текущий результат. Настройки озвучивания влияют на следующий раз, когда вы будете генерировать аудио.


Распознавание (преобразование речи в текст)

Выберите движок для транскрибирования загруженного аудио. По умолчанию используется ElevenLabs Scribe.

Поставщик

Стоимость

Примечания

ElevenLabs Scribe (по умолчанию)

0,0133 токена/сек

Рекомендуется. Быстро и точно обрабатывает большинство записей.

OpenAI Transcribe

0,02 токена/сек

Модель gpt-4o-transcribe. Хорошо подходит для записей с шумом.

Whisper

0,01 токена/сек

Бюджетный вариант. Немного медленнее при обработке длинных файлов.


Перевод

Выберите модель ИИ для повторного перевода при смене языка перевода или редактировании исходного текста.

⚠️ Автоматический конвейер при первой загрузке всегда использует Gemini 3 на сервере, независимо от выбранной здесь модели. Настройки влияют только на повторный перевод.

Модель

Стоимость

Подходит для

Gemini Flash Lite

0,006 токена/1 тыс. символов

Самые быстрые и самые дешевые повторные переводы

Gemini Flash

0,028 токена/1 тыс. символов

Сбалансированное соотношение скорости и качества

Gemini 3 (по умолчанию)

0,044 токена/1 тыс. символов

Первоначальный перевод по конвейеру и высококачественные повторные переводы

GPT-4o

0,156 токена/1 тыс. символов

Максимальная точность для сложных текстов

GPT-5 Mini

0,028 токена/1 тыс. символов

Хорошее качество при умеренной стоимости


Озвучка без клонирования

Стандартные синтетические голоса. Образец голоса из исходного аудио не используется.

Поставщик

Языки

Стоимость

Скорость

ElevenLabs (по умолчанию)

~74 языка

0,01 токена/сек

~2 секунды

OpenAI

Широкая поддержка

0,03 токена/сек

~5 секунд

Если ElevenLabs не поддерживает нужный вам язык, приложение автоматически переключается на OpenAI.


Озвучивание с клонированием

Эти провайдеры клонируют голос говорящего из загруженного вами аудиофайла или сохраненного пользовательского голоса.

MiniMax (рекомендуется)

Стоимость

0,13,67 токена/сек + 150 токенов за первое клонирование каждого голоса

Регулировка скорости

от 0,5x до 2,0x

Эмоции

7 предустановок + Авто

Минимальная продолжительность звука для клона

10 секунд

Сохраненный пользовательский голос

Да, через Пользовательские голоса

Qwen

Языки

10: русский, английский, китайский, немецкий, французский, испанский, итальянский, японский, корейский, португальский

Стоимость

0,13,67 токена/сек, минимум 5 токенов на запрос

Минимальное время записи аудио для клона

3 секунды

Предустановленные стили

Авто, Медленно, Быстро, Спокойно, Энергично, Профессионально, Дружелюбно, Мягко — только в режиме auto_clone, не с сохраненными пользовательскими голосами

HeyGen

Стоимость

3,67 токена/сек (HeyGen v3 с 3 июня 2026 г.)

Время генерации

~10 минут для длинного текста

Формат вывода

Аудио MP4

Сохраненные пользовательские голоса

Не поддерживается. Клонируются только из загруженных аудиофайлов.


Поведение TTS

  • Редактирование перевода: изменение переведенного текста приводит к очистке текущего озвучивания. Нажмите кнопку воспроизведения, чтобы сгенерировать его заново.

  • Задания в процессе выполнения или завершенные: задания MiniMax, Qwen и HeyGen продолжают выполняться в фоновом режиме. Повторное открытие из «Истории» возобновляет воспроизведение или опрос.

  • Смена языка: если текущий провайдер клонирования не поддерживает новый язык или аудиозапись слишком короткая, приложение автоматически переключается на ElevenLabs.

  • Изменение настроек: при смене провайдера, скорости, эмоции или стиля кэшированный аудиофайл для текущего результата очищается.


Часто задаваемые вопросы

Скорость варьируется от 0,5x (медленнее) до 2,0x (быстрее). Она изменяет темп воспроизведения сгенерированного голосового сопровождения без повторной загрузки файла. Изменение скорости очищает текущий аудиофайл.

Нет. Предустановки стилей («Медленно», «Быстро», «Спокойно», «Энергично» и другие) работают только в режиме auto_clone, когда голос клонируется из загруженного файла. Сохраненные пользовательские голоса игнорируют предустановки стилей.

MiniMax работает быстрее (~1 минута), дешевле (0,13,67 токена/сек) и поддерживает регулировку скорости и эмоций. HeyGen занимает больше времени (~10 минут), но часто звучит более естественно. HeyGen стоит 3,67 токена/сек.

Отредактированный текст больше не совпадает с сгенерированным аудио. Плеер сбрасывается до тех пор, пока вы не нажмете «Воспроизвести» снова. Это предотвращает воспроизведение аудио, которое не соответствует тексту на экране.

MiniMax требует, чтобы загруженный файл содержал не менее 10 секунд речи. Qwen требует не менее 3 секунд. Более короткие файлы вызывают автоматический переход на ElevenLabs.

ElevenLabs используется по умолчанию: он быстрее (~2 секунды) и дешевле (0,01 токена/сек) для большинства языков. OpenAI (0,03 токена/сек) используется в качестве запасного варианта, если ElevenLabs не поддерживает ваш целевой язык.

Плата за активацию клона в размере 150 токенов взимается при первом клонировании конкретного голоса (auto_clone из файла или при первом использовании сохраненного пользовательского голоса). Повторное генерация с тем же активированным голосом оплачивается по ставке всего 0,13,67 токена/сек.

Нет. HeyGen в Translate Audio клонирует голос непосредственно из загруженного аудиофайла. Только MiniMax поддерживает сохраненные голоса с сайта Пользовательские голоса.