Перейти к основному содержимому
Токены и платежи

Стоимость токенов для каждого инструмента

Приблизительная стоимость токенов для моделей перевода видео, аудио и фотографий, а также для моделей создания субтитров и обработки изображений в чатах.

Автор Umakhan Magomedov

Последнее обновление 1 день назад

На этой странице приведены приблизительные расценки на токены для каждого инструмента искусственного интеллекта на сайте VocaLingo. Приложение всегда показывает ориентировочную стоимость перед началом работы, поэтому вы можете проверить стоимость для вашего конкретного запроса.

ℹ️ Все цены являются ориентировочными. Фактическая стоимость может незначительно отличаться в зависимости от окончательных результатов обработки.

Перевод видео

Режим

Цена

HeyGen (синхронизация губ)

Около 3,67 токенов/сек

HeyGen (только аудио)

Около 3,33 токена/сек

HeyGen + расширенное клонирование

Около 7,34 токенов/сек

Дубляж от ElevenLabs

Около 0,84 токенов/сек

Дубляж ElevenLabs + синхронизация губ

Около 1,5 токена/сек

Добавить субтитры

Режим

Приблизительная стоимость

Анимированные шаблоны Mirage

15 токенов за каждую начатую минуту

Стандартные субтитры

Распознавание речи + преобразование

Переведенные субтитры

Распознавание речи + перевод + рендеринг

Подробнее: Как работает функция «Добавить субтитры».

Перевод аудио

Оплата взимается за каждый этап обработки. Озвучка не является обязательной и запускается при нажатии кнопки «Воспроизвести» на вкладке «Перевод». Полное руководство по настройкам: Настройки перевода аудио.

Распознавание речи

Поставщик

Цена

ElevenLabs Scribe (по умолчанию)

Около 0,067 токенов/сек

OpenAI Transcribe

Около 0,1 токена/сек

Whisper

Около 0,05 токенов/сек

Пример: 60-секундное голосовое сообщение с ElevenLabs Scribe ≈ 4 токена.

Перевод

Модель

Цена

Gemini Flash Lite

0,006 токена/1 тыс. символов

Gemini Flash

0,028 токена за 1 тыс. символов

Gemini 3 (перевод по первому конвейеру)

0,044 токена/1 тыс. символов

GPT-4o

0,156 токена/1 тыс. символов

GPT 5.6 Luna

0,028 токенов/1 тыс. символов

При первой загрузке всегда используется Gemini 3. Настройки модели применяются только к повторным переводам.

Озвучка (TTS)

Поставщик

Цена

Дополнительные сборы

ElevenLabs

0,01 токена/сек

Нет

OpenAI

0,03 токена/сек

Нет

MiniMax

0,15 токенов/сек

150 токенов за первый клон на каждый голос

Qwen

0,15 токенов/сек

Минимум 5 токенов на запрос

HeyGen v3

Около 3,67 токенов/сек

Нет

Пример: 30-секундный голосовой перевод с помощью ElevenLabs ≈ 0,3 токена. Тот же текст с помощью HeyGen ≈ 110 токенов.

Перевод фотографий

Модель

Типичная стоимость

Nano Banana 2

Около 8 токенов на фотографию

GPT Image 2

Около 6 токенов за фотографию

Используется в режиме «Фото» переводчика текста. Для генерации изображений в чате используется тот же семейство моделей. Подробности: Как перевести текст с фотографии.

Другие инструменты

«Преобразование речи в текст», «Преобразование видео в текст», «Анализ текста», «Преобразование текста в речь», «Туристический переводчик», «Переводчик текста», «AI-звонки» и «AI-чат» показывают примерное количество токенов перед началом работы. Стоимость зависит от продолжительности, выбранной модели, длины текста и дополнительных резюме.

Часто задаваемые вопросы

Каждый инструмент показывает примерную стоимость в токенах перед тем, как вы нажмете кнопку действия. В «Переводе аудио» оценка обновляется при изменении настроек или генерации голосового сопровождения.

ElevenLabs использует стандартные синтетические голоса (0,01 токена/сек). HeyGen клонирует голос говорящего с более качественной обработкой (около 3,67 токена/сек), и генерация занимает больше времени.

Нет. Токены за озвучку списываются только при нажатии кнопки «Воспроизвести» для генерации аудио. Распознавание, перевод и резюме, полученные в рамках автоматического конвейера, оплачиваются по завершении обработки.

Плата в размере 150 токенов — это разовая плата за активацию клонирования одного голоса. Она взимается при первом клонировании MiniMax нового голоса из вашего файла или сохраненного пользовательского голоса. Последующие генерации с тем же голосом стоят всего 0,15 токена/сек.