Для короткого ролика часто уже есть исходное видео и готовый текст. Но даже в таком простом сценарии нужно записать голос, подогнать длительность, добавить экранные фразы и собрать финальный файл.
Я сделал закрытое веб-приложение, которое выполняет эту последовательность автоматически.
Что работает сейчас
Пользователь загружает или заменяет исходное видео, вводит текст и выбирает мужской или женский голос. Специальные пометки в тексте превращаются в экранные надписи, но не произносятся диктором.
Если видео короче звуковой дорожки, приложение подстраивает его длительность. На выходе получается MP4, готовый к дальнейшей публикации или добавлению музыки.
Как устроена система
Edge TTS создаёт дикторскую дорожку, разметка текста определяет надписи и их положение, а FFmpeg соединяет видео, звук и графику. Все параметры скрыты за формой, поэтому для повторного ролика не нужно заново собирать монтажный проект.
Что это дало
Повторяющийся монтаж стал сервисом: одинаковое правило можно применять к серии роликов, меняя только исходник и текст.
Ограничения
Приложение не выбирает лучшие кадры внутри исходного материала и не добавляет музыку автоматически. Эти решения остаются отдельным этапом, если они нужны конкретному формату.
