Я пытался автоматизировать монтаж уже снятого видео. Когда это начало получаться, следующее ограничение обнаружилось раньше - в идее, сценарии и подготовке съёмки.
Я 60+ часов автоматизировал монтаж видео с ИИ - и понял, что начинать нужно до съёмки
В предыдущей статье я разбирал, что получилось после 60+ часов попыток автоматизировать монтаж длинного экспертного видео с помощью AI.
На этом я не остановился. Я продолжил собирать собственный процесс и дошёл до первой версии системы, где значительную часть работы уже можно последовательно передавать людям и AI. Результатом я был заметно больше доволен.
А потом получил неожиданную обратную связь. Один из людей, которому я показывал новое видео и который раньше довольно жёстко критиковал мои ролики, сказал, что в новом варианте я воспринимаюсь более интересным, активным, живым.
При этом исходная съёмка не изменилась.
- Я не переснимал себя.
- Не говорил эмоциональнее.
- Не становился другим человеком перед камерой.
- Изменился монтаж.
И в этот момент я понял, что всё это время слишком узко формулировал задачу. Чем лучше у меня получалось автоматизировать монтаж, тем заметнее становилось следующее ограничение моего процесса: многие важные решения нужно принимать ещё до монтажа.
После 60+ часов монтаж наконец стал похож на систему
Когда я начинал этот эксперимент, вопрос выглядел довольно просто.
Есть видео, где человек сидит перед камерой и говорит.
Есть современные модели, которые умеют распознавать речь, анализировать текст и видео, генерировать изображения, писать код.
Почему тогда нельзя просто дать системе исходник и сказать:
Сделай нормальный современный монтаж.
И получить результат.
В предыдущем эксперименте я проверял в том числе HyperFrames и OpenEdit. Они действительно умеют довольно быстро делать многое из того, на что раньше требовалась отдельная ручная работа.
Но довольно быстро выяснилось, что проблема не в способности AI нарисовать карточку или добавить субтитры.
Проблема начинается на шаг раньше.
- Нужна ли эта карточка вообще?
- В этот момент зрителю важнее смотреть на меня или на схему?
- Дополнительный текст помогает понять мысль или просто повторяет мои слова?
- Нужно показать интерфейс или оставить человека в кадре?
- Надо добавить движение или, наоборот, убрать всё лишнее?
- Как не превратить пятнадцать минут разговорного видео в бесконечную презентацию из карточек?
Вот на понимание этой функции у меня и ушла большая часть времени. После просмотра нескольких демонстраций AI-монтажа у меня было ощущение, что реальный путь от исходника до нормального результата часто остаётся за кадром. В просмотренных мной примерах он выглядел примерно так:
дал видео -> AI поработал -> получил красивый результат
У меня между этими двумя точками оказалось больше 60 физических часов экспериментов.
Но постепенно работа начала складываться в систему.
Не в волшебную кнопку.
Скорее в набор решений, которые можно последовательно принять, проверить и передать дальше. Ниже - ролик, после которого я впервые посмотрел на монтаж немного иначе: смотреть на YouTube.
Монтаж меняет не только картинку
Раньше я в основном думал о монтаже через дополнительные элементы.
- Поставить картинку.
- Добавить схему.
- Сделать анимацию.
- Подсветить тезис.
- Вставить интерфейс.
После новой обратной связи я понял, что это слишком узкий взгляд. В новом видео я чаще оставался главным объектом в кадре. Дополнительные элементы меньше конкурировали со мной за внимание. Если в конкретный момент важнее было видеть человека, система не пыталась обязательно заменить его очередной карточкой.
И как минимум у одного зрителя изменилось восприятие меня в ролике. Это один эпизод. Он не доказывает, что именно монтаж сделал меня “интереснее” или что такой эффект повторится на других людях и видео. Но для меня это был хороший сигнал.
Я стал смотреть на монтаж не только как на добавление визуальных элементов, но и как на управление вниманием зрителя.
- Где-то главный объект - человек.
- Где-то нужен экран продукта.
- Где-то схема.
- Где-то цифра.
- А иногда лучший ход - вообще ничего не добавлять и оставить человека спокойно закончить мысль.
Если так посмотреть на задачу, становится понятнее, почему автоматизировать монтаж оказалось намного сложнее, чем я ожидал.
Чтобы автоматизировать монтаж, пришлось сначала понять, что он делает
Отдельные технические операции давно не выглядят чем-то невозможным.
- Распознать речь можно.
- Получить таймкоды можно.
- Создать изображение можно.
- Собрать схему можно.
- Добавить текст можно.
- Изменить крупность кадра тоже можно.
Но хороший монтаж состоит не из наличия этих операций. Он состоит из решений между ними.
- Какую функцию выполняет этот кусок видео?
- Нужен здесь дополнительный визуал?
- Если нужен, то какой?
- Что зритель уже видел до этого?
- Не повторяем ли мы один и тот же приём?
- Не заставляем ли человека одновременно слушать меня, читать текст и рассматривать сложную схему?
- Не заслоняет ли оформление саму мысль?
Вот эту функцию я постепенно и пытался разложить на части. И когда она стала понятнее, автоматизация действительно начала работать лучше.
Поэтому мой вывод после этих 60+ часов точно не в том, что AI бесполезен. Скорее наоборот. В моём случае, когда сама функция стала описана лучше, существенную часть исполнения удалось передать цифровой системе. Но именно после этого я упёрся в следующее ограничение.
В какой-то момент я понял: проблема уже не в монтаже
Допустим, система умеет разобрать речь.
Понять функцию фрагмента.
Предложить визуальное решение.
Собрать дополнительный слой.
Проверить часть результата.
Но всё это она делает с видео, которое уже существует.
А мой исходник был снят ещё по старой модели. Я много лет делал контент примерно так:
- есть мысль;
- есть исследование;
- я понимаю, о чём хочу рассказать;
- включаю камеру;
- рассказываю;
- а потом уже думаю, как это всё лучше упаковать.
Для передачи знаний такой подход вполне работал.
Но когда я захотел, чтобы видео было не только содержательным, но и хорошо проходилось зрителем от начала до конца, ограничения этой модели стали заметнее.
Если для конкретной мысли нужен хороший пример, а я его заранее не подготовил, после съёмки остаётся только пытаться что-то подобрать.
Если нужен экран продукта, а я его не записал, монтажу просто нечего вставлять.
Если мысль занимает четыре минуты, хотя её можно было объяснить заметно короче, смена кадров сама по себе эту проблему не решит.
Если логика объяснения получилась рыхлой, красивые карточки её не исправят.
Можно долго улучшать оформление уже снятого материала. Но в какой-то момент я поймал себя на более простом вопросе: почему я вообще начинаю думать о результате так поздно?
До этого моя логика была примерно такой:
снять полезное видео -> хорошо его смонтировать
Теперь она начала разворачиваться:
сначала спроектировать хорошее видео -> потом снять материал, из которого его можно собрать
Для меня это и стало главным результатом эксперимента.
Теперь видео для меня начинается задолго до съёмки
Первый вопрос теперь не:
Как это потом смонтировать?
А:
Что должен получить зритель?
- Что именно он должен понять после ролика?
- С каким представлением приходит?
- Что в его картине должно измениться?
- Какие вопросы естественно возникнут по дороге?
- Какой вывод должен стать понятным к концу?
После этого можно строить движение самой мысли.
- С чего начать.
- Какой контекст действительно нужен.
- Где нужен пример.
- Где доказательство.
- Где возникает следующий вопрос.
- Что можно вообще выкинуть.
И уже поверх этой конструкции появляется визуальная логика.
- Здесь лучше оставить меня в кадре.
- Здесь показать интерфейс.
- Здесь нужна схема.
- Здесь полезно сравнение.
- Здесь зрителю лучше вообще ничего дополнительно не показывать.
После этого уже можно идти снимать материал. Сейчас для себя я вижу процесс примерно так: идея -> что должен получить зритель -> сценарий и развитие мысли -> визуальные решения -> съёмка нужного материала -> автоматизированное производство -> проверка результата
Это выглядит как дополнительная работа до съёмки. Моя текущая гипотеза в том, что она должна сокращать количество дорогих переделок позже. Но я пока не измерял этот эффект на серии новых видео, поэтому не хочу выдавать его за доказанный результат.
На этом этапе для меня важнее другое: если заранее понятнее, что должно получиться, AI уже не приходится после съёмки восстанавливать замысел только из того материала, который ему достался.
Подготовка и производство стали двумя разными процессами
Этот вывод довольно быстро перестал быть только мыслью. Когда я начал приводить систему производства видео в порядок, я разделил её на два самостоятельных контура.
Первый заканчивается ещё до камеры.
Там разбираются идея, концепция, история, сценарий, движение зрителя по материалу, будущие сцены и то, что вообще нужно снять.
Результат - подготовленный пакет для съёмки.
Второй начинается уже после того, как появился реальный исходник.
Там работают расшифровка, монтажная логика, визуальный слой, дополнительные материалы, сборка и проверки.
Я специально не хочу превращать эту статью в документацию обоих workflow. Здесь важен сам факт изменения. До эксперимента я пытался построить систему вокруг вопроса:
Как автоматически смонтировать уже записанное видео?
После эксперимента появились два разных вопроса:
Как спроектировать видео до съёмки?
И:
Как максимально эффективно произвести его после съёмки?
Для меня это теперь две разные функции. В итоге мой сервис с ИИ получает уже не только сырой замысел и запись, а более подготовленный вход. Именно эту границу между проектированием и исполнением я сейчас хочу проверить на следующих видео.
Чем дешевле исполнение, тем важнее правильное решение
Здесь у меня появилась ещё одна рабочая гипотеза. Мне всё меньше нравится простая формула:
AI научился делать монтаж - значит, монтажёр больше не нужен.
Я не исследовал рынок профессии монтажёров и не могу делать такой прогноз. Но собственный эксперимент показал мне другую сторону.
Моя гипотеза сейчас такая: если человек уже понимает ритм, композицию, функцию кадра, когнитивную нагрузку и умеет выбирать между лицом, схемой, интерфейсом и дополнительным видео, AI может заметно увеличить его производительность.
То, что раньше нужно было долго исполнять руками, можно быстрее описать, собрать, проверить и переделать. У человека без этой модели результата появляется тот же мощный инструмент. Но вместе с инструментом профессиональное решение автоматически не появляется. Для себя я сформулировал это так: чем дешевле становится исполнение, тем заметнее становится цена ошибки, сделанной до исполнения.
AI помогает быстрее реализовать решение. Но само по себе ускорение не делает исходное решение сильнее.
Потом я заметил, что со статьями делаю примерно то же самое
Когда я формализовал новый процесс для видео, у меня возникла ещё одна мысль. Со статьями я часто работал по старой схеме:
- есть мысль;
- есть исследование;
- сажусь и пишу;
- потом переставляю блоки, сокращаю и пытаюсь усилить начало.
То есть сначала произвожу материал, а потом пытаюсь улучшить его архитектуру. Видео заставило меня попробовать обратный порядок.
- Сначала определить, что человек должен понять.
- С каким вопросом он приходит.
- Как изменится его понимание.
- Какие факты и примеры для этого нужны.
- Как должна развиваться история.
- И только потом писать текст.
Эта статья уже создаётся именно так. Я начал не с первого абзаца, а с исходного опыта и вопроса: что нового я вообще понял после предыдущего эксперимента? Из него уже появились читательская задача, история, структура и только потом черновик.
Поэтому сейчас мой исходный вопрос про видео изменился. Я начинал с:
Как сделать так, чтобы AI хорошо монтировал уже снятое видео?
Теперь раньше него стоит другой:
Как спроектировать материал так, чтобы из него вообще можно было сделать хорошее видео?
И только потом:
Какую часть исполнения теперь можно передать AI?
Для меня эти вопросы больше не стоят в обратном порядке.