Я хочу проверить, можно ли превратить простой формат «человек говорит в камеру» в современное живое видео без дорогого ручного монтажа. Первая попытка через Codex и CapCut провалилась, но показала более интересную архитектуру автоматизации.

Автоматизация монтажа видео с ИИ: можно ли сделать живой YouTube без монтажёра

Сегодня я выпустил ролик, в который попытался уложить примерно 30 часов своих исследований в 15 минут видео. Сам материал мне нравится. Я долго исследовал тему, собрал методологию, сделал презентацию и записал видео. Потом отправил ролик примерно двадцати предпринимателям и попросил обратную связь.

Один из них ответил максимально честно. Он просто не досмотрел видео. А потом объяснил почему.
Футболка слишком простая.
Руку в карман лучше не класть.
Пятнадцать минут, возможно, стоило превратить в пять.
Справа вместо практически статичных слайдов должна происходить какая-то динамика, связанная с тем, что я говорю.
И кульминация:

Будто ты в 2020 году остался и отстаёшь от YouTube.

Ну что сказать. На дворе сентябрь 2026-го, а мой YouTube, похоже, всё ещё где-то между Zoom-конференцией и корпоративным вебинаром.

Причём я действительно благодарен за такую обратную связь. Можно было написать: «Нормальный ролик, интересно». Мне было бы приятнее и совершенно бесполезно. А здесь человек специально посмотрел видео, попытался понять, почему ему не хочется продолжать, и сформулировал это напрямую. Для меня это нормальная точка роста.

И здесь важный контекст. YouTube для меня вообще не новый. На моих YouTube-каналах опубликовано более 4 000 видео. Отдельный цикл из 666 обучающих роликов за 2,5 года зарегистрирован Реестром рекордов России и международной системой INTERRECORD. Но всё это я много лет делал без специального образования по YouTube, без отдельной YouTube-команды, монтажёров, сценаристов, дизайнеров и профессиональной внешней продакшн-команды.

Видео у меня исторически выросло не из идеи строить медиа. Я начал записывать его, чтобы обучать сотрудников, показывать клиентам решения и один раз нормально объяснённое знание использовать повторно. Постепенно из этого и выросли YouTube-каналы.

Поэтому фраза про 2020 год для меня особенно полезна. Проблема не в том, что я впервые взял камеру. Наоборот, опыта производства видео у меня очень много. Но современный визуальный язык YouTube я системно не строил.

Вот это уже конкретная точка роста. Зрителю всё равно, люблю я монтаж или нет. Если видео скучно смотреть, он его просто закроет.

Можно ли вообще автоматизировать такой монтаж с помощью ИИ

Короткий ответ - технически уже можно собрать систему, которая анализирует речь, планирует визуальные вставки и программно собирает дополнительный видеослой. Но это ещё не означает, что результат получится хорошим.

Именно это я и хочу проверить. Мне интересен не факт, что ИИ способен добавить анимацию или наложить картинку. Мне интересно, можно ли сделать простой разговорный YouTube заметно живее без дорогого ручного монтажа и даже без отдельного сотрудника, который собирает каждый выпуск.

Хорошее содержание само себя не спасает

Я привык смотреть на контент прежде всего через содержание.
Есть сильная мысль.
Есть исследование.
Есть полезный вывод.

Значит, человек должен посмотреть. Оказывается, нет. Можно потратить 30 часов на исследование, потом аккуратно упаковать его в 15 минут, но если зрителю тяжело эти 15 минут пройти, значительная часть работы просто до него не доедет.

Для меня это важный вывод.
Ценность внутри видео и способность видео донести эту ценность - две разные задачи.

Первую я более-менее умею решать. Со второй, судя по всему, действительно немного застрял в 2020-м.

И вот здесь появился вопрос, который мне уже стало интересно исследовать.
Можно ли сделать мой формат видео живым и современным без дорогого монтажа и даже без отдельного сотрудника?

Какой результат я хочу получить

В качестве ориентира мне нравятся видео Максима Спиридонова. Не в смысле, что я хочу копировать его канал или монтаж.
Мне нравится сам принцип.
Человек может просто сидеть перед микрофоном и говорить.
Не нужно десять локаций.
Не нужно постоянно ходить по студии.
Не нужно превращать экспертный ролик в кино.

Но видео при этом ощущается живым. Меняется визуальный ритм.
В нужные моменты появляются дополнительные элементы. Работает эмоция спикера.
Внимание зрителя постоянно получает небольшой новый стимул, хотя в основе всё тот же человек, который сидит и рассказывает.

Вот примерно к такому ощущению я и хочу приблизить свой формат.
На входе у меня обычная запись. Я сижу перед камерой. Говорю.
Вопрос в том, можно ли остальное почти полностью собрать автоматически.

Я пошёл искать готовый способ автоматизации видеомонтажа

Первый логичный шаг - открыть YouTube. Мне хотелось найти один нормальный ролик:

Вот у тебя эксперт, который сидит перед камерой и говорит. Вот исходное видео. Сделай раз, два, три - получишь современную динамичную подачу.

Я быстро поискал. И такого ответа себе не нашёл.
Нашёл отдельные советы. Монтажные приёмы.
Субтитры. Анимации. Перебивки.
Генераторы видео. ИИ-инструменты.
Но простого алгоритма с ходу не обнаружил. Искал что-то вроде:

исходное экспертное видео
> анализ содержания
> понятный набор визуальных действий
> автоматическая сборка
> готовый результат

Возможно, такой материал существует и я просто плохо искал. Но быстрого ответа «делай вот так» я себе не нашёл.
Дальше включился привычный режим программиста. Если готового алгоритма нет, попробуем его собрать. При этом я уже отдельно исследовал ИИ для нарезки длинного видео и автоматическую проверку готового видео. Здесь задача другая: не нарезать исходник и не проверять финал, а автоматически сделать саму подачу живее.

Первая попытка: Codex и CapCut

На компьютере у меня уже был установлен CapCut. Логика выглядела очевидной. Есть готовое видео. Есть Codex, который может работать с интерфейсом компьютера.
Почему бы просто не попросить его:

Посмотри видео и нормально его оформи.

Примерно здесь должна была начаться прекрасная жизнь человека, который больше никогда не занимается монтажом. Не началась.
С подготовительной частью всё выглядело неплохо.
Codex сделал расшифровку, таймкоды и монтажный план.

А потом начался CapCut.
И я довольно долго наблюдал, как искусственный интеллект возит мышкой.
Открыл.
Подождал.
Кликнул.
Перешёл.
Снова подождал.
Попытался найти нужное место.
Что-то передвинул.
Ещё подождал.

В какой-то момент я просто не стал дожидаться результата.
Чтобы мой YouTube перестал выглядеть как 2020 год, я случайно создал самого медленного видеомонтажёра 2026 года.

Промежуточный результат тоже не выглядел так, ради чего хотелось ещё несколько часов наблюдать за мышкой.
Я остановил эксперимент.
И это оказалось полезно.

Проблема была не в том, что Codex не умеет нажимать кнопки.
Проблема была в самом способе автоматизации.

Возможно, интерфейс вообще не нужно автоматизировать

Если человеку для работы нужен интерфейс, это ещё не значит, что цифровому исполнителю нужно повторять внутри него все человеческие действия. Человек открывает видеоредактор, потому что ему нужен удобный визуальный способ управлять таймлайном. Но зачем ИИ часами двигать мышкой, если нужный результат можно описать напрямую?

Например:

00:43-00:49
справа появляется схема из трёх элементов
на 46 секунде выделяется второй элемент
на 49 секунде схема исчезает

Для человека это монтажная задача.
Для программы - спецификация.

И тут я понял, что изначально неправильно определил саму функцию.

Мне не нужен классический видеомонтаж

Исходное видео уже записано.
Речь нормальная.
Большую часть материала резать не нужно.
Субтитры поверх каждого слова мне тоже не нужны.
Даже композиция у меня достаточно стабильная.

Значит, проблема намного уже.
Мне нужно превратить правую / левую часть кадра в динамический визуальный холст, который развивается вместе с моей речью.

Говорю про процесс - показать процесс.
Сравниваю два подхода - визуально показать различие.
Объясняю связь - показать связь.
Говорю про интерфейс - показать интерфейс.
Существующий слайд уже хороший - не заменять его только ради движения, а добавить фокус или анимацию конкретного элемента.
Где-то приблизить меня.
Где-то вообще убрать всё лишнее и оставить только лицо.
Где-то показать предмет, схему или короткую видеовставку.

То есть функция звучит уже иначе:

По смыслу речи автоматически спроектировать и собрать визуальный слой готового экспертного видео.

Это намного точнее, чем «ИИ монтирует YouTube».

Главная гипотеза эксперимента

Эту проблему можно решить обычным способом.
Найти монтажёра.
Отдать ему ролик.
Получить результат.
Потом отдать следующий.
Для многих каналов это нормальная модель.

Но меня сейчас интересует другое.
Можно ли построить формат, в котором один человек записывает экспертное видео, а почти вся дополнительная визуальная динамика производится программно?

Без большой съёмочной команды.
Без дорогого ручного монтажа каждого выпуска.
В идеале - без отдельного сотрудника, который каждый раз собирает весь таймлайн.

При этом результат не должен выглядеть как дешёвая автоматическая нарезка.
Мне не нужен «ИИ-монтаж» ради галочки.
Мне нужен нормальный YouTube. Если система позволяет выпускать больше роликов, но каждый из них выглядит как PowerPoint, на который сверху насыпали эффектов, задача не решена.

Программный монтаж вместо управления видеоредактором

После неудачного опыта с CapCut я начал искать способы вообще убрать видеоредактор из основной цепочки. И оказалось, что для этого уже существуют практические инструменты. Например, Remotion позволяет программно создавать и рендерить видео. Сейчас у него есть отдельные инструменты для работы через программных ИИ-агентов, включая Codex.

Ещё один вариант, который я нашёл, - HyperFrames от HeyGen. Там видеокомпозицию можно описывать через обычные веб-технологии и собирать программно.
Для меня важны даже не конкретные названия. Важна смена подхода.
Вместо:

ИИ
> мышка
> видеоредактор
> таймлайн
> объект
> перетащить
> проверить

можно попробовать:

ИИ
> анализ смысла
> план визуализации
> код
> рендер

Не делать из ИИ человека за компьютером. Пусть он сначала понимает содержание, потом описывает нужный визуальный результат и уже из этого собирает видео программно. Для меня это выглядит намного естественнее.

Не обязательно пересобирать весь ролик

Есть ещё одно упрощение. Исходное видео уже существует.
Зачем каждый раз заново рендерить все пятнадцать минут?
Можно создавать только дополнительные визуальные фрагменты.
Например:

00:18-00:25 - анимация документа
00:43-00:49 - схема связи
01:16-01:22 - фокус на части слайда
02:03-02:11 - анимация процесса

А потом накладывать их на существующий ролик.
Получается:

готовое видео
+ расшифровка с таймкодами
+ план визуализаций
+ короткие визуальные слои
= финальный ролик

Если мне не понравилась одна вставка на третьей минуте, не нужно переделывать весь проект. Пересобирается только она.
Это уже больше похоже не на классический видеомонтаж, а на программный производственный конвейер.

Что именно показывать справа

Следующий вопрос - чем заполнять эти визуальные эпизоды.
Пока моя логика простая.
Сначала использовать то, что уже есть.
Если слайд нормально объясняет мысль, не нужно выбрасывать его только потому, что теперь у нас появился ИИ.
Можно добавить движение.
Сфокусировать внимание.
Показать элементы последовательно.
Изменить масштаб.
Добавить глубину.

Если мысль абстрактная, можно собрать простую схему.
Если нужен реальный объект - показать его.
Если нужен интерфейс - показать интерфейс.
Если нужна реальная сцена - использовать фотографию или короткое видео.

Постепенно у меня сформировалось правило:
Не искать красивую вставку. Искать визуальную форму конкретной мысли.

Если я говорю про передачу данных между двумя системами, необязательно показывать человека с ноутбуком из фотобанка. Можно просто показать две системы и переход информации между ними. Это полезнее.

И не превратить всё это в TikTok

Здесь есть очевидная опасность. Мне сказали, что видео выглядит как 2020 год. Самая простая реакция - срочно сделать 2026-й.
Чтобы каждые две секунды что-нибудь происходило.
Зум.
Текст.
Мем.
Стрелка.
Переход.
Ещё зум.
Анимация.
Снова текст.

Технически задача «добавить динамики» будет выполнена. Смотреть это я сам, скорее всего, не смогу.
Получится отличный прогресс: вчера я был в 2020-м, а завтра на каждое третье слово прилетает анимированный огурец.

Мне нужна не максимальная динамика.
Мне нужна динамика, которая помогает содержанию.

Поэтому у каждой вставки должен быть один проверочный вопрос:

Что зрителю стало понятнее или легче воспринимать благодаря этим нескольким секундам?

Если ответа нет, вставка не нужна. В хороших разговорных видео мне как раз нравится, что главным остаётся человек и его мысль. Визуальная работа усиливает спикера, а не пытается победить его за внимание.

Сначала план, потом автоматический монтаж

Ещё одно решение - не давать системе команду:

Сделай красиво.

Это не спецификация. Я хочу разделить процесс на две стадии.
Сначала система получает видео и расшифровку.
Анализирует речь. Смотрит существующие слайды.

Выделяет места, где визуализация действительно поможет.
Предлагает тип визуализации.
Описывает идею.
Фиксирует таймкод.
И формирует план.
После этого останавливается.

Я смотрю план.
Удаляю лишнее.
Меняю спорное.
Утверждаю.
И только потом начинается производство.
Система готовит нужные элементы, делает анимации, собирает короткие визуальные фрагменты и накладывает их на готовое видео.

Получается:

ИИ анализирует
> предлагает визуальное решение
> я проверяю
> ИИ производит
> я смотрю результат

Для творческой работы мне такая граница сейчас кажется разумнее полной автономности.

Постепенно собрать библиотеку решений

Под этот эксперимент я уже завёл отдельный репозиторий. Сами большие видео там хранить не хочу. Они останутся локально.
В Git мне интереснее хранить саму систему:

  • расшифровку;
  • анализ ролика;
  • план визуализаций;
  • правила визуального стиля;
  • мои решения после проверки;
  • библиотеку типовых приёмов;
  • технические параметры сборки.

Потому что я не хочу каждый раз начинать с чистого листа. Формат видео у меня достаточно повторяемый.
Со временем можно накопить набор конструкций:

показать процесс
показать связь
сравнить два подхода
выделить часть слайда
показать документ
показать интерфейс
показать изменение во времени
показать движение объекта
дать крупный план спикера

Тогда системе уже не нужно каждый раз изобретать визуальный язык заново. Нужно определить, какой приём лучше объясняет текущую реплику, и адаптировать его. Вот это уже похоже на повторяемую функцию.

Как я пойму, что автоматизация видеомонтажа получилась

Сам факт, что система автоматически добавила двадцать анимаций, ничего не доказывает. Можно собрать технически очень сложный конвейер и получить видео, которое всё равно никто не досматривает.

Поэтому результат эксперимента для меня звучит не так:

ИИ смог автоматически смонтировать ролик.

А так:

Удалось ли сделать мой простой разговорный формат заметно более живым и интересным без дорогого ручного монтажа?

Я хочу проверить 4 вещи.

  1. Сколько моего ручного времени останется на один выпуск.
  2. Можно ли повторить процесс на следующем видео, а не только один раз красиво продемонстрировать.
  3. Насколько стабильно система попадает в нужный мне визуальный язык.
  4. И главное - становится ли ролик действительно лучше для зрителя.

В идеале производственный процесс должен быть очень простым.

  1. Я записал видео.
  2. Положил файл в папку.
  3. Посмотрел предложенный визуальный план.
  4. Подтвердил.
  5. Получил готовый ролик.

Если при этом результат по ощущению приблизится к тем разговорным видео, которые я сам с удовольствием смотрю, для меня это уже будет серьёзный результат.

Почему мне вообще интересен этот эксперимент

Вся история началась довольно смешно. Я выпустил видео. Человек посмотрел и сказал:

Ты как будто остался в YouTube 2020 года.

Можно было обидеться.
Можно было решить, что это вкусовщина.
Можно было сказать, что серьёзный контент вообще не обязан развлекать.
Но это ничего бы мне не дало.

Я благодарен за эту обратную связь именно потому, что она показала работу, которую я до этого практически игнорировал.
Подготовить сильное содержание - одна функция. Доставить его зрителю в форме, которую он готов смотреть - другая.

Вторую я много лет решал прежде всего содержанием, объёмом и регулярностью, но без отдельного профессионального YouTube-продакшена. Сейчас мне интересно проверить, можно ли системно добавить к этому современную визуальную подачу, не превращая производство каждого ролика в дорогой отдельный проект.

Эту задачу можно решить сотрудником.
Можно решить студией.
Можно оплачивать ручной монтаж каждого ролика.

Но мне интереснее проверить другую конструкцию. Можно ли достаточно хорошо описать эту функцию, чтобы основную работу выполняла система?
На входе - моё готовое видео.
На выходе - живой ролик, который не выглядит визуально устаревшим.
Между ними - цифровой производственный контур.

Пока это только гипотеза. Следующий шаг - собрать всю систему и прогнать через неё настоящий выпуск. А потом посмотреть на результат уже не глазами программиста. Потому что программист внутри меня легко может быть счастлив от того, что пять библиотек корректно собрались, рендер не упал и все таймкоды совпали.

Зрителю на это абсолютно всё равно.
Он либо продолжит смотреть. Либо закроет видео.

Поэтому настоящий вопрос эксперимента простой:
Смогу ли я с помощью ИИ сделать свой формат живым и современным, не превращая производство YouTube в отдельный дорогой бизнес-процесс?

Если да - будет круто.
Если нет - я хотя бы пойму, где автоматизация заканчивается и где действительно нужен хороший человек.

Первый вывод у меня уже есть.
Когда ИИ начинает часами повторять мышкой действия человека в интерфейсе, возможно, автоматизировать нужно не интерфейс. Нужно найти саму функцию и другой способ её выполнить.

А второй ещё проще.
Иногда фраза «ты застрял в 2020 году» полезнее двадцати комментариев «норм, интересно».

FAQ

Можно ли автоматизировать монтаж разговорного видео с помощью ИИ?

Технически можно автоматизировать анализ речи, планирование визуальных вставок и программную сборку дополнительного видеослоя. Но качество такого результата ещё нужно проверять на реальном выпуске.

Почему я отказался от автоматизации монтажа через CapCut?

В моём эксперименте Codex мог работать с интерфейсом, но управление видеоредактором через мышь оказалось слишком медленным и неудобным. Поэтому я решил проверить программную сборку визуального слоя без постоянной работы через интерфейс редактора.

Что именно я хочу автоматизировать?

Не классический монтаж всего ролика, а создание визуального слоя вокруг уже готовой речи: схем, анимаций, фокуса на слайдах, интерфейсов и других вставок, которые помогают зрителю воспринимать конкретную мысль.

Как я пойму, что эксперимент удался?

Нужно проверить, сокращается ли моё ручное время, повторяется ли процесс на следующих роликах, сохраняется ли нужный визуальный стиль и становится ли само видео действительно интереснее смотреть.