Я думал, что после 60+ часов тестов нужно просто улучшать монтажёр. Исследование спроса и конкурентов привело к другому следующему шагу: сначала понять, сколько реальных авторов вообще нуждаются в такой работе.

Что осталось от идеи ИИ-видеомонтажёра после исследования рынка

В первой статье я больше 60 часов пытался добиться от ИИ нормального монтажа длинного видео с говорящей головой.

Во второй дошёл до следующего ограничения: часть проблем вообще бессмысленно лечить после съёмки. Хороший ролик приходится проектировать раньше.

После этого самым очевидным шагом было продолжать улучшать систему. Но я сделал другое. Я пошёл проверять, есть ли здесь вообще продуктовая возможность.

И исходная идея довольно быстро стала уже.
Короткие ролики оказались отдельной работой.
Многие базовые операции монтажа уже широко доступны.
В длинном видео всё ещё остаётся сложный слой, который мне интересен технически.

Но этого мало. Можно найти красивую незакрытую задачу, потратить ещё сотни часов на продукт, а потом обнаружить, что людей с такой работой слишком мало. Поэтому главный вопрос у меня сейчас уже не:

Можно ли заставить ИИ хорошо монтировать длинное видео?

А другой:

Сколько вообще существует людей, которым такая работа нужна достаточно регулярно, чтобы ради них имело смысл строить отдельный продукт?

Как я вообще исследовал эту идею

Чтобы не сводить вывод к личному ощущению после одного ролика, я пошёл по нескольким слоям.

  1. Сначала разложил монтаж на отдельные работы: субтитры, паузы, B-roll, кадрирование, главы, Shorts, автоматический монтаж целиком.
  2. Потом отдельно проверил язык спроса в Google и Яндекс Suggest.
  3. После этого свёл конкурентов и посмотрел, какие операции уже закрываются существующими сервисами.
  4. Дальше отделил short-form от long-form.
  5. Потом попытался понять, что именно остаётся сложным в полном длинном ролике.

И уже после этого дошёл до вопроса размера реальной аудитории.
Получилась примерно такая логика:

ШагЧто я проверялЧто это изменило
1Что люди вообще формулируют как отдельную задачуПоявилась карта работ, а не один общий “ИИ-монтаж”
2Какие формулировки реально встречаются в поисковых подсказкахСтало видно, где язык спроса сформирован, а где слабый
3Что уже умеют существующие продуктыБазовые операции перестали выглядеть достаточным преимуществом
4Чем Shorts отличаются от полного длинного роликаShort-form ушёл в отдельный рынок
5Что ломается именно в длинном видеоНа первый план вышла последовательность редакторских решений
6Какие пользовательские сценарии скрываются внутри long-formПоявились две разные работы: после съёмки и до съёмки
7Сколько вообще может быть подходящих авторовНачалось отдельное supply-side исследование реальных каналов
8Что будет доказательством после размера рынкаUsage, повтор и оплата остались отдельными gate

То есть я не пытался сразу получить TAM (объем рынка). Сначала нужно было понять, какую именно работу вообще считать рынком.

Что показал поисковый слой

Я прогнал отдельные кластеры по разным уровням работы.
Важно: цифры ниже - не частотность запросов. Это количество подтверждённых или наблюдаемых формулировок в наших прогонах Google/Яндекс Suggest. Wordstat в этих прогонах не измерялся.

РаботаExactRelatedРелевантных наблюдаемых фразЧто я из этого вынес
Чистка речи и пауз0220Работа существует, но язык чаще про саму проблему
Транскрибация и субтитры42133Самый сформированный базовый слой, но уже стандартная функция
B-roll и визуальные вставки0010Слабая отдельная AI-категория, скорее часть готового монтажа
Кадрирование, zoom, графика1026Есть feature-level сигнал, но кластер частично загрязнён соседними “титрами”
Главы и таймкоды002Узкая функция, не отдельная большая работа
Shorts/Reels из длинного видео3326Отдельная сформированная работа
Автоматический монтаж длинного/экспертного видео1017Широкий “автоматический монтаж” виден, узкие long-form формулировки слабее
“ИИ сам монтирует видео”2222Сильнее всего звучит готовый результат, а не отдельная функция
Ускорить / автоматизировать монтаж3027Есть операционный интерес, но часто информационный
Бизнес-результаты видео0215Нельзя из этого обещать просмотры, лиды или продажи

Для меня здесь был важен не сам счётчик. Картина получилась асимметричная.
На нижнем уровне язык очень конкретный: субтитры, транскрибация, паузы, Shorts.

А чем ближе к нашей узкой гипотезе “длинное экспертное видео с говорящей головой”, тем слабее становится отдельный поисковый язык.
При этом более широкое обещание существует. Люди формулируют:
“нейросеть которая сама монтирует видео”;
“ИИ который монтирует видео за тебя”;
“автоматически смонтировать видео”.

То есть конечная “раобта” понятна. Но это ещё не доказывает, что наш конкретный сервис для длинных видео сегмент большой.

Короткие ролики я вынес в отдельную работу

Сначала я складывал почти весь ИИ-монтаж в одну корзину.

  • Есть длинный исходник.
  • Из него можно убрать паузы.
  • Сделать субтитры.
  • Добавить изображения.
  • Изменить крупность.
  • Нарезать Shorts и Reels.

На уровне технологий здесь действительно много общего: расшифровка, смысловой анализ, таймкоды, кадрирование, сборка.

Но с точки зрения человека это разные работы. В коротких роликах длинное видео становится сырьём. Нужно найти самостоятельные сильные фрагменты, определить границы, собрать вертикальный кадр, оформить субтитры и получить несколько отдельных клипов.

В длинном видео задача обратная. Нужно сохранить всю мысль и провести зрителя через ролик целиком. Не найти двадцать удачных секунд, а на протяжении пятнадцати минут решать:

  • оставить человека в кадре;
  • показать интерфейс;
  • вывести короткий тезис;
  • добавить изображение или видеовставку;
  • изменить крупность;
  • или ничего не делать.

И исследование конкурентов увидел, что есть целый класс продуктов, которые специализируются именно на коротких вертикальных клипах из длинного исходника. Рынок коротких роликов я отдельно исследовал раньше.

Я решил эту ветку пока отложить. Не потому, что там нет рынка. Скорее потому, что там уже много специализированных решений, а я сам пока не вижу достаточно сильной причины делать ещё одно.

Список функций перестал выглядеть как продукт

Следующим шагом я посмотрел не только на спрос, но и на то, что уже умеют продукты.
На момент исследования картина была примерно такой:

Продукт / классЧто уже закрываетГде остаётся граница для моей задачи
Short-form clippers вроде OpusClip, Vizard и похожихВыбор фрагментов, 9:16, субтитры, отдельные короткие клипыЭто другая работа, не полный long-form ролик
GlingРусская расшифровка, паузы, filler cleanup, rough cut, экспорт в NLEХорошо закрывает техническую чистку, но не автоматическую визуальную режиссуру всего ролика
JupitrrЕсть режим 16:9 и длинные видео до 30 минут на старших планахВ опубликованном списке языков не было русского, а сам продукт не закрывает весь наш workflow
Captions AI EditСильная автоматизация коротких и средних роликовАвтоматический AI Edit ориентирован на гораздо более короткие ролики, чем мои 10-30 минут

Я специально не пытаюсь доказать этой таблицей, что “конкурентов нет”. Это был бы слишком удобный вывод. Она показывает другое: Транскрибация, субтитры, паузы, rough cut, базовое кадрирование, главы и отдельные визуальные вставки уже существуют как зрелые возможности.

Поэтому формула:

субтитры + паузы + zoom + B-roll

перестала меня убеждать как продуктовая гипотеза.

Все эти вещи нужны.
Но они скорее становятся базовым слоем.
А ценность приходится искать выше.

Самое сложное оказалось не добавить эффект, а выбрать его

Здесь мои предыдущие тесты оказались полезнее любого списка функций. Система уже умеет довольно много:

  • Она может понять речь.
  • Сформулировать тезис.
  • Сделать карточку.
  • Подобрать изображение.
  • Показать интерфейс.
  • Приблизить кадр.

У меня с видео в итоге проблема начинается между этими действиями:

  • Что сейчас лучше показать зрителю?
  • Меня?
  • Одну фразу?
  • Экран продукта?
  • Картинку?
  • Схему?
  • Видеовставку?
  • Нужно ли менять крупность?
  • Или правильное решение в этот момент - вообще ничего не добавлять?

Именно здесь у меня раньше ломался длинный результат.
Отдельный кадр мог выглядеть красиво.
Но если красивых карточек, текста и движений становилось слишком много, через несколько минут ролик превращался в борьбу за внимание.

Я сам как зритель смотрю видео и понимаю, что мне нужно слушать автора

  • Читать тезис.
  • Следить за субтитрами.
  • Смотреть на картинку.
  • И ещё понимать, зачем всё это появилось.

Поэтому сейчас наиболее интересной частью автоматического монтажа для меня выглядит не способность добавить видеовставку. А способность решить:

нужна ли она здесь вообще?

Причём не один раз, а последовательно по всему длинному ролику.
Это пока не доказанное преимущество продукта.
Это просто тот слой, где я сам увидел наиболее сложную и плохо формализованную работу.

Потом длинное видео раскололось ещё на две задачи

Когда этот слой стал понятнее, появилась следующая проблема. До этого я рассуждал о длинном ИИ-монтаже как об одной работе:

У меня уже есть видео. Возьмите его и сделайте нормальный готовый ролик.

Это первый сценарий.
Я снял 15-20 минут говорящей головы. Может быть, записал экран продукта. Дальше система сама разбирает содержание, чистит техническую часть, принимает визуальные решения, собирает ролик, а я только проверяю спорные места.

Условно:
готовая запись -> автоматическая обработка -> короткая проверка -> готовое видео
И это по-прежнему основная гипотеза, которую я хочу проверить.

Но есть и вторая работа.
Я ещё не снял видео.
У меня есть тема, мысль, исследование.

И вместо того чтобы сначала записать всё как получится, а потом пытаться спасти это монтажом, можно раньше решить:

  • что должен понять зритель;
  • как развивается мысль;
  • где нужен пример;
  • где нужно показать интерфейс;
  • какие дополнительные кадры подготовить;
  • что вообще должно быть снято.

Тогда процесс выглядит уже иначе:
тема -> сценарий и развитие мысли -> визуальный план -> съёмка -> автоматическая обработка -> готовое видео

Это скорее ИИ-режиссёр, чем ИИ-монтажёр.

Технически обе работы могут использовать одну систему.
Но для человека они сильно отличаются.

В первом случае он хочет:

Я уже всё снял. Не заставляйте меня переделывать процесс. Просто сделайте максимум возможного.

Во втором:

Я готов изменить подготовку, если это заметно улучшит результат.

Сейчас мне второй сценарий близок, потому что я сам к нему пришёл после предыдущих экспериментов. Но это ещё ничего не говорит о спросе.

Возможно, большинство людей как раз хотят первый вариант:

Закинул видео - пусть оно само сделает что нужно.

Поэтому вторую работу я пока оставляю гипотезой.

И тут я упёрся в вопрос, который уже нельзя решить кодом

После всего этого можно было сказать:

  • хорошо, нашли более сложную работу;
  • простые функции уже есть у многих;
    = значит, надо строить систему вокруг смысловых решений.

Но в этот момент у меня возник гораздо менее приятный вопрос:

Может быть, и спроса такого нет?

Потому что незакрытая работа и хороший рынок - не одно и то же.
Можно решить сложную задачу, которая нужна 1 000 человек.
Можно сделать прекрасный сервис для авторов, которые выпускают 1 ролик раз в полгода.
Можно попасть в сегмент, где у тех, кому качество действительно важно, уже есть монтажёр, или редактор или своя небольшая команда.
А те, у кого команды нет, могут ещё не зарабатывать на контенте достаточно, чтобы регулярно платить за новый сервис.

То есть дальше уже бессмысленно спорить о том, насколько красивым получился очередной монтаж. Сначала нужно понять, сколько вообще существует подходящих клиентов.

Сначала я хотел просто отрезать всех после 100 тысяч подписчиков

Моя первая гипотеза была довольно бытовой. Если у автора уже больше 100 тысяч подписчиков, наверное, у него есть деньги, реклама и кто-то, кто закрывает производство видео.

Моя гипотеза, что сервис сильнее нужен тем, кто ещё не дорос до полноценной команды. Для первой оценки я посмотрел публичный рейтинг LiveDune по YouTube в России, прежде всего категорию “Образование”.

И довольно быстро увидел проблему. В одном списке рядом могут находиться персональный эксперт, университет, онлайн-школа, бренд, тематический канал и автор, который действительно похож на человека с небольшой командой или вообще без неё.

Число подписчиков у них сопоставимое.
Работа - совершенно разная.

То есть правило: “до 100 тысяч = наш клиент” не работает.
Как не работает и обратное: “после 100 тысяч = у всех уже есть команда”.

Подписчики удобны, чтобы разбить выборку на группы. Но реальный потенциальный клиент для меня сейчас выглядит точнее:

Автор уже понял, зачем ему YouTube, регулярно выпускает длинные видео и использует канал для работы или бизнеса, но устойчивого производства с отдельной командой у него ещё нет.

Вот это уже похоже на сегмент, который имеет смысл искать. Но и здесь я пока не знаю, насколько он большой.

Поэтому следующий эксперимент - выборка реальных каналов

Здесь я уже отдельно зафиксировал методику, чтобы не получить красивый TAM из воздуха.

ПараметрЧто считаю сейчас
ГеографияРоссия / русскоязычный YouTube
Размер канала1 000-100 000 подписчиков
Когорты1-5k, 5-10k, 10-30k, 30-60k, 60-100k
Основная категория поискаEducation / Образование
Дополнительные категорииPeople & Blogs, Science & Technology, Howto & Style
Целевая выборка100-150 уникальных каналов
Форматlong-form, прежде всего talking head и talking head + screen
Тип автораперсональный эксперт / коммерческий creator, а не просто организация
Дополнительный фильтресть ли уже зрелая production-команда
Что хочу получитьпорядок рынка и долю Job A / Job B proxy, а не псевдоточную TAM-цифру

Публичные каталоги уже дали несколько полезных ограничений. Например, SciTopus на момент проверки содержал 567 русскоязычных научно-образовательных каналов, из которых 225 были отмечены активными за последний год.

Это полезный факт. Но это не “рынок”. Каталог узкий, вручную курируемый и смещён в сторону науки и образования. LiveDune, Social Blade и похожие публичные рейтинги, наоборот, лучше показывают верхнюю часть рынка и хуже подходят для маленьких каналов. То есть один готовый список здесь не работает. Нужна стратифицированная выборка и ручная классификация.

Одно из быстрых исследованих дало мне диапазон 15-30 тысяч потенциальных Job A каналов. Я сознательно не принимаю эту цифру как результат. Она построена на цепочке предположений о размере российского сегмента, активности, формате и наличии команды. Для меня это хороший пример того, зачем вообще нужен отдельный блок глубокого исследования.

Получить число легко.
Получить число, которому можно доверять, намного сложнее.
Сейчас исследование дошло именно до ручной выборки 100-150 реальных каналов.
После неё уже можно будет получить более честный диапазон.

Даже если рынок окажется большим, это будет только следующая проверка

Допустим, выборка покажет, что подходящих авторов действительно много.
Это всё равно ещё не продукт.

Для следующего полевого теста я уже заранее зафиксировал несколько критериев.

Что проверяюРабочий зелёный сигнал
Время проверки готового видеодо 10 минут
Критические смысловые ошибки0
Принятые визуальные решенияне меньше 80%
Скрытая ручная работа с моей стороныдо 10 минут активной работы на ролик
Повторавтор приносит второй реальный ролик без уговаривания
Деньгипосле принятого результата готов платить от 3 000 руб./мес. или эквивалент

Это не результаты. Это только заранее заданные критерии, чтобы потом не объяснять любой исход успехом. Эта последовательность совпадает с моим текущим фильтром гипотез до пилота.

Поэтому сейчас последовательность для меня выглядит так:
точная работа -> существующие альтернативы -> оставшийся сложный слой -> реальная популяция клиентов -> использование -> повтор -> оплата

Я начинал этот эксперимент с вопроса:

Можно ли сделать нейросеть, которая сама монтирует длинное видео?

Потом вопрос стал точнее:

Какие решения она должна принимать, чтобы длинный ролик действительно было нормально смотреть?

А теперь я дошёл до третьего:

Сколько вообще людей регулярно сталкиваются с этой работой и ещё не решили её человеком или своей командой?

И пока у меня нет ответа на этот вопрос, следующий разумный шаг - не добавлять ещё одну функцию в монтажёр.
Сначала посчитать людей.