Я проверил Ask Studio в YouTube Studio на простой задаче - попросил посчитать все видео канала. Получил неверный ответ и разбираю, когда аналитике ИИ-ассистента можно доверять.

Я спросил Ask Studio, сколько видео на моём YouTube-канале. Ответ оказался неверным

Уже несколько недель я замечал в YouTube Studio встроенного ИИ-ассистента Ask Studio. Сам YouTube описывает его как инструмент, который помогает получать статистику канала, анализировать эффективность видео, разбираться в аудитории и генерировать идеи. Ответы формируются большими языковыми моделями на основе информации канала, YouTube и интернета. (официальная справка YouTube)

Несколько раз я видел предложение воспользоваться ассистентом, но откладывал. Потом решил наконец проверить. Причём начал не со сложной аналитики, а с максимально простого вопроса:

Сколько всего видео опубликовано на моём канале за всё время?

Ask Studio ответил: 121 видео. 97 Shorts и 24 обычных видео. Я сразу понял, что ответ неправильный. На канале опубликовано несколько тысяч видео. Получился довольно странный первый тест ИИ-ассистента для аналитики YouTube: я ещё не успел попросить его что-либо анализировать, а уже перестал доверять исходным данным.

Почему я начал именно с количества видео

Последнее время в разговорах о бизнес-аналитике я регулярно сталкиваюсь с одной идеей. Есть CRM, таблицы, отчёты, показатели. Почему бы не добавить поверх них чат с искусственным интеллектом? Руководитель пишет:

Где у меня проблема?

ИИ изучает данные, объясняет ситуацию и предлагает, что делать. На уровне интерфейса идея выглядит очень привлекательно. Я уже несколько раз экспериментировал с такими сценариями: передавал моделям таблицы, изображения отчётов, дополнительный контекст о бизнесе, продукте и воронке. И каждый раз упирался примерно в один вопрос: текст получить легко, но можно ли доверять тому, на чём этот текст построен?

В предыдущих экспериментах даже дополнительный бизнес-контекст далеко не всегда приводил к сильным управленческим сигналам. Часто рекомендации просто пересказывали то, что и так было видно в таблице. Поэтому Ask Studio мне был особенно интересен. В отличие от обычного чат-бота, которому сначала нужно передать данные, этот ассистент находится непосредственно внутри YouTube Studio. Официальная документация говорит, что он может отвечать на вопросы об эффективности канала и использует данные канала и аудитории. (официальная справка YouTube)

Логично было начать с факта, который можно проверить.
Не с вопроса «как мне развивать канал?».
Не с вопроса «какие видео мне снимать?».
Не с поиска аномалий и причин падения просмотров.
Просто с количества видео.

Я специально не стал начинать с рекомендаций

Если первым вопросом спросить:

Что мне сделать, чтобы канал рос быстрее?

Можно получить десять очень убедительных рекомендаций. Проблема в том, что такой ответ сложно проверить.
Допустим, ассистент скажет увеличить долю длинных видео.
Откуда появился этот вывод?
Правильно ли он определил нынешнее соотношение форматов?
Какой период использовал?
Все ли видео увидел?
Какие данные счёл релевантными?
Что является фактом, а что уже интерпретацией модели?

Поэтому я предпочитаю проверять подобные системы снизу вверх.
Сначала факты.
Потом расчёты.
Потом интерпретация.
И только после этого рекомендации.
В моём эксперименте система споткнулась на первом уровне.
Я задал уточняющие вопросы, попытался объяснить, что мне нужны все видео, но достоверного общего числа так и не получил.

Что именно произошло в этом тесте

Факт эксперимента довольно узкий. Я спросил Ask Studio об общем количестве видео на своём канале.
Ассистент ответил, что их 121. Я знаю, что на канале их несколько тысяч.

Следовательно, этот конкретный ответ не соответствовал реальному количеству опубликованных материалов. Из этого нельзя делать вывод, что Ask Studio всегда считает данные неправильно. Нельзя утверждать и то, что он вообще не умеет работать с аналитикой YouTube. Один запрос этого не доказывает. Но для меня он изменил уровень доверия к следующим ответам. Если я не могу проверить базовую цифру, мне сложно переходить вместе с системой к более сложным выводам, где правильного ответа уже не видно напрямую.

Я не знаю, почему Ask Studio дал такую цифру

Здесь есть принципиальная граница. Мне неизвестна внутренняя архитектура Ask Studio. Я не знаю, получает ли языковая модель полный перечень материалов канала, агрегированные показатели, ограниченную выборку или данные через отдельные инструменты.

Поэтому было бы неправильно говорить: «у него есть база данных, он должен был выполнить один запрос». Это было моё первоначальное ожидание, а не установленный технический факт. Официально YouTube сообщает другое: ответы Ask Studio создаются большими языковыми моделями, которые используют информацию с канала, от YouTube и из интернета. При этом YouTube отдельно предупреждает, что качество и точность ответов могут различаться, а некоторых данных или возможностей для ответа системе может не хватать. (официальная справка YouTube)

Этого описания недостаточно, чтобы определить причину моей ошибки.
Возможно, ассистент работал не со всеми видео.
Возможно, использовал определённый набор аналитических данных.
Возможно, вопрос попал за границы поддерживаемого сценария.
Возможно, произошла обычная ошибка генерации ответа.

По этому эксперименту определить причину нельзя. Именно поэтому я разделяю две вещи: неверный результат я наблюдал, а причину неверного результата пока не знаю.

У меня появилась простая лестница доверия к ИИ-аналитике

После этого теста я бы проверял аналитического ИИ в таком порядке:

  1. Может ли система правильно получить исходные факты.
  2. Может ли она правильно посчитать производные показатели.
  3. Может ли она найти закономерность и показать, на каких данных она основана.
  4. Может ли после этого предложить действие, которое действительно следует из найденного сигнала.

Проблема в том, что пользователь обычно сразу хочет уровень четыре. Именно там ИИ выглядит наиболее впечатляюще. Но если сломан первый уровень, хороший текст на четвёртом уровне ничего не исправляет. Представим, что ассистент говорит:

У вас слишком большая доля Shorts. Стоит увеличить количество длинных видео.

Рекомендация может звучать совершенно разумно. Но если перед этим система неверно определила количество Shorts и длинных видео, ценность такой рекомендации для меня резко падает. Она может оказаться правильной. Но я уже не знаю, получена она из данных или просто правдоподобно звучит. Для управленческой аналитики это принципиальная разница.

Чат вообще не всегда является хорошим интерфейсом для цифр

У этого эксперимента для меня есть ещё один слой. Даже если все числа правильные, я не уверен, что хочу получать бизнес-аналитику длинным текстом. Когда мне последовательно перечисляют десяток показателей, я вынужден держать их в оперативной памяти.
Продажи выросли здесь.
Просели там.
У одного сотрудника такой показатель.
У другого другой.
В этом месяце значение одно.
В прошлом другое.
Теперь попробуй мысленно сопоставить всё это и найти зависимость.

Мне намного проще увидеть таблицу и график.
Если показатель находится в норме, я могу вообще его пропустить.
Если что-то резко отклонилось, визуально это заметно сразу.
Можно посмотреть динамику.
Разложить показатель на составляющие.
Понять, кто или что тянет результат вниз.

В текстовом отчёте эту структуру приходится сначала восстанавливать у себя в голове. Я неоднократно сталкивался с этим и при работе с обычными управленческими отчётами. Именно поэтому даже небольшой набор данных мне иногда проще превратить в отдельную страницу с таблицей и графиками, чем читать его последовательным текстом. Поэтому я не считаю, что хороший ИИ для аналитики обязательно должен превращать данные в разговор.

В некоторых задачах полезнее обратное. ИИ определяет, куда посмотреть, а сами данные показывает в форме, в которой человек быстрее принимает решение.

Каким я хочу видеть такого помощника

Для меня хороший ИИ-ассистент поверх бизнес-данных должен сначала доказать, что умеет надёжно работать с фактическим слоем.
Если система показывает цифру, я хочу понимать её источник.
Если данных недостаточно, хочу увидеть это прямо, а не получить правдоподобное число.
Если найдено отклонение, хочу иметь возможность провалиться в исходные данные.
Если система формулирует гипотезу, хочу отличать гипотезу от измеренного факта.

А уже после этого мне интересны объяснения, рекомендации и действия. Фраза «у вас здесь проблема» сама по себе не очень полезна. Мне нужно понимать, почему система так решила и могу ли я проверить основание этого решения.

Поэтому пока рекомендациям Ask Studio я доверять не готов

Это не вывод о качестве Ask Studio вообще. Это вывод из одного конкретного эксперимента на моём канале. YouTube сам предупреждает пользователей, что качество и точность ответов Ask Studio могут различаться. (официальная справка YouTube)

После полученного результата я для себя добавляю более практичное правило:

Если ИИ не прошёл проверку на простом проверяемом факте, я не использую его более сложные выводы без проверки исходных данных.

Чем сложнее рекомендация, тем важнее это правило. Убедительный язык создаёт ощущение понимания. Но в аналитике меня интересует не ощущение понимания. Меня интересует цепочка: данные -> расчёт -> сигнал -> вывод -> действие. Если я не доверяю первому звену, всё остальное становится намного менее ценным.

Следующий эксперимент будет чище

В следующем тесте я хочу убрать главный неизвестный фактор этого эксперимента - непонятный мне способ доступа Ask Studio к данным. Я выгружу список видео канала в таблицу. После этого дам один и тот же файл нескольким современным моделям и поставлю одинаковую задачу:

Посчитай количество видео.

Потом добавлю следующий уровень:

Раздели видео по типам и покажи расчёт.

В таком эксперименте у моделей будут одинаковые исходные данные, а правильный результат можно будет проверить программно.

Если модели начнут ошибаться уже на готовой таблице, это будет один класс проблемы.
Если таблицу они обработают правильно, а встроенный помощник YouTube продолжит давать другой результат, это будет указывать уже на другой слой системы - доступ к данным, инструменты или логику их использования.

Именно это мне сейчас интересно проверить. Не какая нейросеть убедительнее разговаривает. А насколько надёжно цифровая система может пройти путь от данных до результата, который я могу проверить. Это и будет следующим экспериментом.