Я начал с широкой гипотезы про поиск по аудиоархивам и постепенно сузил её до анализа глубинных интервью. Самое интересное - исследовательский алгоритм независимо привёл меня к той же базовой логике, на которой уже работает «Дожми встречу»: ценность появляется после транскрибации, когда разговор превращается в рабочий результат.
Я начал это исследование с достаточно широкой идеи.
Компании записывают звонки, встречи, интервью, исследования.
Аудио и видео накапливаются, но большая часть записей после первого использования просто остаётся лежать в архиве.
Отсюда возникает естественная гипотеза: сделать систему, которая понимает весь этот массив и позволяет задавать ему вопросы.
Где клиент говорил о конкретной проблеме?
В каком разговоре согласовали условие?
Что пользователи говорили о новой функции?
Какие проблемы повторялись в нескольких интервью?
То есть вместо ручного поиска и переслушивания записей получить смысловой поиск по накопленным разговорам.
Но по мере исследования стало понятно, что формулировка «поиск по аудиоархиву» слишком широкая.
Более интересная работа обнаружилась не в самом поиске, а в том, что человек делает после разговора.
Это продолжение моего более общего подхода: сначала пройти рынок достаточно широко, а уже потом сужать гипотезу. В этот раз широкий вход был не отраслевым, а функциональным: я начал с любых накопленных разговоров и пытался понять, где внутри этой области находится повторяемая работа с понятным результатом.
Что именно я исследовал
Исходную задачу я сформулировал примерно так:
Есть массив записанных разговоров. Человеку нужно найти в нём конкретный факт, тему, решение, цитату или закономерность и при необходимости проверить результат по исходной записи.
Я смотрел на звонки продаж и поддержки, пользовательские интервью, рабочие встречи, медиаархивы и другие накопленные записи.
Исследовал сам процесс, существующие способы решения, российские и зарубежные продукты, предварительную экономику и технические ограничения.
Это было кабинетное исследование. Оно хорошо подходит для того, чтобы сузить пространство гипотез, но не доказывает реальную готовность пользователей платить.
И именно это ограничение дальше оказалось принципиальным.
Одна технология скрывает несколько разных работ
Снаружи все эти сценарии похожи.
Есть запись, внутри которой нужно что-то найти.
Но контакт-центр, который разбирает жалобу клиента, делает совсем не ту же работу, что продуктовый исследователь после серии интервью.
Юрист ищет одну формулировку.
Редакция работает с большим видеоархивом.
Продуктовый менеджер ищет повторяющиеся проблемы нескольких пользователей.
Руководитель пытается восстановить договорённость со встречи.
Технологическая основа может быть похожей, но конечные результаты разные.
Разная частота работы.
Разная цена ошибки.
Разные пользователи.
Разные покупатели.
Поэтому идея универсального «поиска по корпоративному аудио» стала для меня слишком широкой.
То, что одна технология может обслуживать десять сценариев, ещё не означает, что существует один продукт для всех десяти.
Я отдельно проверил, как эти работы называют в поиске
После первого прохода мне стало важно проверить не только логику исследования, но и язык реального спроса.
Я отдельно прогнал три направления через поисковое исследование по России:
- глубинные и пользовательские интервью;
- встречи и совещания;
- анализ звонков.
Здесь важно не смешивать источники данных.
Google Suggest и Yandex Suggest я использовал, чтобы проверить, действительно ли люди формулируют запросы такими словами.
Численные значения ниже - только данные Яндекс Wordstat за последние 30 дней на момент проверки 18 сентября 2026 года.
По интервью подтвердились, например:
расшифровка интервью- 276 точных результатов;транскрибация интервью- 72;расшифровка глубинного интервью- 12.
Для запроса анализ глубинных интервью Wordstat показал 399 по общему запросу, но это не точная частотность конкретной фразы, поэтому я не смешиваю это число с exact-значениями выше.
У встреч язык спроса оказался заметно шире:
расшифровка встречи- 867 точных результатов;резюме встречи- 652;транскрибация встречи- 400;саммари встречи- 273;протокол встречи ИИ- 150.
Есть и гораздо более крупные общие запросы вроде протокол встречи и протокол совещания, но там смешано много намерений: образцы документов, оформление, административные процедуры. Я не считаю эти цифры прямым спросом на продукт для обработки встреч.
По звонкам поисковые подсказки уже показали сформированный язык категории: речевая аналитика, анализ звонков, анализ звонков отдела продаж, транскрибация звонков, ИИ анализ звонков.
Но численный слой Wordstat по этой ветке я пока не использую: сбор упёрся в часовую квоту API до получения измеренных значений.
Для меня здесь важен не рейтинг трёх направлений по одной цифре. Важнее другое.
Интервью, встречи и звонки действительно описываются рынком как разные работы.
Причём для встреч люди заметно чаще ищут не только исходный текст, но и уже готовый результат после разговора: резюме, саммари, конспект, протокол.
Это усилило мысль, что продукт нужно проектировать не вокруг общей технологии транскрибации, а вокруг конкретной работы после разговора.
Самый интересный след появился в анализе глубинных интервью
Отдельно я посмотрел на работу продуктовых команд с пользовательскими и глубинными интервью.
Под анализом глубинного интервью здесь я имею в виду не пересказ разговора, а работу после него:
- найти значимые наблюдения,
- сохранить связь с исходными словами пользователя,
- сопоставить несколько интервью
- и довести подтверждённые выводы до следующего продуктового действия.
Здесь запись разговора - только начало.
Даже если транскрипт уже готов, дальше нужно понять, что именно в разговоре важно.
Найти значимые фрагменты.
Не потерять точные формулировки.
Восстановить контекст.
Сопоставить одно интервью с другими.
Увидеть повторяющиеся проблемы.
Отделить сильный сигнал от единичного мнения.
А затем ещё перенести результат в исследовательскую базу, гипотезу или рабочую задачу.
И здесь исходная гипотеза начала заметно меняться.
Мне стал интересен уже не поиск по аудио как таковой, а вся цепочка:
разговор -> подтверждающий материал -> вывод -> рабочее действие.
Транскрипт - ещё не результат анализа
Расшифровать разговор сегодня значительно проще, чем несколько лет назад.
Но даже хороший транскрипт не заканчивает исследовательскую работу.
Представим часовое глубинное интервью.
За этот час пользователь может:
- описать проблему,
- назвать ситуацию, в которой она возникает,
- объяснить текущий способ решения,
- упомянуть альтернативы,
- рассказать о барьерах
- несколько раз самому себе противоречить.
Для продуктовой работы важен не весь текст одинаково.
Нужно найти именно те фрагменты, которые что-то подтверждают или опровергают.
А затем сохранить связь между выводом и тем, что человек действительно сказал.
В этом месте транскрибация превращается из конечного продукта в инфраструктуру следующей работы.
Я уже приходил к похожему выводу, когда отдельно проверял, достаточно ли простой расшифровки голосовых сообщений для самостоятельного продукта. В обоих случаях текст сам по себе оказывается промежуточным результатом.
Краткий пересказ и доказательство - разные вещи
Можно загрузить интервью в языковую модель и попросить сделать основные выводы.
Получится аккуратный пересказ.
Но если один из этих выводов должен повлиять на продукт, появляется более сложный вопрос:
На основании каких слов пользователя этот вывод сделан?
Если модель пишет: «Пользователю неудобен текущий процесс», я хочу иметь возможность сразу увидеть исходную формулировку.
Кто это сказал.
На каком месте записи.
В каком контексте.
Встречался ли такой же сигнал в других разговорах.
Есть ли интервью, которое ему противоречит.
Это нужно не только для защиты от ошибок ИИ.
Даже человек может по-разному интерпретировать один разговор.
Поэтому для анализа глубинных интервью мне кажется гораздо более ценной не автоматическая генерация красивых «инсайтов», а сохранение проверяемой связи между выводом и первоисточником.
Минимальный полезный результат выглядит иначе
После этого я перестал считать основной единицей результата транскрипт или краткий пересказ.
Гораздо интереснее выглядит отдельный проверяемый фрагмент исследования.
В нём есть:
- наблюдение;
- точная цитата;
- исходное интервью;
- таймкод и возможность быстро открыть нужное место записи;
- необходимый контекст;
- тип сигнала;
- связанные наблюдения из других интервью;
- противоречащие наблюдения;
- статус проверки человеком.
Только после проверки человеком такой материал превращается в основание для продуктового вывода.
Получается обратимая цепочка:
рабочая задача -> продуктовый вывод -> подтверждение -> цитата -> исходный разговор.
Если через месяц кто-то спросит, почему команда вообще пришла к определённому выводу, не придётся отвечать: «Кажется, пользователи об этом говорили». Можно вернуться к первоисточнику.
Главным конкурентом может быть не другой ИИ-сервис
В открытом исследовании я не нашёл очевидного российского стандарта исследовательского репозитория уровня специализированных зарубежных систем. Но я не считаю отсутствие заметного конкурента доказательством свободного рынка.
Потому что настоящий конкурент здесь может быть собран из уже существующих инструментов.
Запись разговора проходит через сервис транскрибации.
Текст отправляется в ChatGPT или другую модель.
Потом важные части переносятся в Miro, Notion или таблицу.
Финальный вывод попадает в трекер задач.
Каждый элемент уже существует. Если здесь и есть самостоятельная ценность нового решения, то, вероятно, она находится между этими этапами: убрать ручные переходы и при этом не потерять связь между продуктовым выводом и исходными словами пользователя.
Но пока это именно гипотеза. Отсутствие специализированного продукта можно трактовать и наоборот: возможно, существующего набора инструментов большинству команд вполне достаточно.
Технически задача пока не выглядит главным риском
Исследование не показало фундаментальной технической проблемы.
Речь можно расшифровывать.
Длинные разговоры можно обрабатывать частями.
Из них можно извлекать структурированные наблюдения.
Цитаты можно связывать с транскриптом и таймкодами.
Сигналы нескольких интервью можно сопоставлять между собой.
При этом остаются серьёзные требования к качеству:
- ошибка распознавания речи;
- неверное разделение говорящих;
- потеря контекста;
- пропущенный важный фрагмент;
- выдуманная моделью цитата;
- неверное объединение разных смыслов;
- попытка представить интерпретацию модели как слова пользователя.
Поэтому участие человека здесь я не считаю временным недостатком.
Наоборот. Правильная система, скорее всего, должна не принимать исследовательские решения вместо человека, а сокращать механическую работу вокруг них.
Система находит и структурирует материал.
Человек подтверждает то, что действительно должно стать доказательством.
Самый важный вопрос исследование пока не закрыло
После всей этой работы остаётся главный неизвестный:
Достаточно ли эта работа ценна, чтобы продуктовая команда изменила привычный процесс и платила за отдельный инструмент?
Кабинетное исследование этого не показывает.
Пока я не знаю, насколько регулярно такая потребность возникает у разных команд.
Не знаю, насколько важна для них связь с исходной записью.
Не знаю, кто именно принимает решение о покупке.
Не знаю, нужен ли здесь самостоятельный продукт или правильнее встроить эту функцию в уже существующий рабочий инструмент.
И здесь для меня возник ещё один интересный поворот.
Исследование привело меня к тому, что уже было создано
У меня уже есть продукт «Дожми встречу».
Я сделал его раньше этого исследования и в первую очередь под собственную работу.
Сам пользуюсь им каждый день.
После офлайн-встречи могу отправить запись с диктофона.
После онлайн-встречи - передать файл или ссылку на запись.
В результате получаю качественную расшифровку на русском языке и структурированный материал, по которому можно быстро восстановить содержание разговора, не переслушивая его целиком.
Когда я создавал этот продукт, у меня ещё не было нынешнего алгоритма исследования гипотез.
Продукт появился из собственной практической потребности.
А теперь я начал с гораздо более широкой задачи - с накопленных аудиоархивов - и последовательно пошёл от общего к частному.
В результате исследование снова привело примерно к той же базовой конструкции:
Ценность находится не в самой записи и даже не в самой транскрибации, а в превращении разговора в готовый рабочий результат.
Для меня это сильный сигнал. Но не доказательство.
Один и тот же транскрипт нужен по-разному
После поисковой проверки я ещё раз посмотрел на собственное использование продуктов.
И здесь стало видно то, чего не хватало в первом выводе исследования: важен не только тип разговора, но и где и как человек использует результат после него.
В «Дожми встречу» я почти никогда не открываю расшифровку, чтобы перепроверить конкретное слово или цитату.
Я обычно помню контекст разговора.
Мне в первую очередь нужны общее резюме и основные смыслы, по которым можно быстро восстановить встречу и перемещаться по её содержанию.
Полная расшифровка для меня при этом всё равно важна, но в другой роли.
Я скачиваю её как исходный материал и дальше могу использовать в нейросети, чтобы подготовить правило, регламент, статью, пост, сообщение или задачу.
У сотрудников, которые только входили в новые для себя процессы, поведение было другим.
Они чаще возвращались в расшифровку и проверяли конкретные места разговора.
Это пока только внутреннее наблюдение, а не доказательство поведения рынка, но оно хорошо показывает зависимость продукта от контекста пользователя.
В «Дожми продажи» ситуация ещё другая.
Там работа идёт с большим количеством клиентских звонков, и рядом с обработкой ИИ критически важно иметь прямой доступ к исходной расшифровке, разделённой по спикерам.
Нужен быстрый поиск по словам и фразам, возможность найти конкретную цитату и при необходимости посчитать повторения.
К этому набору функций продукт пришёл не из теории, а из ежедневной работы со звонками.
Если система делает вывод о разговоре, человек должен иметь возможность быстро проверить, на чём этот вывод основан.
Для исследовательских интервью проверка первоисточника нужна ещё по другой причине.
Там конкретная фраза пользователя может стать основанием для продуктового вывода.
Поэтому переход от наблюдения к точной цитате, контексту и месту в исходной записи становится частью самой исследовательской работы.
Получаются как минимум три разных режима:
-
встречи
— быстро понять содержание и продолжить работу;
— здесь на первом плане резюме и структурированный материал, а транскрипт остаётся доступным исходником; -
звонки
— анализировать и контролировать разговоры;
— здесь вывод ИИ и исходная расшифровка должны находиться рядом и легко проверяться; -
исследовательские интервью
— собирать доказательства;
— здесь особенно важна обратимая связь от вывода к цитате и первоисточнику.
Технологическая база у этих режимов похожа.
Но продуктовая логика уже разная.
Именно поэтому вопрос «нужна ли расшифровка» оказался слишком простым.
Гораздо полезнее спрашивать: в какой момент человек возвращается к исходному разговору, зачем он это делает и какой следующий результат хочет получить?
Что именно это подтверждает, а что нет
Исследование не доказало, что «Дожми встречу» уже является правильным массовым продуктом.
Не доказало, что его нужно развивать именно в текущем виде.
Не доказало, что другие пользователи будут использовать его так же часто, как я.
И тем более не доказало массовую готовность рынка платить.
Но получилось другое. Методика, которая начинала с широкой области и не была построена для подтверждения уже существующего продукта, самостоятельно пришла к очень похожей базовой логике.
Это не подтверждение рынка, но хороший повод продолжать проверку на следующем, более узком уровне.
Теперь вопрос можно поставить значительно точнее.
Не: Нужен ли людям сервис для расшифровки встреч?
И не: Нужен ли универсальный поиск по аудио?
А: Какой конкретный рабочий результат после разговора достаточно ценен, чтобы человек регулярно использовал для него отдельный продукт?
Анализ глубинных интервью - один из таких кандидатов
Текущее направление исследования как раз вывело меня на один конкретный вариант.
После пользовательского интервью получить не просто транскрипт или краткий пересказ, а проверяемый исследовательский материал, который можно использовать дальше в работе продуктовой команды.
Если такой сценарий подтвердится на реальных командах, это не обязательно означает создание отдельного нового продукта.
Возможно, это окажется одним из сильных направлений развития уже существующего «Дожми встречу».
Если не подтвердится, базовую гипотезу тоже не нужно автоматически выбрасывать.
Тогда имеет смысл проверить следующий конкретный результат внутри того же общего процесса.
Например, результат после продажи, обычной рабочей встречи, интервью кандидата или другого разговора.
То есть сейчас для меня важно разделить два уровня.
Первый уровень уже выглядит устойчивее: разговор можно превращать в структурированный рабочий результат, и такая функция имеет практический смысл как минимум в моём собственном ежедневном использовании.
Второй уровень ещё предстоит доказать: какой именно результат является достаточно частым, дорогим и ценным для внешнего пользователя.
В процессе обнаружилась ещё одна проблема - качество самих доказательств
Первый проход исследования дал ещё один полезный урок.
Часть утверждений в исследовательском пакете формально выглядела как факты, хотя непосредственным источником являлся ответ другой ИИ-модели.
Для поиска направлений это полезно.
Для публичного доказательства - нет.
Поэтому я сознательно не переношу в эту статью некоторые эффектные цифры только потому, что они уже оказались в отчёте.
Если число влияет на мой вывод, мне нужен исходный источник, реальное наблюдение, эксперимент или прозрачный расчёт.
Иначе очень легко построить красивую цепочку, в которой одна модель придумала рыночный сигнал, вторая его пересказала, третья присвоила ему высокий уровень уверенности, а в конце я сам начал воспринимать его как реальность.
Так исследовать продукт бессмысленно.
Что я делаю дальше
После дополнительной проверки я больше не хочу продолжать это как одну общую гипотезу про работу с аудио.
Дальше нужны три отдельных исследования.
Первое - про глубинные и пользовательские интервью.
Там нужно понять уже не только ценность анализа, а конкретный способ использования продукта: кто записывает разговор, откуда берётся запись, нужен ли импорт или собственная запись, веб-сервис или приложение, как человек работает с несколькими интервью, как проверяет цитаты и куда переносит результат.
Второе - про встречи и совещания.
Здесь поисковый спрос заметнее, а рынок уже занят существующими сервисами.
Поэтому кроме сценария использования нужно отдельно разбирать конкурентов и отзывы: что людям нравится, что раздражает, какие способы записи и импорта стали стандартом, где есть проблемы и какие части работы остаются неудобными.
Отдельно важно не смешать онлайн- и офлайн-встречи.
Если у них окажутся разные способы захвата записи, разные ожидания и разные конкуренты, это могут быть два разных продуктовых режима.
Третье - про аналитику звонков.
Поисковый язык категории уже виден, но численный Wordstat я доберу отдельно.
Здесь нужно проверить, какие функции рынок считает базовыми для речевой аналитики и насколько важны именно те механики, к которым уже пришёл «Дожми продажи»: расшифровка по спикерам, поиск слов и фраз, проверка выводов по исходнику и массовый анализ.
То есть следующий этап для меня теперь звучит не как «ещё глубже исследовать транскрибацию».
Нужно отдельно понять, какой продукт ожидает человек в каждом из трёх контекстов и как именно он будет им пользоваться.
Это важнее списка функций.
Способ записи, импорт, интерфейс, момент возврата к первоисточнику и следующий рабочий шаг могут определить границы продукта сильнее, чем сама модель распознавания речи.
Главный вывод
Самым интересным результатом для меня стала не конкретная функция ИИ.
Интереснее другое. Практическая работа сначала привела меня к созданию «Дожми встречу».
А теперь отдельный исследовательский алгоритм, начиная с гораздо более широкого пространства задач, снова подвёл меня к очень похожей базовой идее.
Сам разговор не является конечным результатом. Расшифровка тоже. Ценность появляется тогда, когда содержание разговора превращается в результат, который можно использовать дальше.
Это ещё не ответ на вопрос, каким должен быть продукт.
Но теперь следующий вопрос значительно конкретнее:
Какую именно работу после разговора стоит автоматизировать первой?
Анализ глубинных интервью - один из кандидатов, который возник из этого исследования.
Встречи и аналитика звонков - ещё два отдельных направления, которые после дополнительной проверки уже нельзя честно складывать в один продукт только потому, что везде есть речь и транскрипция.
Для меня это и есть смысл всей серии: не придумать красивое применение ИИ и потом искать ему подтверждения, а постепенно дойти до функции, которую люди действительно хотят передать системе.
И теперь к этому добавился ещё один критерий: нужно понимать не только что обрабатывать, но и где, когда и зачем человек будет возвращаться к результату.
FAQ
Как анализировать глубинные интервью с помощью ИИ?
Я бы не ограничивал анализ автоматическим кратким пересказом. Полезнее выделять конкретные наблюдения, сохранять точные цитаты и связь с исходным фрагментом записи, сопоставлять повторяющиеся и противоречащие сигналы и только после проверки человеком превращать их в продуктовые выводы.
Чем краткий пересказ интервью отличается от анализа интервью?
Краткий пересказ сокращает содержание разговора. Анализ должен помочь понять, какие наблюдения подтверждают или опровергают гипотезу, где они повторяются и на каких исходных словах пользователя основан вывод.
Зачем сохранять цитаты и таймкоды глубинного интервью?
Чтобы любой существенный вывод можно было быстро проверить по первоисточнику. Это снижает риск потерять контекст, принять интерпретацию за факт или опереться на неточную формулировку модели.
Можно ли полностью автоматизировать анализ кастдева?
Технически можно автоматизировать много механических шагов, но в текущей гипотезе человек остаётся в контуре проверки: система находит и структурирует материал, а исследователь подтверждает то, что действительно должно стать доказательством для решения.