После ретроспективы «Говори дело» я решил проверить более универсальную идею: голосовой ввод прямо в любом приложении смартфона. Исследование быстро показало, что проблема находится не столько в качестве распознавания речи, сколько в архитектуре платформ, конкуренции со встроенной диктовкой и самой единице ценности продукта.
Почему я не буду делать универсальную ИИ-клавиатуру для голосового ввода
В предыдущем исследовании я ретроспективно разобрал «Говори дело» - продукт, который когда-то сделал как Telegram-бота для работы с голосом.
Он принимал аудио, видео и ссылки, расшифровывал содержимое, приводил текст в порядок, извлекал поручения, определял исполнителя и дедлайн и мог создать задачу в Битрикс24.
После ретроспективного разбора возник следующий вопрос.
Может быть, проблема была не в самой идее голосового ввода, а в Telegram-боте как интерфейсе?
Если человеку всё равно удобнее говорить, чем печатать, логичным продолжением казался универсальный голосовой ввод: открыл любое приложение, нажал микрофон, проговорил мысль и сразу получил готовый текст.
Я отдельно исследовал эту гипотезу.
Сначала пришлось разделить саму задачу
Внутри «Говори дело» были склеены несколько разных работ:
- распознать речь;
- очистить и структурировать текст;
- найти поручение;
- определить исполнителя;
- определить срок;
- создать действие в рабочей системе.
Технически их можно собрать в один конвейер. Но для пользователя это разные уровни ответственности.
Если система неправильно отредактировала мой текст, я могу его поправить.
Если она неправильно назначила сотрудника, срок или создала задачу в CRM, ошибка уже влияет на других людей и рабочий процесс.
Поэтому между «понять, что человек сказал» и «самостоятельно что-то сделать» есть важная граница.
Распознавание речи уже стало инфраструктурой
Базовая транскрибация давно перестала быть сложной самостоятельной функцией.
Есть Whisper и другие модели распознавания речи.
Telegram умеет переводить голосовые сообщения в текст.
В операционных системах есть диктовка. Битрикс24 развивает собственные сценарии работы с аудио, видео и ИИ.
Поэтому предложение:
отправь голосовое, а я превращу его в текст
само по себе уже слабо отличается от функций существующих платформ.
Транскрибация остаётся полезной, но превращается в инфраструктурный слой.
Она отвечает на вопрос:
что человек сказал?
А ценность чаще появляется на следующем этапе:
что теперь с этим нужно сделать?
Подробнее этот переход я уже разбирал в статье «Голосовой ввод с ИИ: почему обычной транскрибации уже мало».
Тогда появилась гипотеза универсального голосового ввода
Следующий вариант выглядел намного сильнее.
Не отправлять сообщение отдельному боту.
Не копировать результат обратно.
А встроить ИИ прямо в клавиатуру телефона.
Пользователь открывает Telegram, почту, CRM или любую форму, нажимает микрофон, свободно говорит, а система сразу вставляет готовый текст.
На уровне концепции это хороший интерфейс.
Но исследование показало серьёзное ограничение на уровне самой платформы.
На iPhone сторонняя клавиатура не является полноценным приложением
Сторонние клавиатуры iOS работают как ограниченные расширения.
Одно из ключевых ограничений - отсутствие обычного доступа к микрофону внутри клавиатурного расширения.
Получается, что простая механика:
нажал микрофон -> говоришь -> текст появляется в текущем поле
не реализуется так же свободно, как внутри обычного приложения.
Можно строить обходные схемы через основное приложение или отдельный фоновый процесс. Но тогда появляется переключение контекста.
А исходная ценность идеи была как раз в обратном: убрать лишние действия.
Есть и второй барьер. Для сетевой обработки сторонней клавиатуре требуется расширенный доступ. Для пользователя разрешение доступа клавиатуры к вводимым данным само по себе создаёт вопрос доверия. То есть наиболее привлекательная версия продукта одновременно получает серьёзные ограничения в точке, где должна быть максимально незаметной.
Простую задачу уже закрывают встроенные альтернативы
Если пользователь хочет не печатать руками, у него уже есть системная диктовка, Gboard и другие встроенные средства.
Если нужно получить текст голосового сообщения, это всё чаще умеет сам мессенджер.
Если нужно сохранить мысль, есть заметки, диктофон, Telegram «Избранное» и отдельные ИИ-сервисы.
Поэтому улучшать только распознавание речи недостаточно.
Продукту приходится двигаться дальше - в смысловую обработку текста.
Но здесь появляется другой эффект.
Чем сильнее ИИ редактирует текст, тем важнее его проверять
Представим короткую рабочую фразу:
По Иванову не согласовали цену, завтра нужно ещё раз обсудить.
Если ИИ просто распознаёт слова, ценность мало отличается от обычной диктовки.
Если он начинает активно переписывать сообщение, текст становится чище, но появляется риск изменить смысл.
Достаточно потерять одно «не», перепутать число, срок или имя.
Поэтому после генерации человеку приходится читать результат.
На длинных заметках это может быть оправдано: ИИ экономит много ручной обработки.
На сообщении из двух предложений иногда быстрее сразу написать самому.
Поэтому скорость речи сама по себе ничего не говорит о ценности продукта.
Считать нужно время от возникновения мысли до готового и проверенного результата.
У массового потребительского продукта появляется ещё и экономический вопрос
Облачная обработка речи имеет переменную себестоимость.
Чем активнее пользователь говорит, тем больше аудио нужно распознавать и тем больше текста обрабатывать.
Для дешёвой безлимитной подписки возникает неприятная конструкция: наиболее активный пользователь одновременно становится наиболее дорогим.
При этом текущее исследование не даёт подтверждённых данных по российскому массовому рынку о стоимости привлечения, удержании, пожизненной ценности клиента и готовности платить за отдельный голосовой инструмент.
Поэтому гипотеза:
сделаем хороший ИИ-голосовой ввод за несколько сотен рублей в месяц и получим массовую подписку
пока ничем не подтверждена.
После этого меняется сам вопрос
Изначально вопрос звучал так:
как сделать хороший голосовой ввод?
После исследования он выглядит иначе:
какую законченную работу можно выполнить после того, как человек рассказал голосом, что произошло?
Это гораздо интереснее. Например, менеджер выходит со встречи и говорит:
Встречался с Ивановым. Интересуется продуктом X. Бюджет около миллиона. До пятницы ждёт предложение. В четверг нужно перезвонить. Ещё попросил отправить спецификацию.
Если результатом будет красивый абзац текста, мы просто немного ускорили ввод информации.
Если после этой фразы система:
- обновит карточку клиента;
- зафиксирует бюджет;
- сохранит интерес;
- создаст следующий контакт;
- поставит задачу;
- подготовит последующее письмо,
то мы уже автоматизировали законченную работу. И здесь голос перестаёт быть продуктом.
Он становится способом передать системе информацию о произошедшем событии.
Подробнее этот класс задач я разбирал в статье «Голосовой ввод в бизнес-процессах».
Что в итоге остаётся от идеи
Универсальную мобильную ИИ-клавиатуру общего назначения я дальше не рассматриваю как отдельный продукт.
Причины достаточно конкретные:
- базовое распознавание речи уже встроено в платформы;
- iOS создаёт серьёзные ограничения для сторонней клавиатуры;
- разрешения и доступ к данным создают барьер доверия;
- смысловая ИИ-редактура требует проверки;
- дешёвая безлимитная потребительская модель не имеет подтверждённой экономики.
При этом сама область голосовых интерфейсов никуда не исчезает.
Просто следующую гипотезу стоит искать не вокруг функции «голос в текст», а вокруг конкретной работы после события.
Например:
встреча закончилась -> сотрудник наговорил результат -> CRM, задачи и последующее письмо обновились автоматически.
Тогда мы уже конкурируем не с диктовкой Apple или Google.
Мы конкурируем с ручной работой, которую человек сегодня вынужден выполнять после разговора.
Это продолжает вопрос, с которого начиналась вся ретроспектива «Говори дело»: нужен ли вообще отдельный сервис расшифровки голосовых сообщений, если ценность возникает уже после самой расшифровки.
И это совсем другая продуктовая задача. После двух исследований вопрос для меня теперь звучит так:
В какой повторяемой рабочей ситуации человеку проще две минуты рассказать, что произошло, чем вручную переносить это в несколько систем?
И уже вокруг ответа на этот вопрос имеет смысл строить следующее исследование.
FAQ
Можно ли сделать голосовую клавиатуру для iPhone?
Стороннюю клавиатуру для iPhone сделать можно, но само расширение сторонней клавиатуры iOS не имеет прямого доступа к микрофону. Поэтому голосовые функции требуют дополнительной архитектуры за пределами клавиатурного расширения.
Чем ИИ-клавиатура отличается от обычной диктовки?
Обычная диктовка в первую очередь превращает речь в текст. ИИ-клавиатура может дополнительно очищать устную речь, перестраивать формулировки и форматировать результат, но чем сильнее она меняет исходный текст, тем важнее его проверка.
Почему одного хорошего распознавания речи недостаточно для отдельного продукта?
Потому что базовый голосовой ввод уже встроен в мобильные операционные системы и клавиатуры. Отдельному продукту нужна дополнительная работа, которую встроенная диктовка не выполняет.
Где голосовой интерфейс выглядит перспективнее?
В сценариях, где речь сразу превращается не просто в текст, а в законченный рабочий результат: обновление CRM, фиксацию итогов встречи, создание следующих действий или заполнение структурированных данных.