Сначала я хотел всего лишь перестать тратить лишний контекст на PDF. Потом проверил, ищут ли люди похожую работу, и получил первый внешний сигнал для продуктовой гипотезы.
В какой-то момент я заметил, что при работе с документами у меня слишком быстро заканчиваются токены.
Я регулярно загружаю документы в нейросети: сравниваю версии, вытаскиваю факты, разбираю содержание, собираю структуру.
С обычным текстом всё было предсказуемо.
С PDF расход выглядел заметно тяжелее.
Сначала я хотел решить только свою проблему.
Потом из неё получилось отдельное продуктовое исследование.
Сначала я разобрался, куда уходят токены
Я пошёл смотреть, что именно получает Claude, когда я загружаю PDF.
В официальной документации Anthropic механика описана довольно прямо.
При обработке PDF система:
- преобразует каждую страницу в изображение;
- отдельно извлекает текст с каждой страницы;
- передаёт Claude оба слоя;
- Claude анализирует и текст, и изображения.
Это имеет смысл, когда в документе важны графики, схемы, диаграммы, подписи, изображения или расположение элементов.
Но в моём сценарии часто нужен был только текст.
Мне не требовалось анализировать дизайн договора.
Не нужно было смотреть на изображение каждой страницы.
Я хотел получить содержание документа и дальше работать уже с ним.
По документации Anthropic, текстовый слой одной страницы PDF обычно занимает примерно 1500-3000 токенов в зависимости от плотности содержимого. Изображение страницы считается отдельно.
Если взять документ на 20 страниц, только текстовый слой может занять примерно 30 000-60 000 токенов.
Для меня этого было достаточно, чтобы изменить собственный процесс.
Свою проблему я почти закрыл
Я начал сначала извлекать содержание документа.
Если мне нужен был только текст, я передавал нейросети текст.
Если была важна структура, мог сохранить заголовки, списки и таблицы в Markdown.
Если были важны изображения, диаграммы или расположение элементов, оставлял исходный PDF.
То есть технически проблема перестала быть особенно сложной.
Но появилась другая.
Это вообще проблема только у меня?
Я много работаю с нейросетями, поэтому цена контекста для меня заметна.
Другому человеку текст из PDF может быть нужен совсем по другой причине.
Он может хотеть:
- скопировать текст;
- отредактировать документ;
- перевести его;
- сделать краткое содержание;
- достать отдельные данные;
- перенести таблицу;
- загрузить содержимое в другую систему;
- обработать много одинаковых документов.
Поэтому я решил не превращать собственную боль в продуктовую гипотезу без внешнего сигнала.
Я уже фиксировал для себя принцип: сначала исследование, потом продукт.
Здесь я сделал то же самое.
Сначала я пошёл не туда
Первая гипотеза была довольно технической.
Раз мне удобно работать со структурированным текстом, я начал проверять запросы вида:
- PDF в Markdown;
- Word и DOCX в Markdown;
- Excel и XLSX в Markdown;
- другие документы в Markdown.
Первичный сбор дал 328 наблюдаемых поисковых формулировок.
После очистки 299 остались релевантными исследованию.
Но сам факт существования формулировки почти ничего не говорит.
Поэтому дальше я измерил частотность конкретных запросов через Wordstat.
И здесь картина начала меняться.
Спрос на Markdown есть, но он не оказался главным сигналом
Среди запросов на преобразование документов в Markdown были такие точные значения за исследованный 30-дневный период:
| Запрос | Частотность |
|---|---|
docx в markdown | 179 |
excel в markdown | 69 |
excel to markdown | 62 |
word to markdown converter | 45 |
pdf to markdown converter | 39 |
перевод pdf в markdown | 30 |
Эти значения нельзя складывать.
Один и тот же пользователь может использовать несколько близких запросов.
Но для меня уже было видно другое.
Работа с преобразованием документов в Markdown существует.
При этом она распадается по конкретным типам документов и выглядит скорее как набор отдельных технических задач, чем как один большой самостоятельный кластер.
Тогда я сделал ещё один замер.
Убрал Markdown из формулировки вообще.
И проверил более простую работу:
PDF в текст.
Здесь порядок цифр оказался совсем другим
Точные запросы за тот же исследованный период:
| Запрос | Частотность |
|---|---|
pdf в текст | 19 113 |
pdf в текст онлайн | 2 428 |
pdf в текст бесплатно | 1 278 |
pdf to text | 563 |
извлечь текст из pdf | 213 |
pdf to text converter | 60 |
docx to text | 28 |
Эти значения тоже нельзя складывать.
Но даже без суммирования видно главное.
Самый сильный сигнал в моей выборке оказался не вокруг Markdown.
Он оказался вокруг очень простой формулировки:
У меня есть PDF. Мне нужен из него текст.
Это был первый момент, когда исследование перестало быть для меня разговором о форматах.
Формат здесь оказался только входом.
Интереснее стала сама работа.
Внутри этой работы обнаружился ещё один кластер
Даже PDF в текст нельзя считать одной однородной задачей.
Отдельно появились запросы:
pdf скан в текст- 190;pdf в текст ocr- 178;отсканированный pdf в текст- 172;ии pdf в текст- 141;нейросеть pdf в текст- 93.
То есть часть людей хочет извлечь уже существующий текстовый слой.
А часть приходит с изображениями страниц, где сначала требуется OCR.
Это важное ограничение.
19 113 запросов pdf в текст нельзя объявить размером рынка простого конвертера.
Поиск показывает формулировку работы.
Он пока не показывает, каким способом её нужно выполнять и что человек будет делать с результатом дальше.
Что я в итоге нашёл через прямой поиск
Для меня здесь проявились уже не форматы, а несколько наблюдаемых работ.
Первая:
получить текст из PDF.
Вторая:
распознать текст из сканированного PDF.
Третья:
сохранить часть структуры документа при преобразовании.
Но самая интересная зона начинается после этого.
Потому что человек может получить текст и затем:
- отправить его в нейросеть;
- найти конкретные факты;
- извлечь определённые поля;
- сравнить несколько документов;
- обработать пачку файлов;
- перенести результат в таблицу, CRM или другую систему.
Именно здесь может находиться уже не разовая утилита, а повторяющаяся работа.
Почему я пока не называю это продуктом
Поисковый спрос подтверждает, что работа существует.
Но он не отвечает на вопросы, которые для продукта важнее самой частотности.
Я пока не знаю:
- сколько людей получают текст именно для нейросетей;
- сколько делают это регулярно;
- сколько обрабатывают документы пачками;
- что чаще всего происходит после получения текста;
- сколько ручной работы остаётся дальше;
- есть ли у этой работы владелец в компании;
- какова цена текущего процесса;
- готов ли кто-то платить за решение;
- есть ли там функция, которую имеет смысл автоматизировать целиком.
Поэтому вывод 19 113 запросов -> надо строить продукт был бы слишком сильным.
Такого вывода у меня нет.
Но сигнал уже достаточно сильный для следующего шага
До этого исследования у меня была только собственная проблема.
Теперь есть внешний поисковый сигнал.
Причём заметно более сильный, чем исходная техническая гипотеза вокруг Markdown.
Для меня это меняет уровень уверенности.
Не настолько, чтобы строить большой сервис.
Но достаточно, чтобы перестать исследовать запросы только на бумаге и проверить работу через реальное использование.
Если человек один раз получает текст и уходит, это одна история.
Если у него каждую неделю десятки похожих документов и после каждого извлечения начинаются одни и те же действия, это уже совсем другая.
Тогда объектом исследования становится не PDF.
И не текст.
А повторяющаяся цепочка работы после документа.
Что я считаю подтверждённым сейчас
На этом этапе у меня есть несколько достаточно аккуратных выводов.
- Есть измеримый поисковый спрос на конкретные операции с документами.
- Самый сильный сигнал в проверенной выборке -
PDF в текст. - Спрос на DOCX, Excel и PDF в Markdown существует, но заметно меньше.
- Внутри
PDF в текстесть отдельный кластер распознавания сканов. - Поисковый запрос показывает первую работу, но почти ничего не говорит о следующей.
- Найденного спроса недостаточно, чтобы считать продукт подтверждённым.
На этом факты заканчиваются.
Следующий шаг должен ответить уже не на вопрос:
Сколько людей что-то ищут?
А на другой:
Что человек делает после того, как получил текст из PDF?
Если там обнаружится повторяемая работа, за которую уже платят временем, ручными действиями и ошибками, тогда у меня появится основание двигаться от поискового сигнала к продуктовой гипотезе.
Пока я дошёл только до этого рубежа.
И для первого этапа исследования этого достаточно.
FAQ
Почему PDF расходует много токенов в Claude?
Anthropic описывает обработку PDF как сочетание двух слоёв: текст каждой страницы извлекается отдельно, а сама страница преобразуется в изображение. Claude анализирует и текст, и изображение.
Какой поисковый запрос оказался самым сильным?
В моей выборке самым сильным точным запросом стал «pdf в текст» - 19 113 показов за исследованный 30-дневный период. Это сигнал спроса на работу, а не размер рынка.
Можно ли складывать частотности похожих запросов?
Нет. Один человек может использовать несколько близких формулировок, поэтому такие значения нельзя суммировать и выдавать за число уникальных пользователей.
Почему я сначала исследовал Markdown?
Это было продолжением моей собственной технической задачи: мне удобно передавать нейросети структурированный текст. Поиск показал, что спрос на преобразование в Markdown есть, но он заметно меньше широкого спроса на PDF в текст.
Означает ли найденный спрос, что продукт уже найден?
Нет. Поиск подтверждает наличие конкретной работы, но не показывает частоту её повторения одним пользователем, следующую работу, готовность платить и экономику. Для этого нужен следующий продуктовый тест.