Почему из одного PDF текст извлекается, а из другого нет
Два PDF могут выглядеть одинаково, но внутри один содержит настоящий текст, второй - только изображения, а третий - ошибочный слой OCR. Разбираю три уровня проблемы и что делать в каждом случае.