pdf-inspector - локальный инструмент на Rust, который сначала пытается понять, что вообще находится внутри PDF, и только потом решает, какие страницы действительно требуют тяжёлой обработки.

pdf-inspector - локальный инструмент на Rust, который сначала пытается понять, что вообще находится внутри PDF, и только потом решает, какие страницы действительно требуют тяжёлой обработки.

PDF-пайплайны не должны начинаться с OCR.

Что он делает:

- классифицирует PDF;

- извлекает структурированный Markdown там, где это возможно;

- определяет страницы, которые нельзя нормально разобрать обычным способом;

- отправляет на OCR только проблемные страницы.

Главная идея - не прогонять через OCR весь документ по умолчанию.

На fast path здесь нет:

- LLM;

- внешних API;

- SaaS;

- сетевых зависимостей.

Это особенно полезно для больших PDF-пайплайнов, где OCR обычно становится самым дорогим и медленным этапом.

Вместо:

PDF → OCR всех страниц → парсинг

получаем:

PDF → классификация → native extraction → OCR только сложных страниц

Меньше вычислений, ниже latency и проще контролировать приватность данных.

🔗 github.com/firecrawl/pdf-inspector

2