pdf-inspector - локальный инструмент на Rust, который сначала пытается понять, что вообще находится внутри PDF, и только потом решает, какие страницы действительно требуют тяжёлой обработки.
PDF-пайплайны не должны начинаться с OCR.
Что он делает:
- классифицирует PDF;
- извлекает структурированный Markdown там, где это возможно;
- определяет страницы, которые нельзя нормально разобрать обычным способом;
- отправляет на OCR только проблемные страницы.
Главная идея - не прогонять через OCR весь документ по умолчанию.
На fast path здесь нет:
- LLM;
- внешних API;
- SaaS;
- сетевых зависимостей.
Это особенно полезно для больших PDF-пайплайнов, где OCR обычно становится самым дорогим и медленным этапом.
Вместо:
PDF → OCR всех страниц → парсинг
получаем:
PDF → классификация → native extraction → OCR только сложных страниц
Меньше вычислений, ниже latency и проще контролировать приватность данных.
🔗 github.com/firecrawl/pdf-inspector