Чем вытащить данные с любого сайта и как парсить с агентами

Часто звучит вопрос про парсинг. Нужно это чаще, чем кажется, собрать цены конкурентов, сложить статьи в свою базу знаний, скормить что-то агенту. В общем вот список, сохраняйте, пригодится.

Чем вытащить данные с любого сайта и как парсить с агентами

Готовые сервисы, работают из коробки

Превращает любую страницу, включая JS-сайты и PDF, в чистый markdown для модели.

Добавляете r.jina.ai перед ссылкой и получаете чистый текст страницы, бесплатный тариф щедрый.

Маркетплейс из 28 тысяч готовых скраперов почти под любой популярный сайт.

Расширение для Chrome, вытаскивает данные со страницы в два клика и отправляет их в Sheets или Notion.

Превращает сайты и соцсети в RSS-ленту с фильтрами и автопостингом в телеграм.

Открытые библиотеки, их ставит агент

Популярный открытый скрапер, отдает сайт сразу в markdown для модели.

Агент водит браузер как человек, логинится, кликает и забирает данные.

Фреймворк с ротацией прокси, ретраями и очередями, когда страниц реально много.

Промышленная классика на питоне для обхода миллионов страниц.

Сам подстраивается под изменения верстки, поэтому ломается заметно реже.

Показываете пример нужных данных, он сам находит шаблон и вытаскивает остальное.

Чистит страницу от рекламы, меню и сайдбаров, это движок Obsidian Web Clipper.

Когда сайт сопротивляется

Запросы с отпечатком настоящего браузера, самый простой способ не выглядеть ботом.

Тот же трюк на уровне curl, работает движком под curl_cffi.

Замена Playwright на патченом Chromium, проходит антибот и капчу.

То же самое, только на Firefox.

Что стоит добавить в список?

40
11
1
1