Чем вытащить данные с любого сайта и как парсить с агентами
Часто звучит вопрос про парсинг. Нужно это чаще, чем кажется, собрать цены конкурентов, сложить статьи в свою базу знаний, скормить что-то агенту. В общем вот список, сохраняйте, пригодится.
Готовые сервисы, работают из коробки
Превращает любую страницу, включая JS-сайты и PDF, в чистый markdown для модели.
Добавляете r.jina.ai перед ссылкой и получаете чистый текст страницы, бесплатный тариф щедрый.
Маркетплейс из 28 тысяч готовых скраперов почти под любой популярный сайт.
Расширение для Chrome, вытаскивает данные со страницы в два клика и отправляет их в Sheets или Notion.
Превращает сайты и соцсети в RSS-ленту с фильтрами и автопостингом в телеграм.
Открытые библиотеки, их ставит агент
Популярный открытый скрапер, отдает сайт сразу в markdown для модели.
Агент водит браузер как человек, логинится, кликает и забирает данные.
Фреймворк с ротацией прокси, ретраями и очередями, когда страниц реально много.
Промышленная классика на питоне для обхода миллионов страниц.
Сам подстраивается под изменения верстки, поэтому ломается заметно реже.
Показываете пример нужных данных, он сам находит шаблон и вытаскивает остальное.
Чистит страницу от рекламы, меню и сайдбаров, это движок Obsidian Web Clipper.
Когда сайт сопротивляется
Запросы с отпечатком настоящего браузера, самый простой способ не выглядеть ботом.
Тот же трюк на уровне curl, работает движком под curl_cffi.
Замена Playwright на патченом Chromium, проходит антибот и капчу.
То же самое, только на Firefox.
Что стоит добавить в список?