В последнее время приходится часто парсить сайты, думаю, что скоро расскажу для чего. Опубликую отдельную серию постов об этом. Делать это напрямую, например через Claude Code, можно, но не хочется стрелять из пушки по воробьям, да и существуют более удобные инструменты. Поэтому вот топ-10 бесплатных скраперов с GitHub:
- https://github.com/firecrawl/firecrawl - можно направить его на любой веб-сайт и отслеживать каждую страницу, рендерить JavaScript и получать чистые и структурированные данные, которые ИИ отлично читает. 155 тысяч звезд, среди 100 лучших репозиториев на GitHub
- https://github.com/unclecode/crawl4ai - один из самых популярных скраперов на GitHub. Преобразует любой веб-сайт в чистый markdown для LLM. 74 тысячи звезд. Apache 2.0
- https://github.com/browser-use/browser-use - ИИ-агент, который управляет браузером как человек. Кликает, прокручивает, входит в аккаунт, заполняет формы и извлекает данные с веб-сайтов. За полтора года набрал более 100 тысяч звезд. Лицензия MIT
- https://github.com/apify/crawlee - профессиональный фреймворк для скрапинга. Включает ротацию прокси, автоматические повторные попытки, подмену отпечатка браузера и управление очередями
- https://github.com/scrapy/scrapy - промышленный скрапер. Отслеживает миллионы страниц, извлекает любой контент и экспортирует чистые данные
- https://github.com/microsoft/markitdown - проект Microsoft. Преобразует любой файл или веб-страницу в markdown: PDF, документы Office, картинки, аудио. 168 тысяч звезд
- https://github.com/D4Vinci/Scrapling - отличный скрапер, который автоматически адаптируется к изменениям в дизайне веб-сайтов и неплохо уклоняется от обнаружения системами антискрапинга
- https://github.com/Genymobile/scrcpy - для скрапинга из Android-приложений, у которых нет веб-версий. Более 145 тысяч звезд. Apache 2.0
- https://github.com/alirezamika/autoscraper - задаешь пример, и он находит шаблон, чтобы автоматически отслеживать остальную часть сайта
- https://github.com/lwthiker/curl-impersonate - улучшенная версия curl, которая отлично имитирует отпечаток реального браузера. Запросы выглядят как запросы реального человека с Chrome