Веб-скрапинг: библиотеки и фреймворки сбора данных
Обновлено · 14 проектов · часть каталога из 178 опенсорс-решений
Сбор и очистка данных с сайтов — от готовых сервисов-краулеров до низкоуровневых парсеров. Часть проектов сразу отдаёт результат в формате, пригодном для скармливания языковой модели.
Веб-скрапинг
14 проектов в категории
-
Веб-скрапинг★ 164 тыс
Firecrawl
firecrawl/firecrawlAPI, который превращает любой сайт в чистый Markdown для ИИ-пайплайнов — скрапинг, краулинг и извлечение данных в один запрос. Чем ценно: обходит антибот-защиты и работает с JS-сайтами, где обычные парсеры пасуют.
Открыть на GitHub -
Веб-скрапинг★ 78 тыс
Crawl4AI
unclecode/crawl4aiАсинхронный краулер, заточенный под ИИ: выдаёт чистый Markdown из любого сайта. Чем ценно: извлечение данных через LLM и глубокий краулинг — готовый вход для RAG и агентов.
Открыть на GitHub -
Веб-скрапинг★ 64 тыс
Scrapy
scrapy/scrapyСамый популярный Python-фреймворк для скрапинга — асинхронный, с пайплайнами и мидлварами. Чем ценно: проверенный годами стандарт для больших и сложных парсеров.
Открыть на GitHub -
Веб-скрапинг★ 29 тыс
Scrapegraph-ai
ScrapeGraphAI/Scrapegraph-aiСкрапинг через LLM: описываешь словами, что извлечь, — ИИ сам строит пайплайн и парсит страницу. Чем ценно: не нужно вручную писать CSS-селекторы под каждый сайт.
Открыть на GitHub -
Веб-скрапинг★ 25 тыс
Crawlee
apify/crawleeПолноценный фреймворк для скрапинга на Node.js с ротацией прокси и user-агентов. Чем ценно: поддерживает Playwright и Puppeteer для JS-сайтов и готов к продакшену.
Открыть на GitHub -
Веб-скрапинг★ 17 тыс
Katana
projectdiscovery/katanaМолниеносный краулер на Go от ProjectDiscovery — собирает ссылки и эндпоинты, обходя JS-сайты. Чем ценно: headless-режим и скорость делают его мастхэвом для пентеста и разведки.
Открыть на GitHub -
Веб-скрапинг★ 15 тыс
monolith
Y2Z/monolithТо же самое на Rust: страница со всеми ресурсами упаковывается в один HTML. Чем ценно: быстрее и без зависимостей, но берёт разметку как есть — для сайтов, где картинки подгружаются скриптом, нужен вариант с браузером.
Открыть на GitHub -
Веб-скрапинг★ 11 тыс
Camoufox
daijro/camoufoxStealth-браузер на базе Firefox, который проходит антибот-тесты — Cloudflare, рекапчу, фингерпринтинг. Чем ценно: дроп-ин замена Playwright для сайтов, где обычные боты палятся.
Открыть на GitHub -
Веб-скрапинг★ 7 тыс
Pydoll
autoscrape-labs/pydollPython-библиотека для автоматизации Chromium без WebDriver, с реалистичными действиями. Чем ценно: обходит рекапчу, Cloudflare и Turnstile без плагинов — напрямую через Chrome DevTools Protocol.
Открыть на GitHub -
Веб-скрапинг★ 7 тыс
Trafilatura
adbar/trafilaturaPython-библиотека для извлечения текста и метаданных с веб-страниц — убирает навигацию, рекламу и мусор. Чем ценно: оставляет только основной контент и отдаёт его в Markdown, JSON или CSV.
Открыть на GitHub -
Веб-скрапинг★ 5 тыс
HTTrack
xroche/httrackКлассический копировщик сайтов: обходит ссылки и складывает зеркало на диск. Чем ценно: забирает сайт целиком, а не по одной странице; ссылки внутри переписываются на локальные.
Открыть на GitHub -
Веб-скрапинг★ 2 тыс
node-website-scraper
website-scraper/node-website-scraperСкачивает сайт в папку вместе со стилями, скриптами и картинками. Чем ценно: настраивается из кода — удобно, когда нужно правило «эти адреса берём, эти пропускаем».
Открыть на GitHub -
Веб-скрапинг★ 2 тыс
Selectolax
rushter/selectolaxСверхбыстрый HTML-парсер на Python — до 30 раз быстрее BeautifulSoup. Чем ценно: CSS-селекторы и XPath для высоконагруженного скрапинга без тормозов.
Открыть на GitHub -
Веб-скрапингвыбор автора★ 2 тыс
SingleFile CLI
gildas-lormeau/single-file-cliКомандная строка того же SingleFile: сохраняет страницу целиком одним файлом со стилями, шрифтами и картинками внутри. Чем ценно: открывает страницу в настоящем браузере, поэтому забирает и то, что подгружается лениво — проверено на выгрузке Tilda, копия совпала с оригиналом пиксель в пиксель.
Открыть на GitHub
Подборка отражает находки на момент обновления страницы. Опенсорс-проекты быстро развиваются и иногда переезжают — если ссылка изменилась, найдите репозиторий по названию на GitHub. Проверяйте лицензию и актуальность перед использованием в продакшене.
← Данные и API · Финансы →