Веб-скрапинг: библиотеки и фреймворки сбора данных
Обновлено · 10 проектов · часть каталога из 164 опенсорс-решений
Сбор и очистка данных с сайтов — от готовых сервисов-краулеров до низкоуровневых парсеров. Часть проектов сразу отдаёт результат в формате, пригодном для скармливания языковой модели.
Веб-скрапинг
10 проектов в категории
-
Веб-скрапинг
Firecrawl
firecrawl/firecrawlAPI, который превращает любой сайт в чистый Markdown для ИИ-пайплайнов — скрапинг, краулинг и извлечение данных в один запрос. Чем ценно: обходит антибот-защиты и работает с JS-сайтами, где обычные парсеры пасуют.
Открыть на GitHub -
Веб-скрапинг
Crawl4AI
unclecode/crawl4aiАсинхронный краулер, заточенный под ИИ: выдаёт чистый Markdown из любого сайта. Чем ценно: извлечение данных через LLM и глубокий краулинг — готовый вход для RAG и агентов.
Открыть на GitHub -
Веб-скрапинг
Crawlee
apify/crawleeПолноценный фреймворк для скрапинга на Node.js с ротацией прокси и user-агентов. Чем ценно: поддерживает Playwright и Puppeteer для JS-сайтов и готов к продакшену.
Открыть на GitHub -
Веб-скрапинг
Scrapegraph-ai
ScrapeGraphAI/Scrapegraph-aiСкрапинг через LLM: описываешь словами, что извлечь, — ИИ сам строит пайплайн и парсит страницу. Чем ценно: не нужно вручную писать CSS-селекторы под каждый сайт.
Открыть на GitHub -
Веб-скрапинг
Scrapy
scrapy/scrapyСамый популярный Python-фреймворк для скрапинга — асинхронный, с пайплайнами и мидлварами. Чем ценно: проверенный годами стандарт для больших и сложных парсеров.
Открыть на GitHub -
Веб-скрапинг
Pydoll
autoscrape-labs/pydollPython-библиотека для автоматизации Chromium без WebDriver, с реалистичными действиями. Чем ценно: обходит рекапчу, Cloudflare и Turnstile без плагинов — напрямую через Chrome DevTools Protocol.
Открыть на GitHub -
Веб-скрапинг
Camoufox
daijro/camoufoxStealth-браузер на базе Firefox, который проходит антибот-тесты — Cloudflare, рекапчу, фингерпринтинг. Чем ценно: дроп-ин замена Playwright для сайтов, где обычные боты палятся.
Открыть на GitHub -
Веб-скрапинг
Trafilatura
adbar/trafilaturaPython-библиотека для извлечения текста и метаданных с веб-страниц — убирает навигацию, рекламу и мусор. Чем ценно: оставляет только основной контент и отдаёт его в Markdown, JSON или CSV.
Открыть на GitHub -
Веб-скрапинг
Katana
projectdiscovery/katanaМолниеносный краулер на Go от ProjectDiscovery — собирает ссылки и эндпоинты, обходя JS-сайты. Чем ценно: headless-режим и скорость делают его мастхэвом для пентеста и разведки.
Открыть на GitHub -
Веб-скрапинг
Selectolax
rushter/selectolaxСверхбыстрый HTML-парсер на Python — до 30 раз быстрее BeautifulSoup. Чем ценно: CSS-селекторы и XPath для высоконагруженного скрапинга без тормозов.
Открыть на GitHub
Подборка отражает находки на момент обновления страницы. Опенсорс-проекты быстро развиваются и иногда переезжают — если ссылка изменилась, найдите репозиторий по названию на GitHub. Проверяйте лицензию и актуальность перед использованием в продакшене.
← Данные и API · Финансы →