Веб-скрапинг: библиотеки и фреймворки сбора данных

Обновлено · 14 проектов · часть каталога из 178 опенсорс-решений

Сбор и очистка данных с сайтов — от готовых сервисов-краулеров до низкоуровневых парсеров. Часть проектов сразу отдаёт результат в формате, пригодном для скармливания языковой модели.

Веб-скрапинг

14 проектов в категории

  • Веб-скрапинг★ 164 тыс

    Firecrawl

    firecrawl/firecrawl

    API, который превращает любой сайт в чистый Markdown для ИИ-пайплайнов — скрапинг, краулинг и извлечение данных в один запрос. Чем ценно: обходит антибот-защиты и работает с JS-сайтами, где обычные парсеры пасуют.

    Открыть на GitHub
  • Веб-скрапинг★ 78 тыс

    Crawl4AI

    unclecode/crawl4ai

    Асинхронный краулер, заточенный под ИИ: выдаёт чистый Markdown из любого сайта. Чем ценно: извлечение данных через LLM и глубокий краулинг — готовый вход для RAG и агентов.

    Открыть на GitHub
  • Веб-скрапинг★ 64 тыс

    Scrapy

    scrapy/scrapy

    Самый популярный Python-фреймворк для скрапинга — асинхронный, с пайплайнами и мидлварами. Чем ценно: проверенный годами стандарт для больших и сложных парсеров.

    Открыть на GitHub
  • Веб-скрапинг★ 29 тыс

    Scrapegraph-ai

    ScrapeGraphAI/Scrapegraph-ai

    Скрапинг через LLM: описываешь словами, что извлечь, — ИИ сам строит пайплайн и парсит страницу. Чем ценно: не нужно вручную писать CSS-селекторы под каждый сайт.

    Открыть на GitHub
  • Веб-скрапинг★ 25 тыс

    Crawlee

    apify/crawlee

    Полноценный фреймворк для скрапинга на Node.js с ротацией прокси и user-агентов. Чем ценно: поддерживает Playwright и Puppeteer для JS-сайтов и готов к продакшену.

    Открыть на GitHub
  • Веб-скрапинг★ 17 тыс

    Katana

    projectdiscovery/katana

    Молниеносный краулер на Go от ProjectDiscovery — собирает ссылки и эндпоинты, обходя JS-сайты. Чем ценно: headless-режим и скорость делают его мастхэвом для пентеста и разведки.

    Открыть на GitHub
  • Веб-скрапинг★ 15 тыс

    monolith

    Y2Z/monolith

    То же самое на Rust: страница со всеми ресурсами упаковывается в один HTML. Чем ценно: быстрее и без зависимостей, но берёт разметку как есть — для сайтов, где картинки подгружаются скриптом, нужен вариант с браузером.

    Открыть на GitHub
  • Веб-скрапинг★ 11 тыс

    Camoufox

    daijro/camoufox

    Stealth-браузер на базе Firefox, который проходит антибот-тесты — Cloudflare, рекапчу, фингерпринтинг. Чем ценно: дроп-ин замена Playwright для сайтов, где обычные боты палятся.

    Открыть на GitHub
  • Веб-скрапинг★ 7 тыс

    Pydoll

    autoscrape-labs/pydoll

    Python-библиотека для автоматизации Chromium без WebDriver, с реалистичными действиями. Чем ценно: обходит рекапчу, Cloudflare и Turnstile без плагинов — напрямую через Chrome DevTools Protocol.

    Открыть на GitHub
  • Веб-скрапинг★ 7 тыс

    Trafilatura

    adbar/trafilatura

    Python-библиотека для извлечения текста и метаданных с веб-страниц — убирает навигацию, рекламу и мусор. Чем ценно: оставляет только основной контент и отдаёт его в Markdown, JSON или CSV.

    Открыть на GitHub
  • Веб-скрапинг★ 5 тыс

    HTTrack

    xroche/httrack

    Классический копировщик сайтов: обходит ссылки и складывает зеркало на диск. Чем ценно: забирает сайт целиком, а не по одной странице; ссылки внутри переписываются на локальные.

    Открыть на GitHub
  • Веб-скрапинг★ 2 тыс

    node-website-scraper

    website-scraper/node-website-scraper

    Скачивает сайт в папку вместе со стилями, скриптами и картинками. Чем ценно: настраивается из кода — удобно, когда нужно правило «эти адреса берём, эти пропускаем».

    Открыть на GitHub
  • Веб-скрапинг★ 2 тыс

    Selectolax

    rushter/selectolax

    Сверхбыстрый HTML-парсер на Python — до 30 раз быстрее BeautifulSoup. Чем ценно: CSS-селекторы и XPath для высоконагруженного скрапинга без тормозов.

    Открыть на GitHub
  • Веб-скрапингвыбор автора★ 2 тыс

    SingleFile CLI

    gildas-lormeau/single-file-cli

    Командная строка того же SingleFile: сохраняет страницу целиком одним файлом со стилями, шрифтами и картинками внутри. Чем ценно: открывает страницу в настоящем браузере, поэтому забирает и то, что подгружается лениво — проверено на выгрузке Tilda, копия совпала с оригиналом пиксель в пиксель.

    Открыть на GitHub

Подборка отражает находки на момент обновления страницы. Опенсорс-проекты быстро развиваются и иногда переезжают — если ссылка изменилась, найдите репозиторий по названию на GitHub. Проверяйте лицензию и актуальность перед использованием в продакшене.

Хочешь забирать такие находки первым?

Я постоянно в полях — нахожу инструменты, которые ускоряют работу в разы, и сразу делюсь ими в каналах. Подписывайся: пока другие пишут с нуля, ты будешь собирать из готового.