Веб-скрапинг: библиотеки и фреймворки сбора данных

Обновлено · 10 проектов · часть каталога из 164 опенсорс-решений

Сбор и очистка данных с сайтов — от готовых сервисов-краулеров до низкоуровневых парсеров. Часть проектов сразу отдаёт результат в формате, пригодном для скармливания языковой модели.

Веб-скрапинг

10 проектов в категории

  • Веб-скрапинг

    Firecrawl

    firecrawl/firecrawl

    API, который превращает любой сайт в чистый Markdown для ИИ-пайплайнов — скрапинг, краулинг и извлечение данных в один запрос. Чем ценно: обходит антибот-защиты и работает с JS-сайтами, где обычные парсеры пасуют.

    Открыть на GitHub
  • Веб-скрапинг

    Crawl4AI

    unclecode/crawl4ai

    Асинхронный краулер, заточенный под ИИ: выдаёт чистый Markdown из любого сайта. Чем ценно: извлечение данных через LLM и глубокий краулинг — готовый вход для RAG и агентов.

    Открыть на GitHub
  • Веб-скрапинг

    Crawlee

    apify/crawlee

    Полноценный фреймворк для скрапинга на Node.js с ротацией прокси и user-агентов. Чем ценно: поддерживает Playwright и Puppeteer для JS-сайтов и готов к продакшену.

    Открыть на GitHub
  • Веб-скрапинг

    Scrapegraph-ai

    ScrapeGraphAI/Scrapegraph-ai

    Скрапинг через LLM: описываешь словами, что извлечь, — ИИ сам строит пайплайн и парсит страницу. Чем ценно: не нужно вручную писать CSS-селекторы под каждый сайт.

    Открыть на GitHub
  • Веб-скрапинг

    Scrapy

    scrapy/scrapy

    Самый популярный Python-фреймворк для скрапинга — асинхронный, с пайплайнами и мидлварами. Чем ценно: проверенный годами стандарт для больших и сложных парсеров.

    Открыть на GitHub
  • Веб-скрапинг

    Pydoll

    autoscrape-labs/pydoll

    Python-библиотека для автоматизации Chromium без WebDriver, с реалистичными действиями. Чем ценно: обходит рекапчу, Cloudflare и Turnstile без плагинов — напрямую через Chrome DevTools Protocol.

    Открыть на GitHub
  • Веб-скрапинг

    Camoufox

    daijro/camoufox

    Stealth-браузер на базе Firefox, который проходит антибот-тесты — Cloudflare, рекапчу, фингерпринтинг. Чем ценно: дроп-ин замена Playwright для сайтов, где обычные боты палятся.

    Открыть на GitHub
  • Веб-скрапинг

    Trafilatura

    adbar/trafilatura

    Python-библиотека для извлечения текста и метаданных с веб-страниц — убирает навигацию, рекламу и мусор. Чем ценно: оставляет только основной контент и отдаёт его в Markdown, JSON или CSV.

    Открыть на GitHub
  • Веб-скрапинг

    Katana

    projectdiscovery/katana

    Молниеносный краулер на Go от ProjectDiscovery — собирает ссылки и эндпоинты, обходя JS-сайты. Чем ценно: headless-режим и скорость делают его мастхэвом для пентеста и разведки.

    Открыть на GitHub
  • Веб-скрапинг

    Selectolax

    rushter/selectolax

    Сверхбыстрый HTML-парсер на Python — до 30 раз быстрее BeautifulSoup. Чем ценно: CSS-селекторы и XPath для высоконагруженного скрапинга без тормозов.

    Открыть на GitHub

Подборка отражает находки на момент обновления страницы. Опенсорс-проекты быстро развиваются и иногда переезжают — если ссылка изменилась, найдите репозиторий по названию на GitHub. Проверяйте лицензию и актуальность перед использованием в продакшене.

Хочешь забирать такие находки первым?

Я постоянно в полях — нахожу инструменты, которые ускоряют работу в разы, и сразу делюсь ими в каналах. Подписывайся: пока другие пишут с нуля, ты будешь собирать из готового.