Awesome

Awesome-crawler-cn

互联网爬虫，蜘蛛，数据采集器，网页解析器的汇总，因新技术不断发展，新框架层出不穷，此文会不断更新...

Scrapy - 一种高效的屏幕,网页数据采集框架。
- django-dynamic-scraper - 基于Scrapy内核由django Web框架开发的爬虫。
- Scrapy-Redis - 基于Scrapy内核采用Redis组件的爬虫。
- scrapy-cluster - 基于Scrapy内核采用Redis 和 Kafka 开发的分布式爬虫框架。
- distribute_crawler - 基于Scrapy内核采用redis, mongodb开发的分布式爬虫框架。
pyspider - 一个强大纯python的数据采集系统.
cola - 一个分布式的爬虫框架.
Demiurge - 基于PyQuery的微型爬虫框架.
Scrapely - 一个纯python的HTML页面捕捉库.
feedparser - 一个通用的feed解析器.
you-get - 静默网站爬去下载器.
Grab - 网站采集框架.
MechanicalSoup - 一个自动化的互动网站Python库.
portia - 基于Scrapy的可视化数据采集框架.
crawley - 基于非阻塞通信(NIO)的python爬虫框架.
RoboBrowser - 一个简单的，不基于Web浏览器的基于Python的Web 浏览器.
MSpider - 一个基于gevent(协程网络库)的python爬虫.
brownant - 一个轻量级的网络数据抽取框架.
extractnet - 基于机器学习进行网页内容提取的工具

Apache Nutch - 用于生产环境的高度可扩展的高度可扩展的网络爬虫.
- anthelion - 一个基于Apache Nutch抓取语义注释在HTML页面插件.
Crawler4j - 简单和轻量级的网络爬虫.
JSoup - 采集，分析，处理和清洗HTML页面.
websphinx - HTML网站特定的处理、信息提取.
Open Search Server - 全套搜索功能，建立你自己的索引策略。分析、提取全文数据，这个框架可以索引的一切.
Gecco - 一个易于使用的轻量级网络爬虫.
WebCollector -简单的抓取网页的界面，可以在不到5分钟内部署一个多线程的网络爬虫.
Webmagic -一个可扩展的爬虫框架.
Spiderman -一个可扩展的，多线程的网络爬虫.
- Spiderman2 - 分布式网络爬虫框架，支持javascript渲染.
Heritrix3 - 可扩展，大规模的网络爬虫项目.
SeimiCrawler - 一个敏捷的分布式爬虫框架.
StormCrawler - 基于开放源代码、构建低延迟的网络资源采集框架，基于Apache Storm.
Spark-Crawler - 基于Apache Nutch 的网络爬虫，可以运行于Spark.