关于爬虫的项目(非商业)截止至2026.6.21全面总结版本
TL;DR:
最近调研了一下爬虫的相关工具,希望有工具能自动化地全面上网查询信息,于是有此文
注:此文是作者平常刷公众号的时候看到好文章就传入文件传输助手的积累,可以说相当全面的版本,大家有推荐的也可以在评论区@一下我或者分享一下
相关开源项目整理:Web 抓取 / 浏览器自动化 / 内容采集方向
一、项目总览表
| 序号 | 项目名称 | 类型 | 核心定位 | 技术路线 | 适合场景 | 开源地址 / 文档 |
|---|---|---|---|---|---|---|
| 1 | Crawlee | 通用爬虫自动化库 | 面向生产级 Web 爬取的 Node.js / TypeScript 框架 | Cheerio / Puppeteer / Playwright | 静态网页、动态网页、浏览器自动化爬虫 | https://github.com/apify/crawlee |
| 2 | Scrapling | 自适应 Web Scraping 框架 | 提升爬虫在页面变化后的稳定性 | Python Web Scraping + 自适应选择器 | 页面结构经常变化的网站 | https://github.com/D4Vinci/Scrapling |
| 3 | ScrapeGraphAI | AI 驱动爬虫框架 | 用 LLM 理解网页并抽取结构化信息 | LLM + 图式流程 + 网页解析 | 非规则页面、自然语言抽取任务 | https://github.com/VinciGit00/Scrapegraph-ai |
| 4 | crawl4ai | LLM 友好型爬虫框架 | 面向 AI 应用的网页抓取、清洗、Markdown 输出 | Browser / HTML parsing / Markdown extraction | RAG、知识库构建、网页转 Markdown | https://github.com/unclecode/crawl4ai |
| 5 | MediaCrawler | 多平台社媒爬虫 | 抓取小红书、抖音、B站、微博、知乎等平台内容 | Playwright / 平台适配器 | 社媒内容采集、舆情、内容分析 | https://github.com/NanmiCoder/MediaCrawler |
| 6 | Katana | 安全扫描 / URL 爬取工具 | 面向安全测试的快速爬虫与 URL 发现 | Go + headless crawling | Web 安全、资产发现、漏洞扫描前置爬取 | https://github.com/projectdiscovery/katana |
| 7 | EasySpider | 可视化爬虫工具 | 无代码 / 低代码网页采集工具 | 可视化流程 + 浏览器自动化 | 非程序员采集网页数据、轻量自动化 | https://github.com/NaiboWang/EasySpider |
| 8 | BrowserCluster | 浏览器自动化集群系统 | 多浏览器实例并发调度与爬取 | Browser Cluster / Playwright / Puppeteer 类思路 | 大规模动态网页采集、浏览器任务集群 | https://github.com/934050259/BrowserCluster |
| 9 | openclaw-web-scraper | MCP 网页抓取工具 | 零配置、基于 Playwright 的网页转 Markdown 工具 | Playwright + Chromium + MCP | AI Agent 调用浏览器抓取网页正文 | LiranUdi/openclaw-web-scraper |
| 10 | Fetcher MCP | MCP 内容提取工具 | 基于 Readability 的网页正文提取工具 | Readability + Markdown / HTML 输出 | 批量抓取文章正文、清洗广告和导航栏 | jae-jae/fetcher-mcp |
| 11 | Microsoft Playwright MCP | 官方 MCP 浏览器自动化工具 | 提供完整浏览器操作能力 | Playwright + MCP | 登录、点击、填表、截图、多步骤自动化 | Microsoft Playwright MCP |
| 12 | Playwright Scraper MCP | 极简 MCP 抓取工具 | 一个 URL 输入,一个 Markdown 输出 | Playwright + Markdown extractor | 简单网页正文抓取、Agent 工具链集成 | dennisgl/mcp-playwright-scraper |
| 13 | rust-clawer / opencli 相关项目 | CLI / 爬虫工具 | 终端化网页抓取或 OpenCLI 相关能力探索 | Rust / CLI / Web crawling | 命令行抓取、自动化脚本 | https://github.com/coder-brzhang/rust-clawer |
二、重点项目规范化拆解
1. Crawlee
基本定位
Crawlee 是一个面向生产环境的爬虫自动化框架,核心目标是把不同类型网页的抓取方式统一起来。
它不是单一爬虫,而是一套爬虫抽象层,内部提供多种 crawler:
| 子模块 | 核心能力 | 适合网页类型 |
|---|---|---|
| CheerioCrawler | 只下载 HTML,不启动浏览器 | 静态网页 |
| PuppeteerCrawler | 启动 Chromium,执行 JavaScript | 动态网页、需要点击/滚动的网站 |
| PlaywrightCrawler | 支持 Chromium、Firefox、WebKit | 复杂动态网页、跨浏览器模拟 |
核心优势
| 维度 | 说明 |
|---|---|
| 工程化程度 | 高,适合做正式爬虫项目 |
| 扩展性 | 强,可以按网站类型切换抓取方式 |
| 资源控制 | 可以在轻量 HTML 抓取和重型浏览器抓取之间切换 |
| 生态 | Apify 维护,文档较完整 |
适合用途
静态网页 → CheerioCrawler
普通动态网页 → PuppeteerCrawler
复杂前端 / 多浏览器模拟 → PlaywrightCrawler
不适合用途
如果只是“给 AI 一个 URL,直接拿正文 Markdown”,Crawlee 会显得偏重,需要自己写规则、选择器和处理逻辑。
2. Scrapling
基本定位
Scrapling 是一个自适应 Web Scraping 框架,重点解决的问题不是“能不能抓”,而是:
网页结构变了之后,爬虫还能不能继续稳定运行。
核心问题
传统爬虫常依赖 XPath / CSS Selector:
div.article > p:nth-child(3)
一旦网页结构调整,选择器就失效。Scrapling 的价值在于提高选择器和内容定位的鲁棒性。
适合用途
| 场景 | 是否适合 |
|---|---|
| 长期维护的站点采集 | 适合 |
| 页面结构经常变的网站 | 适合 |
| 简单一次性抓取 | 不一定必要 |
| 社媒平台大规模采集 | 需要配合登录态和反爬处理 |
评价
Scrapling 更适合作为“稳定性增强层”,而不是完整的一站式采集平台。
3. ScrapeGraphAI
基本定位
ScrapeGraphAI 是一个 AI 驱动的网页抓取框架。它的核心思想是:
不要完全依赖固定选择器,而是让 LLM 理解网页内容,再根据目标抽取信息。
传统爬虫 vs ScrapeGraphAI
| 维度 | 传统爬虫 | ScrapeGraphAI |
|---|---|---|
| 抽取方式 | CSS / XPath / 正则 | LLM 理解网页 |
| 配置方式 | 写规则 | 写自然语言目标 |
| 适合页面 | 结构稳定页面 | 非规则页面、语义抽取 |
| 成本 | 低 | 可能消耗 LLM token |
| 稳定性 | 依赖结构 | 依赖模型理解能力 |
适合用途
从一个网页里抽取:
- 产品价格
- 作者信息
- 发布时间
- 正文摘要
- 表格中的关键字段
- 页面里的联系方式
不适合用途
不适合高频、大规模、低成本采集,因为 LLM 调用成本和延迟会明显高于传统爬虫。
4. crawl4ai
基本定位
crawl4ai 更贴近 AI 应用工作流,适合把网页内容转成适合大模型处理的格式。
它的核心价值不是“模拟浏览器操作”,而是:
网页 → 清洗 → 正文提取 → Markdown → LLM / RAG / 知识库
适合用途
| 场景 | 说明 |
|---|---|
| RAG 数据采集 | 把网页正文转成 Markdown |
| 网页总结工具 | 抓取网页正文给 LLM 总结 |
| 论文 / 博客 / 文档采集 | 提取主要内容,过滤导航栏和广告 |
| AI Agent 工具 | 作为网页阅读工具接入 Agent |
评价
如果你的目标是做“AI 阅读网页 / 自动整理网页 / 构建知识库”,crawl4ai 比 Crawlee 更直接。
5. MediaCrawler
基本定位
MediaCrawler 是一个面向国内主流社交媒体和内容平台的多平台爬虫项目。
典型支持方向
| 平台类型 | 示例 |
|---|---|
| 社交媒体 | 小红书、微博 |
| 视频平台 | 抖音、B站 |
| 内容社区 | 知乎 |
| 其他平台 | 视项目适配情况而定 |
核心优势
| 维度 | 说明 |
|---|---|
| 平台针对性 | 强,重点覆盖国内内容平台 |
| 适合研究 | 适合做舆情、推荐系统、内容分析 |
| 工程价值 | 平台适配逻辑较有参考价值 |
| 星标数量 | 原文件记录为 42.6k stars,说明关注度高 |
风险
这类项目通常面临三个问题:
1. 平台反爬机制频繁变化
2. 登录态、Cookie、验证码处理复杂
3. 法律和平台协议风险更高
所以它适合学习和研究,但实际使用时要控制采集范围、频率和合规边界。
6. Katana
基本定位
Katana 是 ProjectDiscovery 生态下的爬虫工具,主要服务于安全测试场景。
它和普通内容爬虫不同,目标不是提取文章正文,而是发现:
URL
接口
路径
参数
表单
隐藏入口
JS 中暴露的资源
适合用途
| 场景 | 是否适合 |
|---|---|
| Web 资产发现 | 适合 |
| 漏洞扫描前置爬取 | 适合 |
| Bug bounty | 适合 |
| 抓取文章正文 | 不适合 |
| 社媒内容采集 | 不适合 |
评价
Katana 应该放在“安全扫描 / 攻防资产发现”类别,不应该和 Crawlee、crawl4ai 这种内容爬虫混为一类。
7. EasySpider
基本定位
EasySpider 是一个可视化爬虫工具,目标是降低写爬虫脚本的门槛。
核心特点
| 特点 | 说明 |
|---|---|
| 可视化 | 通过界面配置采集流程 |
| 低代码 | 不需要从零写 Python / JS |
| 适合新手 | 对非专业开发者友好 |
| 开源 | 相比八爪鱼这类商业工具,更适合研究和定制 |
适合用途
偶尔采集网页数据
做课程项目
做小规模数据整理
给非技术成员使用
不适合用途
大规模采集
高并发采集
复杂反爬网站
需要长期稳定运行的生产系统
8. BrowserCluster
基本定位
BrowserCluster 是浏览器自动化集群爬虫系统,重点不是单个页面抓取,而是:
多个浏览器实例的并发调度、任务分发和集群化执行。
适合用途
| 场景 | 说明 |
|---|---|
| 大量动态网页抓取 | 需要多个浏览器实例并发 |
| 页面需要 JS 渲染 | 静态 HTTP 抓取不够 |
| 登录态任务 | 可以复用浏览器上下文 |
| 自动化测试 / 抓取混合任务 | 适合 |
评价
BrowserCluster 更偏“基础设施层”,适合做大规模浏览器自动化任务。如果只是单篇文章提取,它会显得过重。
三、MCP / Agent 友好的网页抓取工具
这一类项目的重点不是传统爬虫,而是让 AI Agent 能够调用浏览器或网页提取工具。
1. openclaw-web-scraper
定位
零配置网页抓取工具,基于 Playwright + Chromium,支持有状态浏览器会话。
核心能力
打开页面
点击展开
滚动
提取内容
输出 Markdown
适合场景
AI Agent 需要像人一样打开网页并提取信息
2. Fetcher MCP
定位
基于 Readability 算法的网页正文提取 MCP 工具。
核心优势
| 能力 | 说明 |
|---|---|
| 正文提取 | 去除广告、导航栏、侧边栏 |
| 批量抓取 | 支持多个 URL 并发 |
| 输出格式 | HTML / Markdown |
| 适合 Agent | 工具接口简单,AI 不需要复杂决策 |
适合场景
URL 列表 → 批量抓取正文 → Markdown → 总结 / RAG
3. Microsoft Playwright MCP
定位
微软官方 Playwright MCP 工具,提供完整浏览器操作能力。
核心能力
导航
点击
填表
截图
PDF 生成
页面元素读取
多步骤浏览器操作
优点
能力全面,适合复杂网页交互。
缺点
工具数量多,Agent 调用时容易出现工具选择复杂度过高的问题。
适合场景
登录
填表
网页后台操作
复杂流程自动化
4. Playwright Scraper MCP
定位
极简网页抓取 MCP 工具。
核心逻辑
输入 URL
↓
调用 scrape_to_markdown
↓
输出 Markdown
优点
简单、明确、Agent 不容易误用。
适合场景
只需要把网页正文变成 Markdown
四、商业工具 / 非纯开源工具
下面这些工具在原始文件中也出现了,但它们不应和开源项目混在一起。
1. Bright Data
类型
商业化网页数据采集服务。
核心能力
| 能力 | 说明 |
|---|---|
| Web Unlocker | 处理验证码、IP 封锁、反爬 |
| Scraping Browser | 云端浏览器,内置反检测能力 |
| Bright Data MCP | 给大模型使用的数据采集 MCP 服务 |
适合场景
跨境电商数据采集
机票酒店比价
金融数据采集
复杂反爬网站
注意
Bright Data 不是传统意义上的开源项目,更像商业化数据采集基础设施。
2. Cloudflare Browser Rendering
类型
商业 / 云端浏览器渲染服务。
核心能力
| 能力 | 说明 |
|---|---|
/crawl 端点 | 云端网页抓取 |
| Browser Rendering | 云端浏览器渲染 |
| MCP Server | 可接入 AI Agent 工作流 |
适合场景
不用自建浏览器环境
需要稳定云端网页渲染
需要把网页抓取接入 Agent
注意
Cloudflare 方案更偏云服务,不是普通开源爬虫框架。
3. 八爪鱼采集器 Octoparse
类型
商业可视化采集器。
核心能力
可视化点选
流程图式采集逻辑
自动识别列表和翻页
导出 CSV / Excel
云端运行
适合场景
非程序员快速采集数据
临时性数据整理
低代码采集任务
注意
八爪鱼不是开源项目,适合使用,不适合作为开源技术栈研究对象。
4. Web Scraper Chrome 插件
类型
浏览器插件式轻量采集工具。
核心特点
基于 Sitemap 配置采集流程
在浏览器中完成抓取
适合临时性轻量数据采集
适合场景
偶尔抓几个网页表格
简单列表页采集
个人轻量任务
5. 后羿采集器
类型
可视化采集工具。
定位
和八爪鱼类似,强调跨平台和低门槛使用。
注意
不是开源框架,适合工具使用,不适合做开源项目研究主线。
五、按技术路线分类
A. 传统工程型爬虫框架
| 项目 | 核心特点 | 推荐程度 |
|---|---|---|
| Crawlee | 工程化最完整,适合生产级爬虫 | 高 |
| Scrapy | Python 经典爬虫框架,生态成熟 | 高 |
| Scrapling | 强调自适应和稳定性 | 中高 |
| Katana | 安全扫描和 URL 发现 | 特定场景高 |
B. 浏览器自动化型爬虫
| 项目 | 核心特点 | 推荐程度 |
|---|---|---|
| Playwright | 现代浏览器自动化核心工具 | 高 |
| Selenium | 老牌自动化工具,生态成熟 | 中高 |
| BrowserCluster | 浏览器集群化调度 | 中高 |
| Crawlee PlaywrightCrawler | 工程化封装 Playwright | 高 |
C. AI / LLM 友好型抓取工具
| 项目 | 核心特点 | 推荐程度 |
|---|---|---|
| crawl4ai | 面向 LLM / RAG 的网页转 Markdown | 高 |
| ScrapeGraphAI | LLM 语义抽取网页信息 | 中高 |
| Fetcher MCP | 批量正文提取,适合 Agent | 高 |
| Playwright Scraper MCP | 极简 URL → Markdown | 高 |
| Microsoft Playwright MCP | 完整浏览器自动化 | 中高 |
D. 国内内容平台 / 社媒采集
| 项目 | 核心特点 | 推荐程度 |
|---|---|---|
| MediaCrawler | 覆盖国内多个社媒平台 | 高,但合规风险需控制 |
| EasySpider | 可视化开源采集工具 | 中高 |
| rust-clawer / opencli | CLI / Rust 爬虫探索 | 中 |
E. 商业化采集服务
| 工具 | 核心特点 | 推荐程度 |
|---|---|---|
| Bright Data | 反爬能力强,适合复杂海外数据 | 高,但成本高 |
| Cloudflare Browser Rendering | 云端浏览器渲染与抓取 | 中高 |
| 八爪鱼 | 可视化采集,适合非技术用户 | 中 |
| 后羿采集器 | 可视化采集 | 中 |
| Web Scraper 插件 | 轻量浏览器插件 | 中 |
六、选型建议
1. 目标是“构建 AI 知识库 / RAG 数据采集”
优先考虑:
crawl4ai
Fetcher MCP
Playwright Scraper MCP
ScrapeGraphAI
推荐组合:
URL 列表
↓
Fetcher MCP / crawl4ai
↓
Markdown 正文
↓
清洗、分块、向量化
↓
RAG / 知识库
2. 目标是“稳定抓取普通网站数据”
优先考虑:
Crawlee
Scrapy
Scrapling
推荐组合:
静态网页:Scrapy / Crawlee CheerioCrawler
动态网页:Crawlee PlaywrightCrawler
页面经常变化:Scrapling
3. 目标是“抓取国内社媒平台数据”
优先考虑:
MediaCrawler
EasySpider
Playwright
但要注意:
登录态
验证码
平台风控
频率限制
平台协议
数据合规
这类任务不能只看技术可行性,还要评估合规边界。
4. 目标是“安全测试 / 资产发现”
优先考虑:
Katana
ProjectDiscovery 生态
Playwright
推荐链路:
Katana 爬 URL
↓
提取 JS / 接口 / 参数
↓
接入漏洞扫描器 / 指纹识别 / fuzz
5. 如果目标是“AI Agent 自动浏览网页”
优先考虑:
Microsoft Playwright MCP
openclaw-web-scraper
Fetcher MCP
Playwright Scraper MCP
Cloudflare Browser Rendering MCP
推荐逻辑:
简单正文提取:Fetcher MCP / Playwright Scraper MCP
复杂网页操作:Microsoft Playwright MCP
云端浏览器:Cloudflare Browser Rendering
七、总结
五条主线:
工程化爬虫:Crawlee / Scrapy / Scrapling
AI 网页理解:crawl4ai / ScrapeGraphAI / Fetcher MCP
社媒平台采集:MediaCrawler / EasySpider
浏览器自动化:Playwright / BrowserCluster / Microsoft Playwright MCP
商业反爬服务:Bright Data / Cloudflare Browser Rendering / 八爪鱼
更多推荐
所有评论(0)