TL;DR:
最近调研了一下爬虫的相关工具,希望有工具能自动化地全面上网查询信息,于是有此文

注:此文是作者平常刷公众号的时候看到好文章就传入文件传输助手的积累,可以说相当全面的版本,大家有推荐的也可以在评论区@一下我或者分享一下

相关开源项目整理:Web 抓取 / 浏览器自动化 / 内容采集方向

一、项目总览表

序号项目名称类型核心定位技术路线适合场景开源地址 / 文档
1Crawlee通用爬虫自动化库面向生产级 Web 爬取的 Node.js / TypeScript 框架Cheerio / Puppeteer / Playwright静态网页、动态网页、浏览器自动化爬虫https://github.com/apify/crawlee
2Scrapling自适应 Web Scraping 框架提升爬虫在页面变化后的稳定性Python Web Scraping + 自适应选择器页面结构经常变化的网站https://github.com/D4Vinci/Scrapling
3ScrapeGraphAIAI 驱动爬虫框架用 LLM 理解网页并抽取结构化信息LLM + 图式流程 + 网页解析非规则页面、自然语言抽取任务https://github.com/VinciGit00/Scrapegraph-ai
4crawl4aiLLM 友好型爬虫框架面向 AI 应用的网页抓取、清洗、Markdown 输出Browser / HTML parsing / Markdown extractionRAG、知识库构建、网页转 Markdownhttps://github.com/unclecode/crawl4ai
5MediaCrawler多平台社媒爬虫抓取小红书、抖音、B站、微博、知乎等平台内容Playwright / 平台适配器社媒内容采集、舆情、内容分析https://github.com/NanmiCoder/MediaCrawler
6Katana安全扫描 / URL 爬取工具面向安全测试的快速爬虫与 URL 发现Go + headless crawlingWeb 安全、资产发现、漏洞扫描前置爬取https://github.com/projectdiscovery/katana
7EasySpider可视化爬虫工具无代码 / 低代码网页采集工具可视化流程 + 浏览器自动化非程序员采集网页数据、轻量自动化https://github.com/NaiboWang/EasySpider
8BrowserCluster浏览器自动化集群系统多浏览器实例并发调度与爬取Browser Cluster / Playwright / Puppeteer 类思路大规模动态网页采集、浏览器任务集群https://github.com/934050259/BrowserCluster
9openclaw-web-scraperMCP 网页抓取工具零配置、基于 Playwright 的网页转 Markdown 工具Playwright + Chromium + MCPAI Agent 调用浏览器抓取网页正文LiranUdi/openclaw-web-scraper
10Fetcher MCPMCP 内容提取工具基于 Readability 的网页正文提取工具Readability + Markdown / HTML 输出批量抓取文章正文、清洗广告和导航栏jae-jae/fetcher-mcp
11Microsoft Playwright MCP官方 MCP 浏览器自动化工具提供完整浏览器操作能力Playwright + MCP登录、点击、填表、截图、多步骤自动化Microsoft Playwright MCP
12Playwright Scraper MCP极简 MCP 抓取工具一个 URL 输入,一个 Markdown 输出Playwright + Markdown extractor简单网页正文抓取、Agent 工具链集成dennisgl/mcp-playwright-scraper
13rust-clawer / opencli 相关项目CLI / 爬虫工具终端化网页抓取或 OpenCLI 相关能力探索Rust / CLI / Web crawling命令行抓取、自动化脚本https://github.com/coder-brzhang/rust-clawer

二、重点项目规范化拆解

1. Crawlee

基本定位

Crawlee 是一个面向生产环境的爬虫自动化框架,核心目标是把不同类型网页的抓取方式统一起来。

它不是单一爬虫,而是一套爬虫抽象层,内部提供多种 crawler:

子模块核心能力适合网页类型
CheerioCrawler只下载 HTML,不启动浏览器静态网页
PuppeteerCrawler启动 Chromium,执行 JavaScript动态网页、需要点击/滚动的网站
PlaywrightCrawler支持 Chromium、Firefox、WebKit复杂动态网页、跨浏览器模拟

核心优势

维度说明
工程化程度高,适合做正式爬虫项目
扩展性强,可以按网站类型切换抓取方式
资源控制可以在轻量 HTML 抓取和重型浏览器抓取之间切换
生态Apify 维护,文档较完整

适合用途

静态网页 → CheerioCrawler
普通动态网页 → PuppeteerCrawler
复杂前端 / 多浏览器模拟 → PlaywrightCrawler

不适合用途

如果只是“给 AI 一个 URL,直接拿正文 Markdown”,Crawlee 会显得偏重,需要自己写规则、选择器和处理逻辑。


2. Scrapling

基本定位

Scrapling 是一个自适应 Web Scraping 框架,重点解决的问题不是“能不能抓”,而是:

网页结构变了之后,爬虫还能不能继续稳定运行。

核心问题

传统爬虫常依赖 XPath / CSS Selector:

div.article > p:nth-child(3)

一旦网页结构调整,选择器就失效。Scrapling 的价值在于提高选择器和内容定位的鲁棒性。

适合用途

场景是否适合
长期维护的站点采集适合
页面结构经常变的网站适合
简单一次性抓取不一定必要
社媒平台大规模采集需要配合登录态和反爬处理

评价

Scrapling 更适合作为“稳定性增强层”,而不是完整的一站式采集平台。


3. ScrapeGraphAI

基本定位

ScrapeGraphAI 是一个 AI 驱动的网页抓取框架。它的核心思想是:

不要完全依赖固定选择器,而是让 LLM 理解网页内容,再根据目标抽取信息。

传统爬虫 vs ScrapeGraphAI

维度传统爬虫ScrapeGraphAI
抽取方式CSS / XPath / 正则LLM 理解网页
配置方式写规则写自然语言目标
适合页面结构稳定页面非规则页面、语义抽取
成本可能消耗 LLM token
稳定性依赖结构依赖模型理解能力

适合用途

从一个网页里抽取:
- 产品价格
- 作者信息
- 发布时间
- 正文摘要
- 表格中的关键字段
- 页面里的联系方式

不适合用途

不适合高频、大规模、低成本采集,因为 LLM 调用成本和延迟会明显高于传统爬虫。


4. crawl4ai

基本定位

crawl4ai 更贴近 AI 应用工作流,适合把网页内容转成适合大模型处理的格式。

它的核心价值不是“模拟浏览器操作”,而是:

网页 → 清洗 → 正文提取 → Markdown → LLM / RAG / 知识库

适合用途

场景说明
RAG 数据采集把网页正文转成 Markdown
网页总结工具抓取网页正文给 LLM 总结
论文 / 博客 / 文档采集提取主要内容,过滤导航栏和广告
AI Agent 工具作为网页阅读工具接入 Agent

评价

如果你的目标是做“AI 阅读网页 / 自动整理网页 / 构建知识库”,crawl4ai 比 Crawlee 更直接。


5. MediaCrawler

基本定位

MediaCrawler 是一个面向国内主流社交媒体和内容平台的多平台爬虫项目。

典型支持方向

平台类型示例
社交媒体小红书、微博
视频平台抖音、B站
内容社区知乎
其他平台视项目适配情况而定

核心优势

维度说明
平台针对性强,重点覆盖国内内容平台
适合研究适合做舆情、推荐系统、内容分析
工程价值平台适配逻辑较有参考价值
星标数量原文件记录为 42.6k stars,说明关注度高

风险

这类项目通常面临三个问题:

1. 平台反爬机制频繁变化
2. 登录态、Cookie、验证码处理复杂
3. 法律和平台协议风险更高

所以它适合学习和研究,但实际使用时要控制采集范围、频率和合规边界。


6. Katana

基本定位

Katana 是 ProjectDiscovery 生态下的爬虫工具,主要服务于安全测试场景。

它和普通内容爬虫不同,目标不是提取文章正文,而是发现:

URL
接口
路径
参数
表单
隐藏入口
JS 中暴露的资源

适合用途

场景是否适合
Web 资产发现适合
漏洞扫描前置爬取适合
Bug bounty适合
抓取文章正文不适合
社媒内容采集不适合

评价

Katana 应该放在“安全扫描 / 攻防资产发现”类别,不应该和 Crawlee、crawl4ai 这种内容爬虫混为一类。


7. EasySpider

基本定位

EasySpider 是一个可视化爬虫工具,目标是降低写爬虫脚本的门槛。

核心特点

特点说明
可视化通过界面配置采集流程
低代码不需要从零写 Python / JS
适合新手对非专业开发者友好
开源相比八爪鱼这类商业工具,更适合研究和定制

适合用途

偶尔采集网页数据
做课程项目
做小规模数据整理
给非技术成员使用

不适合用途

大规模采集
高并发采集
复杂反爬网站
需要长期稳定运行的生产系统

8. BrowserCluster

基本定位

BrowserCluster 是浏览器自动化集群爬虫系统,重点不是单个页面抓取,而是:

多个浏览器实例的并发调度、任务分发和集群化执行。

适合用途

场景说明
大量动态网页抓取需要多个浏览器实例并发
页面需要 JS 渲染静态 HTTP 抓取不够
登录态任务可以复用浏览器上下文
自动化测试 / 抓取混合任务适合

评价

BrowserCluster 更偏“基础设施层”,适合做大规模浏览器自动化任务。如果只是单篇文章提取,它会显得过重。


三、MCP / Agent 友好的网页抓取工具

这一类项目的重点不是传统爬虫,而是让 AI Agent 能够调用浏览器或网页提取工具。

1. openclaw-web-scraper

定位

零配置网页抓取工具,基于 Playwright + Chromium,支持有状态浏览器会话。

核心能力

打开页面
点击展开
滚动
提取内容
输出 Markdown

适合场景

AI Agent 需要像人一样打开网页并提取信息

2. Fetcher MCP

定位

基于 Readability 算法的网页正文提取 MCP 工具。

核心优势

能力说明
正文提取去除广告、导航栏、侧边栏
批量抓取支持多个 URL 并发
输出格式HTML / Markdown
适合 Agent工具接口简单,AI 不需要复杂决策

适合场景

URL 列表 → 批量抓取正文 → Markdown → 总结 / RAG

3. Microsoft Playwright MCP

定位

微软官方 Playwright MCP 工具,提供完整浏览器操作能力。

核心能力

导航
点击
填表
截图
PDF 生成
页面元素读取
多步骤浏览器操作

优点

能力全面,适合复杂网页交互。

缺点

工具数量多,Agent 调用时容易出现工具选择复杂度过高的问题。

适合场景

登录
填表
网页后台操作
复杂流程自动化

4. Playwright Scraper MCP

定位

极简网页抓取 MCP 工具。

核心逻辑

输入 URL
    ↓
调用 scrape_to_markdown
    ↓
输出 Markdown

优点

简单、明确、Agent 不容易误用。

适合场景

只需要把网页正文变成 Markdown

四、商业工具 / 非纯开源工具

下面这些工具在原始文件中也出现了,但它们不应和开源项目混在一起。

1. Bright Data

类型

商业化网页数据采集服务。

核心能力

能力说明
Web Unlocker处理验证码、IP 封锁、反爬
Scraping Browser云端浏览器,内置反检测能力
Bright Data MCP给大模型使用的数据采集 MCP 服务

适合场景

跨境电商数据采集
机票酒店比价
金融数据采集
复杂反爬网站

注意

Bright Data 不是传统意义上的开源项目,更像商业化数据采集基础设施。


2. Cloudflare Browser Rendering

类型

商业 / 云端浏览器渲染服务。

核心能力

能力说明
/crawl 端点云端网页抓取
Browser Rendering云端浏览器渲染
MCP Server可接入 AI Agent 工作流

适合场景

不用自建浏览器环境
需要稳定云端网页渲染
需要把网页抓取接入 Agent

注意

Cloudflare 方案更偏云服务,不是普通开源爬虫框架。


3. 八爪鱼采集器 Octoparse

类型

商业可视化采集器。

核心能力

可视化点选
流程图式采集逻辑
自动识别列表和翻页
导出 CSV / Excel
云端运行

适合场景

非程序员快速采集数据
临时性数据整理
低代码采集任务

注意

八爪鱼不是开源项目,适合使用,不适合作为开源技术栈研究对象。


4. Web Scraper Chrome 插件

类型

浏览器插件式轻量采集工具。

核心特点

基于 Sitemap 配置采集流程
在浏览器中完成抓取
适合临时性轻量数据采集

适合场景

偶尔抓几个网页表格
简单列表页采集
个人轻量任务

5. 后羿采集器

类型

可视化采集工具。

定位

和八爪鱼类似,强调跨平台和低门槛使用。

注意

不是开源框架,适合工具使用,不适合做开源项目研究主线。


五、按技术路线分类

A. 传统工程型爬虫框架

项目核心特点推荐程度
Crawlee工程化最完整,适合生产级爬虫
ScrapyPython 经典爬虫框架,生态成熟
Scrapling强调自适应和稳定性中高
Katana安全扫描和 URL 发现特定场景高

B. 浏览器自动化型爬虫

项目核心特点推荐程度
Playwright现代浏览器自动化核心工具
Selenium老牌自动化工具,生态成熟中高
BrowserCluster浏览器集群化调度中高
Crawlee PlaywrightCrawler工程化封装 Playwright

C. AI / LLM 友好型抓取工具

项目核心特点推荐程度
crawl4ai面向 LLM / RAG 的网页转 Markdown
ScrapeGraphAILLM 语义抽取网页信息中高
Fetcher MCP批量正文提取,适合 Agent
Playwright Scraper MCP极简 URL → Markdown
Microsoft Playwright MCP完整浏览器自动化中高

D. 国内内容平台 / 社媒采集

项目核心特点推荐程度
MediaCrawler覆盖国内多个社媒平台高,但合规风险需控制
EasySpider可视化开源采集工具中高
rust-clawer / opencliCLI / Rust 爬虫探索

E. 商业化采集服务

工具核心特点推荐程度
Bright Data反爬能力强,适合复杂海外数据高,但成本高
Cloudflare Browser Rendering云端浏览器渲染与抓取中高
八爪鱼可视化采集,适合非技术用户
后羿采集器可视化采集
Web Scraper 插件轻量浏览器插件

六、选型建议

1. 目标是“构建 AI 知识库 / RAG 数据采集”

优先考虑:

crawl4ai
Fetcher MCP
Playwright Scraper MCP
ScrapeGraphAI

推荐组合:

URL 列表
  ↓
Fetcher MCP / crawl4ai
  ↓
Markdown 正文
  ↓
清洗、分块、向量化
  ↓
RAG / 知识库

2. 目标是“稳定抓取普通网站数据”

优先考虑:

Crawlee
Scrapy
Scrapling

推荐组合:

静态网页:Scrapy / Crawlee CheerioCrawler
动态网页:Crawlee PlaywrightCrawler
页面经常变化:Scrapling

3. 目标是“抓取国内社媒平台数据”

优先考虑:

MediaCrawler
EasySpider
Playwright

但要注意:

登录态
验证码
平台风控
频率限制
平台协议
数据合规

这类任务不能只看技术可行性,还要评估合规边界。


4. 目标是“安全测试 / 资产发现”

优先考虑:

Katana
ProjectDiscovery 生态
Playwright

推荐链路:

Katana 爬 URL
  ↓
提取 JS / 接口 / 参数
  ↓
接入漏洞扫描器 / 指纹识别 / fuzz

5. 如果目标是“AI Agent 自动浏览网页”

优先考虑:

Microsoft Playwright MCP
openclaw-web-scraper
Fetcher MCP
Playwright Scraper MCP
Cloudflare Browser Rendering MCP

推荐逻辑:

简单正文提取:Fetcher MCP / Playwright Scraper MCP
复杂网页操作:Microsoft Playwright MCP
云端浏览器:Cloudflare Browser Rendering

七、总结

五条主线:

工程化爬虫:Crawlee / Scrapy / Scrapling
AI 网页理解:crawl4ai / ScrapeGraphAI / Fetcher MCP
社媒平台采集:MediaCrawler / EasySpider
浏览器自动化:Playwright / BrowserCluster / Microsoft Playwright MCP
商业反爬服务:Bright Data / Cloudflare Browser Rendering / 八爪鱼
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐