目标

根据输入的网址,提取网页内容大纲

一、获取APIkey

1. 打开bright data官网,注册并登录

亮数据官网https://get.brightdata.com/webscra

2. 点击【账户管理】>【Users and APl keys]

3. 在【API秘钥】区域,复制秘钥

二、Dify平台配置

1. 安装插件

在Dify的工具市场查找Bright Data 插件并安装

2. 配置插件APIkey

三、配置工作流

1. 创建workflow、chatflow工作流

2. 开始节点配置必填项url

3. 连接插件【Bright Data 网页抓取器】

插件有3个工具,每个工具只能单独使用,每个工具的功能如下:

  • Structured Data Feeds:结构化数据源 智能数据提取工具,根据用户需求自动确定最佳提取方法。支持电子商务、社交媒体、商业智能和内容平台。
  • 抓取为 markdown:网页内容提取为markdown,支持反机器人保护
  • Search Engine:搜索引擎抓取:Google、Bing、Yandex 搜索结果

4、配置【抓取markdown】

说明:本次以【Bright Data 网页抓取器】>【抓取markdown】为例,输入参数引用【开始】节点的“url"

5. 试运行

输入想要解析的网址

5.1典型报错解决办法

a. 如果报错(如下所示):找不到名为 mcp_unlocker 的 区域/代理区域

b. 回到Bright Data平台重新创建一个Unlocker API(解锁API)

c. 选择“网络解锁API”

d.最后点击【添加API】

注意:名字一定是“mcp_unlocker”,要跟Dify里的报错名字一致

e.在【Web Access】>【Web Access API】查看创建的API,并复制最新的秘钥

f. 更新Dify工具里的秘钥

g.最后就可以运行成功了

6.如果想要进一步分析,可以连接【LLM】节点,整理获取到的数据

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐