Skip to main content

Dify

适用于 Dify 工作流的官方 Firecrawl 插件,支持知识库网站同步
3 min read
Note

Dify 官方插件: marketplace.dify.ai/plugins/langgenius/firecrawl

Dify 团队官方插件 • 安装量超过 170,000 次 • 支持 Chatflow 和代理应用 • 免费使用

Dify 集成概览#

Dify 是一个开源的 LLM 应用开发平台。通过官方 Firecrawl 插件,您可以直接在 AI 工作流中抓取和爬取网页。

Chatflow 和工作流应用

使用 Firecrawl 节点构建用于提取数据的可视化流水线

代理应用

让 AI 代理能够按需抓取实时网页数据

Dify 中的 Firecrawl 工具#

该插件提供七个 actions。

搜索

进行网页搜索,并可选择抓取返回的结果,一步获取最新的结果元数据或完整页面内容。

使用场景: 研究助手、发现竞争对手、基于实时来源为答案提供依据。

抓取

将任意 URL 转换为干净的结构化数据,将原始 HTML 转化为可直接使用的洞察。

使用场景: 提取产品数据、抓取文章内容、通过 JSON 模式获取结构化数据。

爬取

递归爬取网站及其子域名,收集大量内容。

使用场景: 全站内容提取、文档抓取、多页面数据收集。

映射

生成网站中所有 URL 的完整映射。

使用场景: 网站结构分析、SEO 审核、为批量抓取发现 URL。

爬取任务

根据任务 ID 获取抓取结果,或取消正在执行的任务。

使用场景: 监控长时间运行的爬取任务、管理异步抓取工作流、按需取消操作。

创建监控

创建定时监控,按固定周期重新检查目标。

使用场景: 保持已采集数据的时效性、监控变更日志、跟踪竞争对手。

监控检查

获取监控详情及检查结果,仅对发生变化的页面采取操作。

使用场景: 增量更新知识库、变更告警、触发下游流程。

快速开始#

安装 Firecrawl 插件

前往 Dify 插件市场,安装 Firecrawl 工具

获取 Firecrawl API 密钥

前往 Firecrawl API 密钥 页面,创建新的 API 密钥

在 Dify 中授权

进入 插件 > Firecrawl > 待授权,输入您的 API 密钥

添加到工作流

将 Firecrawl 工具拖入您的 Chatflow、工作流或代理应用

配置并测试

设置参数并测试工作流

使用模式#

可视化流水线集成

  1. 将 Firecrawl Node 添加到流水线
  2. 选择操作 (Map、Crawl、Scrape)
  3. 定义输入变量
  4. 依次执行流水线

示例流程:

常见用例#

具备实时数据的 AI 聊天机器人

构建由 RAG 驱动、可抓取并引用实时网站内容的聊天机器人

内容分析代理

可通过抓取和分析多个来源来研究主题的代理

竞争对手监控

跟踪竞争对手网站并在发生变更时发出告警的自动化工作流

数据丰富管道

从网站提取并丰富数据,再导入结构化数据库

Firecrawl actions#

工具描述最适用场景
搜索可选返回页面内容的网页搜索基于实时来源生成答案
抓取单页数据提取快速获取内容
爬取多页面递归爬取全站内容提取
映射URL 发现和网站映射SEO 分析、URL 列表
爬取任务异步任务管理长时间运行的操作
创建监控定期重新检查目标保持已采集数据最新
监控检查监控详情和检查结果仅处理发生变化的页面

最佳实践#

代理应用
  • 让代理自行决定何时抓取
  • 使用自然语言指令
  • 在 LLM 设置中启用工具调用
  • 大规模抓取时监控 token 使用量
工作流应用
  • 对大型网站,先使用 Map,再使用 Crawl
  • 设置合适的爬取限制
  • 添加错误处理节点
  • 先用小型数据集进行测试

Dify 与其他平台对比#

功能DifyMakeZapiern8n
类型LLM 应用平台工作流自动化工作流自动化工作流自动化
最适用场景AI 代理和聊天机器人可视化工作流快速自动化开发者自主控制
定价开源 + 云服务按操作次数按任务次数按执行次数
AI 原生部分支持部分支持部分支持
自托管
Tip

专业提示: Dify 擅长构建需要代理动态访问网页的 AI 原生应用,非常适合需要实时数据的聊天机器人、研究助手和 AI 工具。

将网站同步到 Dify 知识库#

Firecrawl 还可以将网页抓取为 Markdown,并通过 Dify Cloud 将其导入 Dify 知识库。

配置 Firecrawl#

打开头像菜单,前往 DataSource 页面,并配置 Firecrawl 凭据。

配置 Firecrawl 密钥

登录你的 Firecrawl 账户,获取 API 密钥,然后在 Dify 中输入并保存。

保存 Firecrawl 密钥

抓取目标网页#

在知识库创建页面中,选择“Sync from website”,选择 Firecrawl 作为提供商,并输入要抓取的 URL。

Scraping setup

配置选项包括:是否爬取子页面、页面爬取上限、页面抓取最大深度、排除路径、仅包含路径,以及内容提取范围。完成配置后,点击“Run”以预览解析后的页面。

Set Firecrawl configuration

查看导入结果#

导入的页面文本会存储在知识库文档中。查看结果,然后点击 Add URL 导入更多页面。

查看 Firecrawl 抓取结果