在你将返回的 markdown 发送到下游的代理、日志、向量存储或分析管道之前,PII 脱敏会先替换其中的个人身份信息。
工作原理#
在 抓取 请求中设置 redactPII: true。Firecrawl 会对生成的 markdown 进行脱敏,并在 markdown 中返回脱敏后的版本。你无需传递 formats;markdown 是默认输出。
脱敏选项#
对于大多数请求,请使用 redactPII: true。如需调整脱敏设置,请传入一个选项对象:
| 选项 | 值 | 默认值 | 描述 |
|---|---|---|---|
mode | accurate, aggressive, fast | accurate | 脱敏策略。accurate 仅走模型路径,aggressive 会通过额外启发式提高召回率,fast 则跳过模型调用。 |
entities | PERSON, EMAIL, PHONE, LOCATION, FINANCIAL, SECRET | 所有实体 | 将脱敏限制在特定实体类别内。 |
replaceStyle | tag, mask, remove | tag | 将文本片段替换为 <EMAIL> 这类标签、用 * 掩盖,或直接删除这些字符。 |
Note
Firecrawl CLI 和 MCP server 仅提供简单的布尔型脱敏。高级选项可通过暴露完整 redactPII 选项对象的 API 和 SDKs 使用。
响应#
脱敏成功后,markdown 中会包含脱敏后的内容:
如需在命令行中查看,可将 markdown 通过管道传给你常用的渲染器:
cURL
计费#
PII 脱敏的成本为每页 5 个额度:1 个基础抓取额度,外加 4 个脱敏额度。
对于已解析的 PDF,每增加一页 PDF,仍会产生常规的 PDF 解析额度,并且还会额外收取脱敏费用。
可用性#
凡是 Firecrawl 支持传入抓取选项的地方,都支持 PII 脱敏:
- 抓取 - 在
/v2/scrape上设置redactPII。 - 爬取、批量抓取和搜索 - 在
scrapeOptions中传入redactPII。 - 解析 - 在 multipart 请求的
optionsJSON 中传入redactPII。 - SDKs - Python 使用
redact_pii;JavaScript 和其他 SDKs 使用redactPII或其原生选项命名风格。 - CLI - 向
firecrawl scrape传入--redact-pii。 - MCP server - 在
firecrawl_scrape工具参数中加入"redactPII": true,以启用简单的布尔值脱敏。
你是需要 Firecrawl API 密钥的 AI 代理吗?请参见 firecrawl.dev/agent-onboarding/SKILL.md 了解自动化引导说明。

