
5 分钟跑通 Firecrawl网页数据提取与 Markdown 转换完整指南【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl你需要从 500 个商品页批量抓取价格并导出 CSV真正耗时的不是抓取本身而是处理每个站点的 HTML 结构。Firecrawl 是一个开源的网页数据提取工具它会自动把任意网页转换成干净的 Markdown 或 AI 可直接使用的结构化数据。它解决什么问题Firecrawl 是一个 web 上下文 API给它一个 URL或一句自然语言问题它返回你要的格式。轮换代理、限流、JS 渲染这些脏活都在服务端处理你只需要调用接口。四个核心能力分别对应四类常见任务单页抓取Scrape一个 URL 转成 Markdown、JSON 或截图适合拿单篇文档页或商品页整站爬取Crawl一次请求遍历网站全部页面适合全站内容采集和构建内容索引URL 发现Map瞬间列出网站所有 URL适合动手爬取之前先估算规模AI 提取Agent一句话描述需求或给出 schema它自动找页面并返回结构化字段适合不确定目标 URL 的场景5 分钟跑通克隆仓库后用 Docker Compose 启动完整栈不需要逐个构建服务git clone https://gitcode.com/GitHub_Trending/fi/firecrawl cd firecrawl docker compose upAPI 默认监听 3002 端口栈里包含 API 工作进程、Playwright 浏览器服务、Redis 和消息队列都由 compose 文件统一管理。部署方式二选一Docker 容器化推荐可复现性最好或本地直接运行适合要改源码的开发者。启动完成后发一个 scrape 请求给任意 URL就能看到第一份 Markdown 输出。核心能力拆解单页抓取输入一个 URL得到干净 Markdown。它会自动剥掉导航、广告等噪音按你指定的格式markdown / html / screenshot / json输出。什么时候用只需要单个页面时。怎么判断正常输出里没有样板文字残留metadata 带 title 和 sourceURL。下图是它的请求界面也可以在这里直接给内置 Agent 分配自然语言任务。整站爬取自动遍历链接构建内容图谱。输入起始 URL 和页面上限它异步抓取站内各页并返回任务 IDSDK 会自动替你轮询直到拿到全部页面内容。什么时候用整个文档站、整个产品目录的采集。怎么判断正常状态为 completedtotal 与 completed 计数一致每条结果都有 sourceURL。下图的 llms.txt 做法就是这类输出的典型形态——整站变成一个 LLM 可读的文本文件。AI 提取预定义 schema精准拿结构化字段。输入一个数据结构比如商品名、价格、库存或一个问题它从页面内容中识别字段并按格式输出。什么时候用需要落库或进表格时。怎么判断正常结果里每个字段都有值或明确为空且附带来源 URL 可回溯。搜索与 URL 发现不知道确切 URL 时用。search 接收查询词返回带整页 Markdown 的搜索结果map 接收一个站点立刻返回带标题和描述的 URL 列表支持按关键词筛选。什么时候用作为爬取前的第一步先确定范围再动手。实战场景如果你在批量抓取产品价格并盯变动。输入商品页 URL得到当前价格与历史走势关键配置点是配一个定时任务定期抓取并落库。仓库 examples 目录里的 amazon-price-tracking 示例就是这条流水线的完整实现抓取 → 存储 → 渲染趋势图。如果你要聚合多源新闻。输入一组来源站 URL用 batch scrape 批量拿全文 Markdown再交给 LLM 做摘要和去重。关键配置点给每个来源设页数上限防止单个来源吃掉全部额度。如果你在批量采集产品文档。先用 map 枚举全部文档 URL 估算规模再用 crawl 带 limit 抓取如果部分页面在登录墙后面就在抓取前加交互动作。关键配置点是 limit 参数和 URL 过滤规则。多语言集成Pythonpip install firecrawl-pyfrom firecrawl import Firecrawl自带异步任务轮询适合大多数数据和 agent 场景Node.jsnpm install firecrawlimport { Firecrawl } from firecrawl异步风格与 API 一致适合前端和全栈工程师Rust仓库内 apps/rust-sdk大批量高并发处理性能好适合资源敏感的服务端另有 Go、Java、PHP、Ruby、.NET、Elixir SDK接口与 API 一一对应 进阶与避坑页面交互Actions抓取前可执行点击、滚动、输入、等待等预设动作适合内容需要交互后才加载的页面。抓取后交互Interact先 scrape 再针对同一页面继续用 AI 提示词或代码操作适合登录、翻页这类多步流程。媒体解析支持网页上的 PDF、DOCX 文件直接解析成文本。三个常见问题现象返回的 Markdown 为空或只有加载骨架。原因JS 渲染未完成或页面需要交互。解决加 wait 动作或改用浏览器引擎抓取。现象频繁出现 429 或超时。原因并发超过目标站点承受力。解决调低 CRAWL_CONCURRENT_REQUESTS默认 10一般站点 5~10 够用对负载敏感的站点降到 2~5。现象crawl 任务长时间卡住。原因站点规模超过 limit 或内链过深。解决先用 map 估算规模再带 limit 抓取自部署且资源充足时可上调 BROWSER_POOL_SIZE默认 5和 MAX_CONCURRENT_JOBS默认 5。自部署另有一个坑默认USE_DB_AUTHENTICATIONfalse表示无鉴权API 暴露到可信网络之外之前先补齐鉴权与 TLS 配置。资源索引自部署指南SELF_HOST.md部署配置含全部环境变量与默认值docker-compose.yamlPython SDKapps/python-sdkKubernetes 与 Helm 部署examples/kubernetes示例合集价格监控、定时抓取等examples下一步先跑一个单页抓取把感兴趣的页面转成 Markdown 检查输出质量。然后选一个站点试 map crawl熟悉异步任务的轮询节奏。如果有结构化数据需求定义第一个 schema 跑一次 AI 提取对照来源 URL 验证字段准确性。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考