ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Firecrawl 网页抓取完整指南:从单页到整站的数据提取

Firecrawl 网页抓取完整指南:从单页到整站的数据提取 Firecrawl 网页抓取完整指南从单页到整站的数据提取【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl自己写爬虫的人都知道JS 渲染的页面拿不到内容、反爬策略层出不穷、HTML 清洗又得单独维护一堆规则。这些琐碎问题加起来往往比拿数据本身还费时间。Firecrawl 就是为了解决这件事的它把搜索、抓取、页面交互统一成一套 API输入 URL 或一句需求输出干净的 Markdown 或结构化 JSON可以直接喂给 LLM 或存进数据库。项目开源既可以调用托管服务也可以自己部署。它替你解决什么功能解决的问题什么时候用Scrape 单页抓取HTML 清洗、JS 渲染内容获取想把一个页面变成干净文本或截图Crawl 整站爬取逐页手工遍历、维护爬取队列需要批量导入文档站、商品目录Search 网页搜索只拿到标题和链接还得自己请求正文不知道目标 URL要先找到再读全文Agent 智能提取手动解析字段、写选择器需要价格、参数这类结构化数据Interact 页面交互动态内容需要点击、输入后才出现抓取前要滚动、搜索或登录操作5 分钟跑起来 ⏱️把项目克隆到本地git clone https://gitcode.com/GitHub_Trending/fi/firecrawl在仓库根目录用 Docker Compose 启动一次拉起 API、worker、Playwright、Redis 等依赖只有 API 端口对宿主机开放docker compose up -d浏览器访问localhost:3002API 有响应就算起来了。不想自己运维的话也可以直接注册官方托管服务拿 API key跳过上面两步。写业务代码前用 pip 装一下 Python SDKfirecrawl-py把 key 设为环境变量FIRECRAWL_API_KEY即可。功能怎么用单页抓取把任意 URL 变成干净数据一句话作用给一个 URL返回你要的格式——markdown、HTML、截图或结构化 JSON。使用方式调用 SDK 的 scrape 方法传入目标 URL 和格式列表如只要 markdown或同时加 html。可以进一步要求只保留正文内容或按标签过滤页面元素对 PDF、DOCX 这类文档链接也能直接解析出内容。典型场景把博客文章转成 Markdown 存进 RAG 知识库或批量转存产品页文字。抓取请求的配置界面如下URL、选项和模型都可以直接指定搜索找网页和读全文一步到位一句话作用搜索网络并且把命中结果页面的完整内容一起返回省掉你二次请求的环节。使用方式调用 search 方法传入查询词和结果条数上限返回的每条记录里就带有 URL、标题和 markdown 正文。典型场景让 AI agent 调研某个话题时它能自己先找到来源再读完内容而不是只拿到一堆链接。整站爬取一个请求拿下一个站点一句话作用给站点首页 URL爬取所有可访问页面逐页返回内容。使用方式调用 crawl 方法传入站点 URL 和页数上限。它是异步任务SDK 会自动轮询状态直到完成你拿到的就是每页的 markdown 和元数据。如果想先了解站点规模可以配合 map 功能枚举 URL支持按关键词检索站内页面。典型场景整站文档导入知识库、竞品商品目录批量入库。一个完整案例监控商品价格变动 以电商价格监控为例完整流程串起来是这样的锁定目标页用 map 功能列出某商品频道下的页面挑出要盯的几个商品 URL页面少的话直接手工维护一个 URL 列表也行。定时抓取写一个定时任务cron 或任意调度器每个周期调用 scrape把价格、库存、商品名定义成结构化输出而不是自己去正则 HTML。落库留痕每次结果连同时间戳写进数据库只存你要的字段历史数据自然沉淀。可视化基于历史数据画趋势图或做简单阈值告警价格下降时收到通知。仓库里examples/blog-articles/amazon-price-tracking/就有一篇用 Firecrawl 做亚马逊价格跟踪的完整示例下面这张图就是其中搭建出来的价格趋势面板常见的坑现象抓回来的内容几乎是空的只剩导航栏。原因页面内容是 JS 动态渲染的静态请求只能拿到骨架。对策确认走的是浏览器渲染自托管时 Playwright 服务必须正常启动如果内容还要先点击才出现改用 interact 先操作再提取。现象整站 crawl 迟迟不结束或中途超时。原因页数上限设得太高或站点链接结构复杂、触发了目标站限流。对策先用 map 摸清 URL 规模再定 limit分批爬取失败页面单独重试。现象结构化提取缺字段或字段值明显错误。原因schema 里字段描述含糊或页面本身就没有对应信息。对策先在输出里加 markdown 格式人工核对页面确实有这条信息再给 schema 字段写清含义。现象自托管服务起不来访问 3002 端口无响应。原因依赖服务Redis、数据库等未就绪或端口被占用。对策用docker compose logs看各容器日志按仓库里的 SELF_HOST.md 核对环境变量和端口配置。速查参考入口 / 参数说明search网页搜索并返回结果页完整内容scrape单页提取可选 markdown / html / 截图 / JSONcrawl整站爬取异步任务SDK 自动轮询map枚举站内所有 URL可加关键词检索interact抓取后对页面执行点击、滚动、输入agent一句话描述需求AI 自动找数据FIRECRAWL_API_KEY环境变量认证入口自托管端口3002默认只暴露 API 服务接下来从单个 scrape 请求开始试起跑通之后再接触 crawl 和 agent上手曲线会很平缓。可以接着看仓库里的 自托管指南 SELF_HOST.md 和 Python SDK 源码目录 apps/python-sdk/后者包含各功能方法的完整示例与测试用例。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表