ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Firecrawl 完全指南:5 分钟把任意网页变成 LLM 就绪的数据

Firecrawl 完全指南:5 分钟把任意网页变成 LLM 就绪的数据 Firecrawl 完全指南5 分钟把任意网页变成 LLM 就绪的数据【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl按这套流程走完你的脚本五分钟就能吐出干净的 Markdown 和结构化 JSON不用写选择器不用配代理。Firecrawl 是一个开源的网页抓取 APIURL 进去大模型能直接用的数据出来。它是什么网页和大模型之间的数据接口一句话定位给 AI 应用喂网页上下文的 API渲染、反爬、清洗整条链路它替你跑完。核心能力如下能力一句话说明典型用法Search搜索网络直接返回结果页的完整正文app.search(firecrawl, limit5)Scrape单个 URL 转 Markdown、HTML、截图或结构化 JSONapp.scrape(url, formats[markdown])Agent只描述需求它自主搜索并取回数据app.agent(prompt查 Notion 的定价)Crawl / Map一次请求抓完整站或瞬间列出全部 URLapp.crawl(url, limit100)、app.map(url)第一次跑通最小配置与首次调用装依赖Python 用户执行pip install firecrawl-pyJavaScript 用户执行npm install firecrawl。拿密钥到官网注册领一个fc-开头的 key配成环境变量FIRECRAWL_API_KEY。首次调用from firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) doc app.scrape(firecrawl.dev, formats[markdown]) print(doc.markdown)跑完之后控制台打印出来的是一整段结构完整的正文标题层级、表格都保留导航、脚本等噪音全部剥掉了。这就是后面所有玩法的起点。三个真实场景批量提取、自动调研与定时抓取把 Hacker News 首页落成结构化 JSON你想每天存档首页榜单但选择器解析法碰上改版就崩。examples/hacker_news_scraper/ 的做法是先写 Pydantic 模型声明要哪些字段再调scrape_url并传formats: [extract]和模型的 schemaAI 按字段逐个回填app FirecrawlApp() data app.scrape_url( https://news.ycombinator.com/, params{ formats: [extract], extract: {schema: NewsData.model_json_schema()}, }, )跑一次首页 30 条新闻的标题、链接、点赞数、排名就进了带时间戳的 JSON 文件。以后页面改版你只需要维护模型不用碰解析逻辑。用一句话查遍符合条件的房源单次抓取只能看一页而找 2000 美元以下的一居室这类任务要跨很多页。examples/deep-research-apartment-finder/ 调deep_research参数只有三个maxDepth迭代轮数示例为 3、timeLimit秒级总时长上限示例 180、maxUrls分析 URL 上限示例 20。它在后台自己搜索、跟链接、抓下一批页面还注册了on_activity回调把每步动作打印出来。几分钟后你拿到的是一页整理好的候选清单房源按价格、设施、位置逐项列清最后交给 Claude 排序推荐。让商品价格的变动按天自动入库盯价格靠手刷太累而定时 抓取是这类数据的天然组合。examples/blog-articles/amazon-price-tracking/ 的思路脚本周期性抓商品页、抽出当前价格、追加落盘调度则完全交给 GitHub Actions 的 cron不需要常驻进程。效果是每天多一条价格记录界面上画出一条趋势曲线跌破阈值还能接通知。进阶技巧与常见问题两个参数级技巧formats可以一次传多种输出比如 markdown 和 screenshot 一起要markdown 喂模型省 token截图留作人工核对的证据。抓整站先用limit小批量试跑确认范围再放大只想要站内少数页面时app.map(url, searchpricing)能按关键词直接筛出相关 URL省掉全量爬取。常见问题站点反爬很强怎么办代理轮换、限速处理和 JS 渲染内容都是内置的官方口径覆盖率能到 96% 的网页这块不用你操心。某个字段老抽错把 schema 里该字段的description写得更具体提取准确率会明显提升。能自托管吗可以。仓库根目录自带docker-compose.yaml执行docker compose up即可整套起本地服务细节见 SELF_HOST.md。Firecrawl 的价值是把从网页到可用数据这段最琐碎的路压缩成一次 API 调用。完整能力清单看 README能直接跑的演示都在 examples/ 里。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表