
Firecrawl 实战入门从网页抓取到 AI 提取三个场景搭出可用系统【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl想给大模型喂网页内容时多数人卡在同一堆问题上HTML 标签杂乱、CSS 和广告占了正文八成换一个网站就得重写一套解析逻辑。Firecrawl一个开源的网页抓取与网页数据平台把这条链路做平任何 URL 进来输出的要么是干净的 Markdown要么是你定义好字段的结构化 JSON再往上还有多轮深度研究和定时抓取任务。下面用官方仓库里的真实示例按单页抓取 → 结构化提取 → 深度研究 → 自动化流水线四层讲清楚它到底能省掉什么活。 三步拿到 API Key先把单页抓取跑通准备工作只有三步安装 SDKpip install firecrawl-pyPython 侧或npm install mendable/firecrawl-jsJS 侧在 Firecrawl 平台注册把 API Key 存进环境变量FIRECRAWL_API_KEY初始化客户端发第一次抓取最小可运行示例长这样from firecrawl import FirecrawlApp app FirecrawlApp() # 自动读取环境变量里的 Key result app.scrape(https://example.com, formats[markdown]) print(result)这一步的价值在于输出已经LLM-ready导航、脚注、脚本全部剥掉正文转成带层级标题的 Markdown直接塞进 prompt 不用再做清洗。如果不想先知道 URL它的 search 接口可以按关键词搜网页并顺带把结果抓成 Markdown等于搜索和抓取合成了一次调用。单页解决后下一个问题通常是我不要全文我只想要里面的表格和列表。 用 Pydantic 模型定义字段让 AI 直接吐结构化数据以仓库里的 Hacker News 抓取器为例examples/ 目录下可找到全部示例做法是先写一个数据模型声明你要哪几个字段、每个字段是什么含义再把模型转成 JSON Schema 传给scrapefrom pydantic import BaseModel, Field class NewsItem(BaseModel): title: str Field(descriptionThe title of the news item) source_url: str Field(descriptionThe URL of the news item) upvotes: str Field(descriptionThe number of upvotes) # app.scrape(url, formats[extract], schemaNewsItem) → 得到符合模型的 JSON服务端会带着这个 Schema 让 LLM 去读页面并填值你拿到的就是可以直接入库的字典列表而不是需要二次解析的文本。脚本跑一次就把结果按时间戳存成 JSON 文件挂上 cron 就是一个免费的资讯聚合管道。这里的关键思路把解析规则从代码变成声明模型负责读页Schema 负责约束输出。结构化提取解决的是一页里取字段但很多任务的答案散在几十个页面上一次抓取远远不够。️ 把找答案变成研究任务深度研究 API仓库里的租房助手示例展示了这种用法用户报出城市、预算、卧室数和设施要求程序把它们拼成一句自然语言查询然后调用deep_research参数大致是最多迭代 3 轮、时间上限 180 秒、最多分析 20 个 URL。Firecrawl 会自己规划搜索、跟进相关链接、逐页判断价值过程中还通过回调把正在读哪个页面这类进度实时吐给你最后返回一份带来源链接的研究结论。把这套能力换个 prompt 就是竞品调研一个公司信息提取示例先用搜索接口拿到候选网页让 LLM 筛出最相关的几个 URL再批量抓取这些页面最终得到整理过的公司档案。两个示例的共同点是——你只描述目标翻页、筛选、汇总这些脏活交给它做人只负责验收结果。单次的研究任务跑通了接下来是让它自己按时跑起来变成一条无人值守的流水线。⏰ 定时任务 变更追踪把抓取变成监控流水线仓库里的 Amazon 价格跟踪示例是完整的参考实现定时抓取商品页 → 价格写入数据库 → 画趋势图 → 跌破阈值时推送通知。搭起来的核心不是写抓取逻辑那是上面已经解决的事而是三件事调度用 GitHub Actions 的 cron 定时触发抓取脚本或直接用 Firecrawl 的 Monitor 能力托管定时检查变更追踪开 change tracking 后每次抓取自动和上次做 diff页面文案变了价格、库存、标题才会触发你的下游逻辑省 token 也省噪音存储与告警历史价格落库用现成的图表库出趋势图超阈值走邮件或 webhook到这里单页抓取、结构化提取、深度研究、定时监控四个能力就串成了一条完整的数据管道。✅ 行动清单今天就跑起来装 SDK、配好FIRECRAWL_API_KEY用第一段代码抓一个你最常访问的页面看 Markdown 输出质量挑一个真实需求写 Pydantic 模型新闻列表、商品价格、招聘信息都行用formats[extract]拿到你的第一份结构化 JSON给其中一个页面加定时任务配上 change tracking只关注变了的那一刻把它变成你的第一个监控告警完整的参数说明和各语言 SDK 用法见仓库内的 README.md 官方文档入口。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考