尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何用 Firecrawl 技能从网页提取结构化数据并轮询异步任务

如何用 Firecrawl 技能从网页提取结构化数据并轮询异步任务 如何用 Firecrawl 技能从网页提取结构化数据并轮询异步任务【免费下载链接】awesome-codex-skillsA curated list of practical Codex skills for automating workflows across the Codex CLI and API.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-codex-skills如果你的 Codex Agent 需要从网页中拿到结构化的 JSON 数据比如公司名、定价套餐、功能列表并且要可靠地取回异步任务的最终结果可以用 awesome-codex-skills 仓库中的 Firecrawl 自动化技能。该技能通过 Composio 的 Firecrawl 集成把FIRECRAWL_EXTRACT结构化提取和FIRECRAWL_EXTRACT_GET/FIRECRAWL_CRAWL_GET异步任务轮询接入你的 Codex 会话。前提条件一个能配置 MCP 服务器的 Codex 环境、一个 Composio MCP 端点以及一个有额度的 Firecrawl 账号。准备条件安装技能并接入 Composio MCP把技能装进 Codex按 README 的手动安装方式把技能文件夹composio-skills/firecrawl-automation/复制到$CODEX_HOME/skills/默认~/.codex/skills/然后重启 Codex 让它加载新的技能元数据。验证安装是否生效ls ~/.codex/skills head ~/.codex/skills/firecrawl-automation/SKILL.mdhead里应能看到name、description等 frontmatter。会话中描述提取任务时Codex 会根据description自动触发该技能也可以直接点名技能。配置 MCP 并连接 Firecrawl 账号技能 frontmatter 声明了requires.mcp: rube所以必须把 Composio MCP 服务器加入你的 MCP 配置https://rube.app/mcp连接流程见技能文档 Setup 一节在配置中加入上面的 MCP 端点按提示连接 Firecrawl 账号Agent 会提供一个认证链接完成授权即可。文档同时提醒Firecrawl 按用量消耗额度credits先把爬取范围收窄、在小 URL 集合上测试再放大。发起结构化数据提取FIRECRAWL_EXTRACT提取使用FIRECRAWL_EXTRACT工具关键参数urls必填要提取的 URL 数组beta 阶段最多 10 个支持https://example.com/blog/*这样的通配符prompt自然语言描述要提取什么schema定义期望输出结构的 JSON Schemaenable_web_search是否允许爬取初始域名之外的链接默认 false。prompt和schema至少提供一个。技能文档给出的示例请求是文档示例Extract company name, pricing tiers, and feature lists from https://example.com/pricing文档的已知坑提醒schema 或 prompt 写得含糊、频繁改动会产出噪音大、不一致的结果。应先把 schema 定稿freeze在小样本 URL 上测试再扩到大批量。可选分支如果你走的是 Composio CLI 集成路径先执行curl -fsSL https://composio.dev/install | bash安装 CLI——该命令会下载并运行官方安装脚本注意先确认来源再composio login登录、composio whoami确认身份工具未连接时先composio link toolkit同一批工具 slug 可以直接用composio execute调用参数以 JSON 传入composio execute FIRECRAWL_EXTRACT -d { urls: [https://example.com/pricing], prompt: Extract company name, pricing tiers, and feature lists }其中urls、prompt为读者按自己的目标页面和字段替换的值。调用前可用composio execute FIRECRAWL_EXTRACT --get-schema查看入参、--dry-run预演。轮询异步任务EXTRACT_GET 与 CRAWL_GET提取任务FIRECRAWL_EXTRACT_GETFIRECRAWL_EXTRACT对较大的任务也是异步的调用不会直接返回最终数据而是返回一个任务id。拿这个id调FIRECRAWL_EXTRACT_GET才能取回最终输出。CLI 路径下即composio execute FIRECRAWL_EXTRACT_GET -d {id: FIRECRAWL_EXTRACT 返回的 job id}id是上一次FIRECRAWL_EXTRACT调用返回的任务标识必须原样替换。整站爬取任务FIRECRAWL_CRAWL_V2 FIRECRAWL_CRAWL_GET爬取走FIRECRAWL_CRAWL_V2常用参数url必填起始 URL、limit默认 10最大爬取页数、maxDiscoveryDepth、includePaths/excludePathsURL 路径正则、allowSubdomains默认 false、crawlEntireDomain默认 false、sitemapinclude默认 /skip/only。关键行为FIRECRAWL_CRAWL_V2会立即返回一个任务 IDUUID不会等你爬完。后续都用FIRECRAWL_CRAWL_GET轮询它返回状态、进度、已用额度和已爬页面数据。技能文档中的示例文档示例Check the status of crawl job 019b0806-b7a1-7652-94c1-e865b5d2e89a如果任务卡住或失控用FIRECRAWL_CANCEL_A_CRAWL_JOB取消它接受 active 或 queued 状态的任务避免继续浪费额度FIRECRAWL_GET_THE_STATUS_OF_A_CRAWL_JOB也可单独用于查进度。两个查询/取消工具都需要爬取发起时返回的任务idUUID。结果如何判定嵌套响应与常见失败拿到响应后不能只看外层调用是否成功文档明确要求检查内层状态嵌套错误单页失败可能藏在response.data.code里例如SCRAPE_DNS_RESOLUTION_ERROR即使外层 API 调用是成功的。始终校验内层 status/error 字段。深层嵌套结果结果常嵌套在data.data或更深处拿到响应后先观察返回结构不要假设是扁平键。限流Firecrawl 可能触发 429 Rate limit exceeded。文档建议对 429/5xx 做退避批量抓取用FIRECRAWL_BATCH_SCRAPE代替大量逐个FIRECRAWL_SCRAPE调用extract 的 URL 批次保持在约 10 个以内。额度不足FIRECRAWL_EXTRACT可能报 Insufficient credits。收窄范围避免用宽泛的首页 URL字段稀疏、产出少。JS 重的页面不渲染的抓取可能漏掉关键内容动态页面用waitFor文档建议 1000–5000ms或配置scrapeOptions_actions先与页面交互再抓。限制与边界FIRECRAWL_EXTRACT的urls在 beta 阶段上限 10 个该技能依赖 Composio MCPrube端点与已授权的 Firecrawl 账号MCP 未配置时技能无法工作额度消耗与爬取范围直接相关文档反复强调先小后大但没给出免费的额度阈值或重试间隔等具体数值实际限速表现以账号实际响应为准。完成以上步骤后你可以在 Codex 会话里直接下达从某页面提取某字段的自然语言任务Agent 触发该技能发起FIRECRAWL_EXTRACT用返回的 jobid轮询FIRECRAWL_EXTRACT_GET并按上面的规则校验嵌套响应。完整的工具清单见技能文档的 Quick Reference 表。【免费下载链接】awesome-codex-skillsA curated list of practical Codex skills for automating workflows across the Codex CLI and API.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-codex-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表