☰
awesome-claude-skills 实践:基于 Rube MCP(Composio)自动化 Scrapingbee 的完整指南
2026/10/4 11:56:41 网站建设 项目流程
  • AI 技能
  • AI 插件
  • 人工智能
  • 工作流自动化

【免费下载链接】awesome-claude-skills

A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows

项目地址:https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills
点击查看免费下载

本文围绕 awesome-claude-skills 仓库中 composio-skills/scrapingbee-automation/SKILL.md 这一技能文档展开,系统讲解如何借助 Rube MCP(Composio 提供的 MCP 网关)在 Claude 等 AI 助手中自动化 Scrapingbee 抓取操作。读完本文,你将掌握从接入 Rube MCP、建立 Scrapingbee 连接,到发现工具、执行抓取任务的完整链路,并了解规避常见陷阱的实战要点。

技能定位:一句话说明这个 Skill 解决什么问题

Scrapingbee 是知名的 Web 抓取与数据提取服务,通常需要开发者自行封装 API 调用。而本仓库提供的scrapingbee-automation技能,将 Scrapingbee 的操作能力通过 Composio 的 Scrapingbee toolkit 暴露为可被 AI 代理直接调用的工具,再由 Rube MCP 统一桥接。用技能文档自身的话说,其核心主张是:"Automate Scrapingbee operations through Composio's Scrapingbee toolkit via Rube MCP."

技能元数据(frontmatter)也给出了关键约束:description中明确强调"Always search tools first for current schemas"(永远先搜索工具,获取当前 schema),requires: mcp: [rube]表明该技能依赖 Rube MCP 作为运行前提。这两点贯穿整个工作流设计的始终。

从仓库视角看,这并非孤立技能:根据 README.md 的说明,awesome-claude-skills 收录了78 个 SaaS 应用的预置工作流技能,全部经由 Rube MCP(Composio)提供,每个技能都包含工具调用序列、参数指引、已知陷阱和快速参考表,工具 slug 均来自 Composio API 的真实数据。Scrapingbee 技能正是这一体系中的一员,与其他 77 个技能共享同一套方法论。

前置条件(Prerequisites)

在开始任何工作流之前,需要满足三个前提:

  1. Rube MCP 已连接:确保RUBE_SEARCH_TOOLS工具可用(这是验证 Rube MCP 是否就绪的标志性信号);
  2. Scrapingbee 连接已建立:通过RUBE_MANAGE_CONNECTIONS建立 Scrapingbee 连接,toolkit 名称为scrapingbee,且状态必须为 ACTIVE;
  3. 先搜索再执行:任何情况下都要先调用RUBE_SEARCH_TOOLS获取当前工具 schema,不能凭记忆硬编码工具 slug 或参数。

接入 Rube MCP(Setup)

接入 Rube MCP 的过程极为轻量,技能文档给出了明确的接入方式:

将https://rube.app/mcp添加为客户端配置中的 MCP server 即可,无需任何 API Key,添加端点后直接可用。

完成端点添加后,按以下四步完成验证与连接:

  1. 通过确认RUBE_SEARCH_TOOLS有响应,验证 Rube MCP 可用;
  2. 调用RUBE_MANAGE_CONNECTIONS,toolkit 指定为scrapingbee;
  3. 若连接状态不是 ACTIVE,按返回的认证链接完成授权设置;
  4. 在运行任何工作流前,确认连接状态已变为ACTIVE。

值得一提的是,这一步适用于仓库内全部 78 个 Composio 技能(如 composio-skills/composio-automation/SKILL.md 采用了完全相同的四步接入流程),也就是说只要接入一次 Rube MCP,后续为任意 SaaS 应用建立连接都遵循同样的模式。

工具发现(Tool Discovery):先搜索,永远是第一步

这是整个技能最强调的一环。技能文档明确要求:在执行任何工作流之前,先发现可用工具,推荐调用如下:

RUBE_SEARCH_TOOLS queries: [{use_case: "Scrapingbee operations", known_fields: ""}] session: {generate_id: true}

该调用会返回四类关键信息:

  • 可用工具的slug 列表(后续执行时引用);
  • 每个工具的输入 schema(字段名、类型、必填项);
  • 推荐执行计划(针对当前 use case 的建议调用序列);
  • 已知陷阱(该工具已知的坑与注意事项)。

这里session: {generate_id: true}表示首次调用时让系统生成会话 ID,供后续工作流复用。

核心工作流模式:三步走

技能文档将标准执行流程归纳为三个步骤,下面逐步展开,并给出可直接复制使用的调用骨架。

Step 1:发现可用工具(Discover Available Tools)

针对具体任务描述进行搜索,复用已有会话 ID:

RUBE_SEARCH_TOOLS queries: [{use_case: "your specific Scrapingbee task"}] session: {id: "existing_session_id"}

将use_case替换为你的真实任务描述(例如"Scrape product page with JS rendering"或"Extract structured data from search results page"),系统会返回与该任务匹配的工具 slug 与 schema。

Step 2:检查连接(Check Connection)

执行工具前必须确认连接处于 ACTIVE:

RUBE_MANAGE_CONNECTIONS toolkits: ["scrapingbee"] session_id: "your_session_id"

Step 3:执行工具(Execute Tools)

使用从搜索结果中获得的真实 slug 与 schema 构造调用:

RUBE_MULTI_EXECUTE_TOOL tools: [{ tool_slug: "TOOL_SLUG_FROM_SEARCH", arguments: {/* schema-compliant args from search results */} }] memory: {} session_id: "your_session_id"

注意两个细节:arguments必须严格遵循搜索返回的 schema(字段名与类型逐一对应);memory参数即便为空也必须显式携带(写为{})。

进阶操作:批量执行与完整 schema

除三步主流程外,技能文档还提供了两种扩展手段,用于更复杂的场景:

  • 批量操作:使用RUBE_REMOTE_WORKBENCH配合run_composio_tool(),可在远程工作台中批量执行多个 Composio 工具调用;
  • 获取完整 schema:对于返回结果中带schemaRef的工具,使用RUBE_GET_TOOL_SCHEMAS获取完整 schema 定义,避免因 schema 过大或存在引用而信息不全。

已知陷阱(Known Pitfalls):六大注意事项

技能文档总结了六条经过实战验证的避坑要点,值得逐条重视:

  1. 永远先搜索(Always search first):工具 schema 会持续变化。绝不能在未调用RUBE_SEARCH_TOOLS的情况下硬编码工具 slug 或参数,这是技能元数据中反复强调的铁律;
  2. 检查连接(Check connection):执行工具前,务必确认RUBE_MANAGE_CONNECTIONS返回的状态是 ACTIVE,避免对失效连接发起调用;
  3. Schema 合规(Schema compliance):必须使用搜索结果的精确字段名与类型,多一个字符或少一个字段都可能导致调用失败;
  4. Memory 参数:每次RUBE_MULTI_EXECUTE_TOOL调用都必须包含memory参数,即使没有上下文数据也要传{};
  5. 会话复用(Session reuse):同一工作流内复用 session ID 以保持上下文连续性;开启新工作流时才生成新的 session ID;
  6. 分页处理(Pagination):留意响应中的分页 token,持续获取直到数据完整,避免遗漏后续批次的结果。

快速参考表(Quick Reference)

技能文档末尾提供了一张速查表,适合作为日常操作时的记忆索引:

操作方式
查找工具RUBE_SEARCH_TOOLS,传入 Scrapingbee 专属 use case
建立连接RUBE_MANAGE_CONNECTIONS,toolkit 为scrapingbee
执行工具RUBE_MULTI_EXECUTE_TOOL,使用发现的工具 slug
批量操作RUBE_REMOTE_WORKBENCH,配合run_composio_tool()
完整 schemaRUBE_GET_TOOL_SCHEMAS,针对带schemaRef的工具

源码级佐证:同一方法论在仓库中的普遍性

从源码结构看,本技能并非孤例。仓库中 composio-skills 目录下的 78 个自动化技能(从-21risk-automation到zyte-api-automation)在 frontmatter、接入步骤、三步工作流、六大陷阱和速查表结构上高度一致,例如 composio-skills/composio-automation/SKILL.md 中同样使用RUBE_SEARCH_TOOLS+queries: [{use_case: "Composio operations", known_fields: ""}]的工具发现模式。这种结构上的高度统一可以推断:Rube MCP 为每个 SaaS toolkit 暴露的调用协议是同构的,本篇文章讲解的 Scrapingbee 工作流模式可以平移复用到其余 77 个技能,差异仅在于 toolkit 名称与具体的工具 slug。这正符合 README.md 中所描述的"每个技能包含工具序列、参数指引、已知陷阱和快速参考表"的统一设计。

结语

通过scrapingbee-automation技能,AI 代理可以在不手写任何抓取代码的前提下,以"搜索工具 → 确认连接 → 执行调用"的标准化流程完成 Scrapingbee 抓取任务。其核心方法论——先搜索 schema、严格参数合规、显式携带 memory、复用会话——既是本技能的实战准则,也是理解仓库中全部 Composio 自动化技能的一把通用钥匙。安装该技能后,只需在客户端中添加https://rube.app/mcp端点并完成一次 Scrapingbee 连接授权,即可开始探索。

  • AI 技能
  • AI 插件
  • 人工智能
  • 工作流自动化

【免费下载链接】awesome-claude-skills

A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows

项目地址:https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills
点击查看免费下载
上一篇:3步搞定Zotero文献管理智能化:阅读进度可视化和标签管理终极指南
下一篇:Crossplane Composition Validating Webhook 设计解析:从 schema 校验到渲染资源验证的完整方案

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询