☰
OpenAI Automation:通过 Composio Rube MCP 在 Claude Skill 中自动化 OpenAI API 工作流
2026/10/3 2:09:43 网站建设 项目流程
  • AI 技能
  • AI 插件
  • 人工智能
  • 工作流自动化

【免费下载链接】awesome-claude-skills

A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows

项目地址:https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills
点击查看免费下载

本指南基于 awesome-claude-skills 仓库中 composio-skills/openai-automation/SKILL.md 展开,讲解如何借助 Composio 的 Rube MCP 集成,在一个 Claude Skill 内直接驱动 OpenAI API——涵盖 Responses API 文本/多模态生成、结构化 JSON 输出、Embedding 向量化、DALL-E 与 GPT Image 图像生成以及模型列表查询。读完本文,你将掌握这套 Skill 的完整配置参数、四条核心工作流的调用方式,以及规避 DALL-E 弃用、推理模型限制等常见陷阱的实战要点。

Skill 定位:预构建的 OpenAI 工作流技能

在 README.md 的 "App Automation via Composio" 章节中,这类技能被定义为"面向 78+ SaaS 应用的预构建工作流技能":每个 Skill 包含工具序列、参数指引、已知陷阱(Known Pitfalls)与快速参考表(Quick Reference),且所有工具 slug 均来自 Composio API 的真实发现结果。

本 Skill 的 frontmatter(见 SKILL.md)声明了其能力边界:

  • name:OpenAI Automation
  • description: 自动执行 OpenAI API 操作——支持多模态与结构化输出的响应生成、Embedding 创建、图像生成以及模型列表查询(经 Composio MCP 集成)
  • requires.mcp:rube,即 Skill 运行的前提是客户端已接入 Rube MCP 服务器

它解决的是典型的"Agent 需要真实调用外部模型能力"场景:当你的 Claude 工作流需要生成文本、分析图片、产出结构化 JSON、为 RAG 构建向量索引或批量出图时,无需自己维护 OpenAI SDK 代码,直接通过 MCP 工具调用即可。

环境准备:接入 Rube MCP 并连接 OpenAI 账户

Setup 步骤非常简洁,共三步:

  1. 添加 Composio MCP 服务器:在客户端配置中加入 MCP 服务器地址https://rube.app/mcp;
  2. 连接 OpenAI 账户:按提示完成 API Key 认证(即 OpenAI API key 鉴权);
  3. 开始使用下方各工作流。

从仓库中同类 Skill(如 composio-skills/ably-automation/SKILL.md)的说明可以推断,Rube MCP 具备一套通用的工具发现与连接管理机制:可用RUBE_SEARCH_TOOLS查询当前可用的工具 schema 与推荐执行方案,用RUBE_MANAGE_CONNECTIONS检查/建立到目标 toolkit 的连接,并用RUBE_MULTI_EXECUTE_TOOL按发现的 tool_slug 实际执行。因此,若首次连接状态不是ACTIVE,应跟进返回的认证链接完成设置后再运行工作流。OpenAI 这类需要 API Key 的 toolkit 即通过该连接流程完成鉴权。

核心工作流一:生成响应(文本、多模态与结构化输出)

OPENAI_CREATE_RESPONSE是覆盖最广的入口,用于一次性模型响应,支持纯文本、图片分析、OCR 以及结构化 JSON 输出。其完整输入参数如下:

Tool: OPENAI_CREATE_RESPONSE Inputs: - model: string (required) -- e.g., "gpt-5", "gpt-4o", "o3-mini" - input: string | array (required) Simple: "Explain quantum computing" Multimodal: [ { role: "user", content: [ { type: "input_text", text: "What is in this image?" }, { type: "input_image", image_url: { url: "https://..." } } ]} ] - temperature: number (0-2, optional -- not supported with reasoning models) - max_output_tokens: integer (optional) - reasoning: { effort: "none" | "minimal" | "low" | "medium" | "high" } - text: object (structured output config) - format: { type: "json_schema", name: "...", schema: {...}, strict: true } - tools: array (function, code_interpreter, file_search, web_search) - tool_choice: "auto" | "none" | "required" | { type: "function", function: { name: "..." } } - store: boolean (false to opt out of model distillation) - stream: boolean

要点解析:

  • 多模态输入:input接受input_text与input_image混合的内容数组,可用于"这张图里有什么"等视觉理解与 OCR 场景;图片以image_url.url传递;
  • 推理模型约束:temperature(0-2 区间)与top_p在推理模型(如 o3-mini、gpt-5 系列 reasoning 模式)下不受支持,应改用reasoning.effort调节推理强度(枚举none/minimal/low/medium/high);
  • 结构化输出:通过text.format指定json_schema。示例——以strict: true约束 schema 时,返回严格符合结构的 JSON:{ type: "json_schema", name: "person", schema: { type: "object", properties: { name: { type: "string" }, age: { type: "integer" } }, required: ["name", "age"], additionalProperties: false }, strict: true };
  • 工具调用:tools支持function、code_interpreter、file_search、web_search;tool_choice支持auto/none/required或指定具体函数;
  • 蒸馏退出:store: false用于选择退出模型蒸馏数据收集;
  • 流式输出:stream: boolean控制是否流式返回。

核心工作流二:创建 Embedding

OPENAI_CREATE_EMBEDDINGS面向向量检索、聚类、推荐与 RAG 流水线:

Tool: OPENAI_CREATE_EMBEDDINGS Inputs: - input: string | string[] | int[] | int[][] (required) -- max 8192 tokens, max 2048 items - model: string (required) -- "text-embedding-3-small", "text-embedding-3-large", "text-embedding-ada-002" - dimensions: integer (optional, only for text-embedding-3 and later) - encoding_format: "float" | "base64" (default "float") - user: string (optional, end-user ID for abuse monitoring)

要点解析:

  • 支持字符串、字符串数组、整数 ID 数组及其二维形式,但每项不超过 8192 tokens、每批不超过 2048 项(详见下文陷阱表);
  • dimensions仅对text-embedding-3及之后版本生效,可用于裁剪向量维度以节省存储;
  • encoding_format默认float,可选base64以压缩传输体积;
  • user字段用于滥用监控场景下的终端用户标识。

核心工作流三:生成图像

OPENAI_CREATE_IMAGE使用 GPT Image 或 DALL-E 模型从文本提示词生成图片:

Tool: OPENAI_CREATE_IMAGE Inputs: - model: string (required) -- "gpt-image-1", "gpt-image-1.5", "dall-e-3", "dall-e-2" - prompt: string (required) -- max 32000 chars (GPT Image), 4000 (DALL-E 3), 1000 (DALL-E 2) - size: "1024x1024" | "1536x1024" | "1024x1536" | "auto" | "256x256" | "512x512" | "1792x1024" | "1024x1792" - quality: "standard" | "hd" | "auto" | "high" | "medium" | "low" - n: integer (1-10; DALL-E 3 supports n=1 only) - background: "transparent" | "opaque" | "auto" (GPT Image models only) - style: "vivid" | "natural" (DALL-E 3 only) - user: string (optional)

要点解析:

  • 模型选型:GPT Image 系列(gpt-image-1、gpt-image-1.5)是当前首选;DALL-E 2/3 已进入弃用周期(见陷阱表);
  • 提示词长度上限随模型变化:GPT Image 32000 字符、DALL-E 3 为 4000、DALL-E 2 为 1000;
  • 尺寸矩阵:横竖版(1536x1024、1024x1536)、方形(1024x1024)、auto自适应,以及 DALL-E 2 的小尺寸(256x256、512x512)和 DALL-E 3 的1792x1024/1024x1792;
  • 专属参数:background仅 GPT Image 支持(透明/不透明/自动);style仅 DALL-E 3 支持(vivid/natural);
  • 数量限制:DALL-E 3 只能n=1,多图请改用 GPT Image 或 DALL-E 2。

核心工作流四:列出可用模型

OPENAI_LIST_MODELS用于探查当前 API Key 可访问的模型集合,输入参数为空:

Tool: OPENAI_LIST_MODELS Inputs: (none)

适合在编写工作流前先做模型可用性探测,避免因模型名不可用导致调用失败。

已知陷阱(Known Pitfalls)

原文档用表格完整记录了六类高频坑点,实际调用时应逐条对照:

PitfallDetail
DALL-E deprecationDALL-E 2 和 DALL-E 3 已弃用,将于 2026-05-12 停止支持,应优先使用 GPT Image 模型
DALL-E 3 single image onlyOPENAI_CREATE_IMAGE搭配 DALL-E 3 仅支持n=1;多图请用 GPT Image 模型或 DALL-E 2
Token limits for embeddingsEmbedding 模型每项输入不得超过 8192 tokens、每批不超过 2048 项
Reasoning model restrictionstemperature与top_p在推理模型(o3-mini 等)上不受支持,应改用reasoning.effort
Structured output strict mode当json_schema格式设置strict: true时,schema 的所有属性都必须列入required数组
Prompt length varies by model图像提示词长度上限不同:GPT Image 32000、DALL-E 3 4000、DALL-E 2 1000

快速参考(Quick Reference)

Tool SlugDescription
OPENAI_CREATE_RESPONSE生成文本/多模态响应,支持结构化输出
OPENAI_CREATE_EMBEDDINGS为搜索、聚类与 RAG 创建文本向量
OPENAI_CREATE_IMAGE从文本提示词生成图像
OPENAI_LIST_MODELS列出当前 API Key 可用的全部模型

实战建议

结合仓库中同批 Rube MCP Skill 的通用模式(参见 composio-skills/ably-automation/SKILL.md),建议在实际工作流中遵循如下纪律:

  • 先发现、后执行:工具 schema 会随 API 演进而变化,执行前先通过RUBE_SEARCH_TOOLS获取最新 tool slug 与输入 schema,不要硬编码;
  • 执行前确认连接:用RUBE_MANAGE_CONNECTIONS确认 OpenAI toolkit 连接状态为ACTIVE再发起调用;
  • 多工具批量执行:需要串联多个 OpenAI 操作时,可在RUBE_MULTI_EXECUTE_TOOL中传入多个{ tool_slug, arguments },并始终携带memory参数(可为空{});
  • 会话复用:同一工作流内复用 session ID,新工作流生成新 ID;
  • 严格 schema 合规:结构化输出开启strict: true时,务必让required数组覆盖全部属性,否则请求会被拒绝。

Powered by Composio,原文见 composio-skills/openai-automation/SKILL.md。

  • AI 技能
  • AI 插件
  • 人工智能
  • 工作流自动化

【免费下载链接】awesome-claude-skills

A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows

项目地址:https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills
点击查看免费下载

相关推荐

上一篇:Umi-OCR完全指南:免费开源离线OCR工具终极解决方案
下一篇:DLSS Swapper终极指南:三步轻松提升游戏性能的免费神器

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询