今天给大家演示一个微观小人国场景构建与多模态生成的 Coze 工作流。这个工作流的设计目标,是将用户输入的主题转化为成体系的微观生活场景,再通过大模型生成文本、图像与视频内容,最终形成可用于创作与展示的多模态成果。从场景文本构思,到文生图提示词,再到批量图像生成、视频合成以及音频植入,每一步都实现了高度自动化与智能化的衔接。这样,用户可以直观地体验从“文字输入”到“沉浸式多模态输出”的全过程。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- 场景构建微观小人国的故事
- 构造文生图提示词图像描述生成
- 图生视频提示词:动态影像设计师
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
该工作流整体上由大语言模型驱动,结合图像生成、视频生成与音频插件节点,形成完整的多模态内容生成链路。其核心模型以豆包·1.5·Pro·32k 为主,在场景构建、图像提示词生成、视频动态描述等环节中被多次调用,保证了上下文连贯性与创意一致性。同时,工作流内包含批处理、循环、插件调用等 Node 节点,使得复杂的任务可以被拆解、优化并高效执行。
核心模型
在核心模型部分,本工作流统一采用豆包·1.5·Pro·32k作为生成支撑模型。它不仅负责场景构建和故事逻辑生成,还承担了图像与视频提示词的创作任务,确保了风格一致与语义延展性。通过合理的参数设定(如温度、最大 token、上下文控制等),模型能够生成具有故事感与画面感的输出,并且可扩展为视频脚本或图像描述。
| 模型名称 | 说明 |
|---|---|
| 豆包·1.5·Pro·32k | 大语言模型,负责微观场景生成、图像提示词构造、视频动态描述等多模态内容的文字支撑 |
Node节点
工作流的 Node 节点涵盖了从大模型调用