诗词类短视频一直是个很微妙的内容赛道。做得好,评论区全是"求教程""太有感觉了";做得不好,就是几张图配个朗读,播放量卡在几百上不去。我前前后后试过纯手工剪辑、模板套用、脚本批量生成几条路子,最后发现真正能把效率和质量同时拉起来的方案,是用扣子(Coze)搭一个AI Agent,把"写诗—配图—配音—合成"这条链路串成自动化工作流,最后交给剪映做收尾。整套流程跑通之后,一条诗词视频从构思到成片大概十几分钟,而且风格稳定、可批量复制。
这篇内容适合三类人看:一是想做诗词、国学、文化类账号但不懂剪辑的创作者;二是已经会用扣子搭简单Bot,想进一步把工作流和剪映打通的进阶玩家;三是纯粹对AI Agent工作流感兴趣,想找一个完整小项目练手的技术爱好者。我会把整个搭建过程拆开讲,包括为什么这么设计、每个节点怎么配、踩过哪些坑,以及最后怎么和剪映衔接。不堆概念,直接上可复现的操作。
1. 先想清楚:诗词视频的自动化到底难在哪
1.1 诗词视频的四个核心环节
一条完整的诗词视频,拆开来看其实是四件事:文案(诗词本身)、画面(配图或视频素材)、声音(朗读或配乐)、剪辑(节奏和字幕)。手工做的话,这四步每一环都要单独花时间,尤其是画面和剪辑,最耗精力。
很多人一开始的想法是"我让大模型直接生成一条视频不就行了"。实测下来这条路走不通,原因很简单:大模型擅长的是文本生成,它不直接产出视频文件。你要的是"文本→图像→音频→视频"的跨模态串联,这中间必须有一个调度层,把不同能力串起来。扣子的工作流本质上就是这个调度层。
1.2 为什么选扣子而不是纯手工或纯脚本
纯手工的问题不用多说,效率低、不可复制。纯脚本(比如自己写Python调API)的问题是门槛高,而且一旦某个环节的接口变了,维护成本很高。
扣子的优势在于它是可视化编排:每个节点干什么一目了然,改起来也快。更重要的是它内置了大量插件(图像生成、语音合成、搜索等),不用自己一个个去对接。对于诗词视频这种"多模态拼接"的场景,可视化工作流的调试效率比写代码高得多。
这里要澄清一个常见混淆:Agent和LLM不是一回事。LLM(大语言模型,比如DeepSeek、通义千问这些)是"大脑",负责理解和生成文本;Agent是"大脑+手脚",它除了会思考,还能调用工具、执行多步任务。扣子里你搭的这个诗词视频机器人,就是一个典型的Agent——它用LLM写诗,用插件画图,用工作流把结果串起来。
1.3 整体链路的拆解思路
我最终定下来的链路是这样的:
- 输入主题:用户给一个关键词,比如"秋思""边塞""江南春雨"。
- 生成诗词:LLM根据主题写一首符合格律或至少押韵的诗。
- 生成画面描述:把诗拆成几个画面,每个画面生成一段图像提示词。
- 批量出图:调用图像生成插件,按提示词出图。
- 生成配音:调用语音合成,把诗读出来。
- 组装:把图、音、字幕按顺序整理好,导出到剪映做最终合成。
这个链路里,扣子负责1到5,剪映负责6。为什么最后一步不放在扣子里做?因为剪映的转场、字幕动画、卡点这些精细化操作,目前还是人工在剪映里调最顺手,而且剪映有大量现成的诗词模板可以直接套。
2. 扣子工作流的节点编排:从主题到成品的每一步
2.1 开始节点与主题输入的设计
工作流的起点是一个"开始"节点,用来接收用户输入的主题。这里有个细节很多人会忽略:输入字段的类型和描述要写清楚。我一般会设两个变量,一个是theme(主题词,字符串),一个是style(风格,比如"豪放""婉约""田园"),风格可以给默认值。
为什么要单独设风格变量?因为同一个主题,豪放和婉约写出来的诗完全不同。如果你只给主题,模型每次生成的风格是随机的,做出来的视频调性不统一。给账号做内容,调性统一比单条爆款更重要。
在开始节点的描述里,我会写一句提示,比如"请输入一个诗词主题,如:秋思、边塞、江南"。这个描述会显示给用户看,降低使用门槛。
2.2 用大模型节点写诗:提示词才是关键
写诗这一步用大模型节点。选模型的时候,中文古诗词这块,国产模型普遍比国外模型更懂格律和意象,我一般用通义千问或者豆包系列,效果稳定。
提示词(Prompt)是这一步的核心。我踩过的坑是:一开始提示词写得太简单,就一句"写一首关于XX的诗",结果模型要么写成现代诗,要么格律乱七八糟。后来我把提示词结构化,效果立刻不一样。我的提示词模板大概是这样:
你是一位精通古典诗词的创作者。请根据以下要求创作一首诗: 主题:{{theme}} 风格:{{style}} 要求: 1. 如果是绝句,四句;如果是律诗,八句。 2. 严格押韵,韵脚统一。 3. 意象要具体,避免空泛的抒情。 4. 每句字数一致(五言或七言)。 5. 只输出诗的内容,不要标题,不要解释。 输出格式: 第一句 第二句 第三句 第四句这里的关键是输出格式约束。如果你不规定"只输出诗的内容",模型很可能给你加上"这首诗表达了……"之类的解释,后面处理起来就麻烦。另外,把诗按句分行输出,是为了后面拆分画面时好处理。
2.3 把诗拆成画面:分镜提示词的生成逻辑
诗写好了,接下来要把它变成画面。一首四句的诗,我一般拆成4个画面,每句对应一个。这一步再用一个大模型节点,输入是刚才生成的诗,输出是4段图像提示词。
提示词大概是这样:
你是一位分镜师。请把下面这首诗的每一句,转换成一段用于AI绘画的画面描述。 诗: {{poem}} 要求: 1. 每句诗对应一段画面描述。 2. 描述要包含:主体、环境、光线、色调、构图。 3. 风格统一为中国风、水墨或工笔,具体根据诗的意境选择。 4. 每段描述控制在50字以内。 5. 按句输出,每段一行。 输出格式: 画面1:xxx 画面2:xxx 画面3:xxx 画面4:xxx这一步的难点在于风格统一。如果每句都让模型自由发挥,可能出现第一张是水墨、第二张是油画的情况,拼在一起很违和。所以我在提示词里强制要求"风格统一",并且指定具体风格。
2.4 批量出图:图像生成节点的参数调优
拿到4段画面描述后,用图像生成节点批量出图。扣子里可以循环调用,也可以一次生成多张。我一般用循环节点,把4段描述依次传进去。
图像生成的参数有几个要注意:
- 尺寸:诗词视频一般是竖屏,所以用9:16的比例,比如768×1344。
- 风格模型:选中国风、水墨类的风格模型,比通用模型出图更贴合。
- 负面提示词:加上"文字、水印、模糊、畸形"这些,避免出图带乱七八糟的东西。
实测下来,出图质量不稳定是常态,同一个提示词多跑几次结果差别很大。我的做法是每个画面生成2到3张备选,后面人工挑一张最好的。虽然多花点时间,但成片质量提升明显。
2.5 配音与字幕:语音合成节点的选择
配音这一步用语音合成节点。诗词朗读对音色的要求比较高,我一般选偏沉稳、有古韵的男声或女声,语速调慢一点,大概0.8到0.9倍速,这样才有吟诵的感觉。
这里有个技巧:不要一句一句单独合成,而是把整首诗作为一个整体传进去。因为单独合成的话,每句之间的停顿会不自然,拼起来很生硬。整首合成,模型会自动处理句间的节奏。
字幕的话,可以在扣子里生成,也可以留到剪映里加。我倾向于在剪映里加,因为剪映的字幕样式多,还能做逐句出现的效果,比在扣子里生成硬字幕灵活。
3. 提示词工程:让AI写出"像样"的古诗词
3.1 为什么大模型写诗容易"翻车"
大模型写古诗词,常见的问题有三个:格律不对、意象堆砌、情感空洞。
格律不对是因为模型对平仄、押韵的掌握并不精确,尤其是律诗,要求更严。意象堆砌是因为模型倾向于把"月""风""花""雪"这些高频词往里塞,读起来华丽但没有逻辑。情感空洞是因为模型没有真实体验,写出来的东西容易"假大空"。
要解决这些问题,靠的不是换更强的模型,而是把约束写进提示词。模型再强,你不告诉它规则,它也不会主动遵守。
3.2 结构化提示词的四个要素
我总结的诗词提示词,包含四个要素:角色、任务、约束、格式。
- 角色:告诉模型它是谁,比如"你是一位精通古典诗词的创作者"。角色设定会影响模型的输出风格。
- 任务:明确要做什么,比如"根据主题创作一首七言绝句"。
- 约束:这是最重要的部分,包括格律、押韵、意象、字数等具体要求。
- 格式:规定输出格式,方便后续处理。
把这四个要素写全,出诗质量会稳定很多。下面是我常用的一个完整模板:
你是一位精通古典诗词的创作者,擅长七言绝句和五言律诗。 请根据以下主题创作一首诗: 主题:{{theme}} 风格:{{style}} 约束条件: 1. 体裁:七言绝句(四句,每句七字)。 2. 押韵:第二句和第四句必须押韵,韵脚统一。 3. 意象:每句至少包含一个具体意象,避免抽象抒情。 4. 情感:情感要贯穿全诗,前后呼应。 5. 语言:用词典雅,但不要生僻字。 输出格式: 只输出四句诗,每句一行,不要标题,不要标点以外的任何符号。3.3 押韵和格律的"软约束"技巧
严格来说,让模型完全遵守平仄格律是很难的,因为平仄涉及中古音,模型训练数据里这方面的标注很少。我的做法是抓大放小:押韵必须保证,平仄尽量但不强求。
押韵怎么保证?在提示词里明确"第二句和第四句押韵",并且可以给一个韵脚示例,比如"如果主题是秋思,可以用'秋、愁、楼、舟'这类韵脚"。给示例比单纯说"要押韵"有效得多。
另外一个小技巧:让模型先想韵脚,再写诗。可以在提示词里加一句"先确定韵脚,再围绕韵脚展开"。这样模型会先锁定韵脚,写的时候不容易跑偏。
3.4 用少样本示例提升稳定性
如果发现模型输出还是不稳定,可以用**少样本(Few-shot)**的方法,在提示词里给一两个示例。比如:
示例: 主题:秋思 风格:婉约 输出: 月落乌啼霜满天 江枫渔火对愁眠 姑苏城外寒山寺 夜半钟声到客船给一个示例,模型就知道你要的是什么格式和风格,输出会稳定很多。注意示例要选质量高的,因为模型会模仿示例的水平。
4. 和剪映的衔接:从素材到成片的最后一公里
4.1 为什么最后一步要交给剪映
前面说过,扣子负责生成素材,剪映负责合成。这么分工的原因是:剪映在视频合成上的精细度和效率,目前还是比纯代码方案强。
具体来说,剪映有几个扣子替代不了的能力:一是转场和动画,诗词视频常用的淡入淡出、水墨扩散这些效果,剪映里有现成的;二是字幕样式,逐句出现、竖排、书法字体这些,剪映操作起来很快;三是卡点,配合背景音乐的节奏切换画面,剪映的音频波形可视化很好用。
所以我的流程是:扣子把图、音、诗都生成好,打包下载,然后导入剪映做最终合成。
4.2 素材的整理与命名规范
这一步看似简单,但命名规范直接决定剪辑效率。如果素材命名乱七八糟,导入剪映后要一张张找,很浪费时间。
我的命名规范是这样的:
项目名_日期_序号_类型.扩展名 例如: 秋思_20240115_01_图.png 秋思_20240115_02_图.png 秋思_20240115_03_图.png 秋思_20240115_04_图.png 秋思_20240115_配音.mp3 秋思_20240115_诗.txt按序号排列,导入剪映后顺序就是对的,不用手动调整。诗单独存一个txt,方便在剪映里复制粘贴做字幕。
4.3 剪映里的高效合成流程
导入素材后,我的合成流程是这样的:
- 铺音频:先把配音拖到音频轨,这是时间基准。
- 对画面:根据配音的节奏,把4张图依次铺到视频轨,每张图的时长和对应的诗句朗读时长对齐。
- 加字幕:用剪映的文本功能,把诗逐句加上,设置成逐句出现。
- 加转场:图片之间加淡入淡出或水墨转场,不要用太花哨的。
- 配背景音乐:选一首古风纯音乐,音量调到配音的30%左右,不要盖过人声。
- 调色:如果出图色调不统一,用剪映的调节功能统一一下色温和饱和度。
整套流程熟练之后,一条视频的合成时间大概5到8分钟。
4.4 批量生产的模板化思路
如果要批量做,可以把上面这套流程模板化。剪映支持保存草稿模板,你把字幕样式、转场、背景音乐都设置好,下次直接替换图片和音频就行。
更进一步,可以把常用的背景音乐、字幕样式、转场效果整理成一个"素材库",每次做新视频直接从库里调。这样单条视频的制作时间能压缩到3到5分钟。
5. 实测中踩过的坑与优化经验
5.1 出图风格不统一的解决办法
前面提过,出图风格不统一是最常见的问题。我试过几种解决办法:
- 在提示词里强制统一风格词:每段画面描述都加上相同的风格前缀,比如"中国水墨画风格,留白,淡雅"。
- 用同一个随机种子:如果图像生成插件支持固定种子,用同一个种子出图,风格会接近很多。
- 后期统一调色:实在不统一,就在剪映里统一调色,能救回来一部分。
实测下来,第一种方法最有效,成本也最低。
5.2 配音语速和停顿的调整
配音最容易出的问题是语速太快、停顿不自然。诗词朗读需要留白,读太快就没有韵味了。
我的调整方法:一是把语速调到0.8倍速;二是在诗里手动加停顿标记,比如在每句末尾加一个逗号或换行,让模型知道这里要停;三是如果插件支持,调整停顿参数。
还有一个细节:配音和画面的对齐。如果配音是整首读的,你要在剪映里根据音频波形,找到每句诗的起止点,再对齐画面。这个需要一点耐心,但做几条之后就熟练了。
5.3 工作流调试的常见报错
扣子工作流调试时,常见的报错有几类:
| 报错类型 | 常见原因 | 解决办法 |
|---|---|---|
| 变量未定义 | 节点引用了不存在的变量 | 检查变量名拼写,确认上游节点有输出 |
| 类型不匹配 | 传入了错误类型的数据 | 检查变量类型,必要时用转换节点 |
| 插件调用失败 | 插件额度用完或参数错误 | 检查额度,核对参数格式 |
| 输出为空 | 模型没按格式输出 | 优化提示词,加强格式约束 |
调试的时候,善用试运行功能,每个节点单独跑一遍,看输出对不对,再往下接。不要一次性跑整个流程,出错了很难定位。
5.4 成本与效率的平衡
最后说下成本。扣子的插件调用是有额度的,图像生成和语音合成都比较耗额度。如果批量生产,成本要考虑进去。
我的优化思路:一是出图不要贪多,每个画面2张备选就够了,多了浪费;二是配音可以复用,如果做系列视频,同一个音色和语速设置可以一直用;三是先小批量测试,跑通流程、确认质量后,再批量生产。
效率上,一条视频从输入主题到成片,熟练之后大概10到15分钟。如果做系列,可以一次生成多条诗的素材,然后集中剪辑,效率更高。
6. 这套方案还能怎么扩展
跑通基础流程之后,我试过几个扩展方向,效果还不错。
第一个是多风格切换。在开始节点加一个风格选择,用户可以选"水墨""工笔""写意"等,工作流根据选择调用不同的图像风格模型。这样同一个主题能出不同视觉风格的视频。
第二个是系列化生产。比如做"唐诗三百首"系列,可以批量输入诗名,工作流自动生成画面和配音,然后集中剪辑。这种系列内容涨粉比较稳,因为用户有追更预期。
第三个是加入背景知识。在诗生成之后,再加一个节点生成一段简短的赏析或背景介绍,作为视频的结尾或开头。这样内容更有深度,也更容易获得平台的推荐。
第四个是和数字人结合。如果想让视频更有辨识度,可以用数字人出镜朗读,配合诗词画面。这个链路稍微复杂一点,但做出来效果很不一样。
这套方案的核心思路其实可以迁移到很多内容类型上:只要是"文本+图像+音频"的组合,都可以用类似的工作流来提效。关键是把链路拆清楚,每个环节用最合适的工具,然后用工作流把它们串起来。工具会变,但这个"拆解—编排—优化"的思路是不变的。