☰
同一句提示词,让 Claude Opus 5.5 和 Sonnet 5.5 各自做一期测评视频,结果风格完全不同
2026/10/1 21:21:24 网站建设 项目流程

两部视频都是模型从零开始写代码生成的:画面、界面、配乐、音效,没有用任何素材库。区别只在于用了哪个模型。

工具调用全部都是使用myapi,两个视频共五分钟,算在一起不超过十块钱,词元消耗大概在180k左右

myapi-ai.com

Opus 5.5 版成片

Sonnet 5.5 版成片


一、实验怎么做的

我给两个模型发了一模一样的提示词,放在 Claude Code 里跑,除了问进度和一句”继续”,中间没有给技术上的指导:

我需要你自己完完整整做一期视频,大概2-3分钟,来测评说明 claude-xxx 的能力。 所用到的背景音效、背景音乐、claude界面截图/视频等等全都是你自己画出来

唯一的变量是模型。我的电脑环境也很”不友好”:没装 Python,也没装 ffmpeg。模型得自己发现问题、自己解决。

两个模型都在对话里通过 myapi 调用,后面会讲怎么接入。

二、成片数据对比

Opus 5.5

Sonnet 5.5

时长

2 分 30 秒

2 分 34 秒

场景数

8 个

15 个

旁白

纯字幕,无配音

调用 Windows 系统语音合成配音

视频代码量

约 850 行(渲染 + 配乐 + 时间轴)

约 4360 行(含一个 840 行的演示代码生成器)

附带产出

4 个测试用例文件,真实运行

用生成器拼出的 1990 行 / 约 100KB 单文件网页(未在浏览器实际运行)

外部素材

0

0(配音来自系统 TTS,字体用系统自带字体)

缺少 ffmpeg 时

改用 npm 上的 ffmpeg-static

先装 ffmpeg-static,下载中断后写脚本从国内镜像下载


三、Opus 5.5:先验证,再下结论

Opus 的片子给我最深的印象是“每句话都有出处”。

它没有直接去画画面,而是先自己出题、自己跑:

  1. 写了一个故意藏着两个 bug 的 LRU 缓存和 6 个测试用例,真实运行结果是 3⁄6 通过;

  2. 修复后再跑,变成 6⁄6 通过。视频里终端上显示的 PASS / FAIL,就是这次运行的原始输出;

  3. 逻辑推理题(经典的”三个箱子标签全错”)给出答案后,它又写了一段程序穷举所有情况,确认只有从”混合”箱摸这一种解法。

更有意思的是”智能体工作流”这一节。它没有编一个示例,而是把制作这期视频的真实过程做进了片子:发现没有 Python → 发现没有 ffmpeg → 改用 Node.js 工具链 → 写题 → 跑测试 → 合成音频 → 逐帧渲染。

片子开头它就说明”不引用未经核实的跑分”,结尾还加了一段”局限”:题目少、是自己出的、不等于标准基准,关键代码仍需人工审查。

一句话总结:像一位严谨的工程师写的技术报告。 篇幅克制,但每个数字都能追溯。


四、Sonnet 5.5:像一场产品发布会

Sonnet 的片子是完全不同的路线:节奏快、信息密、观感更”成品”。

  • 15 个场景,覆盖代码生成、长上下文、工具调用、视觉理解、速度、价格、适用人群;

  • 主动调用系统自带的语音合成做了全程配音:它找到了三个中文音色(慧慧、瑶瑶、康康),各合成了一句样音,最后用了康康(模型本身听不到声音,谈不上”试听”);

  • 代码生成那一节,画面上”实时书写”的确实是一份真实存在的文件,但它不是一次写成的:模型先写了一个 162 行的小应用,发现和旁白里预设的行数对不上,就另写了一个生成器,用数据表拼出了一个 1990 行、约 100KB 的看板页面,再回头改旁白里的数字。这个页面没有在浏览器里跑过,里面 9 个”图表”函数其实是同一套折线图模板,所以”一次成型、无需返工”的说法是没有验证过的;

  • 发现没有 ffmpeg,它先试了 npm 上的 ffmpeg-static,下载中断后,写脚本从国内镜像把 ffmpeg 下了下来;

  • 每个场景都抽帧检查过,修掉了中文字体显示成方块、元素重叠、代码溢出窗口这几类问题。

一句话总结:像一支执行力很强的内容团队做的宣传片。 观感更接近成品,但片中的数据要先换成真实数据才能发布(见第五节)。


五、一个我必须说明的细节

做对比时我翻了两个模型的工程目录,发现了一个差别:

  • Opus 把”真实性”放在第一位,宁可片子短一点、场景少一点,也不写一个没验证过的数字;

  • Sonnet 把”完成度”放在第一位,会主动把一期测评该有的板块都补齐。

这也是给大家的一个实用提醒:无论用哪个模型生成内容,涉及数据和事实的部分都要自己核实。


六、我该选哪个?

场景

更推荐

排查复杂 bug、改核心代码、需要可追溯结论

Opus 5.5

长链路智能体任务,中途容易遇到意外情况

Opus 5.5

批量写代码、快速出原型

Sonnet 5.5

内容生产、需要成品感和速度

Sonnet 5.5

成本敏感、调用量大

Sonnet 5.5

我自己的用法是:Sonnet 打底干活,Opus 负责把关和攻坚。 两个模型在同一个接口里切换,只需要改一个模型名。


写在最后

同一句话、同一台电脑、同样的”缺工具”环境,两个模型交出了两份风格截然不同的作品(Sonnet 那一场的收尾阶段切到了 Opus,见第一节)。

与其看别人贴的跑分,不如自己用同一个任务去试一试。你会很直观地感受到:Opus 更像一位审慎的资深工程师,Sonnet 更像一位高产的全能执行者。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询