两部视频都是模型从零开始写代码生成的:画面、界面、配乐、音效,没有用任何素材库。区别只在于用了哪个模型。
工具调用全部都是使用myapi,两个视频共五分钟,算在一起不超过十块钱,词元消耗大概在180k左右
myapi-ai.comOpus 5.5 版成片
Sonnet 5.5 版成片
一、实验怎么做的
我给两个模型发了一模一样的提示词,放在 Claude Code 里跑,除了问进度和一句”继续”,中间没有给技术上的指导:
我需要你自己完完整整做一期视频,大概2-3分钟,来测评说明 claude-xxx 的能力。 所用到的背景音效、背景音乐、claude界面截图/视频等等全都是你自己画出来
唯一的变量是模型。我的电脑环境也很”不友好”:没装 Python,也没装 ffmpeg。模型得自己发现问题、自己解决。
两个模型都在对话里通过 myapi 调用,后面会讲怎么接入。
二、成片数据对比
Opus 5.5 | Sonnet 5.5 | |
|---|---|---|
时长 | 2 分 30 秒 | 2 分 34 秒 |
场景数 | 8 个 | 15 个 |
旁白 | 纯字幕,无配音 | 调用 Windows 系统语音合成配音 |
视频代码量 | 约 850 行(渲染 + 配乐 + 时间轴) | 约 4360 行(含一个 840 行的演示代码生成器) |
附带产出 | 4 个测试用例文件,真实运行 | 用生成器拼出的 1990 行 / 约 100KB 单文件网页(未在浏览器实际运行) |
外部素材 | 0 | 0(配音来自系统 TTS,字体用系统自带字体) |
缺少 ffmpeg 时 | 改用 npm 上的 ffmpeg-static | 先装 ffmpeg-static,下载中断后写脚本从国内镜像下载 |
三、Opus 5.5:先验证,再下结论
Opus 的片子给我最深的印象是“每句话都有出处”。
它没有直接去画画面,而是先自己出题、自己跑:
写了一个故意藏着两个 bug 的 LRU 缓存和 6 个测试用例,真实运行结果是 3⁄6 通过;
修复后再跑,变成 6⁄6 通过。视频里终端上显示的 PASS / FAIL,就是这次运行的原始输出;
逻辑推理题(经典的”三个箱子标签全错”)给出答案后,它又写了一段程序穷举所有情况,确认只有从”混合”箱摸这一种解法。
更有意思的是”智能体工作流”这一节。它没有编一个示例,而是把制作这期视频的真实过程做进了片子:发现没有 Python → 发现没有 ffmpeg → 改用 Node.js 工具链 → 写题 → 跑测试 → 合成音频 → 逐帧渲染。
片子开头它就说明”不引用未经核实的跑分”,结尾还加了一段”局限”:题目少、是自己出的、不等于标准基准,关键代码仍需人工审查。
一句话总结:像一位严谨的工程师写的技术报告。 篇幅克制,但每个数字都能追溯。
四、Sonnet 5.5:像一场产品发布会
Sonnet 的片子是完全不同的路线:节奏快、信息密、观感更”成品”。
15 个场景,覆盖代码生成、长上下文、工具调用、视觉理解、速度、价格、适用人群;
主动调用系统自带的语音合成做了全程配音:它找到了三个中文音色(慧慧、瑶瑶、康康),各合成了一句样音,最后用了康康(模型本身听不到声音,谈不上”试听”);
代码生成那一节,画面上”实时书写”的确实是一份真实存在的文件,但它不是一次写成的:模型先写了一个 162 行的小应用,发现和旁白里预设的行数对不上,就另写了一个生成器,用数据表拼出了一个 1990 行、约 100KB 的看板页面,再回头改旁白里的数字。这个页面没有在浏览器里跑过,里面 9 个”图表”函数其实是同一套折线图模板,所以”一次成型、无需返工”的说法是没有验证过的;
发现没有 ffmpeg,它先试了 npm 上的 ffmpeg-static,下载中断后,写脚本从国内镜像把 ffmpeg 下了下来;
每个场景都抽帧检查过,修掉了中文字体显示成方块、元素重叠、代码溢出窗口这几类问题。
一句话总结:像一支执行力很强的内容团队做的宣传片。 观感更接近成品,但片中的数据要先换成真实数据才能发布(见第五节)。
五、一个我必须说明的细节
做对比时我翻了两个模型的工程目录,发现了一个差别:
Opus 把”真实性”放在第一位,宁可片子短一点、场景少一点,也不写一个没验证过的数字;
Sonnet 把”完成度”放在第一位,会主动把一期测评该有的板块都补齐。
这也是给大家的一个实用提醒:无论用哪个模型生成内容,涉及数据和事实的部分都要自己核实。
六、我该选哪个?
场景 | 更推荐 |
|---|---|
排查复杂 bug、改核心代码、需要可追溯结论 | Opus 5.5 |
长链路智能体任务,中途容易遇到意外情况 | Opus 5.5 |
批量写代码、快速出原型 | Sonnet 5.5 |
内容生产、需要成品感和速度 | Sonnet 5.5 |
成本敏感、调用量大 | Sonnet 5.5 |
我自己的用法是:Sonnet 打底干活,Opus 负责把关和攻坚。 两个模型在同一个接口里切换,只需要改一个模型名。
写在最后
同一句话、同一台电脑、同样的”缺工具”环境,两个模型交出了两份风格截然不同的作品(Sonnet 那一场的收尾阶段切到了 Opus,见第一节)。
与其看别人贴的跑分,不如自己用同一个任务去试一试。你会很直观地感受到:Opus 更像一位审慎的资深工程师,Sonnet 更像一位高产的全能执行者。