☰
16项AI新进展:机器人推理、Agent框架与视频生成全解析
2026/9/26 7:51:05 网站建设 项目流程

这周又把各大技术榜单、开源仓库和几个AI社群刷了一遍,值得摊开聊一聊的东西不少。这一轮新进展覆盖面很广,从机器人推理层的思路转变,到Agent框架的底层拆分,再到视频生成工具链的爆发,最后还有一堆和本地部署、微调、AI编程相关的务实更新。我把它们整理成16个进展,按“推理能力—Agent—视频生成—部署与开发工具”四条线串起来,方便你直接挑自己关心的板块读。不管你是刚入门想找学习方向的,还是已经在做Agent开发、视频工程、端侧部署的,这篇速览都能帮你快速建立本周的行业坐标。

先说一个总体的感受:这周的新东西不再是单纯刷榜单、刷参数的阶段了。大家开始认真讨论“推理到底怎么落到真实任务里”,比如机器人该不该先思考再动手、Agent的每一步该怎么记账和回退、视频生成怎么既可控又高速。这种转向,比单纯多几个模型版本更有看点。

1. 推理能力的第一梯队:机器人、视频生成与“世界模型”的交叉

这个话题往深了说是AI最硬核的部分,往浅了说就是一句话——模型不再只是“会聊天”,而是开始理解物理世界的时间、空间和因果关系。这一周,这方向的几个进展尤其值得留意。

1.1 第1项:机器人推理从“模仿动作”转向“先规划后执行”

机器人领域这周讨论最集中的是“慢思考”进决策链路。过去很多机器人方案走端到端模仿学习:输入图像,输出动作,训练完直接动。这套路在小范围场景好用,但换个光照、换个物体摆放就崩,因为模型把“看到什么就做什么”绑定死了,并没有真正理解任务。

这周的新共识是解耦:把“任务规划”和“运动控制”拆成两层。上层用大模型做推理,负责把一个长指令拆成有序子目标,比如“把红色杯子放到托盘上,再把托盘端到厨房”;下层用视觉-语言-动作模型也就是常说的VLA模型,把每个子目标映射成具体的电机动作。一些团队还引入了世界模型模块,在动手前先在内部模拟一遍操作结果,相当于机器人真正“想了想再动手”。

这种分层思路对工程实践的启发很大。如果你在做机器人相关的项目,别指望一个大模型端到端扛住所有事,把意图解析、轨迹规划、低层控制做成可插拔的模块,反而更容易在真机上稳定跑通。这类项目对算力要求很高,仿真环境里验证通过之后再上真机,是当前比较稳妥的路线。

1.2 第2项:视频生成模型开始反哺视觉推理预训练

视频生成本身是个生成任务,但这周更值得关注的是它作为“视觉推理预训练”的价值。生成一段视频,模型必须学会预测帧与帧之间的变化:物体怎么移动、遮挡之后会发生什么、光源变化是否合理。这个过程本质上就是在训练空间因果理解。

已经有团队把视频生成模型当骨干网络,拿去跑目标跟踪、遮挡恢复、场景问答这些下游任务,效果有明显提升。直观类比就是:一个人看大量连续镜头,慢慢掌握了“接下来会发生什么”的直觉,这种直觉迁移到其他视觉任务上同样管用。这也解释了为什么一些视频生成产品看起来“不太像传统生成模型”,反而更像一个通用视觉理解器。

对普通开发者的启示是:别把视频生成只当成“做短视频的工具”,它的推理能力可以被复用。如果你在做视觉Agent或具身智能项目,完全可以借鉴视频生成模型的中间特征层来做场景理解,甚至直接用它做视觉记忆模块,省掉不少标注成本。

1.3 第3项:8B级开源模型把推理成本打到新档位

这周社区里讨论比较多的几款8B左右的开源模型,在代码生成、函数调用、Agent工具选择这些任务上,已经逼近几个月前只有几十B甚至上百B模型才能达到的水平。背后的关键不是参数变大了,而是训练数据变了——大量高质量合成数据配合真实工具调用轨迹,让小模型在“使用工具”这件事上变得非常精准。

这对普通开发者的意义很直接:8B模型可以放进消费级显卡,甚至一些高端笔记本都能全天运行。本地私有化、低延迟、不依赖云服务,这几点在Agent开发里是刚需。一些提供免费额度的API平台,也开始把这类模型作为主力档位供开发者调用。

我自己的测试方法是拿“工具选择准确率”来快速评估:给模型一堆用户指令和一堆工具定义,看它能不能选对工具、填对参数。这个指标比跑全套大而全的评测便宜得多,几分钟就能判断一个8B模型适不适合做你的Agent底座。

1.4 第4项:长上下文的新解法:分段记忆与检索锚点成为标配

大模型厂商还在卷百万token,但真实项目里“把100万字文档直接灌进去”早就被证明不划算:模型容易“迷失在中间”,而且推理成本成倍上涨。这周的新动向是业界开始务实了,流行的方案是“分段工作记忆加检索锚点”。

具体说,就是把长文档切块,按需召回相关内容进入上下文;同时要求模型在输出里嵌入可点击的来源引用,方便用户溯源验证。这其实是把RAG的思路内化到长上下文处理里。对知识库Agent来说,与其迷信长上下文,不如老老实实配一套“先检索后回答”的管线,并设置好召回数量和分数的阈值。

我见过太多项目栽在“我有长上下文就不做检索了”这种偷懒上。实际上,就算上下文窗口再大,模型对隔着十万八千里信息的注意力都会衰减。检索锚点这套组合,短期之内仍是长文本场景最可靠的工程方案。

2. Agent框架的底层变化:harness、执行链、评测与轻量规划

如果说第一板块是“模型怎么变聪明”,那这一板块就是“Agent怎么变得靠谱”。这周Agent圈讨论的已经不是简单的“用大模型调工具”,而是把Agent本身拆开研究——从执行框架、评测机制到任务规划范式,都在快速迭代。

2.1 第5项:harness 与 agent 的区别,终于被社区讲清楚了

“harness和agent区别”是这一周的热搜词,说明不少人在Agent开发里都栽过跟头。简单说,Agent本体是负责决策的那部分,通常是一个大模型加一套提示词策略;而harness是承载决策的外壳,负责上下文维护、工具调用、执行循环、异常重试、结果校验这些脏活。

为什么要分得这么清?因为一旦分开,你就能给harness加各种工程能力——换模型、加权限控制、做审计日志,而决策层完全不用动。反过来,如果你的Agent项目里根本没有harness层,只是把工具调用写死在流程里,那它其实只是一个普通脚本,不是Agent。

我跑开源Agent框架时经常看到报错信息里出现“Agent execution terminated due to error.”,很多新手以为模型崩了,实际上大部分情况是harness的工具调用抛了异常后没被接住,执行循环直接退出。解决办法也很常规:给每个工具调用包一层重试和结果校验逻辑,超时就返回一个结构化错误,让决策层决定下一步怎么走。这条经验写进周报也不夸张。

2.2 第6项:Agent评测从“结果对不对”转向“过程对不对”

以前评测Agent只看最后任务完成没完成,很多项目甚至用字符串匹配来判断成功。但这周社区越来越多人在讨论“过程正确性”——任务虽然完成了,但过程中是不是盲目调用了很多工具?是不是烧了大量token?是不是执行了超过权限边界的操作?这些都要纳入评分。

可以理解为:一个员工把工作做完,但中途乱花钱、乱承诺,公司不可能觉得他靠谱。Agent也是这个道理。过程成本、动作合法性、步骤链条的合理性,正在成为新一代Agent评测的核心维度。

实操上,我们现在跑Agent批量任务时会记录完整trace,把每一步的规划、工具名、参数、返回结果全部存下来,然后用LLM作为评委去打分,对照“任务完成质量”和“过程合理性”两个维度。这个做法门槛不高,但能暴露模型在单任务里不会暴露的坏习惯,建议做Agent开发的朋友尽早把trace体系建起来。

2.3 第7项:pi-agent式递归规划:把长任务拆成可回滚的子任务

“pi agent”这周出现在不少技术群里,不是指某个厂商的产品,而是社区正在流行的一类轻量级Agent范式,核心是递归规划。以前让Agent处理长任务,最常见的做法是让模型一次生成完整计划,然后按部就班执行。问题在于只要中途某个环节偏离预期,整个计划就崩了。

pi-agent的思路是让决策体只负责回答一个简单问题:“在当前位置,下一步做哪件最值得做的事?”每完成一步,重新评估,继续拆下一步。整个过程像写代码时不写一个大函数,而是分解成多个小函数,每步都有明确的输入输出和回滚点。这个“随时能停、能退回去”的特性很关键,因为真实世界中很少有任务能完全按计划推进。

我自己的经验是:给Agent每一步都写清楚“成功后的下一步”和“失败时的回退操作”,效果远好于在系统提示词里堆一大段详细规划。这种“小而多步”的范式尤其适合自动化运维、数据处理流水线这些容易出意外的场景。

2.4 第8项:Agent开发框架的可视化编排,正在吃掉工程化门槛

以前搭一个Agent,至少要会写代码、懂工具调用协议、会管理上下文状态。这周看到很多Agent开发框架开始提供可视化编排能力,把模型调用、工具节点、记忆模块、重试逻辑都做成可拖拽的组件,用户连一条线、填几个参数就能跑通一个Agent流程。Dify、Coze、n8n这些项目都在朝这个方向使劲。

但我得泼一点冷水:可视化编排降低了入门门槛,并没降低设计复杂度。配置图一旦超过二十个节点,数据流混乱程度可能比代码还难查。我的习惯是无论界面上能拖多少节点,新项目一律用三个基础节点起步——输入校验、模型路由、工具沙箱。先把最小闭环跑通,再逐渐加节点。可视化编排适合快速验证想法和交给非技术成员调整,真到生产级复杂链路,代码里的注释和可测试性还是更可靠。

3. 视频生成的新战场:帧生成、工作流与显卡实测

视频生成是大众感知最强的板块。这一周,大家已经不满足于“生成一段视频看看效果”,而是开始思考“怎么高效、可控、低成本地生成符合需求的视频镜头”。新战场明显从“整段生成”转向“帧生成”和“工程化工作流”。

3.1 第9项:视频帧生成成为新的生成主线

这周值得关注的第一个方向是“视频帧生成”,而不是传统的文生视频。帧生成的意思是:用户先决定关键帧的内容,比如首帧、中间几个姿态帧、尾帧,模型负责把帧与帧之间的过渡补齐。这很接近传统动画的做法——原画师画关键张,动画师补中间帧。

帧生成最大的优点是可控性。文生视频一锤子买卖,很难精确控制镜头内容和持续时间;而帧生成允许你在关键环节卡死画面,再让模型填补运动路径。它也更省算力,因为模型不需要从头想象整段视频,只需要根据已有帧做插值。操作上要注意关键帧之间的间隔,我实测4到6帧比较合理:间隔太小,补帧基本是浪费钱;间隔太大,模型容易产出跳变和穿帮。生成后可以用光流差检查帧间一致性,这是比肉眼更快发现问题的方法。

3.2 第10项:ComfyUI工作流爆发:从单图到长镜头

网上把ComfyUI拼成“comuify”之类的词条越来越多,其实说的是同一个东西:节点式AI图像/视频生成工具。它原本在图像生成圈已经很火,这周社区里大量视频生成工作流模板集中爆发,覆盖了“文本—首帧—补帧—输出”的完整链路,也有不少配合ControlNet、局部重绘的高级模板。

如果你还没接触过ComfyUI的视频工作流,我的建议是别一上来就打开几十个节点的大模板,那会让你晕头转向。先从最小工作流开始,加载一个视频生成模型,加一个文本转首帧节点,再接补帧节点,最后输出。跑通之后再逐步加姿势控制、镜头控制这些高级节点。另外一定记得打开慢速预览和帧缓存,这两个功能在显存不够时是救命稻草,能帮你边看边调整,而不是生成到最后才发现问题。

3.3 第11项:免费生成视频的正规入口,这两天又多了几个

“免费生成视频入口”一直是热门搜索词。这周国内外几款视频生成产品又陆续放出了新的体验额度,可灵AI、即梦AI、海螺AI、Vidu、腾讯智影这些平台都有注册赠送积分的机制,海外像Runway、Pika、Luma也保留了基础免费档位。对个人创作者来说,利用这些额度做风格测试和分镜验证完全够用。

我的实践经验是:先用免费入口确定几条备选风格和镜头方案,把分镜脚本写死,再投入额度或者转去本地开源模型做正式生成,这样能省下不少钱。平台会员权益和免费额度变化很快,具体以官方页面为准。值得提醒的是,免费档位通常会限制分辨率、时长和生成次数,别等做到一半才发现额度不够,提前规划好每一版要试的内容很重要。

3.4 第12项:不同显卡的2K视频生成速度实测:显存带宽比想象中还重要

这周很多人开始晒“不同显卡跑2K视频生成”的实测数据,比如有人在MiniMax系视频模型上测了一圈各档次显卡的生成速度。综合我自己做过的测试和大家的分享,结论很一致:2K视频生成真正卡的瓶颈不是算力而是显存带宽和容量。分辨率一上来,模型中间特征图对显存的消耗是指数级增长,显存不够只能走精度回退或者分块生成,速度自然掉得厉害。

测速度时建议大家固定一个统一口径:固定模型、步数、分辨率,记录每帧耗时和峰值显存占用,最后折算成“每生成1秒视频花多少秒”。有了这个指标,不同显卡之间的对比才有意义,而不是只看一个笼统的“快或慢”。如果你主要做视频生成,买卡前先按这个口径跑一遍目标模型,比看跑分更有参考价值。预算有限的话,优先保证显存容量和带宽,而不是单纯追高核心频率。

4. 训练、部署与开发工具的务实升级

最后一组进展对开发者和研究者最实用:从消费级显卡跑微调的底线,到手机App里集成大模型的路径,再到免费API选型和AI编程工具的升级。这里没有特别惊艳的技术突破,但每一条都能省下你大量试错时间。

4.1 第13项:消费级显卡微调的底线:6750 GRE 与 QLoRA 的现实

“rx6750gre训练大模型”能成为热搜词,说明不少朋友手里就是这类消费级显卡,还想折腾本地微调。先说结论:全量微调在消费级显卡上基本不用想,但是QLoRA这条路完全走得通,7B甚至14B级别模型的参数高效微调,16G到24G显存是可以承受的。

用6750 GRE这类AMD显卡时要注意一点:大量训练生态工具如bitsandbytes主要针对NVIDIA的CUDA优化,在AMD上要走ROCm支持,环境配置会多花不少时间。所以我的建议很直白:如果你选择微调这条路,优先用N卡会顺畅很多;如果只有A卡,可以考虑先跑通llama.cpp生态里的训练工具链,或者干脆用小一点的模型试。

第一次做微调,别一上来就上大型真实数据集。挑几十条样本,验证loss能稳定下降、生成结果有变化,整个链路跑通之后再逐步加大数据量。另外记得,微调不一定比提示词工程更划算,50条高质量样本往往就足够把一个模型调出特定风格,先试提示工程再决定要不要微调。

4.2 第14项:GGUF 成为端侧集成大模型的默认姿势

“android app集成ai大模型gguf”这个热搜词很具体,背后其实是一套已经非常成熟的方案。GGUF是llama.cpp生态的标准模型格式,它的特点是把模型量化、版本管理、内存映射这些细节打包好,让端侧集成变成“下载模型文件,加载推理”这么简单。

在Android或iOS上集成大模型,最通用的路径就是通过llama.cpp或MLC-LLM加载GGUF格式的模型。集成时几个常被忽略的细节:一是不要在UI线程跑推理,必须用异步任务队列,否则界面一卡就是十几秒;二是首次加载模型很慢属于正常现象,可以在启动时预加载并保留在内存里;三是尽量使用内存映射加载,避免把模型文件整个拷贝进内存。

端侧模型适合的任务是意图识别、文本摘要、离线对话、关键词抽取这类轻量场景,长文章写作和高难度推理暂时还是交给云端模型更稳。这套方案最大的价值是私有化——数据不出设备,对不少行业场景是硬需求。

4.3 第15项:免费大模型API档位对照,选型别再拍脑袋

现在提供免费或免费额度的开放平台API越来越多,DeepSeek开放平台、智谱GLM、Kimi/Moonshot、阿里百炼、硅基流动,以及海外的Google AI Studio等都有不同程度的免费档。很多人选型只比较“谁便宜”,但在Agent开发里这是很容易踩坑的思路。

我建议至少从四个维度看:上下文长度、限流策略、工具调用或者说function calling的支持度,以及多模态能力。有些API虽然便宜,但上下文窗口偏小,做复杂Agent任务时频繁截断;有些API价格稍高,但工具调用稳定、结构化输出做得好,能省下大量清洗数据的时间。

我还想提醒一点:API选型要按模块来选,而不是整个项目绑定一家。比如对话模块用便宜的模型,工具调用模块用支持稳定、限流宽松的模型,视觉模块单独选多模态模型。这样组合出来,性能和成本往往比单一供应商更理想。

4.4 第16项:AI编程从“补全代码”升级到“重构项目”

AI编程工具这周的进化方向,已经从“猜你下一行代码”升级到“帮你重构整个项目”。PyCharm这类IDE里的AI插件,已经不只是补全,还能生成测试、解释报错、批量改代码结构。OpenCode这类开源AI编辑器也持续热门,把模型接入、上下文管理、多文件修改做进了编辑器本身。

我自己用AI编程最大的体会是,提示词质量决定使用效果。写提示词时要包含四件事:任务背景、约束条件、验收标准和边界案例。比如“帮我重构这段爬虫代码,要求保留原有接口,处理连接超时,并补充单元测试”就比“帮我优化代码”管用得多。另外,别装一堆AI插件,先挑一个用熟,把提示词习惯和代码审查习惯培养起来,再扩展其他工具。

这周的进展里还有一些应用层面的小变化,比如AI辅助专利预检索和科研论文写作工具开始整合到研发工作流里,成了一些研究者日常的辅助环节,工具本身没有特别惊人的新东西,但把“检索—总结—起草—校对”串成一条线,确实能省不少时间。

我自己的排序是:如果这周只能挑一件事上手,我推荐先去试第14项的GGUF端侧集成,或者第11项的免费视频生成额度,这两个都是立刻能玩起来、成本又低的方向。至于学习路径,不需要去囤一堆框架。把一个Agent的执行循环真正跑明白、把一条视频生成工作流完整调通,比翻一百个仓库都有用。下周大概率还会有新东西冒出来,还是老思路:少看榜单,多动手试。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询