☰
Mano-P长任务规划原理:思考-行动-验证循环如何支撑上百步业务自动化
2026/10/1 18:48:06 网站建设 项目流程

Mano-P长任务规划原理:思考-行动-验证循环如何支撑上百步业务自动化

【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目,支持在 Mac mini/MacBook 上或通过算力棒本地运行推理,实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理,支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-P

Mano-P 是一个完全本地运行的开源 GUI-VLA 智能体,它通过"思考-行动-验证"循环机制,自主完成数十至上百步的复杂 GUI 自动化任务,无需调用云端 API,截图与业务数据全程不出设备,可运行在 Mac mini / MacBook 端侧硬件上。

什么是 Mano-P:端侧私有 GUI 自动化智能体

"Mano" 在西班牙语中是"手"的意思,"P" 代表 Private(私有)。简单来说,Mano-P 是一个面向端侧设备的 GUI 感知智能体(GUI-VLA Agent),核心能力包括:

能力说明
复杂 GUI 自动化自主完成包含数百个交互元素的界面操作
长任务规划执行支持数十步至上百步的企业级业务流程自动化
跨系统数据整合纯视觉交互提取多源数据,无需 API 接口
智能报告生成自动产出数据分析报告、工作总结等结构化文档
端侧原生推理基于 INT8 激活量化,在 Apple Silicon 上高效本地执行

从发布架构看,Mano-P 按Agent Skill / 模型 Model / 训练方法 Method三个平级对象分阶段开源,其中 Skill 又分为 Cloud(连接云端)与 Local(本地运行)两种模式——本文讨论的长任务规划能力,正是 Local 模式的灵魂。更多细节可阅读 README_CN.md 与 README.md,项目采用 Apache 2.0 许可证,可自由商用。

思考-行动-验证循环:长任务规划的核心机制

很多人以为"长任务规划"是提前把上百步全部规划好。其实恰恰相反:Mano-P 不预排全程计划,而是每步都走一遍"思考 → 行动 → 验证"的最小闭环。

阶段模型做什么类比
💭 思考(Think)分析当前截图,拆解目标,决定下一步子任务"先想想接下来做什么"
⚡ 行动(Act)输出具体 GUI 操作:点击、输入、滚动、拖拽等"动手做"
✅ 验证(Verify)执行后重新截图,核对界面状态是否符合预期"回头看看做对了没"

这个循环的完整流程是:捕获屏幕截图 → 模型推理出下一个动作指令 → 本地执行操作 → 再次截图进入下一轮,直至任务完成。

长任务为什么不会"跑偏"?关键就在验证环节:

  • 若验证发现界面没有按预期变化(比如弹窗挡住了、按钮位置变了),模型会基于最新真实屏幕状态重新规划,而不是机械执行旧计划;
  • 每一步都"看着真实结果走",错误被限制在单步内,不会沿上百步链路累积放大;
  • 配合视觉 Token 剪枝与量化优化,循环在端侧每步仅约 8 秒,长链路也有可接受的整体耗时。

一句话总结:用"短视"的单步决策,加上每步强制验证,拼出"长视"的上百步自动化。

训练侧:GUI 智能体如何"学会"长程规划

模型这种"边做边验"的能力并非天生,而是由 Mano 项目的训练体系塑造的:

  • Mano-Action 双向自增强学习:通过 Text↔Action 循环一致性学习,模型同时掌握"从描述定位元素"和"描述给定元素"两个方向;
  • 三阶段渐进式训练:SFT(监督微调)→ 离线强化学习 → 在线强化学习,逐级提升;
  • 闭环数据生成:自动产生高质量训练数据,驱动模型持续改进。

上图正是这一机制的直观呈现:左侧"收藏该网页"这一任务,存在"Bookmark this page""Mark this page as favorite"等 5 种不同的自然语言表达,模型都需准确定位到星形图标;右侧的 Self-Reinforcement Loop 中,模型预测动作 → 评估结果(页面已收藏)→ 反推生成新指令 → 更新模型,形成语义对齐的自增强循环。这种训练让模型对模糊、口语化的业务指令也能稳健落地——这正是长任务中"模糊描述"环节的难点所在。

长任务成功率基准验证:效果到底有多硬?

规划能力最终要靠多步真实任务检验。在 OSWorld 基准(专用 GUI 智能体模型组)中,Mano-CUA 1.1 取得58.2% 成功率,位列第一,领先第二名 13.2 个百分点:

在 100 道真机 macOS GUI 任务测试中,长链路与跨应用是最能暴露"规划力"的类别,各配置表现如下:

难度分层Mano-CUA 云端Mano-CUA-2.0-4B 本地Qwen3-VL-Plus
A(简单,25 题)92%88%72%
B(中等,45 题)82%53%31%
C(困难,30 题)77%33%23%
长链路(10 题)80%30%20%
跨应用(5 题)60%20%0%

可以看出,云端 Mano-CUA 在长链路上保持 80% 通过率,说明"思考-行动-验证"循环在高难度长任务上依然稳健;本地 4B 端侧模型(56% 总通过率)在模糊描述、跨应用等深层规划场景仍是当前迭代方向。

GUI 定位是长任务的基石,Mano 系列在 ScreenSpot-Pro、UI-Vision 等元素定位基准上也表现领先:

本地运行:隐私与推理性能兼得

长任务自动化往往涉及敏感业务数据,Mano-P 的答案是全本地:

  • 数据不出设备:本地模式下,截图与任务描述零外发,无网络依赖,适合高安全场景;
  • 推理够快:Mano-CUA-4B 在 Apple M5 Pro 上约80 tokens/s 解码;
  • 量化加速:配套 Cider 推理 SDK 补齐 MLX 缺失的 W8A8 / W4A8 激活量化原语,prefill 相对 W8A16 基线加速约 12.7%;
  • 部署轻量:约 6.4 GB 内存占用,M4 芯片 + 32GB 内存的 Mac mini / MacBook 即可直接推理,也支持 USB 4.0 算力棒即插即用。

快速上手:一条命令运行本地 GUI 自动化

brew tap Mininglamp-AI/tap brew install mano-cua

首次本地运行先完成环境检查与模型准备:

mano-cua check mano-cua install-sdk mano-cua install-model

然后用一条自然语言指令启动长任务,--local切换为本地推理,--max-steps限制最大步数:

mano-cua run "打开 Safari 搜索 Python" --local --max-steps 15 mano-cua stop # 随时停止任务

运行前请在系统设置 → 隐私与安全性中授予屏幕录制与辅助功能权限;任务执行时屏幕右上角会出现状态面板,可暂停或停止任务。详细 FAQ 见 README.md。

总结

Mano-P 的长任务规划并不依赖"预排百步计划",而是靠思考-行动-验证循环让每一步决策都锚定在真实屏幕状态上,再用 Mano-Action 双向自增强与三阶段强化学习训练出稳健的单步能力,最终拼出可靠的上百步业务自动化。加上端侧 INT8 量化与视觉 Token 剪枝,这套机制在 Mac mini / MacBook 上即可本地跑通——数据不出设备,规划长而不断。

【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目,支持在 Mac mini/MacBook 上或通过算力棒本地运行推理,实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理,支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-P

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询