Midscene.js 路线图一文看懂:v1.12 之后 3 个变化值得提前关注
2026/9/12 23:46:32 网站建设 项目流程

Midscene.js 路线图一文看懂:v1.12 之后 3 个变化值得提前关注

【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene

Midscene.js 是一个视觉驱动的 E2E 测试工具:用自然语言描述操作与断言,由 AI 看截图驱动页面。本文基于当前 v1.12.5 仓库中的真实代码与文档线索,解读它未来 1-2 个版本的重点方向,以及你可以提前做什么。

先看清它现在站在哪

当前版本的主体是三层能力:GUI Agent(aiAct/aiAssert/aiQuery等视觉操作与断言,覆盖 Web、Android、iOS、HarmonyOS 和桌面)、交互式 HTML 报告,以及 Playground/Studio 这类可视化调试工具。

对判断未来方向最有用的两个事实:v1.12 正式推出了@midscene/test(Beta),且官方更新日志明确写着它将"逐步替代旧版 YAML 自动化方案";v1.10 已下线全部 MCP server 包。新方案上线、旧方案宣布退役——这两个信号基本框定了接下来 1-2 个版本的主轴。

接下来要解决的几个真问题

用例怎么写才能长期维护

现状痛点:自然语言指令混在 TypeScript 脚本里,时间一长难读难改;而旧版 YAML 方案在生命周期管理、并发、数据准备等工程化能力上有限。

仓库线索:packages/test/src下已经是一套完整结构——cliengineparsernodereport各司其职,配套的 Midscene Test 概览文档 提出了"声明式语义与确定性工程并重"的设计:业务测试人员写 YAML 用例,平台工程师写 TypeScript 自定义 Node,框架还会把注册的 Node 自动编译成 Markdown 说明书,供人和 AI Agent 共同阅读维护。

落地后的影响:等它从 Beta 稳定,你的项目结构会变得清晰——写用例的、写框架的、AI 生成的脚本各走各的通道,互不污染。如果你在用旧版 YAML 方案,建议现在开始用新框架重写少量用例试水:

- aiAct: 在订单详情页发起退款申请 - aiAssert: 页面显示"退款申请已提交" - order.cleanup: # 自定义 TypeScript Node status: refunded

每次执行的成本与耗时要可度量

现状痛点:视觉类测试一次执行要调多次模型,慢且花钱。哪一步慢、哪一步烧钱,不量化的话无从优化。

仓库线索:packages/core/src/agent/task-cache.ts 负责规划和元素定位两级缓存,缓存失效会自动回退到模型规划并清掉失效条目——这是"同一用例第二次跑更快更便宜"的底层机制;v1.12 的报告侧边栏已加入总耗时与模型调用耗时,Markdown 报告按模型汇总 Token 用量。

落地后的影响:预计后续版本会把这类统计做得更细。对使用者的直接好处是:报告能直接告诉你哪个 AI 步骤耗时最长、花了多少,优化有据可依。

失败了要能回答"为什么失败"

现状痛点:视觉断言失败时往往只留下一张截图,到底是元素变了、文案变了还是模型判断失误,靠人肉重放排查很贵。

仓库线索:packages/core/src/agent/insight.ts 中的 Insight 类支持对"固定 UI 上下文"(历史截图)执行只读的 AI 查询与判断——也就是说,诊断不再只能对实时屏幕做,可以对已发生的失败画面追问;报告本身又完整记录了每一步的模型决策过程。

落地后的影响:推测后续会把"失败原因分析"进一步产品化进报告。到那时,打开失败报告就能直接看到每一步的输入、输出、耗时和 AI 的判断依据,排查从"猜"变成"查"。

截图数据要能留在企业内网

现状痛点:官方文档(数据隐私)明确说明截图会直接发往你配置的模型服务商,含敏感信息的界面走公网 API 在很多企业合规上过不了关。

仓库线索:packages/core/src/ai-model目录下是独立的模型适配层,已注册 Qwen、GLM、UI-TARS、Doubao 等数十种模型,其中包含可自托管的开源视觉模型;官方模型文档也给出了"结合规划模型与视觉模型、按需选择"的组合策略。

落地后的影响:不需要等项目做什么新东西——"自托管开源模型 + 自建扩展"这条链路当前已经具备。有隐私要求的团队可以现在就评估把模型换成自托管版本,作为私有化部署的提前准备。

落地节奏与验证信号

这个项目不发布长期路线图,但从版本节奏看规律很清晰:v1.9 主打 Benchmark 与 YAML 自动化,v1.10 引入 Gherkin 并下线 MCP,v1.12 推出 Test 框架 Beta。它的路径是:新能力先进 Beta 跑,旧方案在后续版本宣布退役。结合上面四条线索,可以这样预判推进节奏:

节奏标志性交付物如何验证它已落地
近期(1-2 个版本)@midscene/test稳定并取代旧版 YAML 运行器更新日志去掉 Beta 标注,旧方案文档标记为 deprecated
中期缓存、耗时统计覆盖更多平台,报告诊断能力产品化报告页直接呈现失败原因分析,文档新增可观测性章节
远期自托管开源模型的完整私有化方案文档出现端到端的内网部署示例

两个可执行的动作:订阅仓库的 releases,每次大版本读一遍 更新日志;如果你正在用旧版 YAML 方案,现在就抽一两个用例按 Midscene Test 文档重写试水。规划可能随开发进度调整。

【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询