会跑、会调了,但它会不会"修了 A 又把 B 改坏"?
到 17 篇,这个 Agent 已经从一个print长成一支"规划—执行—复核"小队:能查行情、能记忆、能装护栏、能灰度换版本。这样一个小队在产线上干了很久,某天一个很会的 RE 说:“我把 planer 的 prompt 改得更聪明了,直接上线吧?”
你怎么办?冒冒失失地让新版替换旧版——旧版会不会在用户没注意的角落里偷偷坏掉?A 改好了,B 呢?对会"不断变"(模型、prompt、温度、任务)的 Agent,"用一次手工试出一坨就上线"是危险的——上次改 prompt 可能让 B 的场景丢掉了。
这个问题,成熟工程靠的不是"我试过了感觉行",而是评估与回归(eval & regression):
- 提前准备一组"标准考题"(golden cases)+ 明确的"通过标准"(pass criteria);
- 每次改 Agent,那它过一遍全部考题,看它有没有把重要行为改坏;
- 用一个可控、可对标的自动评测,回填成一条"安全边界"——只要评测绿了才让它上产线。
难题是:LLM 不像测试代码那样有"唯一正确输出"。你需要定义’回答问题要好到什么程度’:它有没有带出关键事实?结构对不对?够不够相关?这些都能用规则 + 打分来客观判定。这一篇就做一个能让"自动改版的 Agent 换新版"先把关口把