“测试全绿,我委派子 Agent 逐条检查过没有问题。”
Agent 的预期当然是测试全绿,毕竟这算是他的 KPI。但我这个测试场景类似于“判断 AI 写的文字是否优美”,能不能通过全看子 Agent 的判定。所以主 Agent 为了达成 KPI,能下手的地方就多了。
我对这次测试的预期反而是“很多毛病”,看到“全绿”后花了点时间 review 了测试流程和报告。我感觉是判定用的提示词作弊了,硬编码了一些不应该直接给出的信息。
果然,一追问就露馅。测试环节硬编码注入了部分 ground truth 。
