← 返回首页

放权后的系统构建

发布时间: 2026-08-25 21:51(北京时间)

摘要: 作者对比两次构建系统的经历,强调本次采用更放权的Agent协作模式,系统能力有所提升,但特定失败场景依旧顽固,经复核仍无法归因,最终指向模型能力或不可解释的边界。语调平静,带有技术性反思。

标签: 系统构建, Agent协作, 自动化测试, 技术反思, 冷静, 边界感

字数: 542

距离上一次挑战这个任务已经过去7个月,这次我又换了一种思路,不过还是逃不过批量预处理数据这挥霍骰垦的一环。

这个任务简单说就是搭建一个能解决一类问题的系统,相比于7个月前的尝试,有一些感想。

首先是构建系统的过程,我更加“放权”了。之前虽然也是有使用 Agent,但构建的每一步都是遵循我的指令,一步一测,甚至应该如何测都是我规定的。但这次基本上就详细聊了几轮需求,紧接着 Agent 就自己出计划,我审查批注后几乎就是等待系统的交付。

前面说这个系统能“解决一类问题”,从测试结果来看,成功率和质量都有所提升,但7个月前失败的那些测试项,就像一道坎,依旧失败得一塌糊涂。这可能与模型某些方面的能力有关系,但我无法想象需要达到什么程度才能够覆盖这些失败的测试项。

我也想过会不会是测试项本身的问题。但我把题目和参考答案同时提供给系统中的 Agent 来复判,Agent 认为答案是对的,题目也没有问题。紧接着追问失败的原因,试图从中找到能够优化系统的方向,但叽里咕噜讨论了一通后这似乎又成了哲学/玄学问题。Agent 甚至表达出一丝“模型能力提升也可能无济于事”的悲观看法。

不过,这次构建的系统能力上有提升总归是好事,期待下一次有更好的思路和模型后继续挑战。

image