距离上一次挑战这个任务已经过去7个月,这次我又换了一种思路,不过还是逃不过批量预处理数据这挥霍骰垦的一环。
这个任务简单说就是搭建一个能解决一类问题的系统,相比于7个月前的尝试,有一些感想。
首先是构建系统的过程,我更加“放权”了。之前虽然也是有使用 Agent,但构建的每一步都是遵循我的指令,一步一测,甚至应该如何测都是我规定的。但这次基本上就详细聊了几轮需求,紧接着 Agent 就自己出计划,我审查批注后几乎就是等待系统的交付。
前面说这个系统能“解决一类问题”,从测试结果来看,成功率和质量都有所提升,但7个月前失败的那些测试项,就像一道坎,依旧失败得一塌糊涂。这可能与模型某些方面的能力有关系,但我无法想象需要达到什么程度才能够覆盖这些失败的测试项。
我也想过会不会是测试项本身的问题。但我把题目和参考答案同时提供给系统中的 Agent 来复判,Agent 认为答案是对的,题目也没有问题。紧接着追问失败的原因,试图从中找到能够优化系统的方向,但叽里咕噜讨论了一通后这似乎又成了哲学/玄学问题。Agent 甚至表达出一丝“模型能力提升也可能无济于事”的悲观看法。
不过,这次构建的系统能力上有提升总归是好事,期待下一次有更好的思路和模型后继续挑战。
