大模型的“基准测试”比的是模型能力。基准测试的过程我简单理解成固定输入,评价最终输出。
但实际使用中,每个人的需求和目标是不一样的。面对特定需求,模型的选择、Agent框架的选择、每轮的提示词也都不一样。更别说还有 Agent 的配置和记忆的影响。
所以我也蛮好奇大家是“怎么用”Agent 的。看到别人发的截图,会想对方这么问是在做什么事情,Agent 这么答是做了哪些努力,这一问一答间有没有隐含了什么信息。从中去学习大家使用 Agent 的技巧和思路。
这和“如何提问”“如何解决问题”一定程度上是有密切关系的。
我想象中的一个平台是这样的,平台搜集了许多脱敏的“实际问题”,搭配好必备的原材料。用户可以选择一个“实际问题”,选择自己喜欢的 Agent 与模型,然后开始解决这个问题,直到自己满意为止。平台记录“代价”作为分数,比方说总耗时、总成本、骰垦消耗和轮数等等。
等许多用户都挑战过此任务后就能看到某种排名。比方说想看看谁最快、谁最省钱以及谁的轮数最少。然后点进去看看对方的提示词与 Agent 的输出是怎样的。
这个平台有点像 Leetcode 的变体。只是右侧提交代码的地方变成了 Agent 的对话框?不过想来运营这样一个平台是挺烧钱的。