← 返回首页

Agent基准测试新思路

发布时间: 2026-09-04 10:28(北京时间)

摘要: 作者质疑固定输入的模型基准测试,提出众包式Agent评测平台构想:用脱敏实际问题,让用户自选模型与框架,按耗时、成本、token和轮数计分排名,并观察提示词与输出。语调冷静、好奇,偏产品思辨。

标签: 基准测试, 智能体使用, 评估机制, 众包平台, 成本度量, 提示词, 产品构想, 理性分析, 冷静, 好奇

字数: 535

原文链接: /7402396589/Rgwf6vuKH

大模型的“基准测试”比的是模型能力。基准测试的过程我简单理解成固定输入,评价最终输出。

但实际使用中,每个人的需求和目标是不一样的。面对特定需求,模型的选择、Agent框架的选择、每轮的提示词也都不一样。更别说还有 Agent 的配置和记忆的影响。

所以我也蛮好奇大家是“怎么用”Agent 的。看到别人发的截图,会想对方这么问是在做什么事情,Agent 这么答是做了哪些努力,这一问一答间有没有隐含了什么信息。从中去学习大家使用 Agent 的技巧和思路。

这和“如何提问”“如何解决问题”一定程度上是有密切关系的。

我想象中的一个平台是这样的,平台搜集了许多脱敏的“实际问题”,搭配好必备的原材料。用户可以选择一个“实际问题”,选择自己喜欢的 Agent 与模型,然后开始解决这个问题,直到自己满意为止。平台记录“代价”作为分数,比方说总耗时、总成本、骰垦消耗和轮数等等。

等许多用户都挑战过此任务后就能看到某种排名。比方说想看看谁最快、谁最省钱以及谁的轮数最少。然后点进去看看对方的提示词与 Agent 的输出是怎样的。

这个平台有点像 Leetcode 的变体。只是右侧提交代码的地方变成了 Agent 的对话框?不过想来运营这样一个平台是挺烧钱的。