昨晚畅想并完善了一种之前想过的 Agent 的新形态,核心关键词是“主动”。
第一层主动在于,任何时候 Agent 都在想事情、做事情,包括用户没有与其对话的时候。能想什么做什么呢?比如复盘以前的对话、总结用户使用电脑的规律、自己主动到互联网搜集用户可能感兴趣的信息、推测用户此刻可能在做什么事情需要什么帮助。完全以“数字管家”的身份去做事,不计代价。
这层实际上可以用定时任务和SKILL来模拟,但这样不自由没有灵动感,更像是“程序”,用起来肯定不舒服,维护的代价也大。真正的主动是确定权力和资源边界后的“读心术”。
第二个难控制的是推送/打扰的边界。如果处理得好,应该还是蛮舒服的。在恰当的时间点提供恰当的信息,就不算是打扰了。
第二层主动在UI上,现在的 Agent 需要等用户把提示词打完并发出后再开始思考。但 Agent 是不是可以实时偷看输入框,在用户打字的时候就可以做一些思考和准备工作了。