AI个人助理能否让人愿意付订阅费,或许不在于一次性完成最惊艳的任务,而在于能否接手日常的例行工作。邮件分拣、日程安排和文书手续会反复出现,而订行程并不是每天都有的事。更难的考验在于:助理能否可靠地处理这些琐事,同时知道何时该停下来征求许可。

考察任务,而不是功能清单

AssistantBench通过一次性请求来评估助理:用户只说明目标,不逐步引导工具完成每个步骤。任务包括预订飞往指定城市的航班,以及在某个具体地点五个街区内寻找素食餐厅。评估考察助理是否完成任务、响应速度如何,以及在请求缺少信息时是否会追问澄清。性能在16个维度上进行比较。

这种方法之所以重要,是因为看似合理的回复并不等于把事情办完。不符合距离要求的餐厅推荐并没有满足请求。没有厘清重要歧义就贸然推进的订票助理,制造的工作可能比省下的还多。

该基准的开发者已收录122款助理产品,其中包括64款面向大众的通用消费级助理,并亲自测试了其中26款。这些数字反映的是收录范围和实测范围,并不意味着有哪一款产品能完成所有家务类任务。

为什么反复出现的琐事更重要

旅行规划之所以吸引眼球,是因为订机票的场景容易想象,也能带来令人印象深刻的演示。但大多数人订机票的频率,还不足以让它成为每天打开助理的理由。旅行或许更适合作为接入更通用工具的一项专门能力,不过这仍只是对市场走向的一种判断。

收拾好的行李箱和简单的机票,与正在分拣的邮件、文件夹和日历纸形成对比

▲ 偶尔的旅行与重复的琐事

来自七八个群组、合计超过1,200名智能体深度用户和开发者的反馈显示,日常事务处理,即清理邮件、整理文档和填写表单,位居实际用途之首。其次是协调多个智能体,再次是软件和设计修改。旅行在讨论最多的话题中排第四。这些群组偏向技术型用户,因此不应把他们的优先事项误当作针对全体消费者的调查结果。

一次30分钟的骑车通勤,体现了用语音处理例行工作的吸引力。一位用户借助连接了Gmail和Google Calendar的ChatGPT Voice,分拣未读邮件、添加标签并发送日历邀请,到达时收件箱已经清空。这只是个人经历,并不能证明所有用户或助理都能取得同样的结果。其意义在于,任务得以完成,而且是在用户远离办公桌的时间里完成的。

有用的主动性需要一个停止点

被动型助理等待指令。智能体则在用户委托目标后会主动采取一些行动。这种主动性可以是监测已预订航班是否降价并争取可用的旅行抵用金,也可以是核查一整年的医疗收据,准备并提交健康储蓄账户(HSA)报销申请。其潜在价值在于减少反复查看和文书工作,而不是承诺带来财务回报。

草稿卡片沿一条通道前进,而一份密封的财务文件停在等待的手前

▲ 重大操作前的批准

许可的边界随行动后果而变化。起草邮件或找出可能节省保险费用的机会,可以在后台进行。发送无法撤回的消息、转移资金或变更保险保障,则需要用户明确批准。发现更便宜保单的助理应当把它作为选项呈现出来,而不是未经授权直接更换。

这一区分也为购买者判断可靠性提供了依据。仅仅完成任务还不够:助理必须提出有用的追问,在重大变更前给出选项,并尊重用户保留给自己决定的操作。主动性可能让一项服务更有价值,但一次未经授权的高风险操作就可能迅速葬送这份信任。

价格能说明什么,不能说明什么

尽管存在免费助理,收录的产品中付费方案已经相当普遍。所跟踪的产品构成如下:

定价模式 产品数
完全付费 35
有使用上限的免费增值 30
完全免费 13

付费和免费增值两类合计占122款跟踪产品中的65款。这说明了采用这些模式的产品数量,却不能说明用户认为它们值得付费。成本同样重要。据估算,在高使用量下,基于浏览器的复杂智能体任务运营成本约为每位活跃用户每天$20。这一估算并不是所有助理的成本,而执行成本将会下降的预期,也不能决定当下的经济账。

付费前的实用测试

先从一项你真心愿意交出去的重复性任务开始。用一次请求向助理交代完整目标,然后检查它是否完成任务、是否追问缺失的条件,以及是否清楚记录了自己做过什么。对于邮件或日程安排,要把草稿和拟议的日历变更,与你授权它发送的消息或邀请区分开来。对于涉及财务的事务,要在资金转出或账户变更之前设置审批环节。

付费助理最有力的理由,是可靠地把人从每周都会回来的工作中解放出来。一次成功的旅行预订可以展示能力,但反复把事务性工作办好,并在风险升高时懂得克制,才是判断这项服务是否值得纳入日常的更有用标准。