当任务是做判断而不是写文章或写代码时,Jev可以降低Claude Code工作流的成本。在一项包含12个任务的测试中,由Jev在多个模型之间做选择,与把所有任务都交给Claude Opus 5.5相比,API成本降低了36.9%。在另一个潜在客户开发工作流中,Jev以2.35美分的成本为1,000家企业打分。不过,这两个数字都不代表这些判断前后所有环节的成本。

Jev返回的是结构化答案:对是非题给出概率、从给定列表中选出一项,或给出一个数值评分。它不会撰写营销文案,也不会生成代码。正因为有这种区别,Jev与Claude Code配合使用时很有价值,Claude Code可以在Jev做出选择后调度其他模型和工具。

把任务交给合适的模型

模型路由器会在任务运行之前决定由哪个模型来处理。在这项12个任务的测试中,Jev在Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 5.5和Fable 5.1之间进行选择。任务从简单的计算和文本整理,到调试和规划一个3D交互式地图,难度不一。Jev把其中11个任务分配给了更便宜的模型,只把复杂的地图规划任务留给了Claude Opus 5.5。

12个任务的处理方式 API成本
所有任务都交给Claude Opus 5.5 $0.31827
由Jev分配任务 $0.20079

两者相差$0.11748,相当于全部使用Opus时成本的36.9%。这一结果取决于这组特定任务的构成,以及Jev把其中大部分分配给了更便宜的模型。它并不是在所有Claude Code项目中测得的节省幅度。

简单任务的图块流向小型计算模块,设计任务的图块则流向更大的模块

▲ 按复杂度分配任务

Jev还负责从一个文件夹中选择预先编写好的智能体流程,即所谓的技能(skill)。在8条提示词中,Jev和Claude Opus都8次选中了预期的技能。Jev完成这组测试用时1.83秒,Opus则用时19.53秒。这衡量的是选择速度以及这8次选择是否一致,而不是被选中的技能随后产出的工作质量。

从价格可以看出为什么范围狭窄的判断成本很低。在OpenRouter上,Jev的标价约为每百万输入token $0.042,输出token为$0。Claude Haiku 4.5的标价为每百万输入token $1、每百万输出token $5。这些是模型价格,而不是整个工作流的成本:Jev选中的模型仍然需要完成所要求的工作。

2.35美分的潜在客户评分包含什么

潜在客户工作流的第一步是数据采集,而不是Jev。Apify的Google Maps抓取工具采集了温哥华地区10个行业的1,000家企业,每个行业100家。这项任务耗时4.5分钟,花费$0.51。生成的CSV文件包含行业类别、评分、评论数、网站、电话号码、邮政编码和地图坐标等字段。

随后,Jev评估了每家企业购买AI服务的可能性,并为其选出偏好的服务方案。在Claude Code中,这次评分处理了559,420个输入token,用时5.2秒,花费$0.0235,即2.35美分。另一次在交互式地图上处理并展示这些企业的运行耗时12.25秒。这两个时间都不包括耗时4.5分钟的抓取任务。

抽象城市地图上的企业标记形成彩色分组,被选中的标记变成联系人卡片

▲ 潜在客户评分与联系人筛选

各方案的选择结果合计覆盖全部1,000家企业:

Jev选出的方案 企业数
付费广告 753
WhatsApp或电话智能体 210
AI网站 33
内容系统 4

这些是Jev给出的分类,并非经过确认的购买行为,也不是企业自己表达的偏好。当工作流中有大量记录、并且要对每条记录提出同样的限定性问题时,低廉的评分成本最有意义。Jev提供的是评分或类别;采集记录、根据结果采取行动,都需要其他工具来完成。

抓取和评分两次运行合计花费$0.5335。下一步又增加了一笔费用:对排名前50的潜在客户进行的Apify联系方式搜索找到了37个有效邮箱地址,排除了13条记录,花费$0.35。随后,Claude Code在Instantly中准备了一个包含三个步骤的个性化营销活动草稿,使用了行业类别、所在地和评论数等信息。抓取、评分和联系方式搜索的费用合计$0.8835;这一小计并不能说明撰写或运行该营销活动的全部成本。

仅凭评分也无法确定商业价值。整个工作流从采集记录开始,依次是排序、查找联系方式和准备外联。其中几个环节的成本是已知的,但这次针对1,000家企业的运行并没有测量收入。

第三种用法:查找视觉素材

同样的分工也出现在一个媒体搜索项目中。Claude Code构建了一个可浏览331张图片和视频片段的浏览器,Claude Haiku 4.5为这些文件生成描述,Jev则为文件与基于语义的查询之间的匹配程度打分。搜索“working at night”时,系统在3.24秒内找到了一段相关的办公室视频片段。在这里,Jev做的同样是比较,而不是生成描述或构建应用。

引入工作流时的要点

在这些例子中,Jev最擅长的是范围狭窄的决策点:选择模型或技能、为潜在客户打分,或对搜索结果排序。要评估这一角色能否省钱,应比较引入路由前后的整个工作流,而不只是看Jev每个token的价格。数据采集、联系方式补全和生成模型的工作应分别作为独立的费用项目。

如果要搭建类似的潜在客户工作流,应为抓取设置费用上限,确认哪些联系人拥有有效的邮箱地址,并在发送任何邮件之前核对外联要求。这类外联应包含真实的邮寄地址和一行清晰的退订说明。实际的检验标准是:低成本的判断能否推动具体任务向前,同时又不掩盖周边工作的成本。