TypeSafe AI 推出的专用决策模型 Jev,为“先由快速决策模型把关、再交给大型 AI 模型处理”的做法提供了实际例证。在一项对100封收到的邮件进行分类的测试中,Jev 用时23.00秒,花费$0.00196。Claude Fable 5.1 用时218.05秒,花费$0.14811;在这100封邮件中,两者有89封归入相同类别。这一结果无法判定每封邮件究竟由哪个模型分对了,但它说明了团队为何可能把快速分类与成本更高的回复撰写工作分开。

三根高度不同的柱条,最高的旁边有秒表,最矮的旁边有硬币

▲ 时间与成本差异

这种分工正是模型路由的核心:在转交请求之前,先选择由哪个模型处理。在 Claude Code 中,Jev 可以做出初步选择,而需要更深入推理或书面回复的任务仍可交给 Claude。路由决策本身也有成本,因此关键在于它能否在整个工作流程中节省超过其自身开销的费用。

为有限选项而设计的模型

TypeSafe AI 将 Jev 设计为提供三类输出:是或否、从给定列表中选出一项,或按分为2至10档的量表评分。每个答案都附有置信度百分比。这使 Jev 适合判断邮件属于哪个类别,或编程提示词应交给哪个模型,而不适合起草邮件或编写程序。

工作流程可以根据置信度决定何时改由 Claude 处理问题。一种技能路由配置会将置信度低于60%的决策交给 Claude。这个阈值是工作流程中的一种选择,并不保证高于阈值的每项决策都正确。不应让 Jev 承担开放式写作、摘要、数学计算、日历日期的先后比较,或判断其他模型回答质量的任务。它也不应自主执行资金转账。

实测运行的成本

百封邮件测试使用了四个类别:高意向销售线索、中等意向销售线索、低意向销售线索和非销售线索。实测耗时和费用如下:

模型 100封邮件耗时 总成本
Jev 23.00秒 $0.00196
Claude Haiku 4.5 74.65秒 $0.01959
Claude Fable 5.1 218.05秒 $0.14811

许多空白消息气泡经过漏斗,分入几个用颜色区分的组别

▲ 邮件分类结果

Jev 与 Claude Fable 5.1 有89封邮件的分类结果相同,衡量的是一致性,而不是相对于经过核实的标准答案的准确率。如果某个类别将触发重要操作,这一区别就很关键。团队可以按自己的标准抽样核查,并将不确定或影响重大的案例交给更强的模型或人工处理。

其他测试显示了同样的分工适用于哪些场景,以及哪些地方需要谨慎:

  • **编程提示词:**Jev 将12项请求分配给 Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 5 和 Claude Fable 5.1。其中10项没有使用最高档模型。路由后的总成本为$0.506;如果全部由 Claude Fable 5.1 处理,成本则为$1.380。模型档位的选择约有80%被评为最优;有两次 Jev 选择了 Haiku,而 Opus 是更合适的选择。
  • **常规核查:**在涵盖五类任务的150次是非决策中,Jev 每次决策的延迟中位数为219毫秒,总费用为$0.0019。这些任务包括垃圾信息标记、发票核查、社区规则核查、退款资格判断和客户流失信号识别。
  • **评论分类:**Jev 对312条 YouTube 评论作出2184次决策,每条评论评估七个问题。测试耗时72.5秒,成本为$0.0106。若由 Claude Fable 5.1 完成同样的工作,成本约为$3.48,但这是推算值,而非实测费用。Jev 识别出155条需要回复的评论、28条包含内容创意的评论、97条显示购买意向的评论,以及五条垃圾评论。

在评论测试中,Jev 的分类结果与大型模型的一致率为90%至96%,垃圾评论判定的一致率则为98%至100%。与邮件测试一样,一致性不能替代独立核实的标准答案。

如何利用节省的成本,而不过度使用 Jev

2026年9月,OpenRouter 上列出的 Jev 价格为每百万输入 token 收费$0.042,每百万输出 token 收费$0.00。Token 是衡量模型输入或输出的单位。一次典型路由决策的估算成本约为$0.00002。这些价格让大量重复的小型决策成本较低,但编程测试也表明,任务有需要时,路由仍必须选出有能力胜任的模型。

Claude Code 集成使用 jev-decisions 包。其设置步骤包括获取 API 密钥、通过 node scripts/selftest.mjs 检查凭据和延迟、在 settings.json 中连接钩子,以及重启运行环境。/jev on 和 /jev off 命令用于控制路由;/jev status 会报告分类结果、延迟、置信度和累计成本。这些数据让团队能够检查路由器的实际行为,而不是只凭账单金额下降来评价它。

数据处理构成另一项边界。标准账户不具备 SOC 2、ISO 或 GDPR 合规保障,零数据留存也仅限企业账户。敏感的客户姓名、凭据和专有财务记录不应通过标准账户处理。Jev 的适用范围还取决于它能读取什么输入:在另一项文件搜索测试中,它依靠描述性文字、文件夹名称和文件路径找到匹配项,而不是依靠图像像素。因此,标注不清的图像并不适合交给它处理。

实际启示

Jev 似乎最适合作为范围明确的第一步:分类、选择或评分;检查置信度;再将起草内容和更难的推理任务交给适合的模型。从一组可重复、低风险的决策入手,衡量完整工作流程的成本,并根据自己的标准答案复核分类结果。为不确定的决策保留回退方式,不要通过标准账户处理敏感数据。百封邮件测试展示了潜在的成本节省,而路由错误和未经验证的标准答案则说明,监督仍应是设计的一部分。