OpenAI新推出的Decisions API不写答案,只做选择。把文本或图片连同一份固定的候选答案列表发过去,它会在约150毫秒内返回每个选项的概率,而且没有需要付费的输出token。从能发现走神的专注计时器到视频粗剪工具,用7个实际项目来检验,可以清楚看到这种快速、低价的分类器在哪些场合胜过聊天模型,又在哪些地方力有不逮。

决策模型与聊天模型有何不同

标准语言模型逐个token生成答案。token是模型读写文本的小单位,每多一个token,延迟和成本都会增加。Decisions API完全跳过了生成过程。它在模型的一次计算中为一组预先设定的选项打分,因此输出token为零。

一个客服示例可以说明其原理。把“I was charged twice for my order(我的订单被重复扣款)”这条消息与Billing、Technical、Shipping、Other四个选项一起发送,API会以100%的置信度返回Billing。答案永远是你给出的选项之一。

同样的机制还能驱动一个无需人工操作、自动玩开源第一人称射击游戏的机器人。截图和坐标数据与移动选项(前进、后退、横移)以及动作选项(射击、换弹、跳跃)配对,机器人每秒做出多次此类判断,每次成本不到一美分。

OpenAI自己公布的数据如下:

指标 Decisions API 常规gpt-6-luna调用
典型延迟 约150毫秒 约1.6秒
价格 每百万输入token $0.10 按生成的token计费
输出token 无 有

输出token、缓存读取和缓存写入均不收费。

先行一步的对手

这种方式并非OpenAI首创。由一位前OpenAI研究员创立的TypeSafe AI于2026年9月15日发布了Jev,并将其定位为首个公开的“System One”模型,即为即时分类和结构化概率而打造、而非缓慢深思熟虑的模型。早期用户把它用于高吞吐量的分拣工作,例如分流数千封客服邮件,或按建筑风格、与高速公路的距离为房产房源打标签。

项目 OpenAI Decisions API TypeSafe AI Jev
每百万输入token价格 $0.10 $0.042
输入类型 文本和图片 仅文本
主要规格 直接读取截图和照片 请求上下文64k token

Jev的价格不到一半,但看不见图像。Decisions API可以接收图片和实时桌面屏幕截图,这正是实时视觉机器人得以实现的关键。对视觉输入的支持似乎是两者之间的决定性差别。

准备工作

  • 在OpenAI开发者平台创建API密钥。API用量与ChatGPT订阅分开计费。
  • 想不写代码先试一试,可以在同一平台的Decisions Playground中尝试输入和选项列表。
  • 要开发应用,可以向Claude Code或Codex等编程智能体描述需求,并把API密钥放在本地.env文件中。

笔记本电脑旁发光的专注悬浮球,有人说出命令后应用窗口立即切换

▲ 屏幕与语音输入的即时判断

7个项目及其结果

1. 能发现你走神的专注计时器

这款桌面应用为25分钟的Pomodoro计时器加上了屏幕感知能力。输入目标,比如编程,应用每隔几秒截取所有已连接的显示器画面,并询问Decisions API屏幕内容是否仍符合该目标。偏离任务超过一分钟,它就会通过文本转语音发出提醒。在X上浏览广告时,悬浮球变成橙色,并用语音催促回去写代码;回到工作后,它又缩回原样。一个入门级项目有了视觉和即时分类能力,就变成了主动的监督工具。

2. 无延迟的macOS语音控制

按住一键通按键说话,语音转文本功能会把命令转成文字。随后Decisions API从一份动作列表中选出一项:启动或退出应用、切换应用,或控制浏览器标签页和导航。Claude用约15分钟做出了这个Electron应用,命令的处理时间约为120至280毫秒。按住右侧Option键说出“Open Arc”或“Open Google Chrome”,应用几乎瞬间切换。

开发过程带来两点经验。当动作被组织成多层嵌套结构时,“quit Spotify”的置信度只有67%。把选项拍平成单一列表后,置信度和速度都恢复了。此外,这个应用需要在macOS系统设置中同时获得辅助功能和输入监控两项权限。

3. 清理X信息流中的广告和诱饵帖

一个Chrome扩展把每条帖子的文字和图片发送给Decisions API,询问它是否为广告或低质量的互动诱饵帖,并把被标记的帖子折叠成可展开的细条。Claude大约用4分钟写好并在模拟信息流上完成测试。起初它判定过严,把企业的产品发布和使用了宣传性措辞的普通帖子也隐藏了。让模型专门查找帖子右上角的“Ad”标签,就能解决这个问题。

4. 自动模糊屏幕录像中的隐私信息

FFmpeg每半秒抽取一帧,Decisions API检查每一帧是否含有API密钥、电子邮件地址、电话号码和家庭住址等个人信息,工具再对定位到的位置进行模糊处理。用一段塞满虚假邮件和密钥的1分钟测试录像,得到如下结果:

指标 结果
检查的帧数 144
标记的帧数 84
流程总耗时 15.8秒,比实时播放快约4.6倍
API成本 $0.0732

此前的做法是把整个视频文件上传到Gemini扫描敏感数据,既慢又繁琐。

5. 用维基百科竞速测速度和成本

在维基百科竞速中,模型在每个页面选择最有希望的链接,从一篇文章跳转到相距甚远的目标文章。三位参赛者同台比拼:Decisions API、Jev,以及作为标准聊天模型的GPT-5.5。

路线 Decisions API Jev GPT-5.5
Banana到Moon landing 3跳,2.9秒,$0.00327 3跳,7.3秒,$0.00272 2跳,8.9秒,$0.0944
Taylor Swift到Photosynthesis 3跳,1.2秒,$0.00242 3跳,2.0秒,$0.00179 3跳,16.3秒,$0.1277
Pokémon到Roman Empire 6跳,3.1秒,$0.00268 5跳,2.1秒,$0.00136 2跳,14.2秒,$0.0678

聊天模型有时能找到更短的路径,但专用决策模型每一步往往快约10倍,成本约为其二十分之一到五十分之一。

6. 一张照片算出卡路里

这个移动网页应用通过本地Wi-Fi在iPhone的Safari中打开,界面上只有一个拍照按钮。数据来自免费的USDA FoodData Central列表,Claude把它整理成172个类别、5,412种食品。关键的设计在于从不让模型推算卡路里。Decisions API只回答两个受限的选择题,即食物类别和份量,再通过一次后续调用确定具体食品。随后由普通代码根据数据库的标准重量表计算卡路里。

一张芝士汉堡照片约用1秒、花费$0.000054,被判定为488千卡。而一个裹着培根的8磅巨型墨西哥卷饼被归为特大号卷饼,结果只有964千卡。小、中、大、特大这类固定份量档位,没有推理模型就无法处理这种极端情况。

7. 在原始素材中找出废镜头

最后一个项目要从原始录像中剪掉口误、起头失败、重说和静音段。在Adobe Premiere Pro中用Opus 5.5剪辑,准确率可达约98%,但每支视频的API费用高达数百美元。因此,第一轮粗筛改由Decisions API承担。Whisper-1带时间戳转写音频,转写文本按句切分,每一行被归类为口误、起头失败、重说、剪辑提示或保留。

测试 结果
4分45秒的4K片段 1.3秒完成40次判断,7处废镜头全部找出,判断花费$0.0029,转写花费$0.029
4.25GB原始文件 提取音频0.2秒,转写5.7秒,判断1.7秒,标出54处静音和7处废镜头

在语句卡顿处,Whisper-1的速度和逐词时间戳的准确度都胜过本地运行的MLX Whisper模型。只把置信度低的行交给Opus这类更大的推理模型,就能形成分层且省钱的剪辑流程。Claude生成的浏览器剪辑界面杂乱难用,但功能正常。

视频剪辑时间线上剪掉废镜头,只把不确定的片段交给更大的AI模型

▲ 大模型之前的低成本初筛

依赖它之前需要了解的局限

  • 列表之外的事它做不了。让它在浏览器中输入文字,或打开一个没有对应动作的URL,这类语音命令都失败了,因为模型只会在给定的动作中做选择。
  • 它会漏掉复杂边缘情况中的微妙差别。这类判断仍需要完整的推理模型。
  • 嵌套的选项树会降低置信度。单一的扁平列表效果更好。
  • 分类器可能判定过严。出现这种情况时,要像“Ad”标签那样,在提示词中写明需要查找的具体线索。
  • 固定档位遇到极端值就会失灵,巨型卷饼就是例子。

从哪里开始

Decisions API适合需要快速、低成本地反复进行有限选择的工作:对屏幕或照片内容做出反应的实时工具、文本或视频帧的批量分拣,以及放在昂贵模型前面的低成本初筛。可以按以下步骤尝试:

  1. 从工作中挑一项答案落在少数固定类别里的任务,在Decisions Playground中把它作为选项列表来测试。
  2. 把选项放在单一的扁平列表中,不要做成嵌套的树。
  3. 让模型选择类别,让查询表和代码给出卡路里或价格等数字。
  4. 设定置信度阈值,只把低于阈值的条目交给更大的推理模型。
  5. 需要图像输入就用Decisions API;如果只做纯文本的批量分类且最看重成本,就与Jev一起比较。