OpenAI对ChatGPT的最新更新,把工作工具带进了语音对话,并在Chrome当前打开的页面旁边放上了一个助手。原生桌面应用则增加了更快的语音选项和更广泛的电脑控制设置。这些变化有望减少在说话、阅读和起草之间来回切换的麻烦,但不同界面提供的工具和权限各不相同。

语音连接工作任务

ChatGPT Voice现在可以调用电子邮件、日历、Slack等已连接的服务。在ChatGPT Work中,用户可以从聊天输入框发起语音会话,口头描述涉及文档、演示文稿、网站或电子表格的任务。扩展后的工作流程还包括通过语音指挥的多步骤浏览器任务。

麦克风通过柔和的声波连接文档、演示文稿、日历和消息卡片

▲ 语音连接的工作工具

要让连接工具的语音工作流程就绪,仅仅打开麦克风还不够。语音设置提供Live、Advanced和Standard三种模式。日常对话选择Live较为实用,而不同模式消耗账户使用额度的速度也不同。在个性化的高级设置中,开启ChatGPT Voice、Web Search、Canvas、Library Search和Connector Search后,相应的语音和互联工作区功能才能使用。如果关闭Connector Search,语音就无法查询已关联的文件或工作服务。

ChatGPT Work还提供Cloud Browser设置,用于管理站点权限和Cookie。当任务需要助手浏览网站时,这些设置十分关键,但是否授予访问权限应当慎重决定。ChatGPT Work可在桌面网页端和移动端使用,本文涉及的设置属于网页版工作区。各账户可用的功能可能不同,用户应确认自己的设置中出现了哪些选项。

模型菜单提供GPT-6 Astra、GPT-6 Sol和GPT-6 Luna。GPT-6 Astra适合自主执行的多步骤工作,GPT-6 Sol适合一般问答和起草。GPT-6 Luna似乎更适合通过开发者API使用,而不是在ChatGPT Work界面中直接选择。与其挑选听起来性能最强的名字,不如根据任务内容和使用成本来选择。

Chrome面板从打开的标签页开始工作

更新后的ChatGPT Chrome扩展程序把模型选择、插件入口、推理设置和标签页选择集中在浏览器侧边栏中。它最直观的用途,是无需先把文章复制到聊天框,就能根据页面内容生成草稿。在一个例子中,扩展程序读取了一篇介绍Gemini 3.8文本转语音(text-to-speech)功能的Google AI文章,生成了YouTube标题、简介、标签和脚本。

抽象文章旁的浏览器助手面板,显示所选标签页和多张草稿卡片

▲ 基于打开标签页的草稿

这一结果并不只来自页面本身。助手读取了所选标签页,调用了账户中保存的记忆,并检索了一份按指定写作风格定制的指南。最终成果包括开场钩子、功能亮点和两个使用场景。此类草稿的质量取决于账户中保存的内容,因此不同用户得到的结果会有差异。

Chrome Computer Use则是另一项范围更广的权限决定。其设置可以选择“Ask for approval”,也可以对浏览器操作和本地文件授予不受限制的访问权限。保持审批请求开启,用户就能在助手执行操作前进行检查。读取所选页面来起草内容,与允许更广泛的电脑控制,不应被视为同一级别的访问。

桌面版增加本地控制和活动记录

原生ChatGPT桌面应用新增了“Switch to Light”语音选项,旨在加快语音交流。播放速度滑块最高可调至1.5倍,速度越快,消耗的额度也越多。桌面设置还提供推理强度(reasoning effort)选项:Light、Medium、High、Extra High、Max和Ultra。此外,常规设置中的“Enable Ultra effort”开关会让多个智能体并行处理大型项目,但会更快消耗使用额度。

更大的区别在于对电脑的访问。在桌面权限设置中选择“Full access”后,无需逐项审批即可编辑文件和执行终端命令。用户还可以配置针对具体应用的电脑操作、审批策略,以及只读执行等限制。Computer History会记录应用活动、总结工作会话,并推荐可复用的AI技能。桌面Pets是屏幕上的小伙伴,在用户使用其他软件时,以可视化方式提示后台智能体的进度。

这些新增功能使桌面应用在涉及本地应用程序的工作上看起来比标准网页版更合适,但也让权限选择变得更加重要。如果只是想体验更快的语音对话,并不需要开启活动记录或不受限制的电脑访问。

插件有了新入口

改版后的插件页面将工具分为Popular、Small Business、Productivity、Creativity和Developer Tools几类。Gmail、Google Drive、GitHub、Dropbox、Canva、Stripe等服务可以直接连接,已安装的插件可以在输入框中通过菜单或“@”提及调用。需要自定义工具的用户有三种途径:

方式 作用
Create plugin 用通俗的英文描述工具,由ChatGPT生成
Upload plugin 拖放.py、.go或.zip格式的代码包
Create app 通过服务器URL和OAuth设置连接Model Context Protocol(MCP)服务器

MCP是一项开放标准,让AI助手能够连接外部工具和数据。使用自定义插件和MCP应用需要开启Developer Mode,该选项位于插件设置的“Advanced Security”中,开关旁会显示风险较高的警告。

先确定工作流程,再开放访问权限

这次更新的核心转变,是从向ChatGPT索取答案,转向让它借助已连接的工具、打开的浏览器标签页或本地软件完成工作。可以按以下顺序入手:

  1. 确定任务所用的界面。 需要连接工具的语音请求用ChatGPT Work,从所选标签页起草用Chrome侧边栏,需要控制本地应用时用桌面应用。同时确认相关功能是否出现在自己的界面中。
  2. 只开启任务需要的连接。 使用已关联的工作信息时检查Voice和Connector Search,让助手浏览网页前检查Cloud Browser的站点权限和Cookie设置。
  3. 根据工作选择模型和推理强度。 日常起草适合GPT-6 Sol,自主任务推荐GPT-6 Astra。提高语音播放速度或使用Ultra effort,可能会消耗更多账户额度。
  4. 让监督力度与访问范围相匹配。 除非确有必要且环境可信,否则保持电脑操作的审批请求开启。只有在确实需要自定义插件或MCP集成时,才开启Developer Mode。

最直接的变化是便利:语音可以触达已连接的工作,打开的标签页也能成为定制草稿的起点。先确认可用性和权限,只有在具体工作流程需要时再扩大访问范围。