为人工关键词搜索而建的商品目录,与AI购物智能体并不匹配;要改进,靠的不是堆更多文字,而是结构化、聚焦的数据。这是PayPal智能体商务团队通过对照实验得出的核心结论,该团队专注于AI智能体如何替购物者寻找商品并完成购买。丰富商品数据后,所有受测智能体的关键词检索表现都有所提升,目录信息最单薄的商家提升最多。但堆砌缺乏结构的文案会让语义检索变得模糊,在部分测试中还让智能体更频繁地出现幻觉。

从输入关键词到交出整项任务

商业经历了几个不同阶段:实体店、电商网站、电子邮件和短信营销、社交电商,再到如今由AI智能体代人购物的智能体商务。PayPal负责智能体商务的产品总监用同一种框架看待每一次转变:起初它看似威胁现有企业的生存,随后却会变成巨大的机会,因为消费者习惯一旦改变,商业总会随之调整。

购物行为正在经历三个阶段:

阶段 购物者怎么说 商家需要做什么
搜索 输入“学习用品”,逐个点开列表浏览 投入SEO和自有移动应用
意图 “帮我找双胞胎9月升五年级要用的返校衣服和学习用品” 让商品能在AI引擎中被发现
委托 “把返校购物办好,预算不超过$300” 安全地把对话中产生的需求转化为成交

在搜索时代,筛掉无关结果的负担完全落在购物者身上,企业花了十年时间按关键词搜索引擎优化来打磨网站和商品分类。如今市场正进入意图时代,人们用自然语言向大语言模型描述自己的需求。品牌必须走进这些对话去接触购物者,而不是指望他们访问商家自己的网站。

接下来是委托阶段,但它以信任为前提。只有当智能体持续以准确、贴合情境的推荐赢得信任后,购物者才会交出购买权限。

智能体商务的规模可能有多大

PayPal的智能体商务负责人强调,这并非遥远的假设,而是一场已经在重塑电商的变化。支撑这一判断的预测和早期数据如下:

  • 贝恩公司预计,到2030年,AI智能体将执行全部商业交易的15%-25%。
  • 麦肯锡在2025年10月的一项研究中估计,到2030年,智能体商务在美国B2C零售领域将达到$1万亿,在全球达到$3万亿-5万亿。
  • 预计ChatGPT、Google Gemini、Microsoft Copilot、Meta和亚马逊上超过20亿活跃用户,将借助AI智能体开启购物之旅。
  • 行业预测认为,未来十年内软件智能体的数量将超过人类互联网用户。

商家已经感受到影响。2025年假日购物季,经AI引流到零售网站的流量比2024年增长693%。约39%的美国购物者已经在用生成式AI工具辅助购物。零售商还发现,购物者在访问过程中与AI智能体互动时,结账转化率是普通浏览网站的四倍,因为智能体会提供贴合购物者需求的详细商品信息。在一个界面样稿中,AI助手确认了一笔在The RealReal下单的$69订单,并提供送货上门和订单跟踪。

数字集市中,小型机器人助手提着购物袋穿梭于发光的店铺之间

▲ 由智能体代劳的购物

商品目录是为人而建,不是为智能体

商家面临的核心问题是:购物者在第三方平台上与AI智能体对话时,自己的商品能否出现。ChatGPT Shopping、Perplexity Pro和Google Gemini等智能体会把查询直接导向具体商品,而不是品类着陆页。

大多数零售目录并非为此设计。它们依赖堆满关键词的标题、商家用来追踪库存的内部SKU编码,以及为Google Shopping商品信息流定制的数据结构。此外还有几个问题叠加在一起:

  • 什么样的目录算是“可被AI发现”,业内没有统一标准。
  • 许多数据丰富服务商声称能让库存更容易被AI发现,但商家没有可靠的基准来核实这些说法,也无法比较不同方法。
  • 智能体在为商品排序和推荐时会在多个大语言模型之间切换,因此其行为难以预测。
  • 向量数据库以数值形式存储文本含义,而在不同平台上,从中检索的结果既不完全确定,也不易解释。

简言之,智能体的排序是一个黑箱,传统的、基于规则的SEO无法对其进行优化。实际的启示是,不要让目录只迎合某一个检索系统。为了找到能跨平台奏效的策略,PayPal团队在多个智能体上,对商家商品目录开展了数据丰富对照实验。

关键词搜索与语义搜索表现不同

要理解实验结果,先要弄清两种主要检索方式的区别。

维度 关键词搜索(BM25) 语义搜索(嵌入)
匹配方式 查询与商品文本中完全相同的词 将查询和文本转换为向量后按含义匹配
优势 精确、快速、可预测 即使措辞不同也能找到符合意图的商品
盲点 会漏掉同义词和意图 一个向量承载过多分散文本时会失焦
示例 “蓝色跑鞋”只返回包含这些词的商品 “适合马拉松训练的舒适装备”能找到跑鞋

BM25是一种关键词搜索方法,通过查询中的词与商品文本中的词是否完全一致来给商品排序。在关键词搜索中,如果“慢跑用鞋”这类词从未出现在商品数据里,查询可能一无所获。语义搜索使用嵌入,即用数值表示文本含义的方式,因此能把模糊的需求对应到合适的商品。它的弱点是,若强行用一个嵌入去表示冗长而零散的描述,它就不再清楚地指向任何东西。把关键词的精确性与语义的意图理解结合起来的混合方式,能提供最稳固的基础。

丰富商品目录的五种方法

实验没有把数据丰富视为单一技术,而是分成五个数据维度,各自适合不同类型的库存。

维度 补充什么 最适合 不太适合
Attribute Fill 缺失的必备规格 规格信息单薄的目录、小商家 信息已经很丰富的数据源
Description Depth 叙述性背景和使用场景 大众商品、名称笼统的SKU 高度结构化的库存
Buyer Context 用户画像、场合和情境标签 生活方式、礼品、时尚 只看规格的实用品
Trust Signals 评价、品牌热度和口碑 耐用品、家具 短期限时抢购
Product Identity 标准商品实体与变体分组 跨多个渠道销售的库存 未说明

一组前后对比可以说明差别。一条只有“男鞋 BS43,蓝色”这个名称和一行描述的稀疏商品信息,几乎没有可供语义系统匹配的内容。丰富后的版本名称变为“男士轻量跑鞋。透气网面。蓝色”,并加入结构化属性,包括马拉松训练的用途、系带设计、缓震和网面材质,还加上1,240条评价、平均4.6星的评分。有了这些数据,智能体就能把这双鞋与宽泛、概念性的需求联系起来。

一双挂着空白标签的跑鞋,与被属性卡片和星级评分环绕的同款跑鞋对比

▲ 丰富前后的商品数据

实验发现了什么

测试得出了三项主要发现:

  1. 数据丰富始终有助于关键词检索。 在每一组一对一比较中,丰富后的数据都胜过未丰富的基线,并提升了所有智能体的关键词检索前10命中率。更长、更具描述性的文案增加了词汇多样性,能匹配更多关键词,还能纳入从商品图片中提取的属性。
  2. 单薄的目录提升最大。 商品数据起点最弱的商家获得的百分比提升最大,因此也最有快速改进的空间。
  3. 缺乏结构的文本可能适得其反。 随意添加的内容稀释了嵌入所捕捉的含义。在部分测试中,过度丰富的描述让智能体更频繁地出现幻觉,即生成不真实的细节,语义检索排名也随之下降。

像“欢迎光临本店,我们是家族经营的商店”这样的通用店铺文案,会增加无关的词元,也就是模型处理文本的小单位,从而干扰检索。智能体看重的似乎是信息充分、结构清晰的商品内容,而不是品牌声量或营销说法。决定搜索和推荐表现的是质量,而不是文本或标签的数量。数据丰富显然有助于关键词搜索,但仅靠堆砌文本不足以支撑语义检索,后者需要不同的数据结构。

商家现在应该做什么

如果零售商继续只依赖为人类搜索引擎打造的传统Google Shopping商品信息流,其商品被发现的可能性可能大幅下降。没有一种数据丰富方案适用于所有目录,因此有针对性的做法看起来更稳妥:

  • 先做诊断。 在选择丰富策略之前,先判断自己的目录是信息单薄、偏重规格,还是以大众商品为主。
  • 按库存选方法。 不要一刀切地套用一种技术,规格驱动的目录用Attribute Fill,生活方式品类用Buyer Context。
  • 保持具体。 描述聚焦真实用途和规格,而不是长篇叙事或口号。
  • 去掉套话。 把家族经营之类的店铺层面文案从商品信息流中删除。
  • 将信任信号结构化。 把平均评分和评价数量直接写入商品信息流。
  • 兼顾两种检索。 结合关键词检索和语义检索,让商品既能匹配精确查询,也能匹配宽泛意图。
  • 验证而非假设。 建立一种方法,检查AI购物引擎能否解析和检索你的商品信息,并用它来检验服务商的说法。

随着越来越多的购物从AI智能体开始,商家的优势看来将更少来自SEO关键词,而更多来自智能体能够理解的准确、结构化的商品信息。用精确的数据填补单薄目录的空白,是最直接的第一步。