为人工关键词搜索而建的商品目录,与AI购物智能体并不匹配;要改进,靠的不是堆更多文字,而是结构化、聚焦的数据。这是PayPal智能体商务团队通过对照实验得出的核心结论,该团队专注于AI智能体如何替购物者寻找商品并完成购买。丰富商品数据后,所有受测智能体的关键词检索表现都有所提升,目录信息最单薄的商家提升最多。但堆砌缺乏结构的文案会让语义检索变得模糊,在部分测试中还让智能体更频繁地出现幻觉。
从输入关键词到交出整项任务
商业经历了几个不同阶段:实体店、电商网站、电子邮件和短信营销、社交电商,再到如今由AI智能体代人购物的智能体商务。PayPal负责智能体商务的产品总监用同一种框架看待每一次转变:起初它看似威胁现有企业的生存,随后却会变成巨大的机会,因为消费者习惯一旦改变,商业总会随之调整。
购物行为正在经历三个阶段:
| 阶段 | 购物者怎么说 | 商家需要做什么 |
|---|---|---|
| 搜索 | 输入“学习用品”,逐个点开列表浏览 | 投入SEO和自有移动应用 |
| 意图 | “帮我找双胞胎9月升五年级要用的返校衣服和学习用品” | 让商品能在AI引擎中被发现 |
| 委托 | “把返校购物办好,预算不超过$300” | 安全地把对话中产生的需求转化为成交 |
在搜索时代,筛掉无关结果的负担完全落在购物者身上,企业花了十年时间按关键词搜索引擎优化来打磨网站和商品分类。如今市场正进入意图时代,人们用自然语言向大语言模型描述自己的需求。品牌必须走进这些对话去接触购物者,而不是指望他们访问商家自己的网站。
接下来是委托阶段,但它以信任为前提。只有当智能体持续以准确、贴合情境的推荐赢得信任后,购物者才会交出购买权限。
智能体商务的规模可能有多大
PayPal的智能体商务负责人强调,这并非遥远的假设,而是一场已经在重塑电商的变化。支撑这一判断的预测和早期数据如下:
- 贝恩公司预计,到2030年,AI智能体将执行全部商业交易的15%-25%。
- 麦肯锡在2025年10月的一项研究中估计,到2030年,智能体商务在美国B2C零售领域将达到$1万亿,在全球达到$3万亿-5万亿。
- 预计ChatGPT、Google Gemini、Microsoft Copilot、Meta和亚马逊上超过20亿活跃用户,将借助AI智能体开启购物之旅。
- 行业预测认为,未来十年内软件智能体的数量将超过人类互联网用户。
商家已经感受到影响。2025年假日购物季,经AI引流到零售网站的流量比2024年增长693%。约39%的美国购物者已经在用生成式AI工具辅助购物。零售商还发现,购物者在访问过程中与AI智能体互动时,结账转化率是普通浏览网站的四倍,因为智能体会提供贴合购物者需求的详细商品信息。在一个界面样稿中,AI助手确认了一笔在The RealReal下单的$69订单,并提供送货上门和订单跟踪。

▲ 由智能体代劳的购物
商品目录是为人而建,不是为智能体
商家面临的核心问题是:购物者在第三方平台上与AI智能体对话时,自己的商品能否出现。ChatGPT Shopping、Perplexity Pro和Google Gemini等智能体会把查询直接导向具体商品,而不是品类着陆页。
大多数零售目录并非为此设计。它们依赖堆满关键词的标题、商家用来追踪库存的内部SKU编码,以及为Google Shopping商品信息流定制的数据结构。此外还有几个问题叠加在一起:
- 什么样的目录算是“可被AI发现”,业内没有统一标准。
- 许多数据丰富服务商声称能让库存更容易被AI发现,但商家没有可靠的基准来核实这些说法,也无法比较不同方法。
- 智能体在为商品排序和推荐时会在多个大语言模型之间切换,因此其行为难以预测。
- 向量数据库以数值形式存储文本含义,而在不同平台上,从中检索的结果既不完全确定,也不易解释。
简言之,智能体的排序是一个黑箱,传统的、基于规则的SEO无法对其进行优化。实际的启示是,不要让目录只迎合某一个检索系统。为了找到能跨平台奏效的策略,PayPal团队在多个智能体上,对商家商品目录开展了数据丰富对照实验。
关键词搜索与语义搜索表现不同
要理解实验结果,先要弄清两种主要检索方式的区别。
| 维度 | 关键词搜索(BM25) | 语义搜索(嵌入) |
|---|---|---|
| 匹配方式 | 查询与商品文本中完全相同的词 | 将查询和文本转换为向量后按含义匹配 |
| 优势 | 精确、快速、可预测 | 即使措辞不同也能找到符合意图的商品 |
| 盲点 | 会漏掉同义词和意图 | 一个向量承载过多分散文本时会失焦 |
| 示例 | “蓝色跑鞋”只返回包含这些词的商品 | “适合马拉松训练的舒适装备”能找到跑鞋 |
BM25是一种关键词搜索方法,通过查询中的词与商品文本中的词是否完全一致来给商品排序。在关键词搜索中,如果“慢跑用鞋”这类词从未出现在商品数据里,查询可能一无所获。语义搜索使用嵌入,即用数值表示文本含义的方式,因此能把模糊的需求对应到合适的商品。它的弱点是,若强行用一个嵌入去表示冗长而零散的描述,它就不再清楚地指向任何东西。把关键词的精确性与语义的意图理解结合起来的混合方式,能提供最稳固的基础。
丰富商品目录的五种方法
实验没有把数据丰富视为单一技术,而是分成五个数据维度,各自适合不同类型的库存。
| 维度 | 补充什么 | 最适合 | 不太适合 |
|---|---|---|---|
| Attribute Fill | 缺失的必备规格 | 规格信息单薄的目录、小商家 | 信息已经很丰富的数据源 |
| Description Depth | 叙述性背景和使用场景 | 大众商品、名称笼统的SKU | 高度结构化的库存 |
| Buyer Context | 用户画像、场合和情境标签 | 生活方式、礼品、时尚 | 只看规格的实用品 |
| Trust Signals | 评价、品牌热度和口碑 | 耐用品、家具 | 短期限时抢购 |
| Product Identity | 标准商品实体与变体分组 | 跨多个渠道销售的库存 | 未说明 |
一组前后对比可以说明差别。一条只有“男鞋 BS43,蓝色”这个名称和一行描述的稀疏商品信息,几乎没有可供语义系统匹配的内容。丰富后的版本名称变为“男士轻量跑鞋。透气网面。蓝色”,并加入结构化属性,包括马拉松训练的用途、系带设计、缓震和网面材质,还加上1,240条评价、平均4.6星的评分。有了这些数据,智能体就能把这双鞋与宽泛、概念性的需求联系起来。

▲ 丰富前后的商品数据
实验发现了什么
测试得出了三项主要发现:
- 数据丰富始终有助于关键词检索。 在每一组一对一比较中,丰富后的数据都胜过未丰富的基线,并提升了所有智能体的关键词检索前10命中率。更长、更具描述性的文案增加了词汇多样性,能匹配更多关键词,还能纳入从商品图片中提取的属性。
- 单薄的目录提升最大。 商品数据起点最弱的商家获得的百分比提升最大,因此也最有快速改进的空间。
- 缺乏结构的文本可能适得其反。 随意添加的内容稀释了嵌入所捕捉的含义。在部分测试中,过度丰富的描述让智能体更频繁地出现幻觉,即生成不真实的细节,语义检索排名也随之下降。
像“欢迎光临本店,我们是家族经营的商店”这样的通用店铺文案,会增加无关的词元,也就是模型处理文本的小单位,从而干扰检索。智能体看重的似乎是信息充分、结构清晰的商品内容,而不是品牌声量或营销说法。决定搜索和推荐表现的是质量,而不是文本或标签的数量。数据丰富显然有助于关键词搜索,但仅靠堆砌文本不足以支撑语义检索,后者需要不同的数据结构。
商家现在应该做什么
如果零售商继续只依赖为人类搜索引擎打造的传统Google Shopping商品信息流,其商品被发现的可能性可能大幅下降。没有一种数据丰富方案适用于所有目录,因此有针对性的做法看起来更稳妥:
- 先做诊断。 在选择丰富策略之前,先判断自己的目录是信息单薄、偏重规格,还是以大众商品为主。
- 按库存选方法。 不要一刀切地套用一种技术,规格驱动的目录用Attribute Fill,生活方式品类用Buyer Context。
- 保持具体。 描述聚焦真实用途和规格,而不是长篇叙事或口号。
- 去掉套话。 把家族经营之类的店铺层面文案从商品信息流中删除。
- 将信任信号结构化。 把平均评分和评价数量直接写入商品信息流。
- 兼顾两种检索。 结合关键词检索和语义检索,让商品既能匹配精确查询,也能匹配宽泛意图。
- 验证而非假设。 建立一种方法,检查AI购物引擎能否解析和检索你的商品信息,并用它来检验服务商的说法。
随着越来越多的购物从AI智能体开始,商家的优势看来将更少来自SEO关键词,而更多来自智能体能够理解的准确、结构化的商品信息。用精确的数据填补单薄目录的空白,是最直接的第一步。