仓库内高货架的远景,架上整齐排列素色纸箱的照片

先分清三层数据

「跨境电商数据」这个说法太笼统,里面至少混着三种完全不同的东西。分不清这三层,找起来就会一直找不到。

第一层:你自己店铺的后台数据。 销量、转化率、流量来源、广告花费、退款率。这层最准,因为是平台直接给你的,但它只覆盖你自己。

第二层:平台愿意公开的数据。 类目榜单、搜索结果排序、商品详情页上的一切、店铺评分和评论。这层对所有人开放,也是竞品分析的主要素材来源。

第三层:谁都不给的数据。 别人店铺的真实销量、真实流量、真实利润率。这层不存在于任何公开位置。

大多数人卡住,是因为在第二层里找一个只存在于第三层的数字。

平台后台:准,但只有自己

一整面玻璃幕墙,只映出天空与流云的照片

自己店铺的后台数据不需要采集,导出就有。值得说的只有一点:它的字段口径是平台定的,不是通用的。

亚马逊的「销售额」和 Shopee 的「销售额」在退款、运费、平台补贴的计入方式上不一样。做多平台汇总时,如果直接把两个数字加起来,得到的是一个没有意义的和。要么统一口径重算,要么分开看。

这件事听起来基础,但在多平台卖家那里是返工的高发区。

第三方工具:快,但按它的逻辑

工具的价值是开箱即用——不用自己搭,常见平台的常见指标当天就能看。

它的边界也很清楚:

一、字段是它定义的。 你想要的那个组合,它可能不提供,或者用了和你不同的口径。

二、销量和流量是估算的。 这一点必须说破。平台不公开销量,工具的销量数字是用评论数、排名变化、库存变动这些公开信号反推的。不同工具对同一个商品能差出几倍。它可以用来看趋势和排序,不能当成事实。

三、覆盖有限。 主流平台之外的站点、小语种市场、独立站,工具通常不做——那些恰恰是竞争没那么挤的地方。

自己采:慢,但要什么有什么

黄昏逆光下港口岸桥起重机剪影的照片

第三条路是直接从公开页面上取。适合的场景很具体:

  • 工具不覆盖的站点,比如一批独立站、区域性平台
  • 字段组合非标,比如「标题里包含某个词、且评分低于四星、且在售」这种筛选
  • 需要长期跟同一批商品,自己攒时间序列
  • 要把多个来源拼到一张表里做对比

能取到的是页面上真实存在的东西:商品标题、价格、货币、评分、评论数、类目、卖点、库存状态、上架时间、图片数量、卖家名。取不到的是销量和流量——理由同上,它们不在页面上。

我们在亚马逊商品评论里详细写过评论这一类字段的取法和坑;字段怎么定里写了字段设计本身该怎么想。

一个绕不开的替代思路

一堵灰色砖墙,墙上只开着一扇很小的方形窗的照片

既然销量拿不到,那怎么判断一个品好不好卖?

用可观测的代理指标,并且承认它是代理。

  • 评论数的增量:一段时间内评论数涨了多少,比评论总数有用得多——总数反映的是历史积累,增量反映的是当下
  • 排名的稳定性:一个品长期稳定在类目前列,比某天冲到第一更说明问题
  • 在售状态的变化:反复断货又补货,通常意味着卖得动但备货能力跟不上
  • 同款卖家数量的变化:跟卖的人变多,说明这个品被市场识别为有利可图

这些都需要时间序列才有意义,也就是说得连续采一段时间。单次快照只能告诉你此刻的样子,看不出方向。这是自己采相比买工具的一个实际优势:你可以按自己的节奏、只盯自己关心的那批品,攒一份别人没有的历史。

多国站点对比的三个坑

俯视拍摄的螺旋楼梯井的照片

想做跨国比较,有三件事必须在开始前定好,否则数据采回来是拼不起来的:

一、货币。 不同站点的价格单位不同,需要换算,而且必须记录换算用的汇率和日期。否则三个月后回看这份数据,你不知道当时的数字是按什么汇率折的。

二、类目体系。 同一个平台在不同国家的类目树不完全一致,直接按类目名 join 会错位。要么用平台的类目 ID,要么手工建一张映射表。

三、商品编号。 同一款商品在不同站点可能有不同编号,靠编号跨站匹配会漏。通常需要用标题、品牌、型号组合去做模糊匹配,这一步的准确率要事先说清楚能做到多少。

这些都属于值标准化的范畴,在字段设计阶段就该处理掉,而不是等数据交付之后再补救。

清晨空旷的城市街道的照片

怎么选

先回答一个问题:你要的数字,在不在公开页面上?

在——那么工具和自己采都行,区别是覆盖范围和字段自由度。常见平台常见指标用工具更快;非标需求、冷门站点、需要攒时间序列,自己采更合适。

不在——比如真实销量、真实流量、别人的利润率——那么任何声称能提供的渠道都值得怀疑,先问清楚数字是怎么来的。是估算就按估算用,别写进不能出错的地方。