一根深窄的量筒与一个宽浅的托盘并列的特写

挖深还是铺开:这是第一个决定

想要一万条评论做文本分析,有两条路:

  • 挖深:找一个爆款商品,把它的评论尽量取全
  • 铺开:取一百个商品,每个取前一百条

多数人第一反应是挖深,但平台机制不允许——单个商品的评论列表有可翻页深度上限,超出部分不再展示。一个显示两万条评论的爆款,实际能翻到的往往只是其中一部分。

而且即使能取全,挖深也不一定是对的:一个商品的评论只反映那一个商品的问题。做品类研究、做产品改进方向判断,横向铺开的样本代表性更好。

所以正确的问法不是「能取多少条」,是「这个分析需要多少个商品的多少条评论」。这两个数字定下来,可行性才有意义。

变体评论:不定口径必失真

一排颜色不同但形状相同的容器

同一件商品的不同颜色、尺寸,在平台上共用一个父商品编号,但各自有子编号。评论在页面上通常是合并展示的——你看到的两万条评论,可能横跨十几个变体。

这带来两个必须先定的口径:

一、按父编号还是子编号交付。 按父编号:一条商品记录对应全部评论,数量大但你不知道某条评论说的是哪个规格。 按子编号:能对应到具体规格,但同一条评论可能在多个子编号下重复出现。

二、去重规则。 如果按子编号取,同一条评论出现在多个变体下算几条?不定这个,最终条数可能虚高好几倍,而你在做词频统计时会把同一句话数很多次。

做产品改进分析时这一条尤其关键——「这个尺码偏小」和「这个颜色偏暗」是两个完全不同的问题,混在一起看等于没看。测试阶段我们会把两种口径的样例并排给你,确认后再全量。

相关的合并口径问题写在多个来源的数据怎么合并

激励评论:能标记,不能保证识别

评分星形的立体渲染,其中几个颜色略深

平台对部分激励评论有标记,但覆盖并不完整。所以我们不做「这条是不是刷的」这种判断,只保留能让你自己判断的原始维度:

  • 评分分布形态 —— 正常商品的评分分布通常有一定形状,异常尖锐的分布值得警惕
  • 发布时间密集程度 —— 短时间内集中出现大量好评,是一个信号
  • 已验证购买标记 —— 页面公开显示的,我们照原样保留

做竞品对比时这一点特别重要。 如果不看这两个维度,很容易把对方的运营力度误读成产品口碑——一个投了大量激励的竞品,评分会明显高于它的真实水平。

这和 B2B 软件评论站的情况类似,那边的说明在 B2B 软件评论站

评论文本能回答什么问题

打开的笔记本上密集排列的空白横线特写

能回答

  • 反复出现的具体问题 —— 尺码、材质、说明书、包装、物流,这类具体抱怨在评论里最密集
  • 和竞品比差在哪 —— 同品类多个商品的评论放一起,差评主题的差异往往很明显
  • 详情页该补什么 —— 大量评论在问同一个问题,说明详情页没讲清楚
  • 差评是不是在增多 —— 需要周期性采集,单次快照没有基准

回答不了

  • 精确的好评率 —— 取到的不是全量,算出来的比例不等于页面显示的评分
  • 谁在写差评 —— 不做身份识别,这一条没有例外
  • 评论真伪 —— 前面说过,只给判断依据不给结论

采集节奏与快照

台面上并排的三个相同沙漏,沙量不同

评论是累积型数据,和价格那种快照字段不一样:

  • 价格今天和明天不同,取的是两个瞬间
  • 评论今天和明天不同,是因为多了几条——旧的还在

所以评论的周期性采集不是覆盖式更新,而是增量追加。我们默认保留每次采集的完整结果并标记采集时间,这样你能还原「差评是什么时候开始集中出现的」——这个时间点往往比差评内容本身更有价值,因为它能对上你的某次改版或换供应商。

周期性项目要提前定的事写在周期性数据更新要提前确认什么

提需求时说清这五项

空白表单纸与钢笔的桌面特写

  • 商品范围:给定 ASIN 清单,还是按关键词/类目搜出来的一批
  • 每个商品取多少条:受深度限制,说清是「尽量全」还是「前 N 条」
  • 变体口径:父编号还是子编号,重复评论怎么去重
  • 站点:不同国家站的评论是分开的,要几个站说清楚
  • 一次性还是周期性:看变化必须周期性,看现状一次就够

这五项定下来,测试阶段会先跑几个代表性商品,把实测可取条数和两种变体口径的差异给你。商品与价格采集本身的说明在 Amazon 平台页,地图评论的对应说明在谷歌地图评论怎么采集