
先分清:这和商家信息采集是两件事
同一个平台,取商家基础信息和取评论,在成本和限制上完全不是一回事。
商家基础信息(名称、地址、电话、类目、评分)在搜索结果列表上就有,一次搜索翻页就能批量拿到。
评论要先定位到具体商家,再点进详情页,再逐页展开评论列表。一百家商家的基础信息,和一百家商家的评论,请求量差一到两个数量级。
这个区分不做,报价和工期都会错。所以提需求时第一句就该说清楚要的是哪一种。
显示的评论数,和能取到的条数

这是这类需求里最常见的误解。
商家页上写着「3,000 条评论」,但实际能翻页取到的往往只有其中一部分。评论列表存在可回溯深度限制,超出的部分不是采集不到,是平台不再往下展示。
这不是能力问题,也不会因为多花钱而改变。需要注意的是:
- 不同商家的可取比例不一样,评论越多的商家,能取到的比例通常越低
- 不能用取到的条数除以显示总数当作覆盖率去做统计推断,因为取到的那部分不是随机样本
测试阶段我们会先跑几个代表性商家,把「显示多少、实际取到多少」的实测数字给你,再决定这个需求要不要按原方案做。
排序决定你取到的是哪一批

评论列表有多种排序方式,而你只能取到排在前面的那些。这意味着排序方式直接决定了样本构成:
按最相关排序(多数平台的默认)——排前面的是被判定为高质量、高互动的评论。这些评论往往更长、更详细,但也更可能是被反复展示因而影响力被放大的那批。用这个排序做「大家怎么评价这家店」的整体印象是合理的,做「最近有没有出问题」则会漏掉新近的差评。
按最新排序——能拿到近期评论,适合口碑监测和变化追踪。但会漏掉那些长期被顶在前面的高影响力评论,做整体印象分析会失真。
结论是:排序方式必须写进需求,并且写进交付说明。 同一家商家,两种排序取到的评论集合可能重叠不到一半——如果两批数据用了不同排序还拿来对比,得出的「口碑变化」很可能是排序造成的假象。
本地向导权重

平台会给活跃评论者标记等级,这类账号的评论在排序中通常有更高权重。
对你的影响是:按默认排序取到的评论,会系统性偏向活跃评论者。这批人的评论习惯和普通用户不同——写得更长、更常给出细节、评分分布也可能不一样。
这不是坏事,但要知道。做情感倾向统计时,如果不区分评论者类型,得到的分布不能代表全体顾客。我们默认保留页面公开显示的评论者等级标记,就是为了让你能做这个区分。
明确不做的:评论者的身份识别、跨平台账号关联、联系方式挖掘。找到写差评的人是谁不在承接范围内,这一条没有例外,完整边界写在海外公开数据采集的合规边界。
评论数据适合做什么

适合:
- 口碑变化监测 —— 固定排序、固定周期重复采集,看差评是不是在增多、集中在什么问题上
- 竞品对比 —— 同一批条件下取多家商家的评论,比较关注点差异
- 选址与市场研究 —— 某个区域的同类商家普遍被抱怨什么,是进入前值得知道的
- 产品与服务改进 —— 从评论文本里提取反复出现的具体问题
不适合:
- 精确的评分统计 —— 取到的不是全量,算出来的平均分不等于页面显示的评分
- 单次快照下结论 —— 评论是累积的,一次采集只能看到当下的横截面
- 判断评论真实性 —— 公开页面上没有可靠依据,任何声称能识别刷评的说法都要谨慎
提需求时说清这五项

- 商家范围:按关键词加地区搜出来的全部,还是你给定的商家清单
- 每家取多少条:全部(受深度限制)还是取前 N 条
- 排序方式:最新还是最相关——这一条决定样本构成,必须定
- 是否需要评论者等级标记:做分层分析就要,只看文本可以不要
- 一次性还是周期性:口碑监测必须是周期性的,单次没有比较基准
这五项确定后,测试阶段会先跑几个商家把实测可取条数给你。字段口径与快照时间的处理原则写在海外数据的字段值怎么统一,商家信息采集本身的说明在 Google Maps 平台页。
