
先分清:這和商戶資訊採集是兩件事
同一個平台,取商戶基礎資訊和取評論,在成本和限制上完全不是一回事。
商戶基礎資訊(名稱、地址、電話、類目、評分)在搜尋結果列表上就有,一次搜尋翻頁就能批量拿到。
評論要先定位到具體商戶,再點進詳情頁,再逐頁展開評論列表。一百家商戶的基礎資訊,和一百家商戶的評論,請求量差一到兩個數量級。
這個區分不做,報價和工期都會錯。所以提需求時第一句就該說清楚要的是哪一種。
顯示的評論數,和能取到的條數

這是這類需求裡最常見的誤解。
商戶頁上寫著「3,000 條評論」,但實際能翻頁取到的往往只有其中一部分。評論列表存在可回溯深度限制,超出的部分不是採集不到,是平台不再往下展示。
這不是能力問題,也不會因為多花錢而改變。需要注意的是:
- 不同商戶的可取比例不一樣,評論越多的商戶,能取到的比例通常越低
- 不能用取到的條數除以顯示總數當作覆蓋率去做統計推斷,因為取到的那部分不是隨機樣本
測試階段我們會先跑幾個代表性商戶,把「顯示多少、實際取到多少」的實測數字給你,再決定這個需求要不要按原方案做。
排序決定你取到的是哪一批

評論列表有多種排序方式,而你只能取到排在前面的那些。這意味著排序方式直接決定了樣本構成:
按最相關排序(多數平台的預設)——排前面的是被判定為高質量、高互動的評論。這些評論往往更長、更詳細,但也更可能是被反覆展示因而影響力被放大的那批。用這個排序做「大家怎樣評價這家店」的整體印象是合理的,做「最近有沒有出問題」則會漏掉新近的差評。
按最新排序——能拿到近期評論,適合口碑監測和變化追蹤。但會漏掉那些長期被頂在前面的高影響力評論,做整體印象分析會失真。
結論是:排序方式必須寫進需求,並且寫進交付說明。 同一家商戶,兩種排序取到的評論集合可能重疊不到一半——如果兩批數據用了不同排序還拿來對比,得出的「口碑變化」很可能是排序造成的假象。
本地嚮導權重

平台會給活躍評論者標記等級,這類帳戶的評論在排序中通常有更高權重。
對你的影響是:按預設排序取到的評論,會系統性偏向活躍評論者。這批人的評論習慣和普通用戶不同——寫得更長、更常給出細節、評分分佈也可能不一樣。
這不是壞事,但要知道。做情感傾向統計時,如果不區分評論者類型,得到的分佈不能代表全體顧客。我們預設保留頁面公開顯示的評論者等級標記,就是為了讓你能做這個區分。
明確不做的:評論者的身份識別、跨平台帳戶關聯、聯絡方式挖掘。找到寫差評的人是誰不在承接範圍內,這一條沒有例外,完整邊界寫在海外公開數據採集的合規邊界。
評論數據適合做甚麼

適合:
- 口碑變化監測 —— 固定排序、固定週期重複採集,看差評是不是在增多、集中在甚麼問題上
- 競品對比 —— 同一批條件下取多家商戶的評論,比較關注點差異
- 選址與市場研究 —— 某個區域的同類商戶普遍被抱怨甚麼,是進入前值得知道的
- 產品與服務改進 —— 從評論文字裡提取反覆出現的具體問題
不適合:
- 精確的評分統計 —— 取到的不是全量,算出來的平均分不等於頁面顯示的評分
- 單次快照下結論 —— 評論是累積的,一次採集只能看到當下的橫截面
- 判斷評論真實性 —— 公開頁面上沒有可靠依據,任何聲稱能識別刷評的說法都要謹慎
提需求時說清這五項

- 商戶範圍:按關鍵詞加地區搜出來的全部,還是你給定的商戶清單
- 每家取多少條:全部(受深度限制)還是取前 N 條
- 排序方式:最新還是最相關——這一條決定樣本構成,必須定
- 是否需要評論者等級標記:做分層分析就要,只看文字可以不要
- 一次性還是週期性:口碑監測必須是週期性的,單次沒有比較基準
這五項確定後,測試階段會先跑幾個商戶把實測可取條數給你。欄位口徑與快照時間的處理原則寫在海外數據的欄位值怎樣統一,商戶資訊採集本身的說明在 Google Maps 平台頁。
