一疊卡片中只有最上面幾張被抽出的桌面特寫

先分清:這和商家資訊擷取是兩件事

同一個平台,取商家基礎資訊和取評論,在成本和限制上完全不是一回事。

商家基礎資訊(名稱、地址、電話、類目、評分)在搜尋結果列表上就有,一次搜尋翻頁就能批次拿到。

評論要先定位到具體商家,再點進詳情頁,再逐頁展開評論清單。一百家商家的基礎資訊,和一百家商家的評論,請求量差一到兩個數量級。

這個區分不做,報價和工期都會錯。所以提需求時第一句就該說清楚要的是哪一種。

顯示的評論數,和能取到的筆數

兩個刻度不同的量筒並排擺放的特寫

這是這類需求裡最常見的誤解。

商家頁上寫著「3,000 則評論」,但實際能翻頁取到的往往只有其中一部分。評論清單存在可回溯深度限制,超出的部分不是擷取不到,是平台不再往下展示。

這不是能力問題,也不會因為多花錢而改變。需要注意的是:

  • 不同商家的可取比例不一樣,評論越多的商家,能取到的比例通常越低
  • 不能用取到的筆數除以顯示總數當作涵蓋率去做統計推斷,因為取到的那部分不是隨機樣本

測試階段我們會先跑幾個代表性商家,把「顯示多少、實際取到多少」的實測數字給你,再決定這個需求要不要依原方案做。

排序決定你取到的是哪一批

一副攤開的紙牌,只有靠前幾張正面朝上

評論清單有多種排序方式,而你只能取到排在前面的那些。這意味著排序方式直接決定了樣本構成:

依最相關排序(多數平台的預設)——排前面的是被判定為高品質、高互動的評論。這些評論往往更長、更詳細,但也更可能是被反覆展示因而影響力被放大的那批。用這個排序做「大家怎麼評價這家店」的整體印象是合理的,做「最近有沒有出問題」則會漏掉新近的負評。

依最新排序——能拿到近期評論,適合口碑監測和變化追蹤。但會漏掉那些長期被頂在前面的高影響力評論,做整體印象分析會失真。

結論是:排序方式必須寫進需求,並且寫進交付說明。 同一家商家,兩種排序取到的評論集合可能重疊不到一半——如果兩批資料用了不同排序還拿來比較,得出的「口碑變化」很可能是排序造成的假象。

在地嚮導權重

大小不同的三枚金屬徽章的特寫

平台會給活躍評論者標記等級,這類帳號的評論在排序中通常有更高權重。

對你的影響是:依預設排序取到的評論,會系統性偏向活躍評論者。這批人的評論習慣和一般使用者不同——寫得更長、更常給出細節、評分分布也可能不一樣。

這不是壞事,但要知道。做情感傾向統計時,如果不區分評論者類型,得到的分布不能代表全體顧客。我們預設保留頁面公開顯示的評論者等級標記,就是為了讓你能做這個區分。

明確不做的:評論者的身分識別、跨平台帳號關聯、聯絡方式挖掘。找到寫負評的人是誰不在承接範圍內,這一條沒有例外,完整邊界寫在海外公開資料擷取的合規邊界

評論資料適合做什麼

工廠檢驗台的照片,上方懸浮著兩個立體方塊

適合

  • 口碑變化監測 —— 固定排序、固定週期重複擷取,看負評是不是在增多、集中在什麼問題上
  • 競品比較 —— 同一批條件下取多家商家的評論,比較關注點差異
  • 選址與市場研究 —— 某個區域的同類商家普遍被抱怨什麼,是進入前值得知道的
  • 產品與服務改進 —— 從評論文字裡提取反覆出現的具體問題

不適合

  • 精確的評分統計 —— 取到的不是全量,算出來的平均分不等於頁面顯示的評分
  • 單次快照下結論 —— 評論是累積的,一次擷取只能看到當下的橫截面
  • 判斷評論真實性 —— 公開頁面上沒有可靠依據,任何聲稱能識別刷評的說法都要謹慎

提需求時說清這五項

空白表單紙與鋼筆的桌面特寫

  • 商家範圍:依關鍵字加地區搜出來的全部,還是你給定的商家清單
  • 每家取多少則:全部(受深度限制)還是取前 N 則
  • 排序方式:最新還是最相關——這一條決定樣本構成,必須定
  • 是否需要評論者等級標記:做分層分析就要,只看文字可以不要
  • 一次性還是週期性:口碑監測必須是週期性的,單次沒有比較基準

這五項確定後,測試階段會先跑幾個商家把實測可取筆數給你。欄位口徑與快照時間的處理原則寫在海外資料的欄位值怎麼統一,商家資訊擷取本身的說明在 Google Maps 平台頁