
先分清:這和商家資訊擷取是兩件事
同一個平台,取商家基礎資訊和取評論,在成本和限制上完全不是一回事。
商家基礎資訊(名稱、地址、電話、類目、評分)在搜尋結果列表上就有,一次搜尋翻頁就能批次拿到。
評論要先定位到具體商家,再點進詳情頁,再逐頁展開評論清單。一百家商家的基礎資訊,和一百家商家的評論,請求量差一到兩個數量級。
這個區分不做,報價和工期都會錯。所以提需求時第一句就該說清楚要的是哪一種。
顯示的評論數,和能取到的筆數

這是這類需求裡最常見的誤解。
商家頁上寫著「3,000 則評論」,但實際能翻頁取到的往往只有其中一部分。評論清單存在可回溯深度限制,超出的部分不是擷取不到,是平台不再往下展示。
這不是能力問題,也不會因為多花錢而改變。需要注意的是:
- 不同商家的可取比例不一樣,評論越多的商家,能取到的比例通常越低
- 不能用取到的筆數除以顯示總數當作涵蓋率去做統計推斷,因為取到的那部分不是隨機樣本
測試階段我們會先跑幾個代表性商家,把「顯示多少、實際取到多少」的實測數字給你,再決定這個需求要不要依原方案做。
排序決定你取到的是哪一批

評論清單有多種排序方式,而你只能取到排在前面的那些。這意味著排序方式直接決定了樣本構成:
依最相關排序(多數平台的預設)——排前面的是被判定為高品質、高互動的評論。這些評論往往更長、更詳細,但也更可能是被反覆展示因而影響力被放大的那批。用這個排序做「大家怎麼評價這家店」的整體印象是合理的,做「最近有沒有出問題」則會漏掉新近的負評。
依最新排序——能拿到近期評論,適合口碑監測和變化追蹤。但會漏掉那些長期被頂在前面的高影響力評論,做整體印象分析會失真。
結論是:排序方式必須寫進需求,並且寫進交付說明。 同一家商家,兩種排序取到的評論集合可能重疊不到一半——如果兩批資料用了不同排序還拿來比較,得出的「口碑變化」很可能是排序造成的假象。
在地嚮導權重

平台會給活躍評論者標記等級,這類帳號的評論在排序中通常有更高權重。
對你的影響是:依預設排序取到的評論,會系統性偏向活躍評論者。這批人的評論習慣和一般使用者不同——寫得更長、更常給出細節、評分分布也可能不一樣。
這不是壞事,但要知道。做情感傾向統計時,如果不區分評論者類型,得到的分布不能代表全體顧客。我們預設保留頁面公開顯示的評論者等級標記,就是為了讓你能做這個區分。
明確不做的:評論者的身分識別、跨平台帳號關聯、聯絡方式挖掘。找到寫負評的人是誰不在承接範圍內,這一條沒有例外,完整邊界寫在海外公開資料擷取的合規邊界。
評論資料適合做什麼

適合:
- 口碑變化監測 —— 固定排序、固定週期重複擷取,看負評是不是在增多、集中在什麼問題上
- 競品比較 —— 同一批條件下取多家商家的評論,比較關注點差異
- 選址與市場研究 —— 某個區域的同類商家普遍被抱怨什麼,是進入前值得知道的
- 產品與服務改進 —— 從評論文字裡提取反覆出現的具體問題
不適合:
- 精確的評分統計 —— 取到的不是全量,算出來的平均分不等於頁面顯示的評分
- 單次快照下結論 —— 評論是累積的,一次擷取只能看到當下的橫截面
- 判斷評論真實性 —— 公開頁面上沒有可靠依據,任何聲稱能識別刷評的說法都要謹慎
提需求時說清這五項

- 商家範圍:依關鍵字加地區搜出來的全部,還是你給定的商家清單
- 每家取多少則:全部(受深度限制)還是取前 N 則
- 排序方式:最新還是最相關——這一條決定樣本構成,必須定
- 是否需要評論者等級標記:做分層分析就要,只看文字可以不要
- 一次性還是週期性:口碑監測必須是週期性的,單次沒有比較基準
這五項確定後,測試階段會先跑幾個商家把實測可取筆數給你。欄位口徑與快照時間的處理原則寫在海外資料的欄位值怎麼統一,商家資訊擷取本身的說明在 Google Maps 平台頁。
