這個來源最容易被算錯的地方
口碑專案裡最常見的錯誤,是把擷取到的星等取個平均然後和頁面上的總體評分比較,發現對不上就以為擷取錯了。
沒擷取錯,是演算法不同。 平台的總體評分是加權結果,新評論權重更高、評論數量也參與計算。這個數字重現不了,也不需要重現——它和你自己算的星等分布是兩個不同的指標,各有各的用處:前者反映平台呈現給消費者的印象,後者反映真實的評分組成。
我們的做法是兩個都交付,分成兩欄,不做換算。

提需求時建議一併說明的內容
- 是否需要區分邀請評論:幾乎總是需要,否則口碑會看起來偏好。
- 國家範圍:多國業務必須依國家分別擷取,否則會把局部問題當成全域。
- 時間範圍:熱門品牌無法全量,限定區間更現實。
- 是否需要企業回覆:回覆率和回覆速度是很有用的衍生指標。
關於資料口徑
每一列帶 review_url 與 collected_at,評分與評論量屬於擷取時刻的快照。週期性專案保留每次快照而非覆蓋,因為口碑資料的價值在變化過程——某一時刻的評分說明不了什麼,評分怎麼變、變化前後發生了什麼才有意義。
