這個來源最容易被算錯的地方
口碑項目裡最常見的錯誤,是把採到的星級取個平均然後和頁面上的總體評分對比,發現對不上就以為採錯了。
沒採錯,是演算法不同。 平台的總體評分是加權結果,新評論權重更高、評論數量也參與計算。這個數字重現不了,也不需要重現——它和你自己算的星級分佈是兩個不同的指標,各有各的用處:前者反映平台呈現給消費者的印象,後者反映真實的評分組成。
我們的做法是兩個都交付,分成兩列,不做換算。

提需求時建議一併說明的內容
- 是否需要區分邀請評論:幾乎總是需要,否則口碑會看起來偏好。
- 國家範圍:多國業務必須按國家分別採集,否則會把局部問題當成全局。
- 時間範圍:熱門品牌無法全量,限定區間更現實。
- 是否需要企業回覆:回覆率和回覆速度是很有用的衍生指標。
關於數據口徑
每行帶 review_url 與 collected_at,評分與評論量屬於採集時刻的快照。週期性項目保留每次快照而非覆蓋,因為口碑數據的價值在變化過程——某一時刻的評分說明不了甚麼,評分怎樣變、變化前後發生了甚麼才有意義。
