秩和檢驗是一種非參數檢驗方法,主要用于比較兩個或多個獨立樣本或配對樣本的分布是否相同。
一、適用情況
數據不滿足參數檢驗假設:
當數據不服從正態分布、方差不齊或總體分布未知時,秩和檢驗是一種合適的選擇。例如,一些社會經濟數據、生物醫學數據可能不滿足正態分布假設,此時使用秩和檢驗可以避免因錯誤使用參數檢驗而導致的錯誤結論。
比如,比較兩種不同治療方法對患者疼痛程度的影響,疼痛程度數據可能不呈正態分布,這時可以采用秩和檢驗。
小樣本數據:
在樣本量較小的情況下,參數檢驗的效力可能會降低,而秩和檢驗相對較為穩健。特別是當樣本量小于 30 時,秩和檢驗常常是更好的選擇。
例如,在一項小型醫學實驗中,只有十幾名患者參與,比較兩種藥物的療效,由于樣本量小且數據可能不滿足正態分布,使用秩和檢驗更為可靠。
有序數據:
對于有序分類數據(如等級數據),秩和檢驗可以有效地比較不同組之間的差異。例如,將患者的病情分為 “輕度”“中度”“重度” 三個等級,比較不同治療方法對病情等級的影響,可以使用秩和檢驗。
二、基本原理
對于兩個獨立樣本的秩和檢驗(Wilcoxon 秩和檢驗或 Mann-Whitney U 檢驗):
將兩個樣本合并后進行排序,得到每個數據的秩次。然后分別計算兩個樣本的秩和。如果兩個樣本來自相同的總體分布,那么它們的秩和應該相近;反之,如果兩個樣本的分布不同,它們的秩和會有較大差異。
通過比較兩個樣本的秩和大小,以及根據特定的統計量計算和參考分布,來判斷兩個樣本是否來自不同的總體分布。
對于多個獨立樣本的秩和檢驗(Kruskal-Wallis 檢驗):
同樣將多個樣本合并后進行排序,得到每個數據的秩次。然后計算每個樣本的秩和。如果多個樣本來自相同的總體分布,那么它們的秩和應該在一定范圍內波動;反之,如果樣本之間存在差異,它們的秩和會有明顯的不同。
通過計算統計量 H,并與特定的分布進行比較,來判斷多個樣本是否來自不同的總體分布。
對于配對樣本的秩和檢驗(Wilcoxon 符號秩檢驗):
計算配對數據的差值,對差值進行排序并賦予秩次。如果配對數據來自相同的總體分布,那么差值的秩和應該接近零;反之,如果存在差異,差值的秩和會偏離零。
通過比較差值的正秩和與負秩和的大小,以及計算特定的統計量,來判斷配對樣本是否存在差異。
三、主要步驟
提出假設:
對于兩個獨立樣本,原假設為兩個樣本來自相同的總體分布;備擇假設為兩個樣本來自不同的總體分布。
對于多個獨立樣本,原假設為多個樣本來自相同的總體分布;備擇假設為多個樣本不全來自相同的總體分布。
對于配對樣本,原假設為配對數據的差值來自對稱分布(即總體中位數為零);備擇假設為配對數據的差值不來自對稱分布。
計算秩和:
根據不同的檢驗類型,將樣本數據進行合并排序,計算相應的秩和。
確定統計量:
根據秩和計算出特定的統計量,如 Wilcoxon 秩和檢驗的 W 統計量、Kruskal-Wallis 檢驗的 H 統計量、Wilcoxon 符號秩檢驗的 T 統計量等。
確定 P 值:
通過查特定的統計量表或使用統計軟件,確定統計量對應的 P 值。
做出結論:
如果 P 值小于預先設定的顯著性水平(通常為 0.05),則拒絕原假設,認為樣本之間存在顯著差異;如果 P 值大于顯著性水平,則接受原假設,認為樣本之間無顯著差異。
四、優點
對數據分布要求寬松:
不依賴于總體分布的具體形式,適用于各種分布形態的數據,具有廣泛的適用性。
對異常值不敏感:
具有較好的穩健性,即使數據中存在異常值,也能提供較為可靠的結果。
計算簡單:
主要涉及數據的排序和秩和計算,相對容易理解和操作。
五、缺點
檢驗效能相對較低:
在總體分布符合參數檢驗假設的情況下,參數檢驗通常比秩和檢驗具有更高的檢驗效能。
對樣本量要求相對較高:
為了達到與參數檢驗相同的檢驗效能,通常需要較大的樣本量。
結果解釋相對復雜:
結果基于秩次,對于不熟悉非參數檢驗的人來說,理解和解釋可能有一定難度。