用 AI 的壞處 – 你幾乎可以問任何問題,它也會認真回答你。 問得愈有水準,答案的神念 [1] 禁制 [2] 就愈多層。我好奇心重,最近問了 AI 三五個大難題,所以它的答案累積起來已經有幾百層禁制了。我的靈力有限,先破解幾個相對簡單的。身為偽資料科學家,就先來整理這個 Wilcoxon [3] 符號等級檢定。
為什麼需要符號檢定?它主要是用來判斷數據是否達到統計上的顯著性。假設我用一個特殊手法 X ,想要降功耗。然後我拿了一顆 IC 來做實驗,測試改善前和改善後的功耗,一量果然降了 5 mW,這樣算有改進嗎? 還是要改進 5% 才算?又或者至少要減個 10 mW?Wilcoxon 符號等級檢定就是要解決這個問題 – 什麼是顯著性?
讓我先用 10 顆 IC 來舉例,稍後再回頭看最少需要幾顆 IC 來驗證?
| mW | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 前 | 15 | 18 | 12 | 13 | 14 | 17 | 16 | 15 | 14 | 15 |
| 後 | 13 | 15 | 12 | 13 | 13 | 15 | 14 | 13 | 12 | 13 |
所謂符號檢定,就是要看改變的方向是否一致?是正號還是負號?
第一步:算出每顆 IC 的差異值(後-前)
| # | 前 | 後 | 差異(後-前) |
|---|---|---|---|
| 1 | 15 | 13 | -2 |
| 2 | 18 | 15 | -3 |
| 3 | 12 | 12 | 0 |
| 4 | 13 | 13 | 0 |
| 5 | 14 | 13 | -1 |
| 6 | 17 | 15 | -2 |
| 7 | 16 | 14 | -2 |
| 8 | 15 | 13 | -2 |
| 9 | 14 | 12 | -2 |
| 10 | 15 | 13 | -2 |
其中有 8 顆 IC 都同方向,有兩顆不變 (#3 和 #4),他們沒有方向。Wilcoxon 就不算這兩顆,有效樣本是 n = 8。
第二步:對剩下 8 個差異的絕對值排等級
剩下值的差異:-2, -3, -1, -2, -2, -2, -2, -2
絕對值:2, 3, 1, 2, 2, 2, 2, 2
排序:1, 2, 2, 2, 2, 2, 2, 3
- 絕對值=1 → 排名第1 → rank=1
- 絕對值=2(六個並列)→ 佔第2~7名 → 平均等級 = (2+3+4+5+6+7)/6 = 4.5
- 絕對值=3 → 排名第8 → rank=8
代回原資料:
| # | 差異 | 等級 | 正/負 |
|---|---|---|---|
| 1 | -2 | 4.5 | 負 |
| 2 | -3 | 8 | 負 |
| 5 | -1 | 1 | 負 |
| 6 | -2 | 4.5 | 負 |
| 7 | -2 | 4.5 | 負 |
| 8 | -2 | 4.5 | 負 |
| 9 | -2 | 4.5 | 負 |
| 10 | -2 | 4.5 | 負 |
全部 8 個都是負等級! 正等級總和 T+ = 0,負等級總和 T–= 1+4.5×6+8 = 36
第三步:算期望值與變異數(n=8,含 ties 校正)
未校正變異數:
因為有 6 個值並列(tie),要扣掉 ties 校正項:
校正後變異數:
其中,第一、二、三步的分母 4、24、48 都是常數,不是隨便設的 [4]。
第四步:算 Z 值
第五步:算 p 值
P 怎麼來? 它就是常態分佈 (μT , σT) ,超出 Z 值的左右兩邊長尾面積的和。

不用作圖,有三種方法解決:
- 查表:統計課本後面附的「標準常態分布表」(Z table),直接查 Z=2.64 對應的累積機率,再算 1 減掉它、乘 2。
- 公式(累積分布函數 CDF):
其中 Φ 是標準常態的 CDF,這是一個已經被證明、寫死在數學公式/查表/軟體裡的函數,不需要「目測」曲線。
- 軟體直接算:SPSS、Excel(
=2*(1-NORM.S.DIST(2.636,TRUE)))、Python(scipy.stats.norm.sf)都是呼叫同一個 CDF 公式算出來的。
判定
- 有效 n = 8(10 筆中 2 筆差異為 0 被排除)
- 8 顆 IC 全部都是「後 < 前」,沒有一個例外 → 最極端的一致性
- Z = -2.636,p = 0.008 < 0.05 = 5% → 達顯著差異,「後」顯著低於「前」
其中的 5% 就是一般人印象中,約定俗成的 α 顯著水準。所以 5% 是對的,但是不能只看一次的測試達到 5% 就過關。而且有效樣本 n ≤ 5 時,無論效果多完美都不可能顯著。
用 Wilcoxon 符號等級檢定的精確分布(exact test)計算「全部差異都同方向」這個最極端情況的雙尾 p 值:
| n(配對數) | 最極端情況下的 p 值 | 結果 |
|---|---|---|
| 5 | 0.0625 | ❌ 不顯著 |
| 6 | 0.0312 | ✅ 顯著 |
| 7 | 0.0156 | ✅ 顯著 |
| 10(你這次) | 0.0020 | ✅ 顯著 |
也就是說:n=6 是這個檢定理論上能達到顯著的最小樣本量(前提是 6 個有效樣本全部同方向、無一例外)。n=5 或更少時,就算 5 個樣本全部同方向,p 值最好也只能到 0.0625,永遠過不了 0.05 這個門檻。
以上就是關於 Wilcoxon 符號等級檢定的備份錄。
[REF]
- 什麼是「神念」?
核心概念:神念(或稱神識)是修仙者強大靈魂力量的延伸,類似於一種高級的精神感知力。修仙者可以用它來探查四周、傳遞訊息,甚至發動精神攻擊。 - 什麼是「禁制」?
功能作用:主要用於保護寶物、封鎖特定區域(如洞府、宗門重地)或限制他人行動。
觸發後果:未經允許強行闖入或破解,會觸發禁制,輕則發出警訊、將人彈開,重則釋放強大攻擊(如神雷、烈火)將入侵者消滅。 - Frank Wilcoxon(1892年—1965年),是一位美國的統計學家和化學家。他在 1945 年提出了著名的非參數統計驗證方法,包括 “符號等級檢定" (Wilcoxon signed-rank test)與 “等級和檢驗" (Wilcoxon rank-sum test)。
- 常數的由來,也算一層禁制。想知道的才按 “閱讀全文"。