BH-FDR 小筆記

BH 代表這是 BenjaminiHochberg 這兩個人提出的一種統計方法。FDR 表示 false discovery rate,顧名思義,這個方法用來檢測偽陽性率。

它計算的對象不是原始數據,而是顯著性檢定時的那個 p。本來在 p < 5% 時就判定有顯著性。但其中也可能有偽陽性的存在,所以要再多做一個 BH-FDR 把它揪出來。

假設你做了 6 次檢定,得到這些 p 值,乍看之下有五個顯著,C 不顯著,E = 0.049,剛好在邊緣,看了有點不放心,那就適合 BH-FDR。先看簡單的臨界值法。

檢定原始 p 值
A0.021
B0.004
C0.130
D0.018
E0.049
F0.001

我們設定 “假發現率水準":α=0.05

總檢定數:m=6

第 1 步:把 p 值由小到大排序

排序後:

排名 ip 值 pi對應原檢定
10.001F
20.004B
30.018D
40.021A
50.049E
60.130C

第 2 步:計算每個排名的 BH 臨界值

公式是:imα

因為 m=6、α=0.05,所以:

排名 ip 值 piBH 臨界值 i6×0.05
10.0010.0083
20.0040.0167
30.0180.0250
40.0210.0333
50.0490.0417
60.1300.0500

第 3 步:找最大的 i,使得

piimα逐一比較:

  • 0.0010.00830.001≤0.0083,成立
  • 0.0040.01670.004≤0.0167,成立
  • 0.0180.02500.018≤0.0250,成立
  • 0.0210.03330.021≤0.0333,成立
  • 0.0490.04170.049≤0.0417,不成立
  • 0.1300.05000.130≤0.0500,不成立

所以最大的符合者是:i=4


第 4 步:判定顯著結果

BH 方法會把 排名 1 到 4 的檢定都視為顯著。

所以顯著的檢定是:

  • F
  • B
  • D
  • A

不顯著的是:

  • E
  • C

由於 p 值這種東西不能看平均值,也無法正規化,所以用排名來解決。假如不喜歡排名,也有純計算的方法,方法二就是計算 q 值。

q 值的定義:qᵢ = pᵢ × m / i(m=檢定總數 6,i=該 p 在排序中的排名),利用前面排好的順序,代公式算出 q。

步驟 1:算原始 qi
原始 p 值原始 q
0.001 q = p×6/1: 0.0060
0.004q = p×6/2: 0.0120
0.018q = p×6/3: 0.0360
0.021 q = p×6/4: 0.03155
0.049q = p×6/5: 0.0588
0.130q = p×6/6: 0.1300
步驟 2:單調化(關鍵!)

q 必須隨排名單調遞增,所以從最後往前取累積最小值,方向和方法一相反:

qiBH 校正後的 q
q₆ = 0.1300
q₅ = min(0.0588, 0.1300) 0.0588
q₄ = min(0.0315, 0.0588)0.0315
q₃ = min(0.0360, 0.0315)0.0315 (同上)
q₂ = min(0.0120, 0.0315)0.0120
q₁ = min(0.0060, 0.0120)0.0060
步驟 3:用 q < 0.05 篩選
  • p1: 0.001 ,q = 0.006 < 0.05 ,成立
  • p2: 0.004 • q = 0.0120 <0.05,成立
  • p3: 0.018 • q = 0.0315 <0.05,成立
  • p4: 0.021 • q = 0.0315 <0.05,成立
  • p5: 0.049 • q = 0.0588 <0.05,不成立
  • p6: 0.049 • q = 0.1300 <0.05,不成立

結果和方法一是一樣的。為什麼要做這件事呢?假如今天我要做很多次檢定,例如跑 10 種 LLM model 測試 5 種演算法,一共跑了 50 組。每一組信心程度都是 95%。那麼在這麼多測試當中,有 1−(0.95)50 ≈ 92.3% 的機率產生一次歪打正著,結果和其他人相反。但你不能拿這一組數據證明什麼天大的發現?除非你經過了 BH-FDR 測試後,它仍然是顯著。

McNemar 精確檢定小筆記

這又是一種檢測顯著性的方法。上次已經提過 Wilcoxon 符號等級檢定, 這次擴充到 McNemar 檢定。世足賽過去沒多久,McNemar 令我聯想到巴西的內馬爾 (Neymar),但是少了一個 Y。 兩者沒有關係。至於 Mc 開頭的人名,在蓋爾語(蘇格蘭和愛爾蘭),意思是「…的兒子」或「…的孩子」。

Wilcoxon (藍色) 和 NcNemar (紅色) 在下表中,可以看出他們都是處理相依樣本 (使用前、使用後);最大差異是 Wilcoxon 處理連續資料,McNemar 處理類別資料。至於獨立樣本那部分,現在還不在我的 study 雷達範圍。我沒有要改行做統計,所以暫時不會去研究。

資料類型資料分佈 / 特徵獨立樣本
(
兩組不同的人)
配對 / 相依樣本
(
同一組人前後測)
連續型資料
(如:身高、分數)
符合常態分配
(有母數檢定)
獨立樣本 t 檢定獨立樣本 t 檢定
非常態 / 順序尺度
(無母數檢定)
曼-惠特尼 U 檢定
(Mann-Whitney U)
或稱 Wilcoxon 秩和檢定
Wilcoxon 符號等級檢定
(Wilcoxon Signed-Rank)
類別型資料
(如:是/否、過關/淘汰)
計數 / 比例分佈卡方同質性檢定
(或卡方獨立性檢定)
McNemar 檢定

相較於 Cohen’s Kappa 同時考慮相同、不同的分類,McNemar test 只看不同的。假設有考生參加第一次模擬考試後,跑去參加了魔鬼衝刺班,然後又拿一樣的考卷再考一次。

前測 \ 後測答對答錯合計
答對15318
答錯121022
合計271340

我們忽略掉本來就會的 (15 題)、還有補了也不會的 (10 題),專門看有差異的部分;也就是 “對變錯" 的 3 題 (參數 b),和 “錯變對" 的 12 題 (參數 c)。對變錯可能是粗心、或是沒有訂正的習慣,看到題目就想起錯的答案…等等。

把 b、c 帶入 Mcnemar test 公式,計算 X

χ2 = (|3-12|-1)2 / (3+12) = 64 / 15 ​≈ 4.27

這個值服從自由度為 1 的卡方分配,查表可以得到 p≈0.039 < 5%,所以表示顯著。也就是補習有用!

當考試題目不是 40 題,而是只有 10 題的話。那麼 b、c 的值可能很小,這樣算出的 x 會顯得不夠可靠。例如:

前測 \ 後測答對答錯合計
答對303
答錯617
合計9110

帶公式 χ2 = (|0-6|-1)2 / (0+6) = 25 / 6 ​≈ 4.17,查表 p≈0.041,雖然 0.041 還是小於 5%,但是慢慢逼近門檻值了。明明進步了 6 題,而且沒有任何一題 “對變錯",我們直覺這個補習很有用,但是數字不漂亮。

這個時候,我們該用的是精確測試。我們現在變化的有 6 題,全部都是變好。假設跟擲骰子一樣,擲出 6 個雙數的機率 p = (1/2)6 = 0.015625。在另外一方向上 (對變錯),同樣是擲出 6 個單數,機率一樣。兩邊機率相加,p=P(X=6)+P(X=0)=641​+641​=642​=0.03125。

p=0.03125<0.05 比 0.041 還要明顯,所以數字小的時候,適合做 McNemar exact test。

Exact test 不只 McNemar 這一家開張,在兩組獨立樣本時,我們會用 Fisher’s exact test。萬能的天神保佑,我不會需要研究它!

[REF]

Cohen’s Kappa 和 RANSAC

這是兩個關鍵字類似的名詞,前者和 “隨機期望一致" 有關,後者和 “隨機抽樣一致" 有關。先講前者。

假設有兩個法官,一個是公職的法官 A,一個是國民法官 B。我們知道即使九位國民法官意見都一樣,但三位公職法官意見不一樣時,被告都是可教化的,所以我們只各找一位來當例子就好。這兩位法官剛好同時參加過 100 場審判,判決結果如下:

國民法官 B: 有罪國民法管 B: 無罪總和
法官 A: 有罪 60565
法官 A: 無罪102535
總和7030100

Kappa 的公式如下,有時簡稱 K 值:

其中,Po 是兩個法官都有共識的比例,Pe 是兩個法官做出相同判定的期望值。

P0 = (60+25) /100 = 85% (兩個對角線粗體)

Pe = 65/100 * 35/100 + 70/100 * 30/100 = 0.65 * 0.35 + 0.7 * 0.3 = 0.2275 + 0.21 = 0.5475 (紅配紅 + 藍配藍)

Kappa = (0.85 – 0.5475) / (1 – 0.5475) = 0.3025 / 0.4525 = 66.85%

這個值好嗎?

Kappa (k 值)意義
<0.20幾乎沒有共識
0.21–0.40尚可 (fair)
0.41–0.60中等 (moderate)
0.61–0.80高度共識 (substantial)
81–1.00幾乎完全一致

它的數學意義是:Pe 代表雙方意見一致的機率。Po 只是表示有多少比例意見一樣。看似是一樣的東西,但是假設公職法官 A 其實一律都喜歡判無罪,即使國民法官 B 只會判二成無罪,雙方理念根本不同,只是恰好有 20% 結果相似。此時 Po 還是有 20%。而 Pe = 0 + 0.2 = 0.2 = P0,Kappa 直接就歸零了。也就是說 Kappa 抹除了恰好答案一樣的機率。

國民法官 B: 有罪國民法管 B: 無罪總和
法官 A: 有罪000
法官 A: 無罪8020100
總和8020100

我們也可以推廣到是非題考試,甲生每一題都選 O,乙生靠轉公正的筆作答。結果兩人答案有 50% 一樣 (P0 = 50%),兩生有五成作弊的嫌疑…. 嗎?看 Pe (隨機期望一致) 就知道沒有作弊。


至於 RANSAC (RANdom SAmple Consensus) [1] 和 “隨機抽樣一致" 有關。顧名思義,隨機抽樣會抽好幾次。假設我們去夜市玩,遊戲是從摸彩箱中抽出乒乓球,抽中紅色有獎,抽中白色摃龜,抽完球要放回去。箱子裡總共有 100 顆球,其中有獎的機率是 {\displaystyle w}。我的玩法是一把抓 n 顆球,然後預算足夠玩 k 次。

如果我一把抓 n 顆球全部中獎,機率顯然是 {\displaystyle w^{n}} 。至少有一顆沒中 (白球) 的機率是 1-{\displaystyle w^{n}} 。K 次嘗試後,每次都至少有一顆白球的機率是 ( 1-{\displaystyle w^{n}})k。假設我的目標是,不管玩幾次,有一把全紅才叫做成功,假設這機率是 p,失敗率就是 1 – p

1 – p = ( 1-{\displaystyle w^{n}})k

{\displaystyle k={\frac {\log(1-p)}{\log(1-w^{n})}}}

這裡的 k 和 Kappa 的 k 顯然是兩回事。這個公式告訴我們,目標愈大 (n 大),通常要嘗試愈多次 (k)。想成功 (p 大),也要嘗試愈多次 (k 大)。挑戰的題目很大 (w 小),還是要嘗試很多次。雖然都是要嘗試,至少我們知道 w,決定 n 之後,大致能知道 kp 的關係。

Ransack 的中文意思是「洗劫」、「掠奪」或「翻箱倒櫃地徹底搜查」。RANSAC 比較正面,這個演算法是用來從一群有雜訊 (離群值) 的數據中,歸納出最多證據支持的數學模型 (可以是高維度,但通常只看到二維的例子)。

我們猜的模型可能需要 n 個點才畫得出來 – 直線只要兩點 (n = 2),雙曲線可能要 5 個點。假設,為了猜這些點是否能用雙曲線模型來模擬,我們需要先一把抓 5 點 (x1​,y1​),…,(x5​,y5​),看它能不能連成雙曲線?

它可以寫成矩陣 Mh=0,其中

這個模型有 A、B、C、D、E、F 共6 個係數,但只差一個比例因子,所以自由度是 5。只要看 B2 − 4AC > 0 成不成立?就知道基本像不像雙曲線?(先忽略退化檢查,嗚嗚嗚,難怪大家都愛舉直線為例。)如果看起來不像雙曲線,就再抓一把 5 個點來評估。

評估方法是把 “所有點" 都對雙曲線模型計算殘差 (測量距離方法可彈性選擇)。如果這個模型正確,顯然會有更多的點落在這條虛擬的雙曲線上。至於那些沒抓的點算不算是在模型之內?就要看誤差大小。若殘差小於門檻 τ,就當成 inlier (內點),反之是 outlier (離群值)。我們數數這次總共有多少點是內點?記下來找最大值。最後選出抓到最多內點的那個組合就是候選最佳模型。

我們考慮雙曲線模型的話,第一個變數就定下來,n = 5。接著我們還要對資料的品質有點手感,w 是內點的比例;假設這次是估 60% – 100 個點中有 60 個內點,40 個離群值。我希望成功率 99%,那麼至少應該嘗試抓幾次呢?根據前面公式的變化形態:

大約要跑 57 次 RANSAC iteration,才有 99% 信心至少一次抽到全內點的 5 點樣本,也就是可以直接畫出雙曲線。才試 10 次不用放棄!反之,那試了 570 次都失敗,是否模型一定猜錯呢?AI 很客觀地說,什麼事都有可能?模型猜錯只是其中一種可能,儘管模型正確的機率極低。

更有可能是資料很髒,w = 0.2,80% 的資料都是雜訊。那失敗 570 次也很正常,機率高達 83%。

總之,RANSAC 提供了一種客觀的評估邏輯。細看公式就會發現,一次抓 10 點又全對的機率反而比較小,導致要抓更多次才會過關。因此在嘗試階段只會抓 minimum 點數,到最後要修飾模型時,才會抓更大把的內點來調整模型的參數。

[REF]

  1. 隨機抽樣一致

RRF 小筆記

此處的 RRF 是指 Reciprocal Rank Fusion,中文叫做倒數排名融合。第一個關鍵字是倒數,不是ㄉㄠ \ㄕㄨ V ,是 ㄉㄠ V ㄕㄨ \ ,誰的倒數呢? 這就是第二個關鍵字 – 排名的倒數,跟上次的 Wilcoxom 一樣,排名是個最簡單的指標,不用量化,最小的就是 1,然後愈來愈大,至少平手。

第三個關鍵字是融合,表示可以用多種方式排名,然後混在一起算。當然,這就有可能要給不同的方法一個權重。對於所有排名清單集合 R,某個排名清單編號 r ,文件 d 的 RRF(d) 分數如下。其中 k 是一個正值的常數,用來使排名第一和第二的差異不要太懸殊。另一方面,這個值會使得排名在後面的 d 們,RRF (d) 看起來也都差不多,故稱為平滑常數。

那為何不把一種排名做好,要拿一堆排名來融合呢?這個跟基測、會考、聯考一樣,取的是通才。如果只看少數指標,那就是指考了。也沒有不行,就看是哪種應用。有些學校比較看重特定科目,就可以個別給加權分數。

舉例來說,我們希望從 RAG 中找出與使用者提問最相關的資料。然而,「相關」或「相似」本來就沒有唯一的判斷標準,因此我們不侷限於單一檢索方式,而是同時採用 BM25、向量檢索(Vector Retrieval)、Metadata Retrieval 與 Graph Retrieval 等多種策略,再整合各自的搜尋結果。

Vector Retrieval 是最常見的做法:先將問題與資料轉換成 embedding vectors,比較它們在向量空間中的距離,取回相似度最高的前 5 或前 10 筆資料,再將對應文字放入 prompt 的 context window。

Graph Retrieval 則是將資料整理成圖譜結構,利用實體與實體之間的關聯進行檢索,因而能找出僅靠語意相似度不容易發現的關聯性資訊。

Metadata Retrieval 主要透過人名、地名、日期、產品型號等結構化欄位進行精確篩選。

最後,我們可以透過 Reciprocal Rank Fusion(RRF),將不同檢索器產生的排名結果融合成一份候選清單,再選出最適合放入 context window 的內容。

咦?怎麼少講一個 BM25?因為這個比較不直覺。它算是 TF-IDF 的擴展。所以我們先看TF-IDF, 這個名詞同樣要拆解。

詞頻(Term Frequency, TF):計算關鍵字在單一文件內出現的次數。
逆文件頻率(Inverse Document Frequency, IDF):衡量關鍵字在整個文件庫中的罕見程度。越稀有的詞彙權重越高,像「的」這類高頻停用字權重則接近零。

兩個東西乘在一起就是,這個詞比較罕見,又出現很多次,那就是重要。

其中,f(t,d) 表示詞 t 在文件 d 中出現的次數。最基本的 TF 可以直接定義為 TF(t,d) = f(t,d)。至於 IDF(t) 可以表示為:

假設資料庫中共有 N 份文件,df(t) 則表示其中有多少份文件包含詞 t。需要注意 df(t) 計算的是文件數量,而不是詞 t 在所有文件中的總出現次數。TF(t,d) 和 IDF(t) 都有不同的變形。例如,可以對 TF 使用對數縮放,避免詞頻增加時權重無限制地成長;IDF 則常加入平滑項,以避免除以零,並讓數值表現更加穩定。

那麼 BM25 又是什麼呢?BM25 是資訊檢索系統中很常用的文件排名函數。它與 TF-IDF 使用相似的核心訊號,也就是詞頻逆文件頻率;但嚴格來說,BM25 源自機率檢索模型,並不是 TF-IDF 的特例。

看公式,我們可以發現它引入 k1 讓曲線更平滑。然後不只考慮一個單詞 t,而是使用者查詢 ( 如:prompt) q 裡面的所有 t 都加在一起。因為全部相加,右邊的分子分母都有 f(t,d),故我們預期這一項會飽和。

那麼分母的 b、d、avgdl 是怎麼回事呢?

我們回顧一下本來要做什麼事?我們是用一個查詢句 query q,去資料庫的一堆 data d,想要找出前幾名相關的文件。而文件中不同的 d 有長有短,不同文件的長度可能差異很大。長文件因為包含的詞較多,自然也更容易命中查詢關鍵字。

相反地,若同一個詞在一份短文件與一份長文件中出現相同次數,它在短文件中的集中程度通常更高。所以文件 d 的長度 |d| / 平均 d 的長度 (avgdl = average data length),也可以反映重要性。如果都一樣長,那麼 |d|/avgdl = 1,1 – b + b = 1,分母就更簡化了。

另外 b 就可以單獨控制要不要考慮文件長度:

  • b=0:完全不考慮文件長度
  • b=1:完整依照文件長度比例進行正規化
  • 0<b<1:在不正規化與完整正規化之間折衷

公式講完了,最後來正名。BM25 的 25 是版本編號,BM 是 best match。它是由 Okapi 資訊檢索系統所發展的一系列 Best Match 排名函數之一,就算只取 top 5,公式還是叫 BM25。

Wilcoxon 符號等級檢定小整理

用 AI 的壞處 – 你幾乎可以問任何問題,它也會認真回答你。 問得愈有水準,答案的神念 [1] 禁制 [2] 就愈多層。我好奇心重,最近問了 AI 三五個大難題,所以它的答案累積起來已經有幾百層禁制了。我的靈力有限,先破解幾個相對簡單的。身為偽資料科學家,就先來整理這個 Wilcoxon [3] 符號等級檢定。

為什麼需要符號檢定?它主要是用來判斷數據是否達到統計上的顯著性。假設我用一個特殊手法 X ,想要降功耗。然後我拿了一顆 IC 來做實驗,測試改善前和改善後的功耗,一量果然降了 5 mW,這樣算有改進嗎? 還是要改進 5% 才算?又或者至少要減個 10 mW?Wilcoxon 符號等級檢定就是要解決這個問題 – 什麼是顯著性?

讓我先用 10 顆 IC 來舉例,稍後再回頭看最少需要幾顆 IC 來驗證?

mW12345678910
15181213141716151415
13151213131514131213

所謂符號檢定,就是要看改變的方向是否一致?是正號還是負號?

第一步:算出每顆 IC 的差異值(後-前)

#差異(後-前)
11513-2
21815-3
312120
413130
51413-1
61715-2
71614-2
81513-2
91412-2
101513-2

其中有 8 顆 IC 都同方向,有兩顆不變 (#3 和 #4),他們沒有方向。Wilcoxon 就不算這兩顆,有效樣本是 n = 8。

第二步:對剩下 8 個差異的絕對值排等級

剩下值的差異:-2, -3, -1, -2, -2, -2, -2, -2
絕對值:2, 3, 1, 2, 2, 2, 2, 2

排序:1, 2, 2, 2, 2, 2, 2, 3

  • 絕對值=1 → 排名第1 → rank=1
  • 絕對值=2(六個並列)→ 佔第2~7名 → 平均等級 = (2+3+4+5+6+7)/6 = 4.5
  • 絕對值=3 → 排名第8 → rank=8

代回原資料:

#差異等級正/負
1-24.5
2-38
5-11
6-24.5
7-24.5
8-24.5
9-24.5
10-24.5

全部 8 個都是負等級! 正等級總和 T+ = 0,負等級總和 T= 1+4.5×6+8 = 36

第三步:算期望值與變異數(n=8,含 ties 校正)

μT=n(n+1)4=8×94=18\mu_T = \frac{n(n+1)}{4} = \frac{8\times9}{4} = 18

未校正變異數:

n(n+1)(2n+1)24=8×9×1724=51\frac{n(n+1)(2n+1)}{24} = \frac{8\times9\times17}{24} = 51

因為有 6 個值並列(tie),要扣掉 ties 校正項:

t3t48=63648=21048=4.375\frac{t^3-t}{48} = \frac{6^3-6}{48} = \frac{210}{48} = 4.375

校正後變異數:

σT2=514.375=46.625σT=46.6256.828\sigma_T^2 = 51 – 4.375 = 46.625 \quad\Rightarrow\quad \sigma_T = \sqrt{46.625} \approx 6.828

其中,第一、二、三步的分母 4、24、48 都是常數,不是隨便設的 [4]。

第四步:算 Z 值

Z=T+μTσT=0186.8282.636Z = \frac{T_+ – \mu_T}{\sigma_T} = \frac{0 – 18}{6.828} \approx \boxed{-2.636}

第五步:算 p 值

p=2×P(Z>2.636)0.008p = 2\times P(Z’>2.636) \approx \boxed{0.008}

P 怎麼來? 它就是常態分佈 (μT , σT) ,超出 Z 值的左右兩邊長尾面積的和。

不用作圖,有三種方法解決:

  • 查表:統計課本後面附的「標準常態分布表」(Z table),直接查 Z=2.64 對應的累積機率,再算 1 減掉它、乘 2。
  • 公式(累積分布函數 CDF)

p=2×[1Φ(2.636)]p = 2\times[1-\Phi(2.636)]

其中 Φ 是標準常態的 CDF,這是一個已經被證明、寫死在數學公式/查表/軟體裡的函數,不需要「目測」曲線。

  • 軟體直接算:SPSS、Excel(=2*(1-NORM.S.DIST(2.636,TRUE)))、Python(scipy.stats.norm.sf)都是呼叫同一個 CDF 公式算出來的。

判定

  • 有效 n = 8(10 筆中 2 筆差異為 0 被排除)
  • 8 顆 IC 全部都是「後 < 前」,沒有一個例外 → 最極端的一致性
  • Z = -2.636,p = 0.008 < 0.05 = 5% → 達顯著差異,「後」顯著低於「前」

其中的 5% 就是一般人印象中,約定俗成的 α 顯著水準。所以 5% 是對的,但是不能只看一次的測試達到 5% 就過關。而且有效樣本 n ≤ 5 時,無論效果多完美都不可能顯著。

用 Wilcoxon 符號等級檢定的精確分布(exact test)計算「全部差異都同方向」這個最極端情況的雙尾 p 值:

n(配對數)最極端情況下的 p 值結果
50.0625❌ 不顯著
60.0312✅ 顯著
70.0156✅ 顯著
10(你這次)0.0020✅ 顯著

也就是說:n=6 是這個檢定理論上能達到顯著的最小樣本量(前提是 6 個有效樣本全部同方向、無一例外)。n=5 或更少時,就算 5 個樣本全部同方向,p 值最好也只能到 0.0625,永遠過不了 0.05 這個門檻。

以上就是關於 Wilcoxon 符號等級檢定的備份錄。

[REF]

  1. 什麼是「神念」?
    核心概念:神念(或稱神識)是修仙者強大靈魂力量的延伸,類似於一種高級的精神感知力。修仙者可以用它來探查四周、傳遞訊息,甚至發動精神攻擊。
  2. 什麼是「禁制」?
    功能作用:主要用於保護寶物、封鎖特定區域(如洞府、宗門重地)或限制他人行動。
    觸發後果:未經允許強行闖入或破解,會觸發禁制,輕則發出警訊、將人彈開,重則釋放強大攻擊(如神雷、烈火)將入侵者消滅。
  3. Frank Wilcoxon(1892年—1965年),是一位美國的統計學家和化學家。他在 1945 年提出了著名的非參數統計驗證方法,包括 “符號等級檢定" (Wilcoxon signed-rank test)與 “等級和檢驗" (Wilcoxon rank-sum test)。
  4. 常數的由來,也算一層禁制。想知道的才按 “閱讀全文"。
繼續閱讀「Wilcoxon 符號等級檢定小整理」