Cohen’s Kappa 和 RANSAC

這是兩個關鍵字類似的名詞,前者和 “隨機期望一致" 有關,後者和 “隨機抽樣一致" 有關。先講前者。

假設有兩個法官,一個是公職的法官 A,一個是國民法官 B。我們知道即使九位國民法官意見都一樣,但三位公職法官意見不一樣時,被告都是可教化的,所以我們只各找一位來當例子就好。這兩位法官剛好同時參加過 100 場審判,判決結果如下:

國民法官 B: 有罪國民法管 B: 無罪總和
法官 A: 有罪 60565
法官 A: 無罪102535
總和7030100

Kappa 的公式如下,有時簡稱 K 值:

其中,Po 是兩個法官都有共識的比例,Pe 是兩個法官做出相同判定的期望值。

P0 = (60+25) /100 = 85% (兩個對角線粗體)

Pe = 65/100 * 35/100 + 70/100 * 30/100 = 0.65 * 0.35 + 0.7 * 0.3 = 0.2275 + 0.21 = 0.5475 (紅配紅 + 藍配藍)

Kappa = (0.85 – 0.5475) / (1 – 0.5475) = 0.3025 / 0.4525 = 66.85%

這個值好嗎?

Kappa (k 值)意義
<0.20幾乎沒有共識
0.21–0.40尚可 (fair)
0.41–0.60中等 (moderate)
0.61–0.80高度共識 (substantial)
81–1.00幾乎完全一致

它的數學意義是:Pe 代表雙方意見一致的機率。Po 只是表示有多少比例意見一樣。看似是一樣的東西,但是假設公職法官 A 其實一律都喜歡判無罪,即使國民法官 B 只會判二成無罪,雙方理念根本不同,只是恰好有 20% 結果相似。此時 Po 還是有 20%。而 Pe = 0 + 0.2 = 0.2 = P0,Kappa 直接就歸零了。也就是說 Kappa 抹除了恰好答案一樣的機率。

國民法官 B: 有罪國民法管 B: 無罪總和
法官 A: 有罪000
法官 A: 無罪8020100
總和8020100

我們也可以推廣到是非題考試,甲生每一題都選 O,乙生靠轉公正的筆作答。結果兩人答案有 50% 一樣 (P0 = 50%),兩生有五成作弊的嫌疑…. 嗎?看 Pe (隨機期望一致) 就知道沒有作弊。


至於 RANSAC (RANdom SAmple Consensus) [1] 和 “隨機抽樣一致" 有關。顧名思義,隨機抽樣會抽好幾次。假設我們去夜市玩,遊戲是從摸彩箱中抽出乒乓球,抽中紅色有獎,抽中白色摃龜,抽完球要放回去。箱子裡總共有 100 顆球,其中有獎的機率是 {\displaystyle w}。我的玩法是一把抓 n 顆球,然後預算足夠玩 k 次。

如果我一把抓 n 顆球全部中獎,機率顯然是 {\displaystyle w^{n}} 。至少有一顆沒中 (白球) 的機率是 1-{\displaystyle w^{n}} 。K 次嘗試後,每次都至少有一顆白球的機率是 ( 1-{\displaystyle w^{n}})k。假設我的目標是,不管玩幾次,有一把全紅才叫做成功,假設這機率是 p,失敗率就是 1 – p

1 – p = ( 1-{\displaystyle w^{n}})k

{\displaystyle k={\frac {\log(1-p)}{\log(1-w^{n})}}}

這裡的 k 和 Kappa 的 k 顯然是兩回事。這個公式告訴我們,目標愈大 (n 大),通常要嘗試愈多次 (k)。想成功 (p 大),也要嘗試愈多次 (k 大)。挑戰的題目很大 (w 小),還是要嘗試很多次。雖然都是要嘗試,至少我們知道 w,決定 n 之後,大致能知道 kp 的關係。

Ransack 的中文意思是「洗劫」、「掠奪」或「翻箱倒櫃地徹底搜查」。RANSAC 比較正面,這個演算法是用來從一群有雜訊 (離群值) 的數據中,歸納出最多證據支持的數學模型 (可以是高維度,但通常只看到二維的例子)。

我們猜的模型可能需要 n 個點才畫得出來 – 直線只要兩點 (n = 2),雙曲線可能要 5 個點。假設,為了猜這些點是否能用雙曲線模型來模擬,我們需要先一把抓 5 點 (x1​,y1​),…,(x5​,y5​),看它能不能連成雙曲線?

它可以寫成矩陣 Mh=0,其中

這個模型有 A、B、C、D、E、F 共6 個係數,但只差一個比例因子,所以自由度是 5。只要看 B2 − 4AC > 0 成不成立?就知道基本像不像雙曲線?(先忽略退化檢查,嗚嗚嗚,難怪大家都愛舉直線為例。)如果看起來不像雙曲線,就再抓一把 5 個點來評估。

評估方法是把 “所有點" 都對雙曲線模型計算殘差 (測量距離方法可彈性選擇)。如果這個模型正確,顯然會有更多的點落在這條虛擬的雙曲線上。至於那些沒抓的點算不算是在模型之內?就要看誤差大小。若殘差小於門檻 τ,就當成 inlier (內點),反之是 outlier (離群值)。我們數數這次總共有多少點是內點?記下來找最大值。最後選出抓到最多內點的那個組合就是候選最佳模型。

我們考慮雙曲線模型的話,第一個變數就定下來,n = 5。接著我們還要對資料的品質有點手感,w 是內點的比例;假設這次是估 60% – 100 個點中有 60 個內點,40 個離群值。我希望成功率 99%,那麼至少應該嘗試抓幾次呢?根據前面公式的變化形態:

大約要跑 57 次 RANSAC iteration,才有 99% 信心至少一次抽到全內點的 5 點樣本,也就是可以直接畫出雙曲線。才試 10 次不用放棄!反之,那試了 570 次都失敗,是否模型一定猜錯呢?AI 很客觀地說,什麼事都有可能?模型猜錯只是其中一種可能,儘管模型正確的機率極低。

更有可能是資料很髒,w = 0.2,80% 的資料都是雜訊。那失敗 570 次也很正常,機率高達 83%。

總之,RANSAC 提供了一種客觀的評估邏輯。細看公式就會發現,一次抓 10 點又全對的機率反而比較小,導致要抓更多次才會過關。因此在嘗試階段只會抓 minimum 點數,到最後要修飾模型時,才會抓更大把的內點來調整模型的參數。

[REF]

  1. 隨機抽樣一致

RRF 小筆記

此處的 RRF 是指 Reciprocal Rank Fusion,中文叫做倒數排名融合。第一個關鍵字是倒數,不是ㄉㄠ \ㄕㄨ V ,是 ㄉㄠ V ㄕㄨ \ ,誰的倒數呢? 這就是第二個關鍵字 – 排名的倒數,跟上次的 Wilcoxom 一樣,排名是個最簡單的指標,不用量化,最小的就是 1,然後愈來愈大,至少平手。

第三個關鍵字是融合,表示可以用多種方式排名,然後混在一起算。當然,這就有可能要給不同的方法一個權重。對於所有排名清單集合 R,某個排名清單編號 r ,文件 d 的 RRF(d) 分數如下。其中 k 是一個正值的常數,用來使排名第一和第二的差異不要太懸殊。另一方面,這個值會使得排名在後面的 d 們,RRF (d) 看起來也都差不多,故稱為平滑常數。

那為何不把一種排名做好,要拿一堆排名來融合呢?這個跟基測、會考、聯考一樣,取的是通才。如果只看少數指標,那就是指考了。也沒有不行,就看是哪種應用。有些學校比較看重特定科目,就可以個別給加權分數。

舉例來說,我們希望從 RAG 中找出與使用者提問最相關的資料。然而,「相關」或「相似」本來就沒有唯一的判斷標準,因此我們不侷限於單一檢索方式,而是同時採用 BM25、向量檢索(Vector Retrieval)、Metadata Retrieval 與 Graph Retrieval 等多種策略,再整合各自的搜尋結果。

Vector Retrieval 是最常見的做法:先將問題與資料轉換成 embedding vectors,比較它們在向量空間中的距離,取回相似度最高的前 5 或前 10 筆資料,再將對應文字放入 prompt 的 context window。

Graph Retrieval 則是將資料整理成圖譜結構,利用實體與實體之間的關聯進行檢索,因而能找出僅靠語意相似度不容易發現的關聯性資訊。

Metadata Retrieval 主要透過人名、地名、日期、產品型號等結構化欄位進行精確篩選。

最後,我們可以透過 Reciprocal Rank Fusion(RRF),將不同檢索器產生的排名結果融合成一份候選清單,再選出最適合放入 context window 的內容。

咦?怎麼少講一個 BM25?因為這個比較不直覺。它算是 TF-IDF 的擴展。所以我們先看TF-IDF, 這個名詞同樣要拆解。

詞頻(Term Frequency, TF):計算關鍵字在單一文件內出現的次數。
逆文件頻率(Inverse Document Frequency, IDF):衡量關鍵字在整個文件庫中的罕見程度。越稀有的詞彙權重越高,像「的」這類高頻停用字權重則接近零。

兩個東西乘在一起就是,這個詞比較罕見,又出現很多次,那就是重要。

其中,f(t,d) 表示詞 t 在文件 d 中出現的次數。最基本的 TF 可以直接定義為 TF(t,d) = f(t,d)。至於 IDF(t) 可以表示為:

假設資料庫中共有 N 份文件,df(t) 則表示其中有多少份文件包含詞 t。需要注意 df(t) 計算的是文件數量,而不是詞 t 在所有文件中的總出現次數。TF(t,d) 和 IDF(t) 都有不同的變形。例如,可以對 TF 使用對數縮放,避免詞頻增加時權重無限制地成長;IDF 則常加入平滑項,以避免除以零,並讓數值表現更加穩定。

那麼 BM25 又是什麼呢?BM25 是資訊檢索系統中很常用的文件排名函數。它與 TF-IDF 使用相似的核心訊號,也就是詞頻逆文件頻率;但嚴格來說,BM25 源自機率檢索模型,並不是 TF-IDF 的特例。

看公式,我們可以發現它引入 k1 讓曲線更平滑。然後不只考慮一個單詞 t,而是使用者查詢 ( 如:prompt) q 裡面的所有 t 都加在一起。因為全部相加,右邊的分子分母都有 f(t,d),故我們預期這一項會飽和。

那麼分母的 b、d、avgdl 是怎麼回事呢?

我們回顧一下本來要做什麼事?我們是用一個查詢句 query q,去資料庫的一堆 data d,想要找出前幾名相關的文件。而文件中不同的 d 有長有短,不同文件的長度可能差異很大。長文件因為包含的詞較多,自然也更容易命中查詢關鍵字。

相反地,若同一個詞在一份短文件與一份長文件中出現相同次數,它在短文件中的集中程度通常更高。所以文件 d 的長度 |d| / 平均 d 的長度 (avgdl = average data length),也可以反映重要性。如果都一樣長,那麼 |d|/avgdl = 1,1 – b + b = 1,分母就更簡化了。

另外 b 就可以單獨控制要不要考慮文件長度:

  • b=0:完全不考慮文件長度
  • b=1:完整依照文件長度比例進行正規化
  • 0<b<1:在不正規化與完整正規化之間折衷

公式講完了,最後來正名。BM25 的 25 是版本編號,BM 是 best match。它是由 Okapi 資訊檢索系統所發展的一系列 Best Match 排名函數之一,就算只取 top 5,公式還是叫 BM25。

Wilcoxon 符號等級檢定小整理

用 AI 的壞處 – 你幾乎可以問任何問題,它也會認真回答你。 問得愈有水準,答案的神念 [1] 禁制 [2] 就愈多層。我好奇心重,最近問了 AI 三五個大難題,所以它的答案累積起來已經有幾百層禁制了。我的靈力有限,先破解幾個相對簡單的。身為偽資料科學家,就先來整理這個 Wilcoxon [3] 符號等級檢定。

為什麼需要符號檢定?它主要是用來判斷數據是否達到統計上的顯著性。假設我用一個特殊手法 X ,想要降功耗。然後我拿了一顆 IC 來做實驗,測試改善前和改善後的功耗,一量果然降了 5 mW,這樣算有改進嗎? 還是要改進 5% 才算?又或者至少要減個 10 mW?Wilcoxon 符號等級檢定就是要解決這個問題 – 什麼是顯著性?

讓我先用 10 顆 IC 來舉例,稍後再回頭看最少需要幾顆 IC 來驗證?

mW12345678910
15181213141716151415
13151213131514131213

所謂符號檢定,就是要看改變的方向是否一致?是正號還是負號?

第一步:算出每顆 IC 的差異值(後-前)

#差異(後-前)
11513-2
21815-3
312120
413130
51413-1
61715-2
71614-2
81513-2
91412-2
101513-2

其中有 8 顆 IC 都同方向,有兩顆不變 (#3 和 #4),他們沒有方向。Wilcoxon 就不算這兩顆,有效樣本是 n = 8。

第二步:對剩下 8 個差異的絕對值排等級

剩下值的差異:-2, -3, -1, -2, -2, -2, -2, -2
絕對值:2, 3, 1, 2, 2, 2, 2, 2

排序:1, 2, 2, 2, 2, 2, 2, 3

  • 絕對值=1 → 排名第1 → rank=1
  • 絕對值=2(六個並列)→ 佔第2~7名 → 平均等級 = (2+3+4+5+6+7)/6 = 4.5
  • 絕對值=3 → 排名第8 → rank=8

代回原資料:

#差異等級正/負
1-24.5
2-38
5-11
6-24.5
7-24.5
8-24.5
9-24.5
10-24.5

全部 8 個都是負等級! 正等級總和 T+ = 0,負等級總和 T= 1+4.5×6+8 = 36

第三步:算期望值與變異數(n=8,含 ties 校正)

μT=n(n+1)4=8×94=18\mu_T = \frac{n(n+1)}{4} = \frac{8\times9}{4} = 18

未校正變異數:

n(n+1)(2n+1)24=8×9×1724=51\frac{n(n+1)(2n+1)}{24} = \frac{8\times9\times17}{24} = 51

因為有 6 個值並列(tie),要扣掉 ties 校正項:

t3t48=63648=21048=4.375\frac{t^3-t}{48} = \frac{6^3-6}{48} = \frac{210}{48} = 4.375

校正後變異數:

σT2=514.375=46.625σT=46.6256.828\sigma_T^2 = 51 – 4.375 = 46.625 \quad\Rightarrow\quad \sigma_T = \sqrt{46.625} \approx 6.828

其中,第一、二、三步的分母 4、24、48 都是常數,不是隨便設的 [4]。

第四步:算 Z 值

Z=T+μTσT=0186.8282.636Z = \frac{T_+ – \mu_T}{\sigma_T} = \frac{0 – 18}{6.828} \approx \boxed{-2.636}

第五步:算 p 值

p=2×P(Z>2.636)0.008p = 2\times P(Z’>2.636) \approx \boxed{0.008}

P 怎麼來? 它就是常態分佈 (μT , σT) ,超出 Z 值的左右兩邊長尾面積的和。

不用作圖,有三種方法解決:

  • 查表:統計課本後面附的「標準常態分布表」(Z table),直接查 Z=2.64 對應的累積機率,再算 1 減掉它、乘 2。
  • 公式(累積分布函數 CDF)

p=2×[1Φ(2.636)]p = 2\times[1-\Phi(2.636)]

其中 Φ 是標準常態的 CDF,這是一個已經被證明、寫死在數學公式/查表/軟體裡的函數,不需要「目測」曲線。

  • 軟體直接算:SPSS、Excel(=2*(1-NORM.S.DIST(2.636,TRUE)))、Python(scipy.stats.norm.sf)都是呼叫同一個 CDF 公式算出來的。

判定

  • 有效 n = 8(10 筆中 2 筆差異為 0 被排除)
  • 8 顆 IC 全部都是「後 < 前」,沒有一個例外 → 最極端的一致性
  • Z = -2.636,p = 0.008 < 0.05 = 5% → 達顯著差異,「後」顯著低於「前」

其中的 5% 就是一般人印象中,約定俗成的 α 顯著水準。所以 5% 是對的,但是不能只看一次的測試達到 5% 就過關。而且有效樣本 n ≤ 5 時,無論效果多完美都不可能顯著。

用 Wilcoxon 符號等級檢定的精確分布(exact test)計算「全部差異都同方向」這個最極端情況的雙尾 p 值:

n(配對數)最極端情況下的 p 值結果
50.0625❌ 不顯著
60.0312✅ 顯著
70.0156✅ 顯著
10(你這次)0.0020✅ 顯著

也就是說:n=6 是這個檢定理論上能達到顯著的最小樣本量(前提是 6 個有效樣本全部同方向、無一例外)。n=5 或更少時,就算 5 個樣本全部同方向,p 值最好也只能到 0.0625,永遠過不了 0.05 這個門檻。

以上就是關於 Wilcoxon 符號等級檢定的備份錄。

[REF]

  1. 什麼是「神念」?
    核心概念:神念(或稱神識)是修仙者強大靈魂力量的延伸,類似於一種高級的精神感知力。修仙者可以用它來探查四周、傳遞訊息,甚至發動精神攻擊。
  2. 什麼是「禁制」?
    功能作用:主要用於保護寶物、封鎖特定區域(如洞府、宗門重地)或限制他人行動。
    觸發後果:未經允許強行闖入或破解,會觸發禁制,輕則發出警訊、將人彈開,重則釋放強大攻擊(如神雷、烈火)將入侵者消滅。
  3. Frank Wilcoxon(1892年—1965年),是一位美國的統計學家和化學家。他在 1945 年提出了著名的非參數統計驗證方法,包括 “符號等級檢定" (Wilcoxon signed-rank test)與 “等級和檢驗" (Wilcoxon rank-sum test)。
  4. 常數的由來,也算一層禁制。想知道的才按 “閱讀全文"。
繼續閱讀「Wilcoxon 符號等級檢定小整理」

牛來踩坑 Locomo 記

Locomo (Long-Context Conversational Memory) [1] 是一個測試標準,用來評估 AI 對於長對話的記憶能力。現在的大語言模型動輒號稱有 1M token 的 context window,以後可能還愈來愈大;當我們跟它東拉西扯了半天,AI 究竟能搞清楚是現在是在聊哪一個主題嗎?其實連人類都會搞混呢!

上圖取材自 [1]. 左邊的例子是一小段對話,有兩個人物,很口語化的聊天。到時候會考 AI 一些小問題,確認 AI 對於人事時地物都分得清清楚楚,哪隻貓狗烏龜是誰的?養多久?較什麼名字?有沒有養過鸚鵡之類的?

線索文字描述
人物設定JoannaJoanna 是一位來自美國中西部的作家。她對寵物過敏。
人物設定NateNate 喜歡狗和烏龜。他有兩隻寵物烏龜。
2022 年 3 月 27 日Nate……這些小傢伙在事情很重要的時候,能讓我保持冷靜。
2022 年 3 月 27 日Joanna哇!你養牠們多久了?
2022 年 3 月 27 日Nate……已經養了 3 年了。
2022 年 5 月 20 日Nate家裡剛多了一位新成員,這是 Max!
2022 年 5 月 20 日Nate你自己有養寵物嗎?
2022 年 5 月 20 日Joanna很不幸,因為過敏,所以我不能養任何寵物。
2022 年 5 月 25 日Nate……帶 Max 去散步時,遇到一對超友善的夫妻,他們也有一隻狗……我們決定之後安排狗狗一起玩。
2022 年 10 月 21 日Joanna我以前在密西根養過一隻狗……後來我開始過敏……不得不把牠送走。

上圖的右邊的統計數字。可以看到資料庫共有 10 個長對話,平均每輪有 27.2K 個 tokens,21.6 次輪流發言。再來是考試 ,一共分為五類 (Category, 簡稱 Cat) 測試。分別是:

  • 單跳 (single hop) – 問的東西確實說話。
  • 多跳 (multi hop) – 沒直接說,但是可以從分開的上下文理解。
  • 時間推理 (temporal reasoning) – 沒說過,但是從時間關係可以判斷答案。
  • 常識性問答 (open domain knowledge) – 沒說過,但是理論上應該是這樣。
  • 對抗題 (adversarial) – 沒說過,不知道的要說不知道。

總共有 1,986 題。當然考試就要有標準答案,這個 database 對每一題都有人工標記的答案 (gold)。

接下來我們的主角 “牛來" 登場。大家應該都聽過中國手搓 3D 電影牛來吧!?那就不用介紹了。在 2026/8/21,Openrouter 忽然上了一個免費的 AI 模型,公司欄位是隱身 (stealth), 模型叫 Ox alpha。OX 是公牛,所以這麼沒名字的模型就被戲稱為 “牛來" Model。

牛來帳面上的智商還挺高的,Artificial Analysis 指數 57,跟 Claude Opus 4.8 同級,還不用錢。當然我本著 “能花一塊就是賺一塊" 的想法,讓我們家的愛馬仕 (Hermes Agent) 開始瘋狂地測試它,包括跑 Locomo 測試我的一個想法。

前面都跑得挺好,不過它最在終的報告上,把 Cat 1 和 Cat 3 都標記為多跳。這個問題被 我的 AI reviewer GPT 抓出來了。有趣的是 GPT 全家也沒有比 “牛來" 聰明多少?可見分數還是供參考,而且我們都不容易看到自己問題,何況是 AI。

ModelAA Intelligence Index
GPT-535
GPT-5.1 High37
GPT-5.2 xHigh43
GPT-5.5 Medium51
GPT-5.5 High55
GPT-5.5 xHigh56
GPT-5.6 Luna Max51
GPT-5.6 Terra Max55
GPT-5.6 Sol Max59

找到問題當然就要查囉。不查還好,一查之下,愛馬仕 (還沒取名字,本來 Ubuntu 版叫BigClaw,WSL 版叫 “許紅豆",源自 AI 短劇 [2]) 急報 Locomo 資料庫的順序並不是按照單跳、多跳這樣來的。Cat 1 才是真的多跳、Cat 3 是常識題。搞錯分類這個鍋應該 “牛來" 揹,不甘 Agent 的事,所以牛來算醜一。

接下來,我發我們的演算法在對抗題 Cat 5 竟然沒啥效果。我叫 “牛來" 研究一下 Cat 5 差在哪裡?它回報:"重大發現! cat5 的 446 題中,444 題都是 gold=None(拒絕回答題),只有 2 題有實際答案 (是非題)。"

那我們答什麼呢?我們回答 “沒那回事" (Not mentioned),這比 gold 還正確啊!於是"牛來" 熱心地建議我們改 prompt,把 Note mentioned 等效於 None。不過我前幾天看過阿里雲的一篇測試,雖然它跑了 5 個 run,但是 category 只列出 4 個,似乎沒跑對抗題。那我們幹嘛跑呢?牛牛做這題有點歷史包袱,我還是問別人吧!

這時候 GPT 5.5 救場了。它說: 很多 LoCoMo 實驗一般不跑 Category 5,或至少不把它納入主要分數。我再拿這段話給 “牛來" 看,"牛來" 沒有立刻認輸,回頭自己查了一堆資料。得到的結論是 :category 5 的題目沒有 answer 欄位,原來 none 也不是 gold,而是核對答案的程式讀不到資料,所以傳回 none。別人的實驗中 [4],是把 gold 全部設為是非題,這樣就沒有模糊的空間了。可是,牛牛你怎麼不早說~~~

本著 “少一事不如多一事" 的心理,我又檢查了一下數據。"那為什麼官網 “單跳" 有 841 題,你只做 829 題,另外 11 題去哪裡了?" 牛牛神色不變,說 “好問題",然後回去查 bug。12 分鐘後 (體感超久,而且本機在 Telegram 對話不會出現 Typing….,手機才會),它說:"答案找到了"。官方 conv-48 內有 11 組重複題,conv-30 跨 Cat 4 和 Cat5 兩類重複問,合計 12 題。

蛤?前面在同類裡面重複也就算了,後面 Cat4 和 Cat 5 重複問 – “What did Gina receive from a dance contest?" 共兩次。 但是 cat4 的 gold=’a trophy’,cat5 版 的gold=None,這還是算兩題吧,Cat 5 對抗題已經知道 answer 沒定義了。怎麼自作聰明起來了,這牛腦真是擅自突破框架啊!

由於 Monica 裡面的 GPT 5.5 對這個問題回答得模稜兩可,好像什麼都可以。只好再叫我訂閱的 Claude Pro 出來。這傢伙每個月花我 20 鎂,上次 game 做一半就放長假了,不問白不問。Claude Sonnet 5 (effort = High) 果然講得最清楚:"目前幾乎沒有主流已發表論文或公開榜單改用去重後的 830 這個數字——大家還是照官方 841 報告和跑分"。雖然我們不應該迷信智力測驗,但是 Claude Sonnet 5 Max 不愧是堂堂智力 63 分的老大~~~

牛牛沒有牛脾氣,畢竟它也不是真的牛。我叫它改,它就乒乒乓乓地改好了。當 8/26 試用期一過,log 跑出 “Thank you for partiticipating in the Stealth Ox Alpha testing period. This model will be revealed today. August 26th.",然後它就從 Openrouter 下架,改用真名 GLM 5.3 Flash 出道了。

看在我已經奴役它一個禮拜的份上,雖然那 57 分的智力還差強人意,但是便宜治百病啊!所以我把 Openrouter 的主模型切到 GLM-5.3-Flash 了。

Claude Opus 4.8GLM-5.3-Flash
Intelligence5757
Input / 1M$5$0.15
Output / 1M$25$0.50
Context1M1.3 M
Output speed~61 tok/s~49 tok/s
Reasoning

下次如果有什麼馬、什麼蛙可以免費試用,我還是會去蹭一蹭。畢竟 Apple Mac Studio M5 又漲價了。在隱私和效能之間,我會選擇免費。

[REF]

  1. https://github.com/snap-research/locomo
  2. https://www.youtube.com/watch?v=YPbhnoafcsg&t=3612s
  3. https://help.aliyun.com/en/hologres/user-guide/long-memory-service-locomo-benchmark
  4. https://arxiv.org/pdf/2606.06036

納斯達克 100 Covered Call ETF 小整理

以收息為主的理財規劃中,一般人會考慮高殖利率 ETF (0056)、民生消費類股 (中華電信)、或美債等等。我先前主要是用特別股 ETF – PFF,因為它的殖利率比較高,而且穩定程度也和債券差不多。不過因為利率逐漸走低的關係,我只好果斷轉到 Nasdaq-100 Covered Call ETF 的 JEPQ。

QQQ 這幾年都是我的主力持股,雖然比不上一些妖股、飆股,起碼每年可以不穩定地成長個十幾、二十幾趴。根據 72 法則,3~5 年資產就可以翻一倍。因此,即使它三不五時就給我虧掉半年一年的薪水;我並不在意它陰晴不定的脾氣。我最大的顧慮還是 QQQ 配息太少,或者說我本金太小也行。總之,我需要在未來的 60 (?) 年都有人發錢給我。

Nasdaq-100 Covered Call ETF 家族並不是只有一個 JEPQ,撇開它在世界各國交易所、配息型或累積型的分身不談,光是在美國至少就有三個版本。這也就是本篇要介紹的 JEPQ、QQQI、和 GPIQ 三檔。它們都是以納斯達克 100 指數為標的,透過類似賣出價外買權(= 價外認購選擇權 = OTM 買權 = Out-of-The-Money Call Option)收取權利⾦的方式⽀付⽉配息。

賣出價外買權是什麼意思呢?舉例來說,假設 QQQ 股價 800 元 (其實今天只有 700 出頭,講多一點討個吉利),市場上看好不久以後可以漲到 900 元,所以 ETF 公司把 “用 850 元跟它買一股" 的權利以 50 元賣出。也就是把一段時間內,自己未來可能的獲利,預先賣給看好的權證投資人。

如果股價短期間就漲到 9XX 元以上,買權投資人就會要求兌現買權,由於他已經投資了 50 元成本買門票,再用 850 元買 ETF,總共要付出 900 元,然後用 9XX 元賣出。他的全部利潤就是一股 XX 元。ETF 公司本來可以賺到 800 到 9XX 之間,全部 1XX 的漲幅。但是因為它把大好前景便宜賣掉了,所以只能賺到 850 – 800 + 50 = 100 元。

反過來說,如果股價不漲,反而火速跌到 600 元,買權投資人當然不願意花 850 元來買 (廢話!),那麼他投資的 50 元就打了水漂。ETF 公司手上的股票雖然跌了,但好歹也先撈了 50 元入袋。ETF 公司如果計算精準,賺錢時犧牲部分漲幅,虧錢時也比死抱著多賺,它就有錢可以發股息給買這類 Covered Call ETF 的我。

這三家商品的大方向都一樣,但是執行策略卻是各有千秋。簡短地說:

  • JEPQ(摩根⼤通):ELN 包裝 + 主動防禦股票組合。
  • QQQI(NEOS):NDX 指數選擇權 + Section 1256 稅務優惠。
  • GPIQ(⾼盛):部分覆蓋(Partial Overwrite)+ 動態調整。

其中,NEOS 是一間基金公司。NDX 指數就是 “Nasdaq – 100指數",非 ETF。

以下個別說明:

JEPQ:
雖然我上面的例子是用賣出買權來解釋,JEPQ 並⾮直接賣出 QQQ 的買權,⽽是透過股權連結票據(Equity-Linked Notes, ELN)間接嵌⼊ covered call 曝險。而且 JEPQ 的股票持倉也並⾮直接複製 QQQ,⽽是由 J.P. Morgan 量化研究團隊主動篩選出⼀個防禦性⼦集合,Beta 值約為 0.83,和 Nasdaq 100 指數本人八成三像而已。


QQQI(NEOS):
QQQI 的核⼼差異化在於節稅。它持有的原本就是 NDX 指數選擇權(⽽⾮個股或 ETF 選擇權)。在美國稅法下被歸類為 Section 1256 合約,適⽤「60/40 規則」:無論持有期⻑
短,60% 的損益按⻑期資本利得稅率課稅,40% 按短期稅率課稅。對比 JEPQ 的 ELN 配息通常被歸類為普通所得(ordinary income),適⽤最⾼邊際稅率。QQQI 對⾼所得投資⼈⽽⾔,大概節稅 10.2%。

稅務類型 (高所得者)聯邦稅率 + NIIT (淨投資所得稅 3.8%)
長期資本利得約 23.8%
短期資本利得 / ordinary income約 40.8%
差距約 17 個百分點
Section 1256 混合稅率約 30.6%
相對全短期節稅約 10.2 個百分點

除了節稅,QQQI 同時採⽤資本損失收割(Tax-Loss Harvesting)策略,主動管理組合內的未實現損失,進⼀步降低應稅所得。除了賣出買權,也同步買⼊更⾼履約價的買權賺買權價差 (Call Spread Overlay)。也就是小漲時我少賺,但大漲我又賺回來。

可想而知,這麼複雜的策略很吃基金經理人的判斷力,所以他的管理費用也是最高的 0.68%。因為我們是美國的歪果仁,那個什麼稅對我們根本沒差,股息就是一律預扣 30%,所以策略再好也沒有用 (何況結果可能不好),管理費還要多交,顯然這就不會是台灣人的菜。


GPIQ(⾼盛):
GPIQ 的設計哲學最為保守,它只對 25% ⾄ 75% 的投資組合名⽬價值賣出 OTM 買權。這個 OTM 賣得愈少,漲幅就愈貼近指數本人。過去⼀年總報酬率約 23.3%,幾乎與 QQQ 的 26% 持平,Beta 值約 1.03。同時,因為做的事情最少,GPIQ 的費⽤率僅 0.29%,是三者中最低的。相對地,它的配息能力也最差。因為我有 QQQ 了,我當然不需要很像 QQQ 的產品。

介紹完畢,現在來看 2026 年 8 ⽉的實戰數據。

複習一下,夏普率 (Sharp ratio) 就是衡量一個投資組合 “在承受1%的風險下,能得到多少報酬?"

三者各自適用的情境如下。請留意這邊的漲跌都是指短期,因為選擇權都有時效性。

  • 股市大漲:GPIQ > QQQI > JEPQ。
  • 股市盤整: QQQI 和 JEPQ > GPIQ。
  • 股市大跌:JEPQ > GPIQ 和 QQQI 。

    AI 審查時會囉嗦風險,所以我也要提醒大家投資有賺有賠。我是用 JEPQ 領息,並增加 QQQ 下跌時的抵抗力。如果到時候領得股息太多沒用完,我也會按照 AI 的建議去買更保險、Beta 值更低、Sharp 值更高的商品 (AI 建議是 REITs、債券這種)。Keyword 是 “花不完",^^

  • 無論選擇哪⼀檔,covered call ETF 存在若⼲共同的結構性⾵險,投資⼈應充分理解:
    賣出買權的本質是賣出上漲潛⼒換取當期收益,在強勢多頭市場中,這是⼀種負期望值的交換⸺投資⼈放棄的漲幅往往超過收取的權利⾦。
  • 此外,⾼配息率並不等於⾼「收益」,部分配息可能包含資本返還(Return of Capital),實質上是返還本⾦⽽⾮真實獲利,⻑期可能導致淨資產減損。
  • JEPQ 的 ELN 結構額外引⼊了交易對⼿信⽤⾵險;QQQI 的主動管理引⼊了策略執⾏⾵險;GPIQ 的部分覆蓋在下跌市場中提供的緩衝最少。