牛來踩坑 Locomo 記

Locomo (Long-Context Conversational Memory) [1] 是一個測試標準,用來評估 AI 對於長對話的記憶能力。現在的大語言模型動輒號稱有 1M token 的 context window,以後可能還愈來愈大;當我們跟它東拉西扯了半天,AI 究竟能搞清楚是現在是在聊哪一個主題嗎?其實連人類都會搞混呢!

上圖取材自 [1]. 左邊的例子是一小段對話,有兩個人物,很口語化的聊天。到時候會考 AI 一些小問題,確認 AI 對於人事時地物都分得清清楚楚,哪隻貓狗烏龜是誰的?養多久?較什麼名字?有沒有養過鸚鵡之類的?

線索文字描述
人物設定JoannaJoanna 是一位來自美國中西部的作家。她對寵物過敏。
人物設定NateNate 喜歡狗和烏龜。他有兩隻寵物烏龜。
2022 年 3 月 27 日Nate……這些小傢伙在事情很重要的時候,能讓我保持冷靜。
2022 年 3 月 27 日Joanna哇!你養牠們多久了?
2022 年 3 月 27 日Nate……已經養了 3 年了。
2022 年 5 月 20 日Nate家裡剛多了一位新成員,這是 Max!
2022 年 5 月 20 日Nate你自己有養寵物嗎?
2022 年 5 月 20 日Joanna很不幸,因為過敏,所以我不能養任何寵物。
2022 年 5 月 25 日Nate……帶 Max 去散步時,遇到一對超友善的夫妻,他們也有一隻狗……我們決定之後安排狗狗一起玩。
2022 年 10 月 21 日Joanna我以前在密西根養過一隻狗……後來我開始過敏……不得不把牠送走。

上圖的右邊的統計數字。可以看到資料庫共有 10 個長對話,平均每輪有 27.2K 個 tokens,21.6 次輪流發言。再來是考試 ,一共分為五類 (Category, 簡稱 Cat) 測試。分別是:

  • 單跳 (single hop) – 問的東西確實說話。
  • 多跳 (multi hop) – 沒直接說,但是可以從分開的上下文理解。
  • 時間推理 (temporal reasoning) – 沒說過,但是從時間關係可以判斷答案。
  • 常識性問答 (open domain knowledge) – 沒說過,但是理論上應該是這樣。
  • 對抗題 (adversarial) – 沒說過,不知道的要說不知道。

總共有 1,986 題。當然考試就要有標準答案,這個 database 對每一題都有人工標記的答案 (gold)。

接下來我們的主角 “牛來" 登場。大家應該都聽過中國手搓 3D 電影牛來吧!?那就不用介紹了。在 2026/8/21,Openrouter 忽然上了一個免費的 AI 模型,公司欄位是隱身 (stealth), 模型叫 Ox alpha。OX 是公牛,所以這麼沒名字的模型就被戲稱為 “牛來" Model。

牛來帳面上的智商還挺高的,Artificial Analysis 指數 57,跟 Claude Opus 4.8 同級,還不用錢。當然我本著 “能花一塊就是賺一塊" 的想法,讓我們家的愛馬仕 (Hermes Agent) 開始瘋狂地測試它,包括跑 Locomo 測試我的一個想法。

前面都跑得挺好,不過它最在終的報告上,把 Cat 1 和 Cat 3 都標記為多跳。這個問題被 我的 AI reviewer GPT 抓出來了。有趣的是 GPT 全家也沒有比 “牛來" 聰明多少?可見分數還是供參考,而且我們都不容易看到自己問題,何況是 AI。

ModelAA Intelligence Index
GPT-535
GPT-5.1 High37
GPT-5.2 xHigh43
GPT-5.5 Medium51
GPT-5.5 High55
GPT-5.5 xHigh56
GPT-5.6 Luna Max51
GPT-5.6 Terra Max55
GPT-5.6 Sol Max59

找到問題當然就要查囉。不查還好,一查之下,愛馬仕 (還沒取名字,本來 Ubuntu 版叫BigClaw,WSL 版叫 “許紅豆",源自 AI 短劇 [2]) 急報 Locomo 資料庫的順序並不是按照單跳、多跳這樣來的。Cat 1 才是真的多跳、Cat 3 是常識題。搞錯分類這個鍋應該 “牛來" 揹,不甘 Agent 的事,所以牛來算醜一。

接下來,我發我們的演算法在對抗題 Cat 5 竟然沒啥效果。我叫 “牛來" 研究一下 Cat 5 差在哪裡?它回報:"重大發現! cat5 的 446 題中,444 題都是 gold=None(拒絕回答題),只有 2 題有實際答案 (是非題)。"

那我們答什麼呢?我們回答 “沒那回事" (Not mentioned),這比 gold 還正確啊!於是"牛來" 熱心地建議我們改 prompt,把 Note mentioned 等效於 None。不過我前幾天看過阿里雲的一篇測試,雖然它跑了 5 個 run,但是 category 只列出 4 個,似乎沒跑對抗題。那我們幹嘛跑呢?牛牛做這題有點歷史包袱,我還是問別人吧!

這時候 GPT 5.5 救場了。它說: 很多 LoCoMo 實驗一般不跑 Category 5,或至少不把它納入主要分數。我再拿這段話給 “牛來" 看,"牛來" 沒有立刻認輸,回頭自己查了一堆資料。得到的結論是 :category 5 的題目沒有 answer 欄位,原來 none 也不是 gold,而是核對答案的程式讀不到資料,所以傳回 none。別人的實驗中 [4],是把 gold 全部設為是非題,這樣就沒有模糊的空間了。可是,牛牛你怎麼不早說~~~

本著 “少一事不如多一事" 的心理,我又檢查了一下數據。"那為什麼官網 “單跳" 有 841 題,你只做 829 題,另外 11 題去哪裡了?" 牛牛神色不變,說 “好問題",然後回去查 bug。12 分鐘後 (體感超久,而且本機在 Telegram 對話不會出現 Typing….,手機才會),它說:"答案找到了"。官方 conv-48 內有 11 組重複題,conv-30 跨 Cat 4 和 Cat5 兩類重複問,合計 12 題。

蛤?前面在同類裡面重複也就算了,後面 Cat4 和 Cat 5 重複問 – “What did Gina receive from a dance contest?" 共兩次。 但是 cat4 的 gold=’a trophy’,cat5 版 的gold=None,這還是算兩題吧,Cat 5 對抗題已經知道 answer 沒定義了。怎麼自作聰明起來了,這牛腦真是擅自突破框架啊!

由於 Monica 裡面的 GPT 5.5 對這個問題回答得模稜兩可,好像什麼都可以。只好再叫我訂閱的 Claude Pro 出來。這傢伙每個月花我 20 鎂,上次 game 做一半就放長假了,不問白不問。Claude Sonnet 5 (effort = High) 果然講得最清楚:"目前幾乎沒有主流已發表論文或公開榜單改用去重後的 830 這個數字——大家還是照官方 841 報告和跑分"。雖然我們不應該迷信智力測驗,但是 Claude Sonnet 5 Max 不愧是堂堂智力 63 分的老大~~~

牛牛沒有牛脾氣,我叫它改它就拚拚乓乓地改好了。畢竟它也不是真的牛。當 8/26 試用期一過,log 跑出 “Thank you for partiticipating in the Stealth Ox Alpha testing period. This model will be revealed today. August 26th.",然後它就從 Openrouter 下架,改用真名 GLM 5.3 Flash 出道了。

看在我已經奴役它一個禮拜的份上,雖然那 57 分的智力還差強人意,但是便宜治百病啊!所以我把 Openrouter 的主模型切到 GLM-5.3-Flash 了。

Claude Opus 4.8GLM-5.3-Flash
Intelligence5757
Input / 1M$5$0.15
Output / 1M$25$0.50
Context1M1.3 M
Output speed~61 tok/s~49 tok/s
Reasoning

下次如果有什麼馬、什麼蛙可以免費試用,我還是會去蹭一蹭。畢竟 Apple Mac Studio M5 又漲價了。在隱私和效能之間,我會選擇免費。

[REF]

  1. https://github.com/snap-research/locomo
  2. https://www.youtube.com/watch?v=YPbhnoafcsg&t=3612s
  3. https://help.aliyun.com/en/hologres/user-guide/long-memory-service-locomo-benchmark
  4. https://arxiv.org/pdf/2606.06036