這是本專欄的核心章節。它的立論是一句話:
「這需要人類判斷」通常不是一個命題,是一個還沒被設計的 pipeline。
下面先給一個把任何「人類判斷 edge」拆成可實作元件的通用方法,再用它處理五個具體案例。每個案例都給完整的資料源 → pipeline → 模型 → 觸發 → 下單 → 風控 → 失效邊界。
通用方法:判斷的四層拆解
任何被稱為「需要經驗」的交易判斷,都可以拆成四個問題。每個問題都有對應的機器實作。
| 人類判斷的成分 | 機器實作 | 產出物 |
|---|---|---|
| 一、知道要看哪裡 | 從市場的自我描述編譯出資料管線 | 結構化 schema + 監控器 |
| 二、知道看到的東西是什麼意思 | 結構化抽取 → 似然比,而非直接給機率 | 帶校準紀錄的 LR |
| 三、知道別人會怎麼看 | 對手模型(市場、預言機、DVM) | (α, β) 混淆矩陣、提案者信譽 |
| 四、知道自己可能錯 | 對抗性驗證 + 棄權機制 | 信賴度分數 + abstain 旗標 |
多數失敗的自動化嘗試,是因為它們只做了第二層,然後讓 LLM 直接輸出一個部位。
貫穿全部的一條設計原則
LLM 的輸出永遠是「可被獨立檢驗的中間產物」,永遠不是「部位」。
具體地:LLM 產生 schema、產生似然比、產生邏輯邊、產生模糊度分數。部位由確定性的數學(Kelly、LP、門檻條件)算出來。 這條分工不是保守,是唯一能累積校準紀錄的架構——因為只有中間產物是可以事後歸因對錯的。若 LLM 直接給部位,你事後永遠不知道錯在哪一環。
(同一個原則在 Engineering AI Coding Methodology 裡叫「AI 幫你量測,不幫你決策」。這裡是它在交易上的具體形式。)
第二條原則:棄權是一等公民
任何不能輸出「我不知道」的判斷系統都是有害的,因為它會在自己最沒把握的樣本上下最離譜的注。
實作:每個判斷元件都必須輸出 (答案, 信賴度),且下游有明確的信賴度門檻。低於門檻時不是降低部位,是完全不交易。
理由是數學的:低信賴度代表 q 的估計誤差 τ 大。而 Kelly 的成長率曲線 在過度下注側是陡降的——當 τ 與 edge 同量級時,期望成長率的期望值是負的,即使 edge 的點估計是正的。「小注一點」不能解決這個問題,只有「不下注」可以。
案例一:對模糊結算條款的解讀
為什麼看起來不能自動化:需要讀懂法律式的語言、理解言外之意、判斷「實質上算不算達成」。
拆解
這件事其實有兩個可分離的子問題:
- 條款字面上說了什麼(可編譯)
- 條款沒說到的情況有哪些(可枚舉)
第二個才是 edge 所在——漏洞不在條款寫了什麼,在條款沒寫什麼。
設計
資料源:Gamma API 的 question / description / rules 欄位;歷史已結算市場的條款與結果配對(作為訓練與驗證集)。
Pipeline:
條款文字
↓ ①編譯
判定函數 f(世界狀態) → {YES, NO, 未定義}
↓ ②反事實枚舉
生成 N 個具體情境 s₁…s_N,各自問 f(sᵢ) = ?
↓ ③漏洞偵測
標記 f(sᵢ) = 未定義 的情境
↓ ④獨立陪審團
k 個獨立 LLM 實例各自對每個 sᵢ 判定,記錄分歧
↓ ⑤模糊度分數
ambiguity = 分歧率 × 情境發生機率的加權和
②的具體做法很關鍵:不要問 LLM「這條款模糊嗎」(它會給你一個沒有校準的形容詞),要強迫它生成具體的邊界情境——「如果事件在時限前 1 小時發生但公告在時限後 2 小時發出呢?」「如果只有部分達成呢?」「如果來源修正了數據呢?」然後對每個情境問一個有明確答案的封閉問題。
分歧率是可量測的,「模糊」不是。這是把主觀判斷變成客觀數字的關鍵一步。
④的獨立性要求:k 個實例必須看不到彼此的答案,而且最好用不同的提示框架(一個扮演提案者、一個扮演爭議者、一個扮演中立的 DVM 投票者)。同一個模型跑 k 次不算獨立——它們的錯誤高度相關。用不同的提示角色是廉價的去相關手段;用不同的模型更好。
觸發:批次,非即時。每日掃描新上架與臨近到期的市場。
下單:模糊度分數本身不是交易訊號,它是兩個東西的輸入——
風控:模糊度高的市場,部位上限直接減半以上,因為 q 的估計誤差大。而且這類市場的爭議機率高 → 資金凍結風險高(見 資金管理)。
失效邊界:
- LLM 對條款的理解與 UMA 投票者的理解可能系統性不同。前者讀的是文本,後者受到經濟誘因影響。這個差距是
α, β的一部分,必須用歷史爭議結果校準,不能假設為零。 - 條款措辭在市場上架後可能被修改(罕見但發生過)。要對條款文字做版本追蹤。
案例二:突發事件的搶先反應
為什麼看起來不能自動化:需要「知道這則新聞重不重要」的常識。
拆解
「重不重要」其實混合了兩個問題:這則新聞是不是真的,以及它對哪些市場的判定函數有影響。第二個問題在案例一已經解決了——如果你有 f(世界狀態),那麼「影響哪些市場」就是一個索引查詢,不是判斷。
這是本專欄最喜歡的一個化簡:把「常識判斷」轉成「對已編譯的判定函數做反向索引」。
設計
資料源:條款推導的權威來源輪詢器(見 上一篇)為主;新聞線為輔(觸發用);社群異常偵測作為第三層觸發。
Pipeline:
來源事件(官方發布 / 新聞 / 社群異常)
↓ ①事件抽取
(主體, 動作, 客體, 時間, 數值) 五元組
↓ ②去重
語義層去重,只計第一個獨立來源
↓ ③反向索引查詢
查詢所有 f 中,該五元組是輸入變數的市場
↓ ④判定函數求值
f(更新後的世界狀態) → {YES, NO, 未定義, 部分更新}
↓ ⑤產生 LR 或確定性覆寫
↓ ⑥與市價比對 → 門檻檢查 → 下單
③是整個設計的關鍵。它把「這則新聞重不重要」從一個開放式的語義判斷,變成一個在預先建好的索引上的確定性查詢。索引在批次時間建好(案例一的產物),事件到來時只需要毫秒級的查詢。
觸發與分層下單:
| 訊號類型 | 延遲預算 | 下單方式 |
|---|---|---|
| 權威來源確定性事件 | < 1 秒 | 掃單至邊際 edge 歸零(見 流動性截斷) |
| 新聞事件,抽取信賴度高 | < 5 秒 | 保守掃單 + 掛單階梯 |
| 新聞事件,信賴度中 | 無 | 只掛 maker 單 |
| 社群異常 | 無 | 不下單,只提升該市場的輪詢頻率 |
最後一列是重點:低可靠度的來源不用來交易,用來分配注意力。 這讓一個本來會製造噪音的訊號源,變成一個有價值的資源調度器。
風控:
- 每個事件的總下單額度上限,防止一個誤判的抽取結果掃光資金。
- 速率限制預算(見 1.5 秒爆發窗):事件觸發時要按 edge 大小排優先權,不能平均分配。
- 反向確認:下單後 N 秒內若沒有第二個獨立來源確認同一事實,自動減倉。
失效邊界:
- 熱門市場的
D(市場延遲)可能已接近零,此時這條策略只在冷門市場成立。上線前必須先量D的分布並分層。 - 新聞更正。要有「事件撤回」的處理路徑,而不只是「事件發生」。
案例三:對「市場會怎麼結算」的元判斷
為什麼看起來不能自動化:需要猜測一群匿名代幣持有者的投票行為,其中還牽涉利益衝突。
拆解
這個判斷分成兩層,而且兩層要分開估:
- 層一:正確答案是什麼(條款的忠實解讀)→ 案例一的 LLM 陪審團。
- 層二:DVM 實際會投什麼(受誘因影響的行為)→ 一個獨立的行為模型。
edge 在兩層的差距,而不在任何一層本身。
設計
資料源(全部是公開鏈上或可爬取的資料):
- UMA 預言機合約的歷史
ProposePrice/DisputePrice/ 最終結算事件。 - MOOv2 的 37 個白名單提案者地址。
- UMA 投票紀錄(誰投了什麼)。
- Polymarket 的持倉資料(Data API),用於連結投票者與部位。
Pipeline:
歷史爭議資料集
↓ ①按條款模糊度分層(案例一的產物)
↓ ②每層估計 (α, β)
↓ ③提案者層級:每個白名單地址的歷史準確率(beta 後驗)
↓ ④投票者層級:投票權集中度、持倉關聯度
↓ ⑤產生 P(結算=YES | 事實, 分層, 提案者, 爭議狀態)
這整套的輸入全部是公開的、鏈上的、可重建的。 沒有任何一項需要內幕資訊或特權存取。它之所以是 edge,純粹因為沒有人建。
觸發:兩個時點——
- 市場上架時:用分層的
(α, β)修正公平價的天花板/地板。 - 提案落地時(訂閱鏈上事件):
β塌縮,觸發 挑戰窗搶跑。
下單與風控:見 該篇 完整處理。
失效邊界:
- MOOv2 的規則會再改。整個
(α, β)估計建立在當前的治理結構上,治理一變,歷史資料的參考價值下降。要對「規則變更日」做結構性斷點處理,不要用跨越 MOOv2 上線日的資料混合估計。 - 樣本不足:37 個提案者裡,多數的提案次數可能只有兩位數,準確率的後驗區間很寬。要用 beta 後驗的下界,不是點估計。
倫理與法遵界線(明確聲明):本設計只使用公開的鏈上與 API 資料做統計推論。它不包含、也不應延伸到任何試圖影響投票結果的行為——那會是市場操縱,而 UMA 的爭議紀錄裡已經有這類事件的教訓。「預測裁判會怎麼判」與「影響裁判」是完全不同的兩件事,本專欄只做前者。見 風控與法遵。
案例四:「不要只是重複市價」——盲估協議
為什麼看起來不能自動化:人類分析師可以有意識地「先自己想過再看市場」;LLM 會被上下文裡的任何數字錨定。
這是 LLM 驅動交易系統最普遍、最致命、也最容易修的缺陷。
問題的精確形式
如果你的提示裡包含市價(或任何與市價相關的東西:訂單簿、近期成交、其他人的評論),模型的輸出會向市價收斂。結果是:
- 你的
q與p高度相關 → 看起來 edge 很小、很「合理」→ 你以為模型很準。 - 但 收縮權重回歸 裡的
b係數會虛假地顯著,因為模型的輸出包含了市價的資訊。 - 你會把「模型抄了市價」誤認為「模型驗證了市價」,然後在少數模型偏離市價的樣本上重注——而那些偏離恰好是模型出錯的樣本。
設計:盲估協議
①證據收集(無市價)
收集與市場相關的證據集合 E,內容經過過濾:
- 移除任何 Polymarket / Kalshi / 博彩賠率的價格資訊
- 移除「市場認為」「賠率顯示」類的措辭
- 記錄 evidence_hash
②盲估
模型只看 (條款, E),輸出:
- q_model(先驗機率)
- 每個證據的 LR(可分項檢驗)
- confidence(用於棄權)
此步驟的提示中不存在任何市價
③獨立合併(確定性程式,非 LLM)
ℓ_post = w · ℓ_model + (1−w) · ℓ_market
w 由歷史回歸決定(分類別)
④預先登記
寫入不可變紀錄:q_model, p_market, w, q_post, evidence_hash,
confidence, traded?, size
②與③必須是不同的程序,而且③不能是 LLM——因為只要 LLM 同時看到兩者,錨定就回來了。
驗證盲估是否真的盲:對同一批市場,跑一組注入假市價的對照實驗(給模型一個隨機擾動過的價格)。如果 q_model 隨著假市價移動,你的盲估協議漏了。這個測試應該定期自動跑,因為提示模板的任何改動都可能重新引入洩漏。
這是我認為整個專欄裡最有實務價值的一節。 它不產生任何新策略,但它決定了其他所有策略的估計層是不是真的。
案例五:想像一個還沒被定價的世界
為什麼看起來不能自動化:新市場剛上架時沒有價格、沒有歷史、沒有可比較的東西。人類憑「感覺」給一個初始估計。
拆解
「感覺」的實質是參考類別(reference class)預測:這件事屬於哪一類事件,那一類事件的歷史基準率是多少。這是可以結構化的。
設計
資料源:Gamma API 的市場建立時間(偵測新上架);歷史已結算市場的完整資料庫(作為參考類別的來源)。
Pipeline:
偵測新市場(每 N 分鐘查 Gamma,按 created_at 排序)
↓ ①條款編譯(案例一)
↓ ②參考類別檢索
從歷史已結算市場中檢索語義最近的 k 個,
計算它們的實現基準率
↓ ③盲估(案例四)——此時本來就沒有市價,天然是盲的
↓ ④合併:q₀ = 參考類別基準率與模型估計的加權
↓ ⑤兩側掛單階梯,中心在 q₀
②是關鍵,也是這個設計比「問 LLM 猜一個數字」強的地方。 參考類別基準率是有實證支撐的先驗;LLM 的直覺不是。兩者合併時,參考類別應該拿到較大的權重(除非樣本很少)。
新市場天然是盲估情境——這是它的一個被忽略的優點:你不需要防止錨定,因為沒有東西可以錨定。 這讓新市場成為驗證你的估計層的最乾淨樣本。
下單:兩側掛單(maker,零費率,且有 流動性獎勵),寬度由 q₀ 的不確定性決定。詳見 冷啟動做市。
風控:新市場的最大風險是你是唯一的參與者,而對手是市場創建者或知情者。處理:
- 單一新市場的曝險上限設得很低(總資金 0.5% 量級)。
- 成交後的單向壓力偵測:若你的一側被持續吃掉而另一側沒動,這是知情流的訊號 → 立刻撤單、擴大價差。
- 掛單階梯而非單一報價,讓知情者必須付出遞增的成本。
失效邊界:參考類別檢索在真正新穎的事件上會失敗(找不到相似的歷史市場)。此時應該觸發棄權,而不是硬給一個數字。實作上用檢索相似度的閾值當作棄權條件。
五個案例的共同結構
回看這五個設計,它們共用一個模式:
① 把「隱性知識」外顯成一個結構化物件
(判定函數、五元組、混淆矩陣、證據集合、參考類別)
② 用 LLM 產生那個物件,而不是產生決策
③ 用確定性程式消費那個物件產生決策
④ 對①的品質建立獨立的量測(分歧率、抽取信賴度、後驗區間、對照實驗)
⑤ 低品質時棄權,而不是縮小部位
這五步就是「把不能自動化的變成自動化」的通用配方。 它不保證你找到 edge,但它保證你的系統是可歸因、可校準、可改進的——而在一個需要 400 筆樣本才能證明 edge 的領域裡(見 樣本量),可歸因性比初始的聰明程度重要得多。
這篇的重點
- 判斷的四層拆解:知道看哪裡 / 看到什麼意思 / 別人怎麼看 / 自己可能錯,各有機器實作。
- LLM 產生可檢驗的中間產物,確定性程式產生部位。 這是唯一能累積校準紀錄的架構。
- 棄權是一等公民:估計誤差與 edge 同量級時,正確的部位是零,不是小。
- 模糊度要靠「反事實情境的分歧率」量測,不要問 LLM「這模糊嗎」。
- 「這則新聞重不重要」化簡成「對已編譯判定函數的反向索引查詢」。
- 元判斷分兩層(正確答案 vs 實際判定),edge 在差距,且輸入全部是公開鏈上資料。
- 盲估協議是 LLM 交易系統最重要的一個工程要求,並要用假市價注入做定期驗證。
- 新市場天然是盲估情境,且參考類別基準率比 LLM 直覺可靠。