一句話:把博彩賠率去除抽水後與 Polymarket 比對是個老想法,但去抽水的方法選擇本身會製造假 edge;正確的做法是把去抽水當成一個要用實現結果擬合的模型,而 Shin 法估出的內幕資金比例 z,本身就是一個被浪費掉的訊號。
分級:去抽水方法的混淆問題是機制必然;「z 可以預測 Polymarket 的滯後方向」是原創假說。
先講一個必須誠實面對的反證
天真版本的這個策略是:「博彩公司的賠率更聰明,去抽水後拿來當公平價,跟 Polymarket 的差價就是 edge。」
這個前提被證據直接挑戰。 Reichenbach & Walther 在 1.24 億筆 Polymarket 交易上發現,市場價格緊貼實現機率,並且「略優於博彩公司的賠率」(見 錯價從哪來)。
如果 Polymarket 平均而言比賠率準,那麼「賠率對、Polymarket 錯」的方向性假設是錯的。
所以這個策略必須重新設計。正確的形式是:
兩者的分歧是有資訊的,但分歧的方向必須被估計,不能被假設。
而「用什麼變數決定方向」就是這篇的原創內容。
問題一:去抽水方法會製造假 edge
博彩賠率的隱含機率 πᵢ = 1/oddsᵢ 加總大於 1,多出來的部分是抽水(vig)。把它移除有幾種標準方法:
等比法(proportional)
pᵢ = πᵢ / Σπⱼ
冪次法(power)
pᵢ ∝ πᵢ^k, k 解使 Σpᵢ = 1
Shin 法
pᵢ = [ √(z² + 4(1−z)·πᵢ²/Π) − z ] / (2(1−z)), Π = Σπⱼ
z 解使 Σpᵢ = 1。z 的意義是博彩公司認為的內幕資金比例。
三種方法的差異在哪裡最大
在極端賠率處。 等比法把抽水按比例分攤,因此對熱門(低賠率)分攤較多絕對量;Shin 法與冪次法則假設抽水集中在長尾側,因此給熱門更高的公平機率。
這造成一個嚴重的混淆:
「用等比法去抽水後,發現長尾被市場高估」
↕ 無法區分 ↕
「等比法本身在長尾處系統性高估了公平機率」
兩者的觀測結果完全相同。
這是我認為 長尾偏誤實證矛盾 的一個候選解釋,而它似乎沒有被明確提出過:不同研究用不同的去抽水方法(或用不同的基準),而方法的偏誤方向恰好與所研究的偏誤方向重合。
正確做法:擬合,不要假設
去抽水方法不是資料處理步驟,是一個有參數的模型,而參數應該用實現結果估計。
具體地,用冪次法的 k 作為自由參數,在歷史已結算的賽事上做最大概似估計:
最大化 Σ_events Σ_i [ oᵢ · ln pᵢ(k) ] (對數概似)
若擬合出的 k̂ 顯著不等於 1(等比法對應 k = 1),那就代表等比法是錯的,而任何用等比法算出來的「長尾偏誤」有一部分是方法造成的。
這一步應該在任何交易之前完成,而且它只需要公開的歷史賠率與比賽結果,不需要任何 Polymarket 資料。
分聯盟、分市場類型各自擬合。 NBA 的 k̂ 與 MLB 的沒有理由相同。
問題二:z 是一個被浪費掉的訊號
Shin 法的副產品是 z——博彩公司隱含地認為有多少比例的資金來自知情者。
這是一個直接可觀測的、關於資訊不對稱程度的估計量,而幾乎所有使用 Shin 法的人都把它當成中間變數丟掉。
原創假說
z高的賽事,是 Polymarket 落後博彩市場最多的賽事。
機制論證:知情資金會優先流向深度大、限額高、匿名性好的場所。傳統博彩市場在這三項上通常優於預測市場(尤其在冷門聯盟與非主流賽事上)。所以:
- 知情者先在博彩市場下注 → 賠率移動 → 博彩公司的 Shin
z上升。 - Polymarket 上的知情流較少 → 價格反應較慢。
z因此同時是「這裡有知情流」與「那裡還沒反應」的指標。
這個假說的漂亮之處在於它不需要假設誰更準。 它說的是:分歧在 z 高時更可能是 Polymarket 落後,在 z 低時分歧只是噪音。方向由 z 決定,不由先驗決定——這正好回應了開頭那個反證。
可檢驗的形式
在已結算的賽事上跑:
outcome ~ a·logit(p_polymarket) + b·logit(p_devig) + c·[z · (logit p_devig − logit p_polymarket)] + const
c 顯著為正,就支持這個假說:z 越高,賠率相對 Polymarket 的增量資訊越大。
注意 b 也要看:Reichenbach & Walther 的結果暗示 b 可能不顯著(賠率沒有超越 Polymarket 的增量)。但即使 b = 0,c > 0 仍然可能成立——也就是說「平均而言賠率沒有增量,但在高 z 的子集裡有」。這才是這個策略真正的主張。
問題三:收斂需要時間,而時間有成本
即使分歧的方向對,你也需要它在你的持有期內收斂。
收斂半衰期模型:從歷史資料估計「給定初始分歧 Δ₀,t 時間後剩餘分歧」的衰減曲線:
Δ(t) ≈ Δ₀ · exp(−t / τ)
交易條件不是「有分歧」,而是:
Δ₀ · (1 − exp(−T_hold/τ)) > φ·p(1−p) + 持有期的資金成本
其中 T_hold 是你打算持有的時間(通常到賽事開始或結束)。
這一步會刷掉大量看起來有 edge 的機會:如果 τ 是三天而賽事在兩小時後開始,那麼分歧不會收斂,你實際上是在賭賽事結果而不是賭收斂。這兩者的風險完全不同,混為一談是這類策略最常見的錯誤。
費用的殘酷檢查
體育類 φ = 0.05(2026 年 7 月從 0.03 調升)。門檻表(見 費用那篇):
| p | 吃單門檻(機率百分點) |
|---|---|
| 0.50 | 1.25 |
| 0.35 / 0.65 | 1.14 |
| 0.20 / 0.80 | 0.80 |
| 0.10 / 0.90 | 0.45 |
而去抽水後的跨場館分歧,在流動的主流賽事上通常小於 1 個百分點。
結論:這個策略在中價區必須用 maker 執行,否則不成立。 掛單零費率,門檻直接降到零(見 掛單決策式)。
這帶出一個重要的實務轉向:這不是一個「發現分歧就掃單」的策略,是一個「用賠率決定報價中心的做市策略」。 你不是去吃掉分歧,你是在分歧指示的方向上偏斜你的兩側報價。
這也自然與 下一篇的做市策略 融合成同一個系統——同一套報價引擎,賠率提供中心,扭曲模型提供偏斜。
自動化架構
離線層
① 收集多家博彩公司的歷史賠率 + 賽事結果
② 擬合冪次法的 k̂(分聯盟、分市場類型)
③ 擬合 Shin 的 z(每場賽事、每家)
④ 估計收斂半衰期 τ(依聯盟、依距開賽時間分層)
⑤ 跑上面的回歸,估 c 係數 → go/no-go
即時層
⑥ 多家賠率 API 輪詢/串流
⑦ 用 k̂ 去抽水 → p_devig;用 Shin 解 z
⑧ 跨家合併:以流動性與歷史準確率加權
⑨ 計算 Δ = p_devig − p_polymarket,用 z 加權
⑩ 收斂檢查:Δ·(1−e^{−T/τ}) 是否超過費用門檻
⑪ 輸出報價偏斜量給做市引擎(而非直接掃單)
⑧的細節:不要簡單平均。同一家的多個市場(獨贏、讓分、大小分)之間有內在一致性約束,可以互相驗證——如果一家的讓分與獨贏隱含的機率不一致,那家的報價可能是陳舊的。這是一個免費的資料品質檢查。
怎麼驗證
驗證一(最優先):擬合 k̂。 只需要歷史賠率與結果。若 k̂ ≈ 1,等比法沒問題,混淆問題不存在,這一半的主張就撤回。
驗證二:c 係數的回歸。 這是核心假說的直接檢定。c 不顯著就不做這個策略。
驗證三:收斂半衰期 τ。 純觀測。若 τ 遠大於典型持有期,策略退化成方向性賭注。
驗證四:分層檢驗。 c 在主流聯盟與冷門聯盟上應該不同(假說預測冷門聯盟的 c 更大,因為那裡 Polymarket 的參與者更少)。這個分層預測比主效應更能區分「機制成立」與「資料探勘」——因為它是機制的一個非平凡推論。
風險與失效邊界
| 風險 | 描述 | 緩解 |
|---|---|---|
| 方向假設錯誤 | 證據顯示 Polymarket 平均不輸賠率 | 不假設方向,用 z 決定;c 不顯著就不做 |
| 去抽水方法偏誤 | 製造與長尾偏誤同向的假 edge | 擬合 k̂ 而非假設 |
| 收斂 vs 方向賭注 | 分歧不收斂就變成賭比賽結果 | 收斂半衰期檢查 |
| 費用門檻 | 體育 φ=0.05,門檻高於典型分歧 | 必須 maker 執行 |
| 賠率陳舊 | API 給的是舊報價 | 跨市場一致性檢查 |
| 監管 | CFTC 擬議規則可能禁止部分體育合約類型 | 見 法遵;避免依賴場中/球員層級合約 |
| 知情流也來 Polymarket | 假說的機制前提失效 | 定期重估 c;它應該隨平台成熟而衰減 |
最後一項是這個策略最可能的死法。 隨著 Polymarket 深度增加、限額提高,知情者沒有理由避開它。c 係數的時間序列本身就是這個策略的健康指標——應該定期監控,而不是估一次就用一年。
分級
| 主張 | 等級 |
|---|---|
| 賠率含抽水,需要去除 | 機制必然 |
| 不同去抽水方法在極端處差異最大 | 機制必然(代數) |
| 去抽水偏誤與長尾偏誤混淆 | 機制必然,但**「這是實證矛盾的解釋」是原創假說** |
| Polymarket 平均不輸賠率 | 有證據(1.24 億筆交易研究) |
Shin z 預測 Polymarket 的滯後 | 原創假說,驗證二可證偽 |
| 效果在冷門聯盟更強 | 原創假說(機制的非平凡推論),驗證四可證偽 |
| 中價區必須 maker 執行 | 機制必然(費用門檻 vs 典型分歧幅度) |
下一個策略:到期扭曲做市與冷啟動獎勵套利。