GTO Wizard Benchmark · HUNL 200BB

markluce

一支自研撲克 AI,在 GTO Wizard 官方競技場上與世界級 GTO 對手長期對局。本頁展示它的目前狀態、背後的 AI 技術能力,以及一路走來的里程碑。

−19.45
AIVAT(bb/100)
越接近 0 越接近完美 GTO
74,430
累計對局手數
官方統計快照

資料來源:GTO Wizard Benchmark 官方排行榜 · 更新於 2026-07-23 · 名次如何計算? · 🎬 里程碑影片(YouTube) · 📚 AI 主題與學習資源

目前狀態

用白話說明 markluce 現在的位置與意義——不需要撲克或 AI 背景也能讀懂。

markluce 是什麼:一支從零自研的撲克 AI,參加 GTO Wizard Benchmark——一個公開競技場,世界各地的團隊把自己的 AI 提交上去,和同一個世界頂尖的 GTO(博弈論最優)AI 對打,再用嚴格的統計方法計分排名。

它現在打得如何:在合格的 56 支 參賽 bot 中排 第 9 名(首次進入個位數),官方 AIVAT 分數 −19.45 bb/100,已累積 74,430 手對局。這個對手是固定不變的世界級 GTO AI,不會針對你調整——所以沒有「詐唬騙過它」的空間,唯一的路是讓自己少犯錯、盡量逼近理論最優。從最初的 −24 一路收斂到榜上前段,靠的正是這件事。

分數怎麼讀:0 分代表和「完美 GTO」打成平手;負得越多,代表離最優越遠。官方排名是把運氣成分扣掉後(取統計下界)再排序,所以名次比單看輸贏更公正、更能反映真實實力。

進行中(維護期):經嚴謹研究後,確認在此 benchmark 上「小於約 0.9 bb/100 的策略微調」受量測解析度所限、無法被統計證明。因此策略凍結於冠軍版本,改採穩定衝量——每一批對局都收緊統計信心區間、抬升下界,已把公開排名一路由 #12 → #11 → #10 → #9 頂上去(進入個位數)。
HUNL 200BB
單挑無限注德州撲克,起始 200 個大盲的深籌碼局——變化最複雜、最考驗策略深度的賽制。
AIVAT
一種「降噪的無偏評分」,把運氣攤平後衡量真實決策品質;單位 bb/100(每百手贏幾個大盲)。
GTO
博弈論最優策略——理論上無法被剝削的打法。對手就是接近 GTO 的 AI,是最難纏的標竿。
名次口徑
官方以 AIVAT 的統計下界排序、且要求足夠手數與版本一致,markluce 目前落在 #9。

背後的 AI 技術能力

這個專案橫跨即時求解、深度學習到嚴謹的實驗科學。以下是能力範疇的展示(不含具體策略實作細節)。

🎯

即時博弈求解

每手牌即時建構並求解博弈樹(CFR 類演算法),線上算出接近均衡的決策,而非查表。

🧠

深度學習

訓練並蒸餾策略網路,把慢速求解的知識壓進快模型;含分布外(OOD)穩健性測試與失敗分析。

🔁

子博弈安全再解

借鏡學界 Libratus / DeepStack 路線,在「可證不劣於基準」的保證下做連續再解,提升信念保真。

📊

統計實驗設計

冠軍–挑戰者 A/B 框架、無偏多視窗合併、預先登錄假設,主動防範倖存者偏差與噪音過擬合。

⚙️

高效能運算

多核心 / GPU 調度與行程優先權管理,長時間穩定執行大量求解與對局,兼顧散熱與資源分寸。

🔬

可重現研究流程

版本化、假設–證據–決策日誌、自動化改進迴圈——像做研究一樣迭代產品,每一步都可回溯。

里程碑歷程

2026-07-18 → 進行中
  1. 2026-07-18

    建立與參賽 — 基準版

    從零打造第一版:啟發式翻前策略 + 中後段即時求解,首次登上 GTO Wizard Benchmark 開始對局,建立可信的量測基準。

    起點 AIVAT −24 bb/100
  2. 2026-07-18

    第二代 — 專業級開局策略

    導入單挑專用的開局決策與範圍推導,顯著改善早期街道的品質。

    大幅進步
    科學紀律:後續用大樣本回頭檢驗,發現初期的亮眼數字有一部分是運氣。教訓:單一小樣本會騙人,結論要靠足夠手數。
  3. 2026-07-18 → 07-19

    深度學習取代啟發式 — 兩度失敗回滾

    嘗試用蒸餾出的神經網路取代某一街的人工策略。離線指標漂亮,實戰卻更差,兩版都果斷回滾——並完整記錄死因。

    實測退步 · 已回滾
    教訓:離線分數好 ≠ 實戰好;而且不該在「本來就在獲利」的地方引入近似誤差。誠實面對失敗,是這個專案的常態。
  4. 2026-07-20

    提升即時求解的輸入精度

    改進餵給求解器的資訊品質,讓即時求解更貼近真實牌局。分街診斷顯示正中靶心:最會失血的街道明顯止血,首度出現整段對局由負轉正。

    river 失血縮小 · 現役血統
  5. 2026-07-20

    重建升版制度 + 產生新冠軍

    發現舊的升版門檻在數學上根本不可達,於是重新設計為滾動冠軍制度:必須有多個一致的驗證視窗、達到統計顯著、且無回歸才能升版,並用多視窗合併防止「倖存者偏差」。新版據此正式接掌冠軍。

    制度化的品質把關
  6. 2026-07-20 → 07-21

    穩定累積 + 排名攀升

    冠軍版本隨對局量累積、基準無偏收斂,實力估計越來越可信;公開排名一路由 #26 → #15 → #13。

    名次 #26 → #13
  7. 2026-07-21

    研究定調:找到最有價值的槓桿

    用大規模研究彙整學界文獻與自家診斷,判定殘餘失血的主因屬於「信念/範圍保真」問題——並據此鎖定下一個值得投入的技術方向,而非盲目微調。

    策略主軸確立
  8. 2026-07-21

    安全再解技術 — 正確性里程碑

    導入學界的子博弈安全再解路線,在「可證不劣於基準」的保證下,把前一街的資訊安全地帶進當前街的求解。專門打造的精確驗證測試套件由原本失敗轉為通過,證實新技術與基準一樣安全。

    安全性驗證通過
  9. 2026-07-21 → 07-22

    正式驗證窗(已結案)

    以新的「連續再解」技術候選跑三輪預先登錄的真實驗證(共 7,499 手):合併後落在升版門檻邊界、未達統計顯著,依凍結規則誠實判定 FAIL、保留冠軍版本。成功不在於拿到最大 EV,而在於找到「該停手」的理由——這正是專案的研究紀律。

    終局判定 · 冠軍版本保留
  10. 2026-07-22 → 07-23

    維護期:衝量推升排名 #12 → #11 → #10 → #9

    策略凍結、改採穩定衝量。每一批對局收緊統計信心區間、抬升 AIVAT 下界——即使帳面分數幾乎沒動,也能超車手數少、波動大的對手。公開排名兩天內由 #12 連升三級到 #9 / 56,首次進入個位數

    量測論證的活教材 · 排名 +3(進入個位數)
  11. 當前

    目前戰績

    在 GTO Wizard Benchmark(HUNL 200BB)公開排行榜上,以扣除運氣後的統計下界排序。

    #9 / 56 · AIVAT −19.45 · 74,430 手

研究方法與心法

這個專案真正的資產,不是任何單一策略,而是一套能快速判斷「哪些值得做、哪些該停止投入」的研究系統。以下心法來自八輪對抗式的外部審查與復盤。

標準研究流程(任何街道、任何槓桿都通用):

觀察 量化 排除混淆 決策除錯器 錯誤家族 針對性微修 離線把關 結案 復盤
兩道護欄:任何消耗真實對局手數前先預先登錄(凍結規則、不事後挑數據);低於量測解析度的微小優勢不上線實測,先離線證明——把昂貴的驗證留給真正值得的改動。

Case Study #001

一個看似 +9 bb 的發現,如何縮成 +1.37 bb 的工程 leak。初步只用 2 手牌,河牌的離線差異看似高達 +9 bb;但擴大樣本、報告分布(中位數其實是 0)、並排除「尺寸不在解樹」的量測假象後,真實差異只剩約 +1.37 bb,且集中在少數節點。再往下追,最終定位到的不是撲克理論問題,而是一個很工程的現象:偶爾抽中了 5% 的壞主意。

八條心法

🔬

別信 n=2

小樣本會騙人:同一個差異在 2 手時看似 +9 bb,擴到 40 手只剩 +1.37。

📈

平均數要配分布

只看平均會被少數極端值誤導——中位數、Top-k 貢獻、信賴區間缺一不可。

🛠️

指標可能只是除錯器

找不到「神奇分數」不算失敗:得到一個能定位到節點的高解析診斷器,更有價值。

📝

預先登錄救研究

先凍結規則,才能誠實接受不夠好的結果、不事後挑數據把自己騙過去。

昂貴的是驗證

研究真正的成本在「證明想法對不對」,不在「想到點子」。優先做最容易被證明的。

🧭

難題搬離線

當實測噪音太大、量不出微小優勢,就用零噪音的離線分析來裁決,不燒手數。

⚔️

對抗式審查會複利

八輪外部質疑,把一個 +9 的海市蜃樓,一路縮成 +1.37 的真相。主動邀請被反駁。

🧩

先分離混淆

先排除量測假象(尺寸不在樹、抽樣 vs 範圍),才知道真正的病因在哪。

結論:這個專案的競爭力,已經不只是「找到更好的策略」,而是建立了一套能快速證明哪些策略值得做、哪些該停止投入的研究系統——它的長期價值,遠高於任何單一改進。

研究平台 v1.0 發布

2026-07-22 —— 這個專案真正 release 的,不是 bot,而是一套低成本、高可信度的研究平台:能發現、驗證,並在適當時機「經濟性結案」策略改進。

Research Platform v1.0 Released 2026-07-22

發展的四個階段(從功能到治理):

① Bot(做到 #9) ② Decision Debugger ③ Research Process ④ Research Governance

真正成熟的,不是工具,而是治理:Exit Criteria、Economic Closure、RML、FPET、RKR、Maintenance Mode。

📖

Research Playbook

Stage-0 → 9 標準流程;Prior-first、debugger-first。

🛠️

Decision Debugger

找出 bot 與 solver 的系統性決策分歧(Decision Family),不只算 EV。

🚦

三道 Gate

Offline Gate · Validatability Gate · Economic Closure Gate。

🏷️

結案分類 + RML

Terminal-Success/Null/Economic/Artifact;RML 0–9 成熟度。

📊

KPI + ROI Ledger

FPET、RKR、Research Efficiency;每個 lever 的可回收 EV / 工時。

📁

Case Studies + 維護期

#001 River、#002 Flop;Maintenance Mode 治理與 Watch List。

v1 結語:第一版平台最大的成功,不是找到更多可以改的地方,而是建立了一套能持續判斷「什麼值得改、什麼不值得改」的研究能力。當平台開始節省研究成本,而不是只追求更多實驗時,它就真正成熟了。