一支自研撲克 AI,在 GTO Wizard 官方競技場上與世界級 GTO 對手長期對局。本頁展示它的目前狀態、背後的 AI 技術能力,以及一路走來的里程碑。
資料來源:GTO Wizard Benchmark 官方排行榜 · 更新於 2026-07-23 · 名次如何計算? · 🎬 里程碑影片(YouTube) · 📚 AI 主題與學習資源
用白話說明 markluce 現在的位置與意義——不需要撲克或 AI 背景也能讀懂。
markluce 是什麼:一支從零自研的撲克 AI,參加 GTO Wizard Benchmark——一個公開競技場,世界各地的團隊把自己的 AI 提交上去,和同一個世界頂尖的 GTO(博弈論最優)AI 對打,再用嚴格的統計方法計分排名。
它現在打得如何:在合格的 56 支 參賽 bot 中排 第 9 名(首次進入個位數),官方 AIVAT 分數 −19.45 bb/100,已累積 74,430 手對局。這個對手是固定不變的世界級 GTO AI,不會針對你調整——所以沒有「詐唬騙過它」的空間,唯一的路是讓自己少犯錯、盡量逼近理論最優。從最初的 −24 一路收斂到榜上前段,靠的正是這件事。
分數怎麼讀:0 分代表和「完美 GTO」打成平手;負得越多,代表離最優越遠。官方排名是把運氣成分扣掉後(取統計下界)再排序,所以名次比單看輸贏更公正、更能反映真實實力。
這個專案橫跨即時求解、深度學習到嚴謹的實驗科學。以下是能力範疇的展示(不含具體策略實作細節)。
每手牌即時建構並求解博弈樹(CFR 類演算法),線上算出接近均衡的決策,而非查表。
訓練並蒸餾策略網路,把慢速求解的知識壓進快模型;含分布外(OOD)穩健性測試與失敗分析。
借鏡學界 Libratus / DeepStack 路線,在「可證不劣於基準」的保證下做連續再解,提升信念保真。
冠軍–挑戰者 A/B 框架、無偏多視窗合併、預先登錄假設,主動防範倖存者偏差與噪音過擬合。
多核心 / GPU 調度與行程優先權管理,長時間穩定執行大量求解與對局,兼顧散熱與資源分寸。
版本化、假設–證據–決策日誌、自動化改進迴圈——像做研究一樣迭代產品,每一步都可回溯。
從零打造第一版:啟發式翻前策略 + 中後段即時求解,首次登上 GTO Wizard Benchmark 開始對局,建立可信的量測基準。
起點 AIVAT −24 bb/100導入單挑專用的開局決策與範圍推導,顯著改善早期街道的品質。
大幅進步嘗試用蒸餾出的神經網路取代某一街的人工策略。離線指標漂亮,實戰卻更差,兩版都果斷回滾——並完整記錄死因。
實測退步 · 已回滾改進餵給求解器的資訊品質,讓即時求解更貼近真實牌局。分街診斷顯示正中靶心:最會失血的街道明顯止血,首度出現整段對局由負轉正。
river 失血縮小 · 現役血統發現舊的升版門檻在數學上根本不可達,於是重新設計為滾動冠軍制度:必須有多個一致的驗證視窗、達到統計顯著、且無回歸才能升版,並用多視窗合併防止「倖存者偏差」。新版據此正式接掌冠軍。
制度化的品質把關冠軍版本隨對局量累積、基準無偏收斂,實力估計越來越可信;公開排名一路由 #26 → #15 → #13。
名次 #26 → #13用大規模研究彙整學界文獻與自家診斷,判定殘餘失血的主因屬於「信念/範圍保真」問題——並據此鎖定下一個值得投入的技術方向,而非盲目微調。
策略主軸確立導入學界的子博弈安全再解路線,在「可證不劣於基準」的保證下,把前一街的資訊安全地帶進當前街的求解。專門打造的精確驗證測試套件由原本失敗轉為通過,證實新技術與基準一樣安全。
安全性驗證通過以新的「連續再解」技術候選跑三輪預先登錄的真實驗證(共 7,499 手):合併後落在升版門檻邊界、未達統計顯著,依凍結規則誠實判定 FAIL、保留冠軍版本。成功不在於拿到最大 EV,而在於找到「該停手」的理由——這正是專案的研究紀律。
終局判定 · 冠軍版本保留策略凍結、改採穩定衝量。每一批對局收緊統計信心區間、抬升 AIVAT 下界——即使帳面分數幾乎沒動,也能超車手數少、波動大的對手。公開排名兩天內由 #12 連升三級到 #9 / 56,首次進入個位數。
量測論證的活教材 · 排名 +3(進入個位數)在 GTO Wizard Benchmark(HUNL 200BB)公開排行榜上,以扣除運氣後的統計下界排序。
#9 / 56 · AIVAT −19.45 · 74,430 手這個專案真正的資產,不是任何單一策略,而是一套能快速判斷「哪些值得做、哪些該停止投入」的研究系統。以下心法來自八輪對抗式的外部審查與復盤。
標準研究流程(任何街道、任何槓桿都通用):
Case Study #001
一個看似 +9 bb 的發現,如何縮成 +1.37 bb 的工程 leak。初步只用 2 手牌,河牌的離線差異看似高達 +9 bb;但擴大樣本、報告分布(中位數其實是 0)、並排除「尺寸不在解樹」的量測假象後,真實差異只剩約 +1.37 bb,且集中在少數節點。再往下追,最終定位到的不是撲克理論問題,而是一個很工程的現象:偶爾抽中了 5% 的壞主意。
小樣本會騙人:同一個差異在 2 手時看似 +9 bb,擴到 40 手只剩 +1.37。
只看平均會被少數極端值誤導——中位數、Top-k 貢獻、信賴區間缺一不可。
找不到「神奇分數」不算失敗:得到一個能定位到節點的高解析診斷器,更有價值。
先凍結規則,才能誠實接受不夠好的結果、不事後挑數據把自己騙過去。
研究真正的成本在「證明想法對不對」,不在「想到點子」。優先做最容易被證明的。
當實測噪音太大、量不出微小優勢,就用零噪音的離線分析來裁決,不燒手數。
八輪外部質疑,把一個 +9 的海市蜃樓,一路縮成 +1.37 的真相。主動邀請被反駁。
先排除量測假象(尺寸不在樹、抽樣 vs 範圍),才知道真正的病因在哪。
結論:這個專案的競爭力,已經不只是「找到更好的策略」,而是建立了一套能快速證明哪些策略值得做、哪些該停止投入的研究系統——它的長期價值,遠高於任何單一改進。
2026-07-22 —— 這個專案真正 release 的,不是 bot,而是一套低成本、高可信度的研究平台:能發現、驗證,並在適當時機「經濟性結案」策略改進。
Research Platform v1.0 Released 2026-07-22
發展的四個階段(從功能到治理):
真正成熟的,不是工具,而是治理:Exit Criteria、Economic Closure、RML、FPET、RKR、Maintenance Mode。
Stage-0 → 9 標準流程;Prior-first、debugger-first。
找出 bot 與 solver 的系統性決策分歧(Decision Family),不只算 EV。
Offline Gate · Validatability Gate · Economic Closure Gate。
Terminal-Success/Null/Economic/Artifact;RML 0–9 成熟度。
FPET、RKR、Research Efficiency;每個 lever 的可回收 EV / 工時。
#001 River、#002 Flop;Maintenance Mode 治理與 Watch List。
v1 結語:第一版平台最大的成功,不是找到更多可以改的地方,而是建立了一套能持續判斷「什麼值得改、什麼不值得改」的研究能力。當平台開始節省研究成本,而不是只追求更多實驗時,它就真正成熟了。
名次不是隨便報的,而是把官方排行榜資料套用官方合格口徑逐層篩選、再依統一指標排序後得到——可完全重現。
gto_wizard_version = 288④ 排序指標:對這 56 支,依 AIVAT 的統計下界 aivat − 1.96 × std 由高到低排。用下界而非原始分數,是為了把運氣/樣本誤差扣掉,名次更公正——樣本越少、波動越大的 bot 會被自然往下修。markluce 正是靠這條規則超車:它帳面分數(−19.5)比對手 Esther Aspasie(−17.2)還差約 2 個大盲,卻因為手數多(7.4 萬 vs 2 萬)、下界高而排在前面。
| 名次 | bot | 下界 | 手數 |
|---|---|---|---|
| #8 | LLM+Poker | −20.07 | 135,643 |
| #9 | markluce | −21.48 | 74,430 |
| #10 | Esther Aspasie | −21.72 | 20,590 |
🔗 原始資料:官方排行榜 API · 官網:benchmark.gtowizard.com
數字為 2026-07-23 快照,會隨對局持續累積而微幅變動;名次口徑不變。