這個專案橫跨不完全資訊博弈求解、子博弈再解、深度學習與研究方法。以下把每個實際用到的主題,配對可學習的論文/講座/程式碼,並在最後給出如何有效增強 markluce 的誠實方向。
markluce 的即時求解引擎(solver-cli)就建立在這一族演算法上。
透過反覆自我對局、對每個決策點最小化「反事實遺憾」來收斂到 Nash 均衡的演算法家族——撲克 AI 的地基。
markluce 用在:turn/river 即時求解(每手牌建博弈樹跑 CFR)理論上無法被剝削的策略。markluce 的對手(GTO Wizard AI)是近-GTO 且固定,所以目標是「少犯錯、逼近均衡」。
markluce 用在:整個策略目標(對固定 GTO 對手,exploit 空間有限)River 研究線(safe re-solve gadget)的理論基礎——如何在一街「安全地」重解而不變得更可剝削。
把上一街的對手反事實價值(CFV)當作「opt-out 下界」帶進子博弈重解,保證「不劣於 trunk」。markluce 的 safe gadget 就是這個(已 Terminal,見 River Case Study)。
markluce 用在:safe re-solve gadget(agent solver-safe;River Program #001)DeepStack 的核心:每街不是獨立重解,而是把對手 CFV 與自己的貝氏更新範圍持續攜帶下去。markluce 的殘餘失血診斷指向這個「範圍保真」問題。
markluce 用在:belief-fidelity 論點(River 的深度研究主軸)這一組是 markluce 目前還沒用、但最可能帶來 >3 bb 躍升的方向(Maintenance Mode 的 Trigger A)。
不解到終局,而是在較淺的深度停下、用「多個可能的葉價值」近似對手選擇——大幅降低運算成本又保有安全性。論文中把「輸」翻成「贏」。
候選增強:把獨立整街求解改成深度限制(Modicum 式)把 AlphaZero 式的「RL + 搜尋」推廣到不完全資訊:在 public belief state (PBS) 上訓練價值/策略網,搜尋時查詢它。理論上是撲克 AI 的通用框架。
候選增強:PBS value net + search(取代獨立街求解 → 最有機會的架構級賭注)把龐大的博弈樹壓成可解的大小:牌面分桶、動作集合、下注尺寸離散化;對手若下「樹外」尺寸則做 translation 或 nested resolve(否則可剝削性大增)。
markluce 用在:bet-size 樹 + 精確尺寸注入(nested resolve);Flop debugger 的 out-of-tree 分析Measurement Program #003 的核心——為什麼小改進「驗不出來」。
用基準值(baseline)扣掉運氣與動作變異,得到低變異、無偏的每手評分。benchmark 排名就用它;但它仍有「驗證地板」(markluce 是 0.87 bb/100)。
markluce 用在:全程計分 + M3 驗證成本模型(算出哪些改進根本驗不起)衡量一個策略最多能被剝削多少(對真正 GTO 的距離)。markluce 的 gadget regression suite 就用精確 exploitability 驗「安全」。
markluce 用在:gadget 正確性測試(Test A)、river EV-loss 診斷把慢速 solver 的策略蒸餾進快速神經網;或用自我對局訓練。markluce 試過 flop policy net(v0.3/v0.4)但實戰更差、已 archived(離線好 ≠ 實戰好的教訓)。
markluce 用在:flop net(已封存);value/policy net 是 ReBeL 路線的元件這是 markluce 最有價值的產出:一套能算出「一個 +X bb 改進要幾手才驗得出來」、能凍結規則避免自我欺騙、能用分布/去-top-k/分層排除假象的研究治理。
markluce 用在:Research Playbook · Decision Debugger · Validation-Cost 模型先講現實:三個研究線(River +1bb、Flop +0.3bb、Measurement)都指向同一結論——markluce 已measurement-bound:任何 < 0.87 bb/100 的改進,在現行 benchmark 上本質上驗不出來。所以「小修小補」的撲克 lever 已探索殆盡(見 ROI Ledger)。
真正值得投入的,只有能帶來可驗證(>3 bb)躍升的架構級賭注(Trigger A),或提升量測解析度(Trigger B):
① ReBeL-style PBS value net + search(C 區)—— 取代目前「每街獨立求解」,理論上是通用框架,最有機會的大躍升。
② Depth-limited multi-valued leaves(Modicum,C 區)—— 把慢速全街求解換成更聰明的淺解。
③ 完整 continual re-solving(turn→river→…)+ 正確 belief 傳遞(B 區)—— 修 belief-fidelity 的根,但要做對(v0.6/gadget 是不完整版)。
④ 更精細的量測 / 估計器(E 區)—— 降低 0.87 bb 的驗證地板,讓小改進變得可驗證。
⚠️ 依 Maintenance Mode 治理:這些是「架構級」投入(週~月),要先評估 Recoverable-EV × Validation-Cost × Engineering-Cost(Economic Closure Gate)才動工——不要為了 <1 bb 的小訊號重啟大工程。學到值得的方向,就回報成一個新的 Research Program。