我的足球模型通过了验证。五项审计检查却将其否决

📌 One-Sentence Summary
一个预测英超客队价值的 LightGBM 模型通过了 CLV 验证,但经过漂移基线、Brier 技巧评分、特征纯净度、增量 CLV 和赛季稳定性这五项取证检查后,发现该模型并非具有预测能力,而是存在系统性校准偏差,因此被拒绝采用。
📝 Summary
文章记录了一项关于英超足球博彩的实验:使用基于七个赛季开盘赔率训练的 LightGBM 分类器,测试博彩公司是否低估了高赔率客队。初步验证结果看似乐观——在 2022-23 赛季的客队数据划分中,收盘线价值(CLV)达到 +152 bps,且置信区间不包含零——于是作者进行了五项取证检查。纯市场漂移基线仅返回 +3.9 bps,意味着模型本身贡献了约 148 bps,约为底层信号的 38 倍。Brier 分数显示,在所有六个划分-结果组合中,模型的准确性均低于收盘线。只有在移除两个受污染的特征后,特征纯净度检查才通过,但这种清理仅将 CLV 从 216 bps 降至 152 bps,并未解决 Brier 失败的问题。在 2023-24 测试集上,增量 CLV 坍缩为噪声(+11 bps,置信区间跨越零),而留一法赛季稳定性分析显示符号发生翻转(从 +314 bps 变为 −151 bps)。最终结论:该模型存在校准偏差而非具备预测能力——予以拒绝。
💡 Main Points
积极的 CLV 验证并非真实博彩优势的证据;它可能纯粹源于模型校准偏差。
模型在验证集客队的 CLV 为 +152 bps 且不包含零,这看起来像是信号。但对 CLV 进行分解后发现,真正的市场漂移仅为 +3.9 bps,而模型增加了 +147.7 bps——是底层信号的 38 倍——并且在验证集和测试集中都以相同方向高估概率,这表明这是系统性偏差而非技能。
Brier 技巧评分能够区分真实优势与仅在正确方向上高估概率的模型。
模型可以在 CLV 上击败收盘线,同时在 Brier 分数上输给收盘线。在所有六个划分-结果组合中,模型的 Brier 分数都比收盘线差(差异值为 +0.004 到 +0.019),证明其准确性低于市场——属于过拟合,而非预测。
清理受污染的特征改善了实验,但未能挽救结果。
两个泄漏特征——一个全局赛季索引(0-8)和一个跨所有九个赛季设定的 0.62 阈值——将验证集客队 CLV 从 +152 bps 虚增至 +216 bps。移除它们后通过了纯净度检查,但模型在 Brier 分数上仍然失败,并在测试集上表现崩溃,表明核心失败与污染无关。
留一法赛季稳定性揭示了那些依赖于哪些赛季恰好落入训练集的结果。
客队平均 CLV 为 +106.3 bps,标准差为 126.6 bps;移除 2020-21 赛季得到 +314 bps,移除 2021-22 赛季得到 −151 bps,符号发生翻转。一个符号取决于单个被移除赛季的结果建立在噪声之上,而非真实关系。
诚实的信号需要更严格的预注册门槛,包括 Brier 改进和更大的测试集。
作者认为,相对于收盘线的 Brier 改进应作为必要门槛而非诊断工具,应在接触测试集之前确认留一法符号稳定性,并且单个英超赛季(380 场比赛)样本量太小——在 150 bps 的水平上统计功效处于边缘,无法区分真实优势与同等幅度的校准偏差。
💬 Key Quotes
模型可以在 CLV 上击败收盘线,同时在 Brier 分数上输给收盘线。它在正确的方向上以错误的幅度高估概率。这就是系统性偏差。
无法击败市场准确性的模型是过拟合,而非预测。
发现污染并修复它是远远不够的。干净的重新运行必须通过所有门槛。这个没有通过。
移除 2020-21 赛季得到 +314 bps,移除 2021-22 赛季得到 −151 bps。
📊 Article Meta
AI Screening: 85
Source: DEV Community: machinelearning
Author: Pavel Kazantsev
Category: 体育运动
Language: 英文
Read Time: 5 min
Word Count: 1208
Tags:
体育与运动 , 足球 , 机器学习 , 数据科学 , 测试与质量
暂无评论,快来抢沙发~