跳到主要内容
DA DataAlgorithm Data & Algorithms
Research Notes · 公开研究笔记

足球预测的数据科学与算法方法论

这里不谈"稳赢",只谈可验证的方法。每篇文章从假设出发,给出完整数学推导、可复现的实现代码, 以及在真实赛事数据上的回测评估指标。我们公开模型的有效边界,也公开它失效的地方—— 因为一个不说明自身误差的预测系统,没有资格被称为模型。

3研究方向
8规划中选题
6已发布长文
100%推导公开可复现

方法论Methods · 建模与推导

M-03 Planned

概率校准:为什么模型说 70% 时实际只有 58%

可靠性曲线、Platt scaling 与保序回归在足球赛果预测上的对比实验。

规划中 Calibration
M-04 Planned

xG 期望进球的方差被严重低估了

单场 xG 的置信区间往往比点估计更有信息量。用蒙特卡洛重采样给出区间估计。

规划中 xG
M-05 Planned

Elo 评级在国家队赛事中的 K 值选择问题

国家队比赛间隔长、样本稀疏,固定 K 值会导致评级滞后。探讨时间衰减与赛事权重方案。

规划中 Elo

模型实现Models · 可复现代码

MD-01Planned

基线模型:从赛程数据到胜平负概率的最小实现

不到 120 行 Python,产出可评估的基线。所有后续改进都以它为参照系。

规划中Python
MD-02Planned

贝叶斯分层模型:小样本下的球队强度估计

国家队样本稀疏时,分层先验比极大似然稳定得多。含 PyMC 实现与收敛诊断。

规划中Bayesian
MD-03Planned

集成方法:多模型加权是否真的优于最佳单模型

在 72 场样本上做交叉验证,回答一个反直觉的问题:集成什么时候会变差。

规划中Ensemble

数据集与回测Datasets · Backtesting

DS-01Planned

2026 世界杯 72 场结构化赛程数据集说明

字段定义、缺失值处理、时区规范化,以及为何我们不使用第三方赔率作为特征。

规划中Dataset
DS-02Planned

回测框架设计:如何避免时间穿越与数据泄漏

滚动窗口、严格时间切分、以及三个容易被忽略的泄漏来源。

规划中Backtest

通俗洞察Insights · 只需加减乘除

IN-01 Published

你的模型真的比“永远猜主胜”强吗?

51.79% 的准确率减去 42.05% 的多数类基线,真实增益只剩 9.74pp。三个让模型看起来更聪明的评估陷阱,全程只用加减乘除。

12 min Baseline
IN-02 Published

赔率 2.10 是不是就等于 47.6% 的概率?

三路倒数加起来是 1.0481,多出的 4.81% 是庄家的过轮。归一化后主胜只剩 45.43%——对照物选错,优势的正负号会整个反过来。

11 min Odds
IN-03 Published

命中 70% 却亏钱,命中 30% 却赚钱

同一张 10 注账本,准确率栏 70% 完胜 30%,收益率栏 −9.00% 完败 +8.00%。用 EV = p × d − 1 解释矛盾,并用 200 注 × 10000 轮模拟给出波动代价。

12 min ROI
IN-04 Published

说 70% 的时候,真的会发生 70% 吗

三个预测者准确率都是 66.9%,但 ECE 分别是 0.1015 / 0.0267 / 0.0775——相差 3.80 倍。可靠性表、ECE/MCE、Brier 分解,以及一张查表如何把 ECE 砍掉 78%。

13 minCalibration
IN-05 Published

50 场赢 30 和 500 场赢 300,是不是同一件事

同样是 60% 胜率,50 场的置信区间是 [0.4642, 0.7358],500 场是 [0.5571, 0.6429]——宽度差 3.16 倍。标准误、Wilson 修正、样本量反解,以及在 100 个平庸模型里挑最好的那个会虚高 8.78pp。

14 minStatistics
IN-06 Published

押对了方向,还是亏光了:下注多少才对

同一个 14% 正期望的机会,押本金 15.56% 是 100 注 3.00 倍,押 31.11% 变成 0.909 倍——一个翻三倍一个亏钱,全是尺寸的差别。凯利比例的一个除法、半凯利用 25% 增长率换走 77% 腰斩概率,以及胜率高估 3.66pp 就翻转的悬崖。

15 minBankroll

关于 DataAlgorithmAbout · 研究原则

DataAlgorithm 是 EZCAI 的公开研究栏目。我们相信预测系统的可信度来自透明度: 如果一个模型的假设、推导、代码和误差都不可查验,那它与直觉猜测没有本质区别。

Editorial Principles · 编辑原则
  1. 假设先行——每篇文章开头明确列出模型假设及其失效条件。
  2. 推导完整——不跳步,关键变换给出理由,公式独立编号可引用。
  3. 代码可复现——给出足以复现结果的最小实现,标注依赖版本。
  4. 误差公开——报告 Brier 分数、对数损失与校准曲线,不只报告胜率。
  5. 不做投注建议——我们研究概率估计方法,不提供任何投注指导。

免责声明:DataAlgorithm 内容为数据科学与算法研究性质的公开笔记,仅供学习与方法论讨论。 所有概率估计均带有不确定性,不构成任何形式的投注建议或投资建议。