用置信区间估计未来效能(基础篇)
📘

用置信区间估计未来效能(基础篇)

第 1/3 篇

用置信区间框住EA的历史表现

MT5 策略测试器跑完回测,默认只给一个净值曲线和最终收益数字,但这只是单次抽样结果。2024年3月发布的这套方法主张:把历史交易当作样本,用统计置信区间去估计策略未来效能的可能范围,而不是盯死一个点。 具体做法依赖对每笔交易收益率求均值与标准差。若样本量 n 足够大,可用正态分布近似,95% 置信区间约为 均值 ± 1.96×标准差/√n。这意味着同样参数下次跑,真实均值落在这个带内的概率约 95%,外汇与贵金属杠杆高,区间常宽得吓人,需警惕过拟合假象。 实操上,你可以在测试器导出交易报告,用 Excel 或 Python 算这组区间,再对比不同参数组的区间重叠度。区间明显右移且变窄的组,才更可能具备稳定边缘。

「别急着上实盘:样本外数据才够格谈未来效能」

做一套能盈利的 EA 并不等于能放心跑实盘。很多人开发出回测漂亮的自动化策略后,只要没把分配本金亏光就觉得安全,但这种满意感本身不构成入金理由。外汇与贵金属杠杆交易属高风险,样本内好看、样本外崩掉是常态。 真正该问的是:这套系统的利润,能不能覆盖它承担的风险?如果跑了几个月发现确实盈利,但年化连货币基金都跑不赢,或者回撤曲线让人睡不着觉,那这套策略大概率不值得占实盘仓位。 本文借用统计学的估计思路,用样本外测试拿到的数据去推断 EA 未来的真实表现,而不是拿拟合过的曲线自我安慰。后续会落到具体可验证的计算步骤上。

◍ 测试利润不等于实盘利润

跑完 MT5 策略测试器,候选系统会吐出一整套效能指标,利润曲线看着漂亮,但这只是样本内表现。现场成交滑点、点差跳变和行情机制切换,都可能让同样的规则在实盘里回报明显缩水。 标准统计方法能帮我们判断:测试期观察到的效能,有多大概率在后续保持相近水平,或者会衰变到什么程度。它给不了精确值,只能筛出「高概率仍可接受」的策略池。 不少人直接拿粗略的夏普比率去假设未来收益分布,这很危险。过去业绩不预示未来,外汇与贵金属属高风险品种,价格翻转常出于未知驱动。我们要做的是算一套基于概率的效能预测,只作为开仓决策的参考输入,而非保证。

用自举法看置信区间的确定性

置信区间描述的是某个统计量在一段时间内落在特定范围内的概率,它衡量的是我们对估计值的把握程度,而不是价格一定会去哪。统计学家常取 90% 到 99% 的置信水平,水平越高,区间越宽,对极端样本越不敏感。 外汇与贵金属市场高杠杆、高波动,用置信区间做仓位参考时务必意识到:区间外的小概率事件真实发生过,且可能造成穿仓。 本文聚焦自举法(bootstrap)这类重采样技术来构造区间,它不假设总体分布形态,适合样本偏态明显的行情数据。下一节会直接给可跑的 MQL5 重采样代码。

「用自举把小样本撑成统计母体」

自举(bootstrap)在统计里就是反复从已有数据里随机抽、放回抽,拼出一批新数据集。上表能直观看到:原始列是 A/B/C/D/E 各一个,而自举1里 A 出现两次、B 缺失,自举3里 B 占了三行——新集合成员总数不变,但一定有重复项。 这种做法的前提是:手里的原始样本本身得能代表那个看不见的大群体。每做一次重采样,生成的副本就当成不可观测总体的一个代理。把几十上百个自举集和原样本的指标分布摆在一起,就能对未知总体的均值、波动等性质做推断,而不是只盯原始那一条曲线。 外汇与贵金属市场样本量常嫌不够,自举能缓解过拟合误判,但重采样不创造新信息,极端行情外的尾部风险仍可能漏估,实盘前务必在 MT5 策略测试器里多周期复核。

◍ 三种自举置信区间的实现路径

自举置信区间在 MT5 里常用三种算法:枢轴法、百分位法、偏差修正加速法(bca)。枢轴法先大量重采样,算出测试统计量(如均值或中位数),再把原始数据集的统计量按 bootstrap 期望偏移量做调整,得到区间边界。 百分位法更直接:它认为 bootstrap 样本的测试统计量分布近似未知总体分布,取该分布的百分位数间隔作为置信界限,不修正偏倚。 bca 稍复杂,先算偏差校正因子(bootstrap 估计小于原样本的比例),再用 jackknife 重采样估加速度系数,对百分位界限做偏倚与加速度修正,最后从排序的修正值取区间。 外汇与贵金属价格序列厚尾、结构易变,自举区间仅给出概率意义上的不确定范围,实盘仍属高风险,区间宽窄会随样本窗口剧烈变动。

常见问题

回测利润不等于实盘利润,样本内拟合易过优化;只用样本外数据估计未来效能才靠谱,实盘前先看样本外表现。
可用自举法把小样本重采样撑成统计母体,再算置信区间;区间窄且整体为正才倾向有稳定效能。
小布可基于你的交易记录自动跑置信区间与样本外诊断,直接标出过拟合风险与未来效能概率,省去手算。
常见三种:基础自举、偏差校正自举、百分位自举;各有对偏差和偏度的处理差异,可交叉验证结论。
置信区间只框住历史表现的可能范围,外汇贵金属高风险,未来效能仍可能掉出区间,只能作概率参考。