评估假突破过滤需要哪些数据?
假突破过滤:其含义
假突破过滤是一种减少或排除迅速失败的突破尝试的方法。“突破”必须通过机械方式定义(例如,价格在指定的回溯窗口内突破某一水平)。“假”突破通常意味着价格未能持续突破,反而在一定时间或距离条件下返回到先前的区间内。
要评估一种过滤方法是否逻辑一致且可衡量,你需要具备能够让你(1)识别突破、(2)将其分类为假突破或非假突破、(3)在明确陈述的假设下重现相同结果的数据。
所需的数据输入
从支持定义的最小数据集开始。
- 交易工具和市场标识符
- 精确的交易工具名称和交易场所或报价来源。
- 报价惯例(例如,你观察的是买价/卖价还是中间价)。
- 带时间戳的价格序列
- 开盘价、最高价、最低价、收盘价(OHLC)和/或逐笔或K线数据。
- 完整的时间戳覆盖,明确时区和K线边界。
- 一致的采样:用于突破检测和“假”窗口的相同时间框架定义。
- 突破规则参数
- 用于定义先前区间或水平的回溯窗口。
- “突破”的阈值(例如,收盘价突破水平 vs. 任何触及)。
- 是否需要多个确认(例如,超过一根K线)以及持续时间。
- 假突破判定规则参数
- “假”突破的条件:回撤距离(回撤多远)和回撤时间(多少根K线或多长时间)。
- 过滤器是否使用收盘价、K线内高/低价,或买/卖价。
- 计算所需的假设
- 如何处理点差、滑点和执行时机。如果你没有交易/报价数据,仍需说明所使用的替代方法(例如,中间价),并指出这会影响结果。
- 如何处理缺失K线、异常值和类似公司行为的变化(在某些数据集中虽罕见但可能发生)。
数据来源、时效性和质量检查
两组数据可能看起来相同,却隐藏着不兼容的细节。为了评估,你需要可验证的数据来源(数据来自何处)、时效性(反映现实的时间)以及质量检查。
- 可验证的数据来源
- 数据来源身份:由哪个提供商或平台生成。
- 数据系列是重建的、整理的,还是直接采集的。
- 数据如何聚合为K线的文档说明(特别是OHLC)。
- 时效性和对齐
- 数据集覆盖的时间段。
- 任何已知的预处理,例如时区转换或夏令时处理。
- 证据表明突破检测和假突破分类使用相同的时钟和K线定义。
- 数据质量检查(需注意的内容)
- 缺失数据率以及如何填补或排除缺口。
- OHLC与K线内/逐笔数据之间的一致性(如果两者都存在)。
- 异常值处理规则:例如,是否移除或保留尖峰。
- 可重放性:你应该能够在相同输入上重新运行相同的计算并获得相同的分类。
证据或示例:将规则转化为可衡量的分类
评估者需要以可重现的方式将数据与结果联系起来。
示例框架(必须陈述假设):
- 从前N根K线的范围定义突破水平。
- 当收盘价超过该水平时标记为突破。
- 如果价格在M根K线内收盘回到先前范围内,则标记为“假”。
在具备所需数据的情况下,你可以计算如下指标:
- 在规则下检测到的总突破次数。
- 在时间/距离条件下被分类为假突破的比例。
- 对参数的敏感性(例如,改变N或M)。
重要提示:这展示了过滤定义的可衡量性,而非保证改进。历史分类质量可能随波动率状态和市场微观结构而变化。
局限性和风险(显著的失效模式)
即使数据正确,假突破过滤仍可能以可识别的方式失效。
-
定义不匹配 如果“突破”定义使用收盘价,而“假”使用K线内极值(或反之),分类将变得不一致且难以比较。
-
微观结构效应 如果你忽略买/卖价或执行时机,分类可能无法反映交易者实际可实现的结果。此局限性取决于数据。
-
参数过拟合 在同一时间段内尝试多种N和M值可能产生看似有效但实际上无法泛化的结果。应使用独立的时间段进行评估。