跳到主要内容

投研方法论概述

量化策略的三个要素:1)研究问题;2)因子路线;3)建模算法。三者环环相扣:研究问题定义策略要解决什么,因子路线在问题边界内提供信息来源,建模算法把信息转换成可执行的仓位。一个完整的策略,必须三要素齐备且彼此匹配。

量化策略三要素从研究问题�、因子路线、建模算法到可交易策略的关系图

一、研究问题:定义策略的边界

策略可以理解成一个专门解决某个问题的系统。首先需要有针对这个研究问题的清晰描述,从而确定研究的边界在哪。

在胜可知,一个研究问题主要界定三件事:

  • 交易市场和标的:A 股、ETF、国内期货、指数;可以是少数几个品种,也可以是一大批标的。
  • 数据和频率:基于量价 K 线数据,频率覆盖 15 分钟、60 分钟和日线。
  • 研究类型:时序择时(判断几个品种什么时候该买、该卖),或者截面多空(在一大批标的中选强汰弱)。

此外,每个研究问题都会预先划分好时间段:历史数据用于研究和检验,同时留出一段没参与研究的「样本外」数据做最终验证。策略只有在自己没见过的数据上依然有效,才值得信赖。

研究问题示例

「股指期货的日线择时」和「申万一级行业的日线截面多空」是两个不同的研究问题。它们使用的数据、因子的表达方式、建模方法都不一样。问题定义越清晰,后面走的弯路越少。

二、因子路线:从一个想法到一批可用的因子

因子路线是一种偏底层、重逻辑的描述。在胜可知,你可以用一句话说出自己的交易想法,比如「放量突破 60 日均线后,往往还有一波上涨」。大模型会把它整理成一条结构化的因子路线:核心思路是什么、背后是怎样的市场逻辑、为什么会有效、在什么情况下会失效。

有了路线,大模型会围绕它进行适度的发散,一次生成上千个候选因子。但是,我们不可能每次用几千个因子来做策略。另外,同一个底层逻辑,适用于不同研究问题的因子表达是有区别的。所以,平台会构建一个针对特定问题的因子评估流程,分析同一因子路线下的上千个因子,最终筛选出适用于特定研究问题的若干个因子。

因子路线从交易想法到候选因子、四步评估和精选因子的漏斗图

这套评估流程全自动完成,分四步:

  • 去重:剔除走势几乎一模一样的重复因子。
  • 体检:排查因子是否偷看了「未来数据」、信号分布是否异常。
  • 回测评估:把因子放到多个历史时间段里做模拟交易(已计入各市场的真实交易成本),统计收益、回撤、胜率等表现。
  • 稳定性筛选:只有在各个时间段都能稳定贡献正收益的因子,才会留下来。

三、建模算法:从因子信号到持仓权重

建模算法的核心功能就是将若干个因子的数据,通过模型的处理,转变成一个可以交易的持仓权重序列。持仓权重序列满足的一个核心标准是,任意时刻的数值都是对仓位大小的表达,通常来说数值在 -1 到 1 之间,1 表示 100% 的多头仓位,-1 表示 100% 的空头仓位。

那为什么不能直接拿因子值去交易?因为原始因子值缺少三样东西:

  • 量纲不统一:有的因子在 0 附近波动,有的动辄成千上万。
  • 没有仓位概念:数值大不等于应该重仓。
  • 没有风险意识:信号抖动会导致频繁交易,白白损耗成本。

建模算法就是解决这三件事的「翻译官」,把「因子在说什么」翻译成「账户该做什么」。

针对两类研究问题,平台内置了不同的建模算法:

  • 时序择时类:在时序上对因子做处理,因子值分别映射成 [-1, 1] 的信号;同时按持仓周期从短到长预设了多档算法,适配不同节奏的策略。
  • 截面多空类:按因子值给标的排序,买前排、卖后排(比如各取前、后 20%);也可以用组合优化的方式,在换手限制、权重上下限等约束下自动算出更优的配比。

统一输出持仓权重还有一个好处:不同因子、不同算法产出的策略,可以放在同一个标准下比较和组合。评价策略、拼装策略,都变成了同一件事。

筛选出的若干个因子,配上一种建模算法,就构成了一个完整、可回测、可实盘的策略。

四、三要素的关系

把三要素串起来看,一个策略的研发流程是:研究问题划定研究边界,因子路线在边界内提供信息来源,建模算法把信息转换成可交易的持仓权重。三者必须服务于同一个研究问题,任何一环与问题定义不匹配,策略的表现都会失真。

要素核心作用关键产出
研究问题定义研究边界:市场与标的、数据频率、研究类型、时间段清晰的问题描述
因子路线把交易想法发散成上千个候选因子,再评估筛选经多个历史时间段检验的若干因子
建模算法将因子信号转换为持仓权重[-1, 1] 区间的持仓权重序列