ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

量化交易核心公式解析:从多因子模型到机器学习,数学如何取代直觉管理千亿资产

量化交易核心公式解析:从多因子模型到机器学习,数学如何取代直觉管理千亿资产 我见过太多做股票的人从纯凭感觉下单到把Excel里拉出来的一排排数字当作“宝典”。而那句“数学比直觉更赚钱”在量化圈已经不算口号而是每天在上演的现实。文艺复兴、Two Sigma、德邵这三家名字圈内人早就耳熟能详但真正理解它们“怎么用公式管钱”的人并不多。这篇文章我不打算讲什么高深理论就从这几家巨头的家底出发拆解一下到底是哪几类公式在管钱公式又是如何一步步把“直觉”挤出投资决策的。适合谁看如果你在学建模、做投资、或者刚接触量化交易想搞明白“量化到底是在做什么”这篇就是按实操视角写的。纯小白也能看懂因为我会尽量用买菜算账的方式讲清楚复杂概念。1. 拆开“数学比直觉更赚钱”这句话1.1 用公式管钱的本质不是算得准而是反应快“数学比直觉更赚钱”听起来像句口号但它背后是一个很实际的变化过程。早期的投资决策依赖的是庄家、基金经理对行业的理解、对消息的判断、对“盘感”的把握。一个大佬看准了一个方向重仓压上赚了就是神话亏了往往被归结为“时运不济”。量化巨头们最开始做的事情和这完全不同。它们压根不预测某只股票明天一定涨还是跌它们做的是找出历史上反复出现的关系写成公式让公式去处理成千上万个品种在一瞬间判断出哪些品种出现了罕见的价格偏差然后下注。这里的核心不是“算得准”而是反应快、覆盖广、纪律强。人类再看盘也不可能同一时间盯住几千只股票更不可能在两三秒内把几十个因子的数值更新一遍。公式可以。所以“数学赚的钱”一部分来自“时间差”一部分来自“概率优势”——每次只赚很小的钱但只要胜率超过51%积少成多就是千亿规模。这就像赌场里的庄家单个玩家可以在某一局赢走很多但庄家靠的是每局固定的优势概率时间一长利润就自动滚出来了。量化基金的公式就是那个“庄家”它不关心某一次下注的结果它只关心系统长期下来是不是有正期望。1.2 三家巨头为什么都选了“公式”这条路文艺复兴、Two Sigma、德邵三家有个共同点创始人都不是金融科班出身。西蒙斯是数学家二西格玛的大卫·西格尔是计算机科学家德邵的创始人是物理学家背景。他们进入金融市场的角度不是“我想炒股”而是“这个问题能不能用模型来解”。文艺复兴最神秘大奖章基金常年保持极高收益且几乎不对外解释策略内部员工大量是数学、物理博士。它的路数被认为是统计套利的极致——在海量历史数据里挖掘微小的统计相关性然后靠交易频率把微薄的利润累积起来。Two Sigma的标签是“数据科学”和“机器学习”。硅谷式管理搞机器学习、自然语言处理、卫星图像分析这些前沿数据。它管的资产同样庞大但核心思路已经不止于传统的股票统计套利而是把另类数据当成矿藏用算法挖出别人看不到的信号。德邵则像是“仿真派”很多团队成员是计算物理学家。它做的是建一个庞大的市场仿真模型试图在模型里把参与者的行为、市场的微观结构都模拟出来然后在这个模拟场里测试策略再把验证过的策略搬到真实市场。三家路径不同但底层逻辑一致把投资当成科学实验把数据当成实验室里可以重复观测的样本。这也是为什么我常说如果你想进入量化行业第一课不是学K线而是重新理解“什么是数据”。2. 管理千亿资产的公式兵器谱2.1 核心公式一多因子模型的骨架要说公式最基础的搭建砖块就是多因子模型。它的表达式大家都见过长得像线性回归R_i α_i β_1·F_1 β_2·F_2 ... β_k·F_k ε_i这里的R_i是股票i的收益F是因子也就是我们说的“驱动收益的共同原因”。市场因子、行业因子、规模因子、价值因子、动量因子这些都是常见选项。比如一个最简单的三因子模型把股票收益拆成市场带来的部分、小盘股溢价带来的部分、价值股溢价带来的部分剩下的α才是策略真正找到的“额外收益”。量化巨头不会只用三因子它们会用几十甚至上百个因子然后把那些互相重叠的部分做因子正交化处理留下真正独立的信息来源。这里我要说一句很关键的实操心得因子不是找得越多越好。很多新手一上来就堆几十个指标结果回测曲线漂亮得吓人一上实盘就拉胯。为什么因为因子之间高度共线看起来每个都在贡献收益其实是在反复用同一份信息。真正专业的做法是先用相关性矩阵看一眼把相关性高的因子先合并或者剔除再考虑正交化。2.2 核心公式二风险模型与协方差矩阵管钱和赚钱是两码事。赚得多只是结果管得住回撤才是规模能撑到千亿的关键。这里必须聊到风险模型。风险模型的核心是协方差矩阵。你可以理解成每一只股票自身的波动有多大以及它和别的股票之间同涨同跌的倾向有多强。只有把这些关系摸清了才能回答“如果今天全市场暴跌5%我这个组合大概会亏多少”。实际测算中如果组合里有500只股票协方差矩阵就是500×500的矩阵涉及12.5万个协方差参数。直接估算这么多参数不现实所以量化机构一般用多因子结构来降维——先算出因子之间的协方差矩阵再通过因子暴露推回个股之间的协方差。这样一来参数少多了稳定性也高得多。用一个生活化的比喻解释你要估算一群学生整体身高的分布直接量每一个人的身高太费劲但你只需要知道性别、年级这两个因子再知道这两个因子各自的影响和相互间的关系就能把整体分布推得八九不离十。风险模型就是在干这个事。在仓位上常见的做法是让组合的目标波动率保持在一个固定水平比如年化10%。如果模型预测的市场波动上升就主动降低仓位预测波动下降就适度加仓。这个逻辑听起来简单但真到波动剧烈的那几天人的手是会抖的而公式不会。它只会按照预设的风险预算执行减仓。2.3 核心公式三凯利公式与仓位下注说完了整体仓位再聊单笔下注。量化圈特别推崇一个来自信息论的公式——凯利公式。它的标准形式是f* (bp - q) / b其中f*是最优下注比例b是赔率p是胜率q是失败概率1-p。这个公式告诉你在“已知胜率和赔率”的前提下每次该压多少比例的资金才能让长期增长速度最大化。举个例子一个策略的胜率是55%如果赢了平均能赚1块钱输了平均亏1块钱那么赔率b1代入公式得到f*(0.55*1 - 0.45)/1 0.1也就是每次下注10%的资金。如果胜率是60%下注比例就可以到20%。但实际量化交易里没人会直接拿标准凯利公式满仓干。因为凯利公式的前提是“你对胜率的估计精确无误”而现实中胜率本身是有估计误差的。所以普遍的做法是用半个凯利甚至“四分之一个凯利”来降低波动。收益虽然会减少一些但回撤会大幅缩小管理规模才能真正上去。我见过一个朋友用标准凯利跑一个胜率看起来很高的策略结果连续几笔亏损就把他仓位打没了。原因不是公式错而是他把样本外的随机波动当成了稳定胜率。凯利公式是放大器不是彩票预言机这句话建议反复读三遍。2.4 另类公式机器学习模型不再是线性公式传统公式终究是线性模型为主体可现在的Two Sigma这类公司越走越远把随机森林、梯度提升、神经网络全塞进了决策流程。它们的表达不再是我们能简单手写的单一公式而是成千上万个非线性函数的叠加组合。用术语说就是从参数模型走向了非参数模型。这些模型擅长发现数据中复杂、非线性的关系。比如某个地区的天气数据、港口的船舶信号、社交媒体的情绪指标组合在一起可能对某些大宗商品的短期价格存在预测力。你用线性回归去拟合这种关系基本做不到但在机器学习模型里它可能是一个隐藏在树模型分裂规则中的规律。不过机器学习模型有一个致命问题就是过拟合。数据量一大参数一多模型很容易记住历史的“噪音”而不只是“信号”。所以头部量化的机器学习流水线严格区分训练集、验证集、测试集并且大量使用伪随机化方法反复检验模型是否稳定。我自己的经验是如果一个机器学习模型在训练集上的表现比验证集好太多那它大概率是有问题我会直接放弃这个信号而不是试图去修它。3. 从原始数据到完整策略一家量化巨头的标准流水线3.1 数据配方里的“食材”最容易被低估很多人以为量化做的是“算法”其实它先做的是“数据”。没有干净的数据再好的数学也是白搭。这里面有几类数据源我列一下行情数据交易价格、成交量、买卖盘口这是最基础的。基本面数据财报里的收入、利润、资产负债率以及分析师预期。另类数据卫星影像里的停车场车辆数、信用卡消费流水、草根调研数据。非结构化数据新闻文本、社交平台讨论、公司公告的语义情绪。数据到手之后第一个步骤是清洗。价格数据会出现明显的错误记录成交量会因为拆股送股而突变财报数据会有缺失和调整。量化公司每天要处理的数据量按GB算都太小很多人是按TB甚至PB级别来管理的。在我的实操经验里数据清洗最容易被忽视的是“幸存者偏差”。如果你只保留了今天还存续的股票历史数据回测得出的曲线会比真实世界好一大截。因为你把那些退市暴跌、破产清零的股票全部挡在了样本之外。这事儿在量化领域是个经典坑新人不踩个两三次很难长记性。3.2 信号生成从数据到“可交易的想法”数据洗完了接下来就是找规律。这个环节在文艺复兴那里是“统计套利”在Two Sigma那里是“机器学习信号挖掘”在德邵那里是“市场微观结构模拟”。不管名字怎么叫流程是一致的第一步提出一个假设比如“短期内某类股票的收盘价均值回归倾向明显”。第二步把假设量化为信号计算过去N天的偏离程度偏离越大买入信号越强。第三步在全历史数据上做回测算收益曲线、胜率、最大回撤。第四步做样本外验证看这个信号在从未参与建模的数据上是否还有效。信号的生命周期通常很短。一个因子被公开之后市场会迅速套利掉这部分收益所以量化公司必须持续开发新信号。头部基金内部甚至有成百上千个信号同时在跑每个信号的资金权重动态调整。我记得有个前辈说做信号挖掘就像在河里淘金单个信号可能都是碎金真正赚钱靠的是把几百个碎金汇总成一条可观的现金流。这个形容到位管理千亿资产的本质是管理一个极度分散的“信号组合”。3.3 组合构建与执行公式的最后一步是“花钱”信号有了仓位比例定了最后一步是把纸面上的策略变成真实市场上的买卖。这一步叫执行。量化基金执行交易时一般通过算法拆单把一个大买单拆成几百个、上千个小单在半小时甚至一天内慢慢成交避免自己的购买行为把价格推高。这里面有个衡量标准叫市场冲击。如果一笔大单直接砸下去价格瞬间变动那策略的理论收益就会缩水。一个好的执行算法会综合考虑目标价格、成交量预测、市场深度在“时间优先”和“价格优先”之间找平衡。说实话很多策略本身收益很薄全靠执行环节抠细节。我见过同一套信号不同团队执行出来收益差距可以达到年化两到三个百分点。对规模几十亿美元的基金这就意味着几千万美元的差额。巨头们之所以能管千亿资产一半功夫花在策略研发另一半就花在执行优化上。4. 千亿公式也会翻车四个必须避开的坑4.1 过拟合回测漂亮不等于实盘赚钱这是量化圈的第一大坑。一个策略如果你调整了两次参数它的回测曲线就变好看了这很危险。更保险的做法是每一次参数调整都必须伴随一个合理的逻辑解释。如果只是“调这个数让曲线更好”那大概率是把噪声当信号拟合进去了。我的排查习惯是一个新策略上实盘之前先跑长期历史回测再跑随机日期段的样本外测试最后做人工作业的小资金实盘实验。三个环节都过关了才会考虑放量。有一个环节不对就直接回到数据处理阶段重新检查。这里建议大家记住一句话如果回测结果好到让你兴奋过头往往意味着某个地方出了问题。正常的量化策略回测确实会比实盘好一些但不会好出数量级差距。真实世界里手续费、滑点、极端行情都会吞噬收益。4.2 幸存者偏差数据里藏着看不见的“尸体”前面已经提到过幸存者偏差。这个词来源于二战时期统计飞机弹孔分布的例子——统计者只看到返航飞机的伤痕没看到被击落的飞机。放在股票数据里就是只研究现存股票忽略退市股票。历史上退市股票的平均表现远差于存续股票如果数据库不包含退市股票历史任何量化模型都会被高估。这也是为什么我一直强调数据采购时就要带上退市标记建模时要把整个股票池的生命周期都纳入样本。市场上有些便宜的数据源会直接清洗掉退市记录这种事看着省事其实是在给未来的回测埋雷。4.3 流动性冲击当公式扎堆就被反噬2007年8月的量化危机我印象很深。那段时间多家量化基金在毫秒级时间里同时止损结果市场流动性瞬间枯竭很多经典统计套利策略集体亏损。公式没有变市场也没有崩但当所有公式都在做同一件事时公式之间的相互踩踏就成了新风险。这对我们的启示是策略容量是有上限的。一个能管10亿美元的策略不一定能管100亿美元。头部量化公司管理规模做大了以后必须不断向低相关性的新策略扩展而不是在老策略上加更多杠杆。做个人交易者也一样如果你用的策略在散户圈里已经流行开了那它的超额收益大概率也已经衰减得差不多了。4.4 市场环境切换公式的“水土不服”量化模型往往强在“历史会在某个统计意义上重复”。但每一次宏观环境剧变比如利率周期的反转、监管规则的变化都会让部分历史关系失效。这就是所谓“模型崩溃风险”。应对方式之一是在策略里加入“市场状态识别”模块。模型会先用一个状态分类器判断当前是趋势市、震荡市还是高波动市在不同的市场阶段使用不同的信号权重。听起来巧妙但状态识别的滞后性也是个问题等模型确定“现在是震荡市”市场可能已经跑了几个星期。所以做量化一定要有敬畏心。公式能管住千亿资产但管不住所有的意外。这也是为什么顶级量化机构年年招人、年年更新模型因为它们非常清楚不进化就会被市场淘汰。5. 我这些年踩坑后想明白的一些事写到这里我更想以一个从业者的身份说点实在的体会。很多人觉得量化交易就是“找到一个神奇公式就躺着赚钱”这个期望本身就不现实。真正做量化的人更多时候是在处理数据的脏活累活是在不断否定自己想法是在和过拟合、幸存者偏差这些看不见的敌人搏斗。我从第一次跑回测到现在最大的变化是我开始相信过程而不相信神迹。一个策略能不能赚钱不是看它某一年的收益率有多吓人而是看它能不能在连续亏损三个月之后仍然被模型逻辑支撑着坚持执行下去。这个过程非常反人性因为你每天都要质疑自己是不是模型错了是不是该停掉。但数学告诉我们概率优势要足够多的样本才能体现你需要给公式一个兑现概率的时间窗口。如果你正准备入门量化交易我的建议是先别急着写代码选模型。你先去复盘一个自己熟悉的市场把一只股票过去五年的日线图打开想一想它为什么涨为什么跌哪些因素是你能用数字表达的哪些是纯粹的故事和情绪。把这个过程反复练习你会自然感觉到“数学比直觉更赚钱”这句话的力量。最后再分享一个小技巧每次做完一个策略回测我都会强迫自己从样本外随机抽出20%的数据重新跑一遍同一个参数。如果结果和全样本回测差太多我不会再去调参数而是选择放弃这个思路。这个习惯救过我很多次也让我明白一个道理在公式的世界里承认错误比证明自己正确更重要。
返回列表