ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

营建“AI+”基本面量化投资体系:从数据到组合的实践拆解

营建“AI+”基本面量化投资体系:从数据到组合的实践拆解 最近和鹏华基金量化团队的苏俊杰做了一次深度交流主题是“营建‘AI’基本面量化投资体系”。去之前我预期会听到一堆模型和因子聊完之后发现他更强调的是“体系”两个字。数据怎么清洗、因子怎么生成、信号怎么变成仓位、仓位怎么被监控每一步都嵌入了AI能力。现在市面上聊“AI写代码”“AI前端开发”“AI后端开发”“AI开发实战”的人很多但把这些工具真正放进一个基本面量化的生产管线里让AI不只停留在单点炫技是一个更值得讨论的问题。这篇文章把我从访谈中提炼到的核心逻辑和我自己多年搭量化系统的经验放在一起做一次系统拆解。适合正在搭量化投研体系的从业者参考也适合想从传统主动研究转向量化的人作为路线图来读。1. “AI基本面量化投资体系”到底在搭什么先看全貌1.1 为什么偏偏是“基本面量化”而不是单打独斗主动研究和纯量化这两条路长期是分开走的。主动研究员擅长深挖一家公司的产业逻辑、管理层质量、商业模式但覆盖范围有限量化模型擅长在海量标的上做回测、统计、执行但容易忽略商业常识做出一个统计上显著但逻辑上讲不通的因子。“基本面量化”想解决的就是这个割裂问题。它先把主动研究里那些公认有效的逻辑比如“业绩超预期”“盈利质量改善”“管理层增持”转化成可以用数据度量的特征再通过量化模型在全球几百上千只股票上同时计算并验证。这等于把优秀研究员的分析框架变成了一条可复制、可追踪、可回测的生产线。苏俊杰在交流中提到一个关键判断基本面量化不是要去替代主动研究员而是要把他们的判断过程“结构化”。主动研究员看完一份财报能形成“这家公司超预期”的结论量化系统则要把这个结论拆解成“实际值和一致预期的差幅”“盈利修正的方向”“事件发生的时间窗口”等若干可计算变量。人的认知变成因子逻辑机器负责在更大范围内执行这样才能让投研团队的产能不再被单人日覆盖量锁死。1.2 完整体系分四层数据、因子、组合、风控“体系”这个词听起来虚落到系统上其实是清晰的分层架构。一套完整的基本面量化投资体系大致包含四层各层之间有明确的数据接口和职责边界。层级核心任务AI的主要介入点数据层把财报、公告、研报、会议纪要等原始信息结构化NLP实体识别、事件抽取、知识图谱、文本情绪打分因子层从结构化数据中生成收益预测信号和风险暴露机器学习特征工程、因子挖掘、模型训练组合层在风险约束下把信号转为真实持仓权重优化器、风险模型、协方差预测风控层监控组合暴露、回撤归因、交易异常实时监控、绩效归因、自动化预警这套分层不是新鲜发明很多主流量化机构都这么搭。AI进入之后真正的区别在于每一层都不再是孤立的流水线。数据层抽取出来的“管理层增持”字段能直接输送到因子层的模型中因子层训练出的预测结果又会进入组合层的优化器风控层再把实时结果反馈回因子层做模型修正。这个闭环是“体系”区别于“一堆脚本”的核心标志。对刚开始搭建的团队我通常建议先别追求四层都很完整。哪怕先搭一个“数据NLP因子简化组合”的最小闭环也比零散地写几个选股模型有用得多。体系的价值在于每一次研究的产出都能沉淀下来被下一次使用而不是人走模型散。1.3 为什么现在必须加“AI”成本、数据、工具三条线很多年前基本面量化就已经存在但当时的实现方式很原始人工定义财务指标用线性回归做打分再用Excel或者简单的内部工具做回测。这条路能跑却跑不快。现在加上“AI”提升来自三条线。第一是数据成本大幅下降算力和数据存储比十年前便宜了一个数量级公司有实际条件去处理过去完全不可能处理的非结构化文本。第二是数据本身变多了光靠人工读研报和公告已经覆盖不过来必须借助NLP工具做信息抽取。第三是工程效率工具爆发“AI编程”“AI自动化办公”这类工具直接降低了搭建系统的人力门槛。这三条线叠起来使得“AI基本面量化”已经不是要不要做的问题而是怎么做得比别人快的问题。过去一个研究员一周只能精读十份年报现在用AI抽取关键字段一天能覆盖几百家公司的核心事件过去一个新因子从想法到上线要半个月现在配AI编程助手两三天就能出原型。这种效率差异会直接反映在投资组合的信息处理速度上。2. AI如何把财报和公告变成可交易的信号自然语言处理实践2.1 原始文本到结构化因子的标准流水线基本面量化最大的数据瓶颈不是三大财务报表而是大量非结构化文本。管理层讨论、业绩说明会纪要和新闻报道里藏着的有效信息通常不比报表少。把这些文本变成AI可计算的因子需要一条标准流水线。我实际验证下来比较稳定的处理路径是先做文本采集和清洗把公告、研报、新闻从不同数据源归一化成统一格式这一步最麻烦的其实是PDF误识别和表格错位不能在起点省力。接着做实体识别把公司名、人名、股东名、产品名对应到标准主键。再往下是事件抽取判断“这是增持公告、回购公告还是业绩预告”把关键金额、比例、时间窗口一并抽取出来。最后是语义层面的处理判断事件的性质和语气。这条流水线很成熟但真要落地细节决定成败。我在项目里见过最多的翻车情况就是把图片型公告直接拿来跑模型结果内容几乎全乱。所以OCR的置信度检查、段落结构还原、关键字段的二次校验都是不能省略的环节。做抽取模型时也可以用OCR领域微调但先要保证OCR层面不丢字。2.2 从“事件”到“预期差”两个最值得优先做的信号处理完文本后自然要回答一个问题哪些提取出来的信号真正对收益预测有帮助。从基本面量化角度看最值得优先做的信号是“事件”和“预期差”而不是简单的“利好利空”。事件信号比较好理解。比如某公司发布了重要股东增持公告这个事件本身代表了一种内部人的判断公司回购、管理层高额增持这类行为的可信度和信息披露的约束性都比较高天然带有alpha信息。把“是否有事件”“事件类型”“事件强度”三个维度做成结构化字段就能形成一批可解释性很强的因子。预期差信号则更贴近传统的盈利预测逻辑。真正推动股价的不是“业绩好”而是“业绩比市场预期的好多少”。AI可以自动读取业绩预告、分析师的盈利预测调整计算实际值与一致预期的偏差程度再生成预期修正因子。这类因子的逻辑很硬从业者对它的接受度远高于纯机器学习黑箱因子。在访谈中我印象较深的一点是苏俊杰认为要优先选“语义确定性”较高的信号而不是一上来就做开放式的情绪识别。情绪分数听起来前沿但噪声极大增持比例、预期差幅这类信号是可核实的硬信息两者在实盘里的表现差距非常明显。2.3 LLM再能干也要留人工校验样本大语言模型LLM流行之后很多人直接用LLM跑研报摘要和公告情绪分析看起来效果好但有一个隐患LLM的抽取结果不稳定同一个段落换一个输入顺序结果可能不同。用在研究辅助上无所谓用在实盘信号上就是大事。在AI基本面量化的体系里我的习惯是对所有文本抽取结果留下一批人工校验样本。每跑完一批新数据抽几百分之一的结果让研究员看一遍标注错误类型然后定期反馈成训练数据。这一层“人在回路”设计看着笨但能防止系统性漂移。另外要特别注意事件时间戳。公告的发布时间和实际影响市场的时间不一定一致有些公告在盘后发布有些在盘中临时停牌后发布。如果一个事件被错误标注到前一天回测结果会严重失真。这个细节比模型本身更值得投入时间。3. AI编程重塑量化投研工具链从写代码到自动化办公3.1 AI编程助手把研究员的“想法”变成“代码”现在讨论AI编程已经不是趋势问题而是日常操作。量化投研团队尤其明显因为这里的本质工作就是“把想法变成可执行的回测代码”。过去这件事依赖工程师排期研究员提需求、工程师写代码沟通成本很高。现在有了AI编程助手研究员自己就能完成大部分原型开发。我自己用下来的模式是研究员先用自然语言描述“我想做一个业绩预告超预期因子数据来源是A表过滤条件B输出信号C”AI编程助手生成第一版pipeline然后由工程师做代码审查和性能优化。设计优良的话这个过程把“需求沟通—排期—开发—联调”压缩成了“描述—生成—审查—修改”四个短环节。这里有一条必须守住的红线AI生成的代码绝不能直接进实盘。我在实际项目中遇到过AI“一本正经写错字段”的情况比如把同比增长算成了环比增长。所以无论生成多快代码审查和单元测试都不能省略。AI负责把整体骨架拉出来人负责把正确性钉死。3.2 前端与后端都在AI化投研平台的工程改造很多人以为量化投研平台只是写模型实际上一个能支撑“AI基本面量化”体系的平台包含清晰的前端、后端和基础设施。AI前端开发在这里能发挥很大作用监控面板、因子看板、回测曲线展示这些界面需求长期被投研团队低估。后端开发的AI化同样重要。数据API、因子注册服务、策略生命周期管理、任务调度系统这些模块如果用传统方式写工作量巨大。用AI辅助生成标准CRUD接口和任务框架再配合统一字段字典可以大幅度缩短开发周期。我见过一些小团队用AI编程工具在几周内就搭建出原本要两个后端工程师开发三个月的内部系统。这里我想给一个实际建议平台开发不要追求大而全。先把“数据接入—因子计算—简单展示”这条主链路跑通再迭代加功能。AI开发实战的价值前提是工程规范清晰。没有规范AI生成的代码越多后续维护越痛苦。3.3 报表、纪要、问数AI自动化办公的三个落点AI自动化办公这个词听起来像行政效率工具但在量化投研体系里它对应的是三个高价值场景。第一个是定期报告生成。组合周报、月度归因报告这些内容有固定模板但数字需要从系统实时拉取文字描述要跟随数据变化。用AI把这些数字串成可读的分析段落再由研究员审阅能省掉大量重复劳动。第二个是会议纪要。业绩说明会、投研晨会、基金经理复盘每一场会议的信息浓度都很高。AI生成纪要和待办让研究员可以把注意力放在内容判断上。第三个是智能问数。建立一套“自然语言查询数据”的能力比如“这周三组合里有多少家公司上调了盈利预测”AI先转成SQL再调底层数据最后用自然语言回答。这个能力会极大降低团队协作门槛让非工程背景的研究员也能直接和系统交互。这些AI工具不会直接产生alpha但它们让团队更频繁地使用数据间接提升投研效率。4. 从信号到组合落地回测搭建与防“自欺”的方法4.1 把Alpha信号变成仓位组合构建的约束条件单模型在样本里选出一堆股票不意味着可以直接照着买。这个环节要做的是把信号转化成一组符合约束的持仓权重。组合优化器会输入预期收益信号和风险模型然后在行业偏离、个股权重、换手率、流动性等约束条件下求解一个风险收益最合适的组合。基本面量化体系和纯量化的差别在于它通常不追求极致的收益最大化而是追求“信息比率更稳”。原因很简单基本面信号本身蕴含逻辑但它的覆盖频率和调整周期偏慢组合如果换手过高交易成本会把alpha吃光。所以优化器里换手约束和成本模型极其重要。对于刚起步的团队我建议先别急着上大规模机器学习协方差模型。用传统的多因子风险模型把行业、市值、风格暴露控制住先把组合做稳定。等到数据积累够了、团队理解了风险来源再引入AI做协方差预测或非线性优化这样更稳妥。4.2 回测中最容易踩的五个“脏数据”问题回测是量化体系里最容易被“自欺”的环节。表面上看跑得很漂亮实盘却完全不是那么回事绝大多数问题出在数据上。我整理了五个最常踩的坑前瞻偏差用了当时根本没有的数据点比如用“后续公布的年度净利润”去回测当年因子。幸存者偏差股票池只保留了当前还在交易的股票退市和表现极差的股票被无声剔除。复权处理不当没有正确处理分红送转导致价格序列出现不真实的跳空。交易假设过于理想忽略涨跌停买不进去、忽略冲击成本和滑点。参数调优过拟合在同一个数据集上反复试参数直到回测曲线变得完美。应对的核心思路是“从头到尾模拟真实约束”。所有特征只能使用调仓日前已经可得的数据股票池用历史时点的成分交易假设按极端情况的成本来测算。只要回测路径和真实路径保持严格一致结果才有可能外推。提示建立一条规则任何特征字段都要带“数据可得时间戳”而不是只带“财报期”。财报期不等于数据发布时间很多财报实际公布日和截止期差很久。这条规则能挡住大部分前瞻偏差。4.3 因子衰减了怎么办建立模型更新机制没有任何因子能一直有效。市场风格变化、投资者结构变化、制度环境变化都会让曾经显著的基本面信号逐渐钝化。问题不是“会不会衰减”而是“怎么发现衰减并处理”。一个健康的体系需要日常监控因子IC、IR、换手率、多空分组的超额收益曲线。当因子IC连续若干期显著下滑或者多空收益变窄就要触发复核流程。复核的方向包括是数据口径变了是市场风格暂时漂移还是因子逻辑已经被充分定价。AI在这个环节可以承担“异常预警”工作。系统自动给因子做体检做对比分析再用LLM生成一份可读的因子变化说明让研究员快速判断该调整还是该停用。这比每天面对一堆数字更符合人的决策习惯。因子上线的生命周期也不能是一次性的而是要像软件一样有版本、有迭代、有下线机制。5. 新手必看常见问题与避坑实录5.1 过拟合和特征泄漏最隐蔽的两个雷我见过很多新团队做“AI基本面量化”第一版模型回测收益惊人实盘却亏损最常见的原因就是特征泄漏和过拟合。这两个问题藏得深短期内甚至看不出异常。特征泄漏的逻辑很简单一条本应在未来才出现的信息被提前塞进了当前特征。比如直接用“当年年报”的整年净利数据去预测当年下半年的收益看起来上市值有先见之明。避免泄漏的办法是严格依赖“可得性”数据快照里有什么就用什么不要在这个文件和历史序列之间做跨越时间的连接。过拟合则容易发生在参数调整过程中。模型复杂度过高参数多到能记住历史噪声。应对策略包括控制特征数量、使用更简洁的模型结构、做滚动窗口验证。我的经验是基本面量化场景优先用线性模型或浅层树模型效果通常不输深度模型而且可解释性更好。模型越简单越容易在样本外保持稳定。5.2 让“黑盒”变“白盒”AI模型的可解释性不论系统多先进最终拍板下单的依然是投资经理。投资经理天然不愿意把钱押在自己不理解的黑盒上所以AI基本面量化体系里“可解释性”不是一个加分项而是一个生存条件。实操中我会对每个AI因子做归因拆分用特征重要性、SHAP值、分组表现等方式说明这个因子在什么环境下有效在什么环境下无效。然后按基本面逻辑给AI因子分组比如分到“盈利质量组”“预期修正组”“事件驱动组”让每个组都能被传统意义上的投资逻辑解释。还有一条我认为最重要的规定无法解释的因子不上线。即使回测收益再高如果没法说明白它赚的是哪部分钱就不进入实盘组合。这个约束会倒逼研究员在做特征工程时保持谨慎也让我们后续的模型信任度维持在一个较高水平。5.3 “AI”不是替代研究员而是放大研究员“AI基本面量化体系”要搭建成功最难的根本不是技术而是团队分工和认知更新。AI编程、AI前端开发、AI后端开发、AI自动化办公这些工具释放的其实是研究员的非核心精力让研究员更多投入到“定义问题”和“理解结果”上。在访谈中苏俊杰也提到一个观点量化团队真正的竞争力很多人以为是数据和模型其实是“把投研逻辑转化为数学语言”的能力。AI可以加速转化过程但逻辑本身来自人对产业、公司和商业模式的理解来自那些不能被代码替代的直觉。所以团队配置上最理想的组合是有人懂基本面研究有人懂工程化开发还有人懂统计建模AI把三者之间的协作摩擦降到最低。研究员提交一套逻辑工程师和AI把它变成可复用的模块然后再由研究员验证模块是否符合商业直觉。AI在这里是放大器和加速器不是替代品。6. 最后分享一个搭建“AI”体系的小技巧如果你所在的团队条件有限没法一次性把数据、因子、组合、风控四层完整搭起来我建议先选一个特别具体的基本面场景作为突破口。比如“业绩预告超预期”或者“重要股东增持事件”先把这一两类数据从文本到因子、从因子到组合的闭环跑通哪怕范围很小体系标准也要按生产级来做。我自己的体会是小闭环最大的价值在于“可复制”。第一段跑通之后第二个场景、第三个场景会越来越快因为数据规范、事件抽取流程、回测框架和团队协作方式都已经沉淀下来。反过来如果一开始追求大而全很容易陷入工程泥潭几个月过去看不到一个能说服投资经理的产出。另外建议把“数据可得时间戳”当作地基纪律来抓。AI基本面量化不同于纯统计量化它的信号来源复杂、更新节奏不规律时间语义一旦出错后续所有因子和组合都会跟着出错。一个体系是否可靠往往不体现在模型多复杂而体现在这些基础规则有没有被执行到底。
返回列表