跳转至

模块6:机器学习与量化

机器学习可以表示非线性关系,但金融数据的低信噪比、时序依赖和重复试验会增加过拟合风险。本模块重点讨论时序切分、特征泄漏、基线、样本外检验和交易成本。

课程目录

文件序号 内容说明
01_feature_selection.ipynb 多重共线性诊断、互信息与 LASSO 特征选择
02_ml_prediction.ipynb 基于树模型(XGBoost/Random Forest)的收益方向预测
03_deep_learning.ipynb 时序深度模型(LSTM/Transformer)在市场预测中的尝试
04_dangers_of_overfitting.ipynb 比较训练集与验证集表现,识别过拟合和参数搜索偏差
05_cross_validation.ipynb Purged K-Fold、Embargo 与时序交叉验证
06_advanced_portfolio_optimization.ipynb Black-Litterman、Kelly 比例与组合优化
07_leverage_and_margin.ipynb 凯利公式与杠杆风险管理

时间序列机器学习的评估规则

金融时序与常见的独立同分布图像样本不同:数据分布会变化,特征与标签可能重叠,策略还会受到交易成本和市场反馈影响。因此需要正则化(Regularization)、时序验证和持续监测。