模块6:机器学习与量化
机器学习可以表示非线性关系,但金融数据的低信噪比、时序依赖和重复试验会增加过拟合风险。本模块重点讨论时序切分、特征泄漏、基线、样本外检验和交易成本。
课程目录
| 文件序号 | 内容说明 |
|---|---|
01_feature_selection.ipynb |
多重共线性诊断、互信息与 LASSO 特征选择 |
02_ml_prediction.ipynb |
基于树模型(XGBoost/Random Forest)的收益方向预测 |
03_deep_learning.ipynb |
时序深度模型(LSTM/Transformer)在市场预测中的尝试 |
04_dangers_of_overfitting.ipynb |
比较训练集与验证集表现,识别过拟合和参数搜索偏差 |
05_cross_validation.ipynb |
Purged K-Fold、Embargo 与时序交叉验证 |
06_advanced_portfolio_optimization.ipynb |
Black-Litterman、Kelly 比例与组合优化 |
07_leverage_and_margin.ipynb |
凯利公式与杠杆风险管理 |
时间序列机器学习的评估规则
金融时序与常见的独立同分布图像样本不同:数据分布会变化,特征与标签可能重叠,策略还会受到交易成本和市场反馈影响。因此需要正则化(Regularization)、时序验证和持续监测。