1. 这节究竟解决什么实际问题?¶
5.1 Markowitz 均值-方差优化:构建“最优”组合 的具体任务是:在收益、风险和约束之间求解权重,并观察均值估计误差的放大效应。 本节将明确输入数据、计算过程、输出及其在后续研究中的用途。
2. 前置知识¶
理解收益率、协方差、波动率和矩阵的基本含义。 对公式的理解应包括变量定义、单位、时间索引和适用条件。
3. 数据说明¶
固定多资产价格样本用于演示;不把少量资产、单一时期的最优权重当作配置建议。 运行前先检查 shape、日期范围、列名与缺失值。数据看起来能画图,不代表它适合回答研究问题。
4. 学习目标与完成标准¶
完成本节后,你应能用自己的话解释 5.1 Markowitz 均值-方差优化:构建“最优”组合 的输入、计算步骤、输出和局限;尤其能说明:在收益、风险和约束之间求解权重,并观察均值估计误差的放大效应。 你还应能独立改动一个参数并解释结果为什么变化,指出至少一个会让结论失真的假设。
5. 核心概念与公式¶
组合配置同时考虑单项资产风险和资产之间的协方差,目标是控制整体风险暴露。
组合收益是权重加权和;风险由协方差矩阵决定,权重之和、杠杆和做空限制必须写清楚。 看到公式时依次确认:每个符号的单位是什么?它属于哪个时点?分母会不会为零?它是描述性统计量、预测量,还是交易规则?
6. 从零实现¶
原始代码按照“准备输入 → 计算中间量 → 得到结果 → 解释输出”的顺序组织。每个单元应检查变量类型、索引、维度和代表性数值。中间变量用于核对公式实现和定位计算错误。
7. 成熟库实现¶
优化器可以求满足约束的数值解;它不会告诉你输入的预期收益是否可信。 使用库函数前先阅读参数含义、默认值和返回对象;库输出一个数字,并不说明这个数字适合你的交易假设。
8. 两种实现的差异¶
从零实现便于核对公式、调试和识别隐含假设;成熟库适合在计算逻辑已验证后复用。两种实现依赖相同的数据口径与时点假设,使用库函数不会改变输入数据的质量。
9. 预期结果与检查范围¶
你应看到维度正确的 Series/DataFrame、日期单调递增的索引,以及能支持“在收益、风险和约束之间求解权重,并观察均值估计误差的放大效应。”这一任务的表格或图形。金融日收益率均值通常接近 0;若出现极大的连续收益、空表、全 NaN 或索引错位,应先排查数据和对齐逻辑,而不是立即相信结果。
10. 常见错误与诊断¶
协方差矩阵不可逆、权重未归一化、用样本内最优权重宣称可投资、忽略再平衡成本。
诊断顺序:先打印类型与 shape,再看 head()/tail(),接着检查日期和 NaN,最后才比较数值。这样能避免在错误的对象上反复改参数。
11. 研究偏差检查¶
均值估计噪声极大;需要样本外比较、参数敏感性和等权等简单基线。 结果至少应与一个简单基线比较,并明确哪些部分只是教学演示。
12. 三层练习与答案¶
- 基础练习:验证一个中间变量、补全一段小计算,并用一句话解释输出。
- 研究练习:改变窗口、样本区间、约束或标的,记录哪些结论仍成立。
- 开放项目:把本节方法嵌入模块项目,报告基线、失败结果和限制。
题目在 ../exercises/05_portfolio/01_markowitz_exercises.ipynb;完整推导、可运行参考实现与结果检查在 ../solutions/05_portfolio/01_markowitz_solutions.ipynb。请先独立作答,再打开答案。
13. 延伸阅读¶
延伸材料:Portfolio Selection(Markowitz, 1952)。阅读记录应包括研究假设、数据频率、样本范围和结论适用条件。
14. 下一节¶
下一节是 02_risk_parity。本节的概念会成为理解它的输入,而不是孤立的名词。
import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
import yfinance as yf
from scipy.optimize import minimize
from sklearn.covariance import LedoitWolf
plt.rcParams['figure.figsize'] = (10, 7)
plt.style.use('seaborn-v0_8-muted')
# 下载多资产数据以构建组合
tickers = ['AAPL', 'MSFT', 'GOOGL', 'AMZN', 'JPM', 'GLD', 'TLT']
prices = yf.download(tickers, start='2020-01-01', end='2024-01-01',
progress=False)['Close'].dropna()
returns = prices.pct_change().dropna()
n_assets = len(tickers)
mu = returns.mean() * 252 # 年化期望收益率
print(f'已获取 {n_assets} 只涵盖科技、银行、黄金、债市的资产,准备构建跨市场组合。')
已获取 7 只涵盖科技、银行、黄金、债市的资产,准备构建跨市场组合。
# 默认使用固定样本,保证课程与 CI 不依赖实时接口。
USE_OFFLINE_DATA = True
if USE_OFFLINE_DATA:
from pathlib import Path
import sys
docs_root = next(parent for parent in [Path.cwd(), *Path.cwd().parents]
if (parent / 'utils' / 'offline_data.py').exists())
sys.path.insert(0, str(docs_root))
from utils.offline_data import configure_yfinance_offline
configure_yfinance_offline(yf)
else:
print('在线下载为扩展步骤;请核对数据字段、时区和下载日期。')
import matplotlib.pyplot as plt
# 1. 设置系统自带的中文字体(这里使用黑体 SimHei)
plt.rcParams['font.sans-serif'] = ['SimHei'] # 如果你想用微软雅黑,可以改成 ['Microsoft YaHei']
# 2. 解决更换字体后,负号(-)显示为方块的问题
plt.rcParams['axes.unicode_minus'] = False
1. 估值陷阱:为什么要用“收缩估计量”?¶
QuantEcon 深度提示: MPT 最大的痛点是“垃圾进,垃圾出”。普通的样本协方差矩阵(Sample Covariance)在处理多资产时非常不稳定,容易放大噪声。
Ledoit-Wolf 收缩:这是一种更稳健的方法。它将样本协方差向一个结构化的目标(如等相关矩阵)进行“拉伸”,从而降低极端错误。这在资产数量较多时至关重要。
# 传统方法 vs 稳健方法
cov_sample = returns.cov() * 252
lw = LedoitWolf()
cov_lw = lw.fit(returns).covariance_ * 252
print("稳健协方差矩阵计算完成。这能有效降低模型对历史噪声的过度敏感。")
稳健协方差矩阵计算完成。这能有效降低模型对历史噪声的过度敏感。
2. 组合绩效函数¶
$$\mu_p = \mathbf{w}^T \boldsymbol{\mu}, \quad \sigma_p = \sqrt{\mathbf{w}^T \boldsymbol{\Sigma} \mathbf{w}}$$
def portfolio_stats(weights, mu, cov):
w = np.array(weights)
ret = w @ mu
vol = np.sqrt(w @ cov @ w)
sharpe = (ret - 0.04) / vol # 假设无风险利率为 4%
return ret, vol, sharpe
constraints = ({'type': 'eq', 'fun': lambda w: np.sum(w) - 1})
bounds = [(0, 1)] * n_assets
w0 = np.ones(n_assets) / n_assets
# 优化最大夏普 (使用稳健协方差 cov_lw)
res_sr = minimize(lambda w: -portfolio_stats(w, mu, cov_lw)[2], w0,
bounds=bounds, constraints=constraints)
w_sr = res_sr.x
sr_ret, sr_vol, _ = portfolio_stats(w_sr, mu, cov_lw)
# 优化最小方差
res_mv = minimize(lambda w: portfolio_stats(w, mu, cov_lw)[1], w0,
bounds=bounds, constraints=constraints)
w_mv = res_mv.x
mv_ret, mv_vol, _ = portfolio_stats(w_mv, mu, cov_lw)
print("优化计算完成。")
优化计算完成。
4. 可视化:有效前沿与资产配置¶
# 模拟 2000 个随机组合进行对比
n_sims = 2000
sim_results = np.zeros((n_sims, 2))
for i in range(n_sims):
w = np.random.random(n_assets)
w /= w.sum()
r, v, _ = portfolio_stats(w, mu, cov_lw)
sim_results[i] = [r, v]
plt.scatter(sim_results[:, 1], sim_results[:, 0], c=sim_results[:, 0]/sim_results[:, 1],
cmap='viridis', alpha=0.3, s=10)
plt.scatter(sr_vol, sr_ret, marker='*', s=300, color='gold', label='最大夏普组合')
plt.scatter(mv_vol, mv_ret, marker='D', s=150, color='cyan', label='最小方差组合')
plt.xlabel('预期波动率 (Risk)')
plt.ylabel('预期收益率 (Return)')
plt.title("现代投资组合理论:有效前沿")
plt.legend()
plt.grid(alpha=0.2)
plt.show()
print('\n--- 最大夏普组合权重分布 ---')
for t, w in sorted(zip(tickers, w_sr), key=lambda x: -x[1]):
if w > 0.01: print(f"{t:<8}: {w:.2%}")
--- 最大夏普组合权重分布 --- AAPL : 43.13% GOOGL : 29.87% GLD : 27.00%
练习¶
- 对比实验:将
cov_lw换回cov_sample,观察最优权重是否发生了剧烈漂移? - 分散化度量:计算组合的 Herfindahl 指数 ($H = \sum w_i^2$)。H 越小,说明权重分配越分散。计算最大夏普组合的 H 值是多少?
- 现实惩罚:在优化中加入单只股票不超过 20% 的限制,观察有效前沿如何向内收缩。
下一节 → 02_risk_parity.ipynb(我们将学习不依赖期望收益,仅根据风险贡献来平衡组合的方法)