市场_thinker
26-07-04 09:06

这就是这篇论文最核心的方法论突破——“端到端”(End-to-End)学习。它彻底颠覆了传统量化“先预测、再优化”的两步走模式。

为了让你更清晰地看出区别,我们对比一下:

1. 传统监督学习(预测收益率)

· 标签(Label):未来的实际收益率(比如 t+1 时刻的价格变化)。
· 做法:输入特征 X_t,预测 \hat{y}_{t+1},计算 MSE(均方误差)损失,让预测值尽量接近未来的真实价格。
· 缺点:预测收益率太难(信噪比极低),且微小的预测误差在第二步构建组合时会被放大,导致权重不稳定。

2. 本文的端到端策略(直接输出权重)

· 标签(Label):根本没有标签!
· 做法:输入特征 X_t,直接输出投资权重 w_t。然后用这些权重去乘以后续的真实市场收益率 R_{i,t}(这个数据是已知的历史数据),计算出组合的历史收益序列 R_{P,t}。
· 损失函数:计算这个组合收益序列的夏普比率,并设定损失函数为 负夏普比率(-\text{Sharpe})。模型的目标就是调整网络参数,让这个负值最小(即夏普最大)。

---

那没有“标签”,梯度怎么反向传播?参数怎么更新呢?

关键点在于整个计算链条都是可微分的(Differentiable):

特征 X_t \to 神经网络输出权重 w_t \to 组合收益 R_{P,t} = \sum (w_t \times R_{t+1}) \to 计算夏普比率 \to 求导 \to 更新网络。

虽然模型没有直接去“猜”明天的价格,但它通过反向传播,间接学会了如何调整权重,使得历史上的组合收益曲线变得“夏普最高”。这相当于让模型直接去优化最终的投资结果,而不是去优化中间过程的预测精度。

论文中的原话也印证了这一点(引自第1页和第三部分):

“We instead study an end-to-end AI-based policy that maps market states directly to portfolio weights”(我们不预测收益,而是直接映射状态到权重)
“rather than through an intermediate return-forecasting loss”(而不是通过中间的收益率预测损失来学习)

那它靠什么作为“监督信号”?
靠的是组合收益序列本身的统计特征(均值和方差)。如果生成的权重导致组合收益曲线平稳向上(夏普高),模型就得到“正激励”;如果权重导致曲线大起大落或亏损,模型就得到“负激励”。这本质上是将投资组合优化问题,转化为了一个可微分的“策略搜索”问题,类似于深度学习版的“试错法”。

所以,你的质疑非常专业——在没有明确未来价格作为标签的情况下,模型依然能通过最大化历史组合表现的客观函数来进行有效的参数学习。这既是它的巧妙之处,也是它在这篇论文中能跑赢部分基准的原因。

发布于 浙江