ACL 2020 · Semantic Models of Financial Markets
Stock Embeddings Acquired from News Articles and Price History, and an Application to Portfolio Optimization
将新闻对市场的影响从预测网络中分离出来,形成可抽取、可比较、可迁移的股票向量;同一表示既解释新闻与价格的关系,也能直接进入组合风险矩阵。
问题:预测模型不是市场表示
以新闻预测涨跌的神经模型把文本、价格与股票特异性混合在网络参数中。即使预测指标提高,也很难回答哪些新闻与哪些股票相关、不同股票为何具有共同风险,以及学到的关系能否迁移到预测之外的任务。论文因此将股票本身设为可学习对象:每只股票对应一个向量 ,其几何位置由新闻语义与价格运动共同监督。
这个选择还绕开了一个常被忽略的问题。短期价格预测在有效市场假设下极其困难,而用当天及邻近新闻解释已经发生的价格变化,更适合检验模型是否理解文本与市场之间的对应关系。论文明确区分了用于学习表示的 classification setting 与严格使用过去信息的 prediction setting;前者学习语义,后者只在下游组合模拟中用于评估。
股票向量如何选择新闻
每篇新闻被编码为 key-value 对 。股票向量与 key 的内积形成注意力分数:
value 向量按 聚合为股票在时刻 的市场状态
因此,同一批新闻会为不同股票形成不同的市场状态。 不依赖股票代码是否在新闻中出现,而是通过价格监督学习哪些文本模式与该股票相关;它相当于一个把金融符号接地到外部市场现实的参数。
共享分类器解决小样本
按交易日建模时,每只股票只有数千个样本,独立训练容易过拟合。论文让所有股票共享价格运动分类器,将 的序列输入 Bi-GRU,而股票特异性只通过注意力中的 表达。相较逐股票模型,这一机制把分类器的有效样本扩大约 至 倍,并允许模型学习股票之间的相关结构。
实验使用 WSJ 与 Reuters/Bloomberg 两组新闻语料,分别覆盖约 万和 万篇标题;对应 与 只 S&P 500 股票。完整模型结合 classifier sharing 与新闻 key-value 双向量表示,在只有一年数据时仍能超过随机水平,在 Reuters/Bloomberg 全量数据上达到 68.8% 的平均分类准确率。消融实验表明,两种机制的结合比单独加权新闻更能抵抗小样本过拟合。
从表示迁移到现代组合理论
Markowitz 均值—方差模型最小化
标准风险矩阵 来自历史收益协方差,容易受价格噪声和有限窗口影响。论文用股票嵌入之间的余弦关系构造风险矩阵,并与仅价格、Word2Vec、BERT 及简单文本—价格融合方法比较。组合每年只使用此前数据重新训练和配置,测试期与训练期严格分离。
股票嵌入在大多数预期收益约束下超过对照方法。Reuters/Bloomberg 数据上,嵌入组合的平均实现年收益为 35.5%,历史协方差基线为 12.7%,前者约为后者的 2.8 倍。WSJ 数据上的提升较小但仍为正。结果同时说明,仅把文本向量与协方差机械相乘并不稳定;有效信息来自以价格运动监督过的股票语义几何。
发现与边界
论文的核心贡献不是一项固定交易策略,而是把金融文本模型的中间知识变成可操作对象。股票向量可以被抽取、可视化并用于分类器之外的优化问题,这为后续尾部风险建模提供了接口。
结果来自历史数据上的年度滚动模拟,未计入交易成本、冲击成本和现实约束,不能直接解释为未来收益保证。classification setting 也使用了当天新闻,只承担表示学习与语义检验的作用。更重要的后续问题是:价格协方差描述常态波动,文本是否能系统补足罕见事件和结构变化所形成的尾部风险。