隐私计算技术在股市波动预警中的应用
点击关注公众号,“技术干货” 及时达!
❝抖音集团安全研究团队与中央财经大学国家金融安全教育部工程研究中心合作,构建基于隐私计算技术的股市波动预警平台,在数据不出域的情况下利用企业高频财务数据进行机器学习建模。模型效果比仅利用公开数据明显提升。该项目成果在中央财经大学国家金融安全教育部工程研究中心长期展示。
❞
背景
随着金融市场的快速发展和全球经济的不确定性增加,股票市场的波动性日益加剧。股票价格的剧烈波动不仅会影响投资者的收益,还可能引发市场恐慌,进而对整个金融系统产生负面影响。因此,如何有效地预测和预警股票市场的波动风险,成为了金融研究和实践中的一个重要课题。
近年来,越来越多的研究基于企业财务数据,通过机器学习构建股市波动风险预警系统。具体来讲:
以「财务数据」为特征,以 T+1 「股票风险(波动率因子)」为 label 训练机器学习模型。
利用训练得到的机器学习模型预测股票在下一年度的波动率因子,用于风险预警。
一般而言,机器学习模型使用的特征越多,预期效果越好。对于股市波动预警这一应用来讲,使用高频财务数据(例如每季度的财务数据)作为特征训练模型,预期效果会好于使用低频数据(例如年度财务数据)。
「但高频财务数据的隐私性和敏感性较高,涉及到大量公司财务、经营上的细节,各公司出于隐私保护和数据安全的考虑,不愿意公开高频财务数据。」 我国的法律法规也并没有强制要求上市公司披露高频财务数据,尽管这些数据在股票市场的预测中非常有价值,但由于无法获取,形成了一个 “数据孤岛” 问题。
为了解决这个问题,安全研究团队引入了一种隐私计算技术——横向联邦学习。「这是一种分布式的机器学习方法,它能够在保证数据不出本地的情况下,利用不同数据源的数据进行联合建模,为股票市场的风险预测提供新的思路。」
抖音集团安全研究团队与中央财经大学国家金融安全教育部工程研究中心合作,搭建了基于联邦学习的股市波动预警平台。该平台实现了在不泄露敏感数据的前提下,利用高频财务数据来提升股票市场波动性的预测精度。
解决方案
「系统架构」
整个系统的中心是 “股市波动风险预警服务器”,它作为系统的大脑,负责协调和管理整个计算过程。
在系统中,服务器首先初始化模型的参数,然后将这些参数发送给分布在各个上市公司(1~N)的本地计算设备。每个公司利用自身的 “高频财务数据” 在本地进行计算,生成模型的梯度,并将梯度上传回中心服务器。中心服务器会根据这些梯度更新模型参数,再将更新后的参数分发回去,如此循环迭代,直到模型最终收敛。
这个过程中,为了不泄露各公司的本地梯度,梯度聚合采用下文介绍的「安全聚合协议:各公司发送的梯度为某种密文形式,使得股市波动风险预警服务器无法通过密文梯度获知每家公司的明文梯度,但不会影响聚合结果的正确性。」
通过这种架构设计,系统实现了对分散数据的充分利用,同时保证了各上市公司的高频数据始终不对外公开,解决了 “数据孤岛” 问题,兼顾了数据安全和计算效率,为股市波动风险预警提供了一种创新的解决方案。
安全聚合协议
这里的安全聚合协议的作用是:在一个有由各参与方 Pi for i=0,1,⋯,n−1 和 聚合服务器 PS 组成的 n+1 方网络中
各参与方持有自己的私有数据:Pi 持有 xi∈A, 其中 A 为数据取值的有限交换群
如何使 PS 得到 ∑ixi, 但不知道关于每个 xi的任何其他信息?
一个简单的安全集合协议如下:
「Protocol:」
Setup: Pi 与 Pi+1modn 协商种子 seedi,(i+1modn)
Online: 第 k 次安全聚合时:
Pi计算 maski:=F(seedi,(i+1modn),k)−F(seed(i−1modn),i,k), 并将 x~i:=xi+maski 发送给 PS PS 从各 Pi处接受 x~i, 并计算明文聚合 ∑ix~i
这里 F:{0,1}λ×N⟶A 是一个为随机函数。
「正确性:」
由于∑imaski=∑i[F(seedi,(i+1modn),k)−F(seed(i−1modn),i,k)]=0
所以 ∑ix~i=∑ixi
实验效果
模型与数据
建模采用的是一个 5 层全连接神经网络回归模型,利用千余家公司在过去 2011~2022 年度的如下「财务数据」作为特征,以 T+1 年度的股票收益率方差作为 Label 进行建模,对股票风险进行预测。
「特征:」 货币资金、流动资产合计、资产总计、短期借款、应付账款、长期借款、营业收入、营业成本、销售费用、营业利润、利润总额、净利润、其他综合收益
「Label:」 股票收益率的方差 (根据月度波动计算的年度变量)
| 特征 | 解释 | 数据来源 |
|---|---|---|
| 货币资金 | 企业持有的现金及现金等价物,包括库存现金、银行存款等。 | CSMAR 数据库 |
| 流动资产合计 | 企业在一年内或超过一年的一个营业周期内可以变现或耗用的资产总额。 | CSMAR 数据库 |
| 资产总计 | 企业拥有的全部资产的总和,包括流动资产和非流动资产。 | CSMAR 数据库 |
| 短期借款 | 企业在一年内需要偿还的借款,包括银行借款和其他短期借款。 | CSMAR 数据库 |
| 应付账款 | 企业因购买商品、接受劳务等应支付的款项。 | CSMAR 数据库 |
| 长期借款 | 企业在一年以上需要偿还的借款,包括银行借款和其他长期借款。 | CSMAR 数据库 |
| 营业收入 | 企业在一定期间内通过销售商品或提供劳务等主营业务活动所取得的收入。 | CSMAR 数据库 |
| 营业成本 | 企业在一定期间内因销售商品或提供劳务等主营业务活动所发生的成本。 | CSMAR 数据库 |
| 销售费用 | 企业在销售商品过程中发生的各项费用,包括广告费、运输费等。 | CSMAR 数据库 |
| 营业利润 | 企业在一定期间内通过主营业务活动所取得的利润,等于营业收入减去营业成本和销售费用。 | CSMAR 数据库 |
| 利润总额 | 企业在一定期间内的全部利润,包括营业利润和其他业务利润。 | CSMAR 数据库 |
| 净利润 | 企业在一定期间内的最终利润,等于利润总额减去所得税费用。 | CSMAR 数据库 |
| 其他综合收益 | 企业在一定期间内净利润外的其他收益,包括外币报表折算差额等。 | CSMAR 数据库 |
CSMAR 数据库(中国经济金融研究数据库)是从学术研究的需求出发,借鉴芝加哥大学[1] CRSP、标准普尔[2] Compustat、 纽约交易所 TAQ、ISDA,Thomson、GSI Online 等国际知名数据库的专业标准,并结合中国实际国情开发出的国内经济金融型数据库。该数据库涵盖人物特征、银行研究、股票市场、公司研究等 19 大系列,包含 200 多个数据库、4000 多张表、6 万多个字段,不断丰富的数据库内容只为满足学者的研究需求。
模型评估
采用均方误差(MSE)作为模型评估指标,分别计算两个模型在测试集上的 MSE 值。
| method | 建模方式 | 使用数据 | 预测 MSE |
|---|---|---|---|
| Method 1 | 集中式建模 | 年度数据 | 0.042 |
| Method 2 | 联邦建模 | 季度数据 | 0.014 |
「可见,使用高频数据(季度数据)联邦建模方式得到的模型效果明显优于使用低频数据的集中式建模的模型效果。」 这是由于高频财务数据反映了更多公司生产、经营、资金获取和使用方面的细节,与公司股价波动有更强的相关性。
总结与展望
基于隐私计算技术和公司高频财务数据,抖音集团安全研究团队构建了股市波动风险预警系统。与当前广泛使用的基于低频数据集中式建模方式相比,这个系统能够更准确地预测股票波动,有助于平稳金融市场,避免金融系统性风险的发生。
目前,该项目成果已在中央财经大学国家金融安全教育部工程研究中心展示。未来,将进一步向国家金融主管单位推广该系统,通过引入先进的技术和方法,提高金融市场监管的效率和准确性,帮助监管部门更好地了解市场动态,及时应对潜在风险,进一步加强金融市场的规范和透明度。
点击关注公众号,“技术干货” 及时达!