Аннотация
в статье исследуется ансамблевый подход к управлению инвестиционным портфелем на российском фондовом рынке на основе глубокого обучения с подкреплением. Цель работы состоит в воспроизведении базовой ансамблевой архитектуры на данных российского рынка, в проверке ее переносимости и в выявлении тех модификаций, которые, действительно, улучшают качество торговли на длительный период. В качестве исходного решения рассматривается ансамбль из трех алгоритмов принятия решений, для которого последовательно анализируются расширение набора признаков, добавление макроэкономических переменных, штрафов за риск и механизма непрерывной адаптации одного из агентов в процессе торговли. Эксперименты проведены на данных 2015–2025 годов по ликвидным российским акциям, а итоговое сравнение выполнено на периоде 2023–2025 годов. Показано, что наибольший вклад в результат дает механизм непрерывного обучения, при котором агент дообучается на сделках любого активного участника ансамбля. Лучшая конфигурация обеспечивает суммарную доходность 61,7 процента и превосходит пассивные ориентиры по абсолютной доходности, однако не решает проблему защиты капитала на затяжном падающем рынке при высокой ключевой ставке.
Литература
Markowitz H. M. Portfolio Selection. The Journal of Finance. 1952;7(1):77–91. DOI: 10.1111/j.1540-6261.1952.tb01525.x.
Black F., Litterman R. Global Portfolio Optimization. Financial Analysts Journal. 1992;48(5):28–43. DOI: 10.2469/faj.v48.n5.28.
Yang Z., Zhu Y., Guo J., Liu X.-Y., Zhong S., Walid A. Deep Reinforcement Learning for Automated Stock Trading: An Ensemble Strategy. ICAIF ’20. 2020:1–8. DOI: 10.1145/3383455.3422540.
Mnih V., Kavukcuoglu K., Silver D. et al. Human-Level Control through Deep Reinforcement Learning. Nature. 2015;518:529–533. DOI: 10.1038/nature14236.
Lillicrap T. P., Hunt J. J., Pritzel A. et al. Continuous Control with Deep Reinforcement Learning. arXiv:1509.02971. 2016. DOI: 10.48550/arXiv.1509.02971.
Schulman J., Wolski F., Dhariwal P., Radford A., Klimov O. Proximal Policy Optimization Algorithms. arXiv:1707.06347. 2017. DOI: 10.48550/arXiv.1707.06347.
Haarnoja T., Zhou A., Abbeel P., Levine S. Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor. Proceedings of ICML. 2018:1861–1870.
Liu S., Rui J., Gao J. et al. FinRL-Meta: Market Environments and Benchmarks for Data-Driven Financial Reinforcement Learning. 36th Conference on Neural Information Processing Systems (NeurIPS 2022).
Theate T., Ernst D. An Application of Deep Reinforcement Learning to Algorithmic Trading. Expert Systems with Applications. 2021;173:114632. DOI: 10.1016/j.eswa.2021.114632.
Khetarpal K., Riemer M., Rish I., Precup D. Towards Continual Reinforcement Learning: A Review and Perspectives. Journal of Artificial Intelligence Research. 2022;75:1401–1476. DOI: 10.1613/jair.1.13673.
Artzner P., Delbaen F., Eber J.-M., Heath D. Coherent Measures of Risk. Mathematical Finance. 1999;9(3):203–228. DOI: 10.1111/1467-9965.00068.
Rockafellar R. T., Uryasev S. Conditional Value-at-Risk for General Loss Distributions. Journal of Banking & Finance. 2002;26(7):1443–1471. DOI: 10.1016/S0378-4266(02)00271-6.

