Метод динамiчного програмування для однiєї лiнiйно-квадратичної задачi оптимального керування в умовах невизначеностi

Автор(и)

  • А. В. Макарович https://orcid.org/0009-0000-2352-9933 ,
    Київський національний університет імені Тараса Шевченка image/svg+xml
  • О. А. Капустян https://orcid.org/0000-0002-2629-0750 ,
    Київський національний університет імені Тараса Шевченка image/svg+xml

DOI:

https://doi.org/10.17721/2706-9699.2026.1.02

Ключові слова:

оптимальне керування, параболiчнi диференцiальнi рiвняння, динамiчне програмування, розклад полiномiального хаосу

Анотація

Ця стаття присвячена розв’язанню лiнiйно-квадратичної (ЛК) задачi оптимального керування для параболiчного диференцiального рiвняння (ПДР) в умовах параметричної невизначеностi. Щоб впоратися з цiєю невизначенiстю, ми моделюємо невiдомий параметр за допомогою розподiлу ймовiрностей та мiнiмiзуємо математичне сподiвання функцiонала якостi. 

Застосування апарату динамiчного програмування до цiєї системи дає точний закон оптимального керування зi зворотним зв’язком за станом, який визначається нескiнченновимiрним iнтегро-диференцiальним рiвнянням Рiккатi (IДРР). Оскiльки безпосереднє розв’язання цього рiвняння є обчислювально складним, ми застосовуємо спектральний метод Гальоркiна в поєднаннi з розкладом полiномiального хаосу для апроксимацiї стохастичного простору параметрiв. Це математичне перетворення зводить складне стохастичне IДРР до стандартного матричного диференцiального рiвняння Рiккатi (МДРР).

Зводячи стохастичну задачу керування ПДР до МДРР, яке можна розв’язати заздалегiдь, наш пiдхiд дозволяє уникнути обчислювальних перешкод, що зазвичай виникають у середовищах з невизначенiстю. Це створює високоефективну основу для проєктування робастних регуляторiв i майбутнiх реалiзацiй алгоритмiв навчання з пiдкрiпленням.

Посилання

1. Kapustian O., Laptiev O., Makarovych A. Averaging of Linear Quadratic Parabolic Optimal Control Problem. Axioms. 2025. Vol. 14. No. 7. P. 512.

2. Pesare A., Palladino M., Falcone M. Convergence results for an averaged LQR problem with applications to reinforcement learning. Mathematics of Control, Signals, and Systems. 2021. Vol. 33. No. 3. P. 379–411.

3. Alla A., Pacifico A., Palladino M., Pesare A. Online identification and control of PDEs via Reinforcement Learning methods. Advances in computational mathematics. 2024. Vol. 50, No. 4.

4. Sutton R. S., Barto A. G., Williams R. J. Reinforcement learning is direct adaptive optimal control. IEEE Control Systems. 1992. Vol. 12. No. 2. P. 19–22.

5. Sutton R. S., Barto A. G. Reinforcement Learning: An Introduction, 2nd ed. MIT Press, Cambridge, MA, 2018.

6. Recht B. A tour of reinforcement learning: The view from continuous control. Annual Review of Control, Robotics, and Autonomous Systems. 2019. Vol. 2. P. 253–279.

7. Pacifico A., Pesare A., Falcone M. A new algorithm for the LQR problem with partially unknown dynamics. Large-Scale scientific computing. Cham, 2022. P. 322–330.

8. Kirk D. E. Optimal control theory: an introduction. Dover Publications, 2004. 464 p.

9. Ghanem R. G., Spanos P. D. Stochastic finite elements: a spectral approach. Minneola, N.Y : Dover Publications, 2003. 222 p.

10. Xiu D., Karniadakis G. E. The Wiener-Askey polynomial chaos for stochastic differential equations. SIAM Journal on Scientific Computing. 2002. Vol. 24. No. 2. P. 614–644.

11. Gautschi W. Orthogonal Polynomials: Computation and Approximation. Oxford University Press, 2004.

12. Abou-Kandil H., Freiling G., Ionescu V., Jank G. Matrix Riccati Equations in Control and Systems Theory. Birkh¨auser Basel, 2003.

13. Kapustyan E. A., Nakonechnyi A. G. Optimal bounded control synthesis for a parabolic boundary-value problem with fast oscillatory coefficients. Journal of automation and information sciences. 1999. Vol. 31, no. 12. P. 33–44.

Завантаження

Опубліковано

2026-04-24

Як цитувати

Макарович, А. В., & Капустян, О. А. (2026). Метод динамiчного програмування для однiєї лiнiйно-квадратичної задачi оптимального керування в умовах невизначеностi. Журнал обчислювальної та прикладної математики, 1, 13-32. https://doi.org/10.17721/2706-9699.2026.1.02