Also known as: Proximal Policy Optimisation
Proximal Policy Optimization — это алгоритм обучения с подкреплением, используемый для обучения политики агента в задачах принятия решений. Он улучшает поведение политики через ограниченные обновления, направленные на увеличение награды и предотвращение дестабилизирующих изменений между итерациями обучения.
A reinforcement learning algorithm for training an intelligent agent's decision function to accomplish difficult tasks.