Случайная политика — политика обучения с подкреплением, которая выбирает действия случайно, а не на основе выученной ценности или ожидаемого вознаграждения. Она часто используется для исследования среды, базовых сравнений или раннего этапа обучения до появления более информированных политик.
In reinforcement learning, a policy that chooses an action at random.