Жадная политика — стратегия обучения с подкреплением, которая всегда выбирает действие с наивысшей оцененной ожидаемой отдачей. Она отдает предпочтение эксплуатации текущих знаний и не исследует альтернативные действия намеренно.
In reinforcement learning, a policy that always chooses the action with the highest expected return.