State–action–reward–state–action — алгоритм обучения с подкреплением, широко известный как SARSA. Он обучает политику, обновляя оценки ценности на основе наблюдаемых переходов, включающих текущее состояние, действие, награду, следующее состояние и следующее действие.