Also known as: Q learning
Q-learning — это model-free алгоритм обучения с подкреплением, который изучает ценность действий в состояниях без необходимости модели динамики среды. Он стремится приблизить оптимальную Q-функцию, часто используя уравнение Беллмана, чтобы агент мог выбирать действия, максимизирующие ожидаемую отдачу.
A model-free reinforcement learning algorithm for learning the value of an action in a particular state.