Caesar AI Atlas

Apprentissage par renforcement à partir du feedback humain (RLHF)

Also known as: Reinforcement Learning from Human Feedback (RLHF) · Reinforcement Learning From Human Feedback (RLHF) · RLHF

Caesar AI Atlas Definition

L’apprentissage par renforcement à partir du feedback humain (RLHF) est une technique d’alignement du comportement d’un modèle à l’aide de préférences ou d’évaluations humaines. En général, les jugements humains servent à entraîner un modèle de récompense, puis l’apprentissage par renforcement optimise le modèle génératif pour produire des sorties qui correspondent mieux à ces préférences.

Other Definitions

Apprentissage par renforcement à partir du feedback humain Source

A technique that involve training a "reward model" to predict how humans rate the quality of generated content, and then training a generative generative AI model to satisfy this reward model via reinforcement learning. It can be used for example to make the generative AI model more truthful or less harmful.

Apprentissage par renforcement à partir du feedback humain Source

Using feedback from human raters to improve the quality of a model's responses. For example, an RLHF mechanism can ask users to rate the quality of a model's response with a or emoji. The system can then adjust its future responses based on that feedback.

Apprentissage par renforcement à partir du feedback humain Source

A machine learning technique that trains AI models to align their responses with human preferences by using evaluative feedback.

Also Referenced In

Related Terms