Comparaison cĂŽte Ă cĂŽte du taux dâaffirmations non Ă©tayĂ©es et de lâhallucination. Comprenez comment une mesure des affirmations non Ă©tayĂ©es se rapporte Ă la dĂ©faillance plus large des sorties IA fausses ou fabriquĂ©es.
Verdict rapide: Utilisez le taux dâaffirmations non Ă©tayĂ©es lorsque vous quantifiez des assertions sans support ; utilisez Hallucination pour dĂ©crire le mode de dĂ©faillance sous-jacent de lâIA gĂ©nĂ©rative.
Unsupported-claim Rate describes percentage of claims in a model response that are not grounded in supporting evidence.
Contexte : ParticuliĂšrement pertinent pour les rapports dâĂ©valuation qui nĂ©cessitent un taux mesurable dâaffirmations non Ă©tayĂ©es.
Hallucination describes AI-generated output that appears plausible or confident but is false, unsupported, misleading, or fabricated.
Contexte : ParticuliÚrement pertinent pour décrire une défaillance de fiabilité ou de sécurité en IA générative.
| Aspect | Unsupported-claim Rate | Hallucination |
|---|---|---|
| Ce que cela mesure | Le taux dâaffirmations non Ă©tayĂ©es mesure le pourcentage dâaffirmations dans une rĂ©ponse qui manquent de preuves Ă lâappui. | Lâhallucination dĂ©crit un type de sortie fausse, non Ă©tayĂ©e, trompeuse ou fabriquĂ©e. |
| Meilleur cas dâutilisation | Utilisez lâUCR pour comparer des systĂšmes, prompts ou paramĂštres de rĂ©cupĂ©ration avec une grille dâĂ©valuation dĂ©finie. | Utilisez hallucination pour dĂ©crire le mode de dĂ©faillance observĂ© dans une rĂ©ponse de modĂšle ou un incident. |
| Mode de dĂ©faillance | Un UCR Ă©levĂ© indique que de nombreuses affirmations de la rĂ©ponse ne sont pas ancrĂ©es dans des preuves. | Une hallucination peut ĂȘtre une affirmation non Ă©tayĂ©e, une citation inventĂ©e ou une explication fabriquĂ©e plus large. |
| SensibilitĂ© au seuil | LâUCR dĂ©pend de la segmentation des affirmations, de ce qui compte comme preuve et du seuil utilisĂ© pour considĂ©rer une affirmation comme soutenue. | LâĂ©valuation de lâhallucination dĂ©pend de la vĂ©rification factuelle, des contrĂŽles dâancrage et du contexte de la tĂąche. |
| Erreur courante | Traiter un UCR faible comme la preuve que chaque réponse est correcte. | Utiliser hallucination comme une étiquette vague sans consigner quelles affirmations étaient fausses ou non étayées. |
En pratique, lâhallucination est la catĂ©gorie de problĂšme, tandis que le taux dâaffirmations non Ă©tayĂ©es est une maniĂšre de mesurer et de gouverner une partie de ce problĂšme.
Rapporter le risque dâhallucination sans mĂ©thode dâĂ©valuation mesurable.
Compter les affirmations non étayées sans définir ce qui constitue une affirmation ou une preuve de soutien.
Supposer que les citations sont valides sans vĂ©rifier si elles soutiennent lâĂ©noncĂ©.
Utiliser un UCR agrégé pour masquer des défaillances individuelles graves.
Utilisez le taux dâaffirmations non Ă©tayĂ©es lorsque vous Ă©valuez des rĂ©ponses par rapport Ă des sources ou Ă une norme dâancrage. Il convient aux tableaux de bord, aux tests de rĂ©gression et aux dossiers de preuves oĂč les assertions non Ă©tayĂ©es doivent ĂȘtre comptĂ©es.
Utilisez Hallucination lorsque vous dĂ©crivez le schĂ©ma dâerreur substantiel dans une sortie dâIA gĂ©nĂ©rative. Câest le bon terme pour les risques cĂŽtĂ© utilisateur, les descriptions dâincident et les contrĂŽles de fiabilitĂ©.
Pour les preuves ISO/IEC 42001 et NIST AI RMF, les mĂ©triques dâaffirmations non Ă©tayĂ©es peuvent soutenir la surveillance et la validation du risque dâhallucination, surtout lorsque les sorties IA informent des dĂ©cisions ou des communications externes.
Non. Le taux dâaffirmations non Ă©tayĂ©es mesure les affirmations non soutenues dans une rĂ©ponse, tandis que lâhallucination est une catĂ©gorie plus large qui peut inclure des faits faux, des sources fabriquĂ©es et des raisonnements trompeurs.
Oui. Une affirmation peut citer une source mais la lire de travers ou sâappuyer sur une preuve peu fiable. Lâancrage et la factualitĂ© devraient ĂȘtre Ă©valuĂ©s sĂ©parĂ©ment lorsque le cas dâusage lâexige.
Il transforme un risque abstrait dâhallucination en mesure rĂ©pĂ©table. Cela facilite le suivi des changements entre prompts, modĂšles, paramĂštres de rĂ©cupĂ©ration et versions.
No recently viewed comparisons yet.