Параллельное сравнение Unsupported-claim Rate и Hallucination. Разбирает, как измерение неподдержанных утверждений связано с более широким сбоем ложного или fabricated AI output.
Краткий вердикт: Используйте Unsupported-claim Rate, когда нужно количественно оценить unsupported assertions; используйте Hallucination, когда описываете базовый failure mode generative AI.
Unsupported-claim Rate describes percentage of claims in a model response that are not grounded in supporting evidence.
Контекст: Наиболее уместна для evaluation reports, которым нужна измеримая доля неподдержанных claims.
Hallucination describes AI-generated output that appears plausible or confident but is false, unsupported, misleading, or fabricated.
Контекст: Наиболее уместна при описании generative AI reliability или safety failure.
| Аспект | Unsupported-claim Rate | Hallucination |
|---|---|---|
| Что измеряет | Unsupported-claim rate измеряет процент claims в response, которые не имеют supporting evidence. | Hallucination описывает тип output, который является false, unsupported, misleading или fabricated. |
| Лучший сценарий использования | Используйте UCR для сравнения systems, prompts или retrieval settings по определённой evaluation rubric. | Используйте hallucination для описания failure mode, наблюдаемого в model response или incident. |
| Сбойный сценарий | Высокий UCR показывает, что многие claims в response не grounded in evidence. | Hallucination может быть одним unsupported claim, invented citation или более широкой fabricated explanation. |
| Чувствительность к порогу | UCR зависит от того, как сегментируются claims, что считается evidence и какой threshold используется для support. | Оценка hallucination зависит от factual verification, grounding checks и task context. |
| Распространённая ошибка | Считать низкий UCR доказательством того, что каждый answer корректен. | Использовать hallucination как расплывчатый label без записи, какие claims были false или unsupported. |
На практике hallucination — это категория проблемы, а unsupported-claim rate — один из способов измерять и govern часть этой проблемы.
Сообщать hallucination risk без измеримого evaluation method.
Считать unsupported claims без определения, что является claim или supporting evidence.
Считать citations валидными без проверки, поддерживают ли они statement.
Использовать aggregate UCR, скрывая серьёзные individual failures.
Используйте Unsupported-claim Rate, когда оцениваете responses относительно source material или grounding standard. Она подходит для dashboards, regression tests и evidence packs, где unsupported assertions нужно подсчитывать.
Используйте Hallucination, когда описываете содержательный error pattern в generative AI output. Это правильный термин для user-facing risks, incident descriptions и reliability controls.
Для evidence по ISO/IEC 42001 и NIST AI RMF unsupported-claim metrics могут поддерживать monitoring и validation hallucination risk, особенно когда AI outputs информируют decisions или external communications.
Нет. Unsupported-claim rate измеряет unsupported claims в response, а hallucination — более широкая failure category, которая может включать false facts, fabricated sources и misleading reasoning.
Да. Claim может ссылаться на источник, но неверно его интерпретировать или опираться на ненадёжное evidence. Grounding и factuality нужно оценивать отдельно, если use case этого требует.
Он превращает абстрактный hallucination risk в repeatable measurement. Это облегчает отслеживание изменений между prompts, models, retrieval settings и releases.
No recently viewed comparisons yet.