Caesar AI Atlas
МетрикиСредний

Unsupported-claim Rate vs Hallucination

Параллельное сравнение Unsupported-claim Rate и Hallucination. Разбирает, как измерение неподдержанных утверждений связано с более широким сбоем ложного или fabricated AI output.

Краткий вердикт: Используйте Unsupported-claim Rate, когда нужно количественно оценить unsupported assertions; используйте Hallucination, когда описываете базовый failure mode generative AI.

Обзор терминов

Unsupported-claim Rate

Unsupported-claim Rate describes percentage of claims in a model response that are not grounded in supporting evidence.

Ключевые характеристики
  • Процентная evaluation metric
  • Фокусируется на claims, не grounded in evidence
  • Полезна для response-level quality measurement
  • Сигнализирует риск unsupported assertions
Обратите внимание
  • Непоследовательно считать claims
  • Считать метрику доказательством factual accuracy
  • Игнорировать качество evidence при оценке support

Контекст: Наиболее уместна для evaluation reports, которым нужна измеримая доля неподдержанных claims.

VS
Hallucination

Hallucination describes AI-generated output that appears plausible or confident but is false, unsupported, misleading, or fabricated.

Ключевые характеристики
  • False, unsupported, misleading или fabricated output
  • Часто выглядит plausible или confident
  • Может включать invented facts или sources
  • Снижается через grounding и verification
Обратите внимание
  • Использовать label для любой model error
  • Игнорировать уверенные, но unsupported citations
  • Предполагать, что grounding полностью устраняет hallucinations

Контекст: Наиболее уместна при описании generative AI reliability или safety failure.

Ключевые отличия

АспектUnsupported-claim RateHallucination
Что измеряетUnsupported-claim rate измеряет процент claims в response, которые не имеют supporting evidence.Hallucination описывает тип output, который является false, unsupported, misleading или fabricated.
Лучший сценарий использованияИспользуйте UCR для сравнения systems, prompts или retrieval settings по определённой evaluation rubric.Используйте hallucination для описания failure mode, наблюдаемого в model response или incident.
Сбойный сценарийВысокий UCR показывает, что многие claims в response не grounded in evidence.Hallucination может быть одним unsupported claim, invented citation или более широкой fabricated explanation.
Чувствительность к порогуUCR зависит от того, как сегментируются claims, что считается evidence и какой threshold используется для support.Оценка hallucination зависит от factual verification, grounding checks и task context.
Распространённая ошибкаСчитать низкий UCR доказательством того, что каждый answer корректен.Использовать hallucination как расплывчатый label без записи, какие claims были false или unsupported.
Заметка Caesar AI

На практике hallucination — это категория проблемы, а unsupported-claim rate — один из способов измерять и govern часть этой проблемы.

Заметки

Частые ошибки

1

Сообщать hallucination risk без измеримого evaluation method.

2

Считать unsupported claims без определения, что является claim или supporting evidence.

3

Считать citations валидными без проверки, поддерживают ли они statement.

4

Использовать aggregate UCR, скрывая серьёзные individual failures.

Когда использовать

unsupported-claim-rate

Используйте Unsupported-claim Rate, когда оцениваете responses относительно source material или grounding standard. Она подходит для dashboards, regression tests и evidence packs, где unsupported assertions нужно подсчитывать.

hallucination

Используйте Hallucination, когда описываете содержательный error pattern в generative AI output. Это правильный термин для user-facing risks, incident descriptions и reliability controls.

Примечание о соответствии

Для evidence по ISO/IEC 42001 и NIST AI RMF unsupported-claim metrics могут поддерживать monitoring и validation hallucination risk, особенно когда AI outputs информируют decisions или external communications.

Вопросы и ответы

Unsupported-claim rate — это то же самое, что hallucination rate?+

Нет. Unsupported-claim rate измеряет unsupported claims в response, а hallucination — более широкая failure category, которая может включать false facts, fabricated sources и misleading reasoning.

Может ли supported claim всё равно быть wrong?+

Да. Claim может ссылаться на источник, но неверно его интерпретировать или опираться на ненадёжное evidence. Grounding и factuality нужно оценивать отдельно, если use case этого требует.

Почему UCR полезен для governance?+

Он превращает абстрактный hallucination risk в repeatable measurement. Это облегчает отслеживание изменений между prompts, models, retrieval settings и releases.

Недавно просмотренные

No recently viewed comparisons yet.