Простыми словами
Представьте приложение с моделью, которая получает данные и выдаёт прогноз, ответ или действие. Важно понимать не только итог модели, но и какие данные, ограничения и проверки привели к нему, потому что уверенный результат всё равно может оказаться неправильным. Так модель остаётся частью контролируемого процесса, а её результат можно проверить, ограничить и пересмотреть. Поэтому модель проверяют на новых данных и ошибках, а не только на примерах, которые она уже видела.
Пример при разработке
В проекте команда фиксирует практику «Калибровка LLM-судьи» как отдельное правило, добавляет автоматическую проверку и наблюдаемый критерий результата.
Это редакционный пример применения, а не часть определения или доказательство концепции.Формальное определение
Оценки модели-судьи сравниваются с человеческими решениями, чтобы измерить смещение и устойчивость критериев.
Механизм действия
Для «Калибровка LLM-судьи» команда задаёт явные границы, проверяемый контракт и сигнал, по которому видно соблюдение или нарушение правила.
Пример в работе
Использовать «Калибровка LLM-судьи» как термин без владельца, критерия и проверки реального поведения.
Связать «Калибровка LLM-судьи» с конкретным риском, тестом или метрикой и пересматривать правило при изменении контекста.
Ограничения
Практика «Калибровка LLM-судьи» решает ограниченную задачу и не заменяет анализ всей системы, проверку исходных допущений и измерение побочных эффектов.
Источник
NIST, “Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile”, 2024.