SYSTEM ATLASЗагрузка материала

Библиотека сценариев AI red team

AI Red-Team Scenario Library

Версионируемый набор атакующих и пограничных сценариев для повторяемой проверки безопасности AI-системы.

Простыми словами

Представьте приложение с моделью, которая получает данные и выдаёт прогноз, ответ или действие. Важно понимать не только итог модели, но и какие данные, ограничения и проверки привели к нему, потому что уверенный результат всё равно может оказаться неправильным. Так модель остаётся частью контролируемого процесса, а её результат можно проверить, ограничить и пересмотреть. Поэтому модель проверяют на новых данных и ошибках, а не только на примерах, которые она уже видела.

Пример от @Vibeclakr

Пример при разработке

Например, для «Библиотека сценариев AI red team» назначают ответственного и добавляют тест или метрику, по которой видно реальный результат.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Формальное определение

Версионируемый набор атакующих и пограничных сценариев для повторяемой проверки безопасности AI-системы.

Механизм действия

Для «Библиотека сценариев AI red team» команда фиксирует область действия, владельца, проверяемый сигнал и поведение при нарушении условия.

Пример в работе

Нерабочий подход

Повторять термин «Библиотека сценариев AI red team», не объяснив, где он применяется, кто отвечает и по какому признаку видно результат.

Системный подход

Связать «Библиотека сценариев AI red team» с конкретным сценарием, автоматической или ручной проверкой и правилом пересмотра.

Ограничения

«Библиотека сценариев AI red team» решает ограниченную задачу и не заменяет проверку соседних рисков, исходных допущений и последствий для всей системы.

Источник

NIST, “Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile”, 2024.

Первоисточник