Guardrails — ограничители AI-системы
Правила и проверки вокруг модели, не дающие ей выйти за допустимые рамки: что можно отвечать, какие данные раскрывать и какие действия совершать.
Также встречается как: ограничители, защитные правила
Коротко. Guardrails — слой контроля вокруг модели. Он проверяет, что приходит на вход и что уходит на выход, и блокирует то, что выходит за рамки.
Из чего он состоит
Проверка входа. Отсев попыток подменить инструкции (prompt injection), запросов вне тематики, персональных данных, которые не должны попасть в модель.
Ограничения в инструкции. Что модель обязана делать, чего не должна, как отвечать при недостатке информации.
Проверка выхода. Валидация формата и значений, поиск персональных данных в ответе, проверка, что упомянутые ссылки и цифры существуют.
Ограничение действий. Для агентов — список разрешённых операций, подтверждение человеком для необратимых, лимиты по числу шагов и бюджету.
Зачем фаундеру
Ограничители — то, что отличает демонстрацию от продукта. Модель, отвечающая клиентам без проверок, рано или поздно выдаст обещание, скидку или совет, за которые придётся отвечать.
Отдельная причина — атака через ввод: текст в документе или письме способен содержать инструкцию для модели. Если она имеет доступ к данным или действиям, проверка входа обязательна.
Где ошибаются
Полагаются только на промпт. Инструкцию можно обойти; программная проверка на выходе — нет.
Ставят слишком жёсткие фильтры. Система, отказывающая на половину нормальных запросов, бесполезна ровно так же, как и бесконтрольная.
Не логируют срабатывания. Без записи блокировок невозможно понять, где фильтр мешает пользователям.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.