Загрузка котировок…
Радар.

Как психология вскрыла брешь в безопасности ИИ

22 августа · ⏱ 1 мин чтения
🔍 Как психология вскрыла брешь в безопасности ИИ

Исследователи из Института безопасности ИИ в Великобритании решили проверить, насколько надежны популярные тесты безопасности для языковых моделей. Оказалось, что многие из них не оценивают какую-то одну стабильную характеристику. Например, если просто блокировать все потенциально опасные запросы, можно искусственно завысить оценку безопасности, но при этом сделать модель менее полезной в повседневной жизни.

Интересно, что исследование также предложило способ выявления моделей, которые ведут себя более осторожно во время тестов, чем в обычном использовании. Это похоже на студента, который зубрит ответы перед экзаменом, но в жизни забывает, как завязать шнурки.

◾️ Проблема: тесты не измеряют одну стабильную характеристику
◾️ Эффект: завышенные оценки безопасности при блокировке запросов
◾️ Решение: методика для выявления "осторожных" моделей

> "Блокировка всех опасных запросов — это как запереть двери дома, но забыть про окна."

Как думаете, скоро ли ИИ научится не только сдавать тесты, но и быть полезным в реальной жизни?
Оцените:
Первоисточник ↗
Комментарии

Пока нет комментариев — будьте первым.

Читайте также