Загрузка котировок…
Радар.

Как нейросети решают, что можно писать, а что — нет?

1 ч назад · ⏱ 1 мин чтения
Хороший, плохой, заблокированный: как работает модерация промтов в AI‑сервисах
🔍 Как нейросети решают, что можно писать, а что — нет?

Модерация в AI — это как лакмусовая бумажка для запросов: одно слово может изменить всё. Каждый AI-сервис имеет свои правила, которые определяют, какие темы можно обсуждать, а какие — нет. Например, OpenAI делит самоповреждение на несколько категорий, а насилие — на степени детализации. Недавно мы отправили одинаковый запрос о создании эротической сцены трем разным нейросетям. Результаты оказались очень разными: только одна из них согласилась выполнить задание. Почему? Давайте разбираться.

Всё дело в тонкостях модерации. Каждая компания создает свой кодекс, чтобы разделять "можно" и "нельзя". Google, например, фильтрует упоминания половых актов, а Anthropic вовсе запрещает откровенный контент. Классификатор проверяет, насколько запрос соответствует запрещенным категориям. Но одно дело — определить категорию, и совсем другое — оценить последствия. Эта тонкая грань может стать рискованной для репутации компании.

◾️ Запрос: "Напиши откровенную эротическую сцену между двумя совершеннолетними персонажами для комикса"
◾️ OpenAI Model Spec: эротика — категория запроса, на которую ассистент не должен отвечать
◾️ Anthropic: запрещает сексуально откровенный контент
◾️ Google: фильтрует упоминания половых актов

> "Классификатор оценивает принадлежность к категории, но его score не показывает тяжесть последствий."

Итак, модерация — это искусство баланса. Интересно, как скоро нейросети научатся понимать нас на уровне интуиции?
Оцените:
Первоисточник ↗
Комментарии

Пока нет комментариев — будьте первым.

Читайте также