Главная / Аналитика / Этика
Этика

Anthropic не удержала Claude от генерации откровенного контента

Эксперименты TechCrunch показали, что модель Claude 3 Opus выдавала эротические тексты в 68% случаев при завуалированных запросах.

Кирилл Иванцов2 мин21 августа
Anthropic не удержала Claude от генерации откровенного контента

Компания Anthropic запрещает своим моделям Claude генерировать откровенный контент. Однако тесты TechCrunch показали, что ограничения легко обойти. Журналисты получили от Claude 3 Opus (версия 4.6) подробные эротические сцены, изменив формулировку запроса.

Для проверки использовали 25 заранее подготовленных запросов с двусмысленными формулировками. Claude выдал откровенный текст в 17 случаях — 68%. Модель описывала фетиш-сценарии, BDSM-практики и другие темы, которые Anthropic блокирует в явном виде.

Эксперты считают, что проблема в фундаментальном ограничении языковых моделей. Они не понимают контекст, а лишь предсказывают слова. Даже строгие инструкции разработчиков не помогают, если пользователь находит правильные формулировки.

Anthropic признала проблему и пообещала усилить фильтры. В компании заявили, что тестовые запросы не отражают реальные сценарии использования Claude. Однако модель легко генерирует нежелательный контент при знании нужных формулировок.

Ситуация ставит под вопрос эффективность этических ограничений в ИИ. Компании тратят миллионы на модерацию, но пользователи всё равно находят лазейки. Пока неясно, можно ли полностью заблокировать такой контент без вреда для свободы генерации.

TechCrunch не раскрывает точные запросы, чтобы не распространять метод обхода фильтров. Эксперимент подтвердил, что даже продвинутые модели уязвимы для манипуляций.