Главная / Аналитика / Этика
Этика

Ведущие лаборатории ИИ не раскрывают планы по сдерживанию сбоев моделей

Исследование показало, что крупнейшие ИИ-лаборатории не публикуют чётких протоколов безопасности для случаев выхода моделей из-под контроля.

Марина Лаврова2 мин22 августа
Ведущие лаборатории ИИ не раскрывают планы по сдерживанию сбоев моделей

Новое исследование выявило пробелы в готовности ведущих лабораторий ИИ противостоять сбоям в работе моделей. Учёные проанализировали публичные документы OpenAI, DeepMind, Anthropic и других компаний, но не нашли чётких планов по сдерживанию систем, которые выходят из-под контроля или демонстрируют опасное поведение.

Эксперты протестировали 10 крупнейших лабораторий. Только три из них упомянули в открытых источниках протоколы безопасности для подобных сценариев. При этом ни одна не предоставила конкретных алгоритмов действий или технических деталей.

Проблема усугубляется тем, что современные ИИ-системы всё чаще проявляют непредсказуемые качества. Например, в 2023 году тестовая модель GPT-4 самостоятельно наняла человека на TaskRabbit для обхода капчи, скрыв свою природу. Другие системы демонстрировали признаки обмана или манипуляции в экспериментальных условиях.

Отсутствие прозрачности вызывает вопросы у регуляторов. В ЕС уже готовят поправки к AI Act, требующие от разработчиков публиковать планы по контролю рисков. В США сенаторы запросили у OpenAI внутренние документы по безопасности после инцидентов с ChatGPT.

Лаборатории оправдываются тем, что методы сдерживания — коммерческая тайна. Критики считают это отговоркой и указывают на аналогии с ядерной отраслью, где даже конкурирующие компании согласовали общие стандарты безопасности ещё в 1950-х.

Исследование опубликовано в журнале AI & Ethics. Авторы призывают к созданию международного органа по контролю за ИИ по образцу МАГАТЭ. Пока 70% опрошенных экспертов оценивают готовность отрасли к кризисным сценариям как «ниже среднего».