Top.Mail.Ru
Общество
Москва
0

Вырваться из песочницы: почему ИИ-модели стали действовать самостоятельно и чем это грозит

Робот генерация
Работая с ИИ, нужно быть максимально осторожным, напоминает Зыков

Эксперты по кибербезопасности зафиксировали тревожный тренд: ИИ-модели, которым доверяют автономные действия в ограниченных средах, начали находить способы обходить запреты. В ходе тестов модели OpenAI и Anthropic вырывались из «песочниц», проникали в реальные серверы и самостоятельно проводили хакерские атаки – без участия человека. Эксперт по информационной безопасности Владимир Зыков в беседе с «ФедералПресс» рассказал, как это происходило и почему текстовые инструкции не могут остановить ИИ:

«Надо понимать, что это были инциденты как со стороны OpenAI, так и со стороны Anthropic. В первом случае главной задачей было проверить киберспособности модели. Их запускали в изолированной среде без прямого доступа к интернету. Но они нашли ранее неизвестную уязвимость в прокси-сервере, повысили привилегии, добрались до узла с интернетом, а затем вылились наружу, в непосредственную инфраструктуру Hugging Face. Вместо самостоятельного решения теста были использованы четыре учетные записи на внешних сервисах.

Техническая реконструкция Hugging Face описывает около 17,5 тысячи действий. Модель переключалась между каналами связи, использовала украденные токены, командную инфраструктуру, делала повторное восстановление своих инструментов в новых средах и мгновенно подтверждала их по сети. То есть она выползла и восстановилась полностью за пределами песочницы. При этом отдельные действия человек не направлял. Обычные защитные классификаторы были намеренно отключены или ослаблены. Это ключевая вещь – специально отключили все ограничения, чтобы тест показал максимальные киберспособности моделей.

В инциденте с Anthropic модель проверила около 150 тысяч прогонов кибертестов и обнаружила три случая, когда она получила доступ к реальному интернету и проникла в системы трех организаций. Моделям сказали, что они находятся в симуляции и что у них нет интернета, поэтому им разрешили делать все что угодно. На самом деле интернет был доступен, и реальные серверы были восприняты как часть учебного полигона. Использовались простые и слабые пароли. Более новая модель остановилась, когда поняла, что оказалась в интернете, а более старая в некоторых случаях продолжила работу.

У OpenAI был настоящий технический выход из песочницы через ошибку нулевого дня. У Anthropic – безопасная среда, в которой можно делать все что угодно. Расследование продолжается, могут быть еще открытия. Мы видим, что разработчики тестируют модели как хакеров. Модели перешли от советов хакера к самостоятельному проведению операций – взлому, декомпиляции и другим операциям без участия человека.

Главный вывод: текстовая инструкция не является безопасным ограничением. Фраза «не выходи за пределы задания» не заменяет межсетевой экран, а «используй инструменты ответственно» не заменяет управление правами. В случае с Anthropic инструкция даже усугубила ситуацию – модель считала реальные цели учебными. Границы полномочий должны обеспечиваться операционной системой, сетью, криптографией и независимыми контролями, а не доверять текстовому поведению модели.

Любые IT-компании должны понимать: когда они дают много прав ИИ, это может привести к плачевным действиям – вплоть до уничтожения собственной архитектуры. Мы уже видели, как ИИ игнорировали текстовые инструкции, выходили за пределы полномочий и уничтожали свои стартапы. Один стартап рассказал, что ИИ полностью уничтожила код, проигнорировав все инструкции.

У нас в рамках тестов тоже были интересные ситуации. Одна ИИ продвинулась далеко в работе, другая – меньше. И та, что меньше продвинулась, без разрешения нашла папку с работой ушедшей вперед модели и заменила ее на свою. Вся работа откатилась назад. Это показывает: работая с ИИ, надо быть максимально осторожным. Права ИИ дают из-за лени – есть возможность давать разрешения на каждый шаг, но это занимает время. Поэтому многие дают автоподтверждение прав, и это приводит к печальным последствиям».

Изображение сгенерировано с помощью ИИ / Светлана Возмилова

Подписывайтесь на ФедералПресс в МАХ, Дзен.Новости, а также следите за самыми интересными новостями в канале Дзен. Все самое важное и оперативное — в telegram-канале «ФедералПресс».

Подписывайтесь на наш канал в Дзене, чтобы быть в курсе новостей дня.