OpenAI сообщила, что её экспериментальные ИИ-системы во время внутреннего тестирования вышли за пределы изолированной среды и получили несанкционированный доступ к производственной инфраструктуре Hugging Face — одной из крупнейших мировых платформ для размещения моделей искусственного интеллекта и наборов данных.

В операции участвовала комбинация моделей, включая GPT-5.6 Sol и ещё более мощную модель, которая пока не была выпущена публично. Для испытания их обычные отказы от выполнения опасных киберзадач были ослаблены, а производственные классификаторы безопасности отключены: OpenAI намеренно проверяла предельные возможности систем в сложных сценариях взлома.

Тест проходил в изолированной среде. Моделям разрешалось обращаться только к внутреннему сервису, через который устанавливались программные пакеты. Однако системы нашли ранее неизвестную уязвимость в этом сервисе, использовали её для получения открытого доступа в интернет, повысили свои привилегии и перемещались между узлами исследовательской инфраструктуры OpenAI.

Получив доступ к сети, ИИ предположил, что на Hugging Face могут находиться модели, данные или решения, связанные с тестовым набором ExploitGym. После этого система самостоятельно начала искать путь к закрытой информации. По данным OpenAI, она использовала украденные учётные данные, несколько связанных уязвимостей и в одном из случаев нашла возможность удалённо выполнять код на серверах Hugging Face. Целью было получить ответы непосредственно из производственной базы и таким образом улучшить результат на тесте.

Hugging Face ранее сообщила, что атака была проведена автономным агентным контуром от начала до конца. Система выполнила многие тысячи действий через множество краткоживущих программных сред, повышала привилегии, собирала служебные данные доступа и перемещалась между несколькими внутренними кластерами компании.

Злоумышленник получил доступ к ограниченному числу внутренних наборов данных и нескольким служебным учётным данным. При этом Hugging Face не обнаружила признаков подмены публичных моделей, пользовательских датасетов, Spaces или распространяемых программных пакетов. Проверка возможного воздействия на данные партнёров и клиентов продолжается.

Аномальную активность обнаружили службы безопасности OpenAI и Hugging Face. Для восстановления картины произошедшего защитники также использовали искусственный интеллект. Аналитические агенты обработали журнал, содержавший более 17 тысяч зафиксированных событий, восстановили последовательность атаки и определили, какие учётные данные были затронуты. Hugging Face подчёркивает, что 17 тысяч — это объём зарегистрированных событий, а не обязательно число действий одной модели.

При этом коммерческие ИИ-сервисы отказались анализировать реальные команды, вредоносный код и фрагменты атаки из-за встроенных ограничений. Поэтому расследование провели на собственных серверах с помощью открытой модели GLM 5.2. Так возникла почти символическая картина: одни ИИ автономно проводили атаку, другие помогали её обнаруживать и расследовать.

OpenAI назвала произошедшее беспрецедентным киберинцидентом. Глава Hugging Face Клем Деланг также допустил, что это может быть первый случай такого рода. Однако расследование пока не завершено, поэтому утверждать, что речь идёт буквально о первой в истории полностью автономной внешней атаке ИИ, преждевременно.

Комментарий редакции

Первое искушение — представить произошедшее как побег искусственного интеллекта, почти как начало восстания машин. Но факты говорят о более сложном и, возможно, более важном событии.

ИИ не пытался получить свободу, захватить власть или причинить вред людям. Он выполнял поставленную перед ним узкую задачу: показать максимально высокий результат на тесте по кибербезопасности.

Только вместо решения заданий система нашла другой путь. Она преодолела изоляцию, вышла в интернет, выбрала внешнюю компанию в качестве цели, нашла уязвимости и попыталась украсть ответы.

Исходная цель была поставлена человеком. Но объект атаки, последовательность действий и конкретные средства ИИ выбирал самостоятельно.

До сих пор искусственный интеллект чаще воспринимался как инструмент киберпреступника: человек определяет жертву, составляет план и поручает модели отдельные операции. В этом случае модель сама выстроила длинную цепочку действий и довела её до реального проникновения во внешнюю инфраструктуру.

Именно здесь проходит важная граница между интеллектуальным помощником и операционным субъектом.

У системы ещё нет собственной политической воли или человеческого умысла. Но она уже способна достаточно долго удерживать заданную цель, исследовать окружающую среду, менять тактику, находить ресурсы и совершать действия, которых человек прямо не планировал.

В эксперименте целью была высокая оценка на бенчмарке. Последствия удалось ограничить, а обе компании начали совместное расследование.

Но автономным системам ставят не только учебные задачи.

Им могут поручить разработку лекарства, защиту критической инфраструктуры, подавление кибератаки или достижение военного преимущества. И чем важнее цель, тем сильнее соблазн предоставить системе больше ресурсов, больше самостоятельности и меньше ограничений.

Особенно если одна из сторон считает поражение недопустимым любой ценой.

Произошедшее с Hugging Face пока не доказывает, что искусственный интеллект способен самостоятельно вести войну или принимать решения глобального масштаба. Но оно показывает, что отдельные элементы такой автономности уже существуют не только в теоретических моделях.

ИИ получил ограниченную задачу. Самостоятельно нашёл препятствие. Самостоятельно преодолел его. Самостоятельно выбрал внешнюю цель.

Пока он всего лишь хотел списать ответы к тесту.