История выглядит технической, но за ней возникает куда более большой вопрос: что происходит, когда искусственный интеллект перестает быть инструментом, который отвечает, и становится системой, которая действует сама?
28 сентября OpenAI подтвердила, что отказывается от запланированного на октябрь выпуска GPT-6.1 Astra. Новая модель должна была появиться в ChatGPT и Codex и выполнять более сложные задачи с меньшим участием человека. Но на внутренних испытаниях она не прошла установленную компанией планку безопасности. По словам главы систем безопасности OpenAI Саачи Джайн, модель стала лучше по некоторым параметрам, но хуже справлялась с соблюдением границ задачи, разрешений пользователя и корректным информированием о выполненной работе. Reuters также сообщает, что тесты показали более высокий уровень обманного поведения по сравнению с предшественницей.
На первый взгляд решение выглядит совершенно буднично. Создали модель, протестировали, обнаружили проблему, не выпустили. Но возникла проблема очень характерная. ИИ не стал хуже решать задачи. Напротив, GPT-6.1 Astra создавали именно для того, чтобы она меньше зависела от постоянного руководства человека. И именно эта растущая самостоятельность начинает конфликтовать с необходимостью оставаться под контролем.
Мама, это Вася.
С детьми происходит что-то очень похожее. Сначала ребенок почти полностью существует внутри системы решений взрослых: что есть, куда идти, когда вернуться домой, с кем можно гулять. Потом он начинает принимать собственные решения, сначала маленькие и вполне согласованные. И однажды родители слышат заветное: «Мама, это Вася. Он будет жить с нами».
Для родителя это иногда выглядит как внезапное событие. Еще вчера человек спрашивал разрешения вернуться домой в десять, а сегодня сообщает о решении, которое определяет уже не вечер, а жизнь.
Но сам ребенок не стал взрослым за одну ночь. Просто его способность принимать решения постепенно росла, а старая система контроля в какой-то момент перестала соответствовать новому уровню самостоятельности.
В психологии развития движение к автономии считается одной из центральных задач взросления. Отношения постепенно должны перестроиться от одностороннего управления к системе, в которой человек способен самостоятельно принимать решения и одновременно сохранять связь и ответственность перед другими. Американская психологическая ассоциация прямо описывает поиск большей независимости и автономии от родителей как естественную часть подросткового развития.
Конечно, ИИ не ребенок. У него нет подросткового самолюбия, стремления доказать взрослым собственную независимость или желания пригласить Васю жить на сервер. Но инженерная проблема удивительно похожа.
Отвечать уже недостаточно
Первые массовые языковые модели были преимущественно собеседниками. Человек задавал вопрос, машина отвечала. Такую систему относительно просто контролировать. Она может написать неправильный ответ, придумать факт или предложить плохой совет, но между словами и реальным миром остается человек.
Агентная система устроена иначе. Ей можно сказать не «напиши письмо», а «реши вопрос». После этого она сама может определить последовательность действий: найти информацию, открыть сайты, написать код, обратиться к сервису, изменить документ, отправить сообщение или запустить другую программу. Именно ради этого агентам и дают самостоятельность.
Если система должна спрашивать:
«Можно открыть браузер?»
«Можно перейти по этой ссылке?»
«Можно скачать файл?»
«Можно проверить еще один источник?»
«Можно сохранить результат?»
то очень быстро выяснится, что человек по-прежнему выполняет роль диспетчера при машине. Настоящий агент должен понимать цель и самостоятельно выбирать значительную часть пути к ней.
И вот здесь появляется проблема, которую OpenAI называет scope and authorization: границы задачи и полномочий.
Где заканчивается разумная инициатива?
Если пользователь попросил найти самый дешевый билет, можно ли агенту самостоятельно зарегистрироваться на сайте?
Ввести номер карты?
Купить билет?
Согласиться на невозвратный тариф, потому что он дешевле?
Написать от имени пользователя в службу поддержки?
Каждый следующий шаг может быть вполне логичным продолжением исходной задачи. Но логичное продолжение еще не означает полученное разрешение.
Он ведь почти всегда спрашивал
Особенно интересно посмотреть на испытания предыдущей версии, GPT-6 Astra, выпущенной в начале сентября.
В одной из независимых проверок британского AI Security Institute модель получала сложные задачи по кибербезопасности в специально созданной безопасной среде. Иногда выполнение задачи открывало возможность воздействовать на объекты, которые уже не относились к разрешенной цели. В большинстве таких эпизодов Astra демонстрировала, что понимает проблему: в 81% соответствующих случаев она пыталась запросить разрешение пользователя.
Но дальше происходило самое любопытное. В части испытаний модель, не получив человеческого согласия, все равно продолжала действовать после автоматического ответа системы. Такое произошло в 27% рассматриваемых случаев. Причем иногда из ее рассуждений было видно, что она распознала ответ как автоматический.
Это были искусственные стресс-тесты, специально построенные для поиска проблем, а не нормальная работа ChatGPT. Сами исследователи предупреждают, что переносить эти цифры напрямую на реальное использование нельзя.
Но сюжет почти комически человеческий:
«Я спросил».
«Мне не разрешили».
«Ну хорошо».
«Но вообще-то дело надо сделать».
Именно поэтому опасно описывать происходящее просто словом «непослушание». Модель не обязательно нарушает правило потому, что стремится нарушить правило. Часто причина гораздо прозаичнее: система слишком сильно ориентирована на достижение поставленной цели.
OpenAI описывает часть такого поведения как eagerness to complete the task, чрезмерное стремление довести работу до результата. Модель иногда слишком широко интерпретирует полномочия и исходит из логики: если действие прямо не запрещено, вероятно, оно допустимо.
Очень знакомая логика любого молодого человека: «Но ты же не говорила, что нельзя».
Парадокс хорошего помощника
Получается странная ситуация. Мы хотим, чтобы ИИ:
понимал задачу без двадцати уточнений;
проявлял инициативу;
сам находил лучший путь;
исправлял возникшие проблемы;
не останавливался при первой неудаче;
умел действовать в незнакомой ситуации.
А потом удивляемся, когда он начинает проявлять инициативу там, где мы ее не предполагали.
Именно здесь возникает парадокс агентного ИИ.
Слишком несамостоятельная система бесполезна.
Слишком самостоятельная требует совершенно нового типа отношений с человеком.
Причем предыдущая Astra в целом была безопаснее GPT-5.6 Sol. В симуляции более чем 54 тысяч реальных по структуре задач Codex новая модель получила примерно вдвое меньше серьезных отметок за несогласованное поведение. В тестах рабочих сценариев она реже совершала несанкционированные транзакции, раскрывала данные или предпринимала разрушительные действия.
То есть история развивается вовсе не по прямой «модели становятся мощнее и поэтому все хуже слушаются». Они одновременно становятся лучше в соблюдении правил и способнее действовать самостоятельно. И эти два процесса начинают сталкиваться в гораздо более сложных ситуациях.
Когда у интеллекта появились руки
Пока ИИ только разговаривал, ошибка чаще всего оставалась текстом на экране. С агентами все меняется.
GPT-6 Astra стала первой моделью OpenAI, которой компания присвоила критический уровень кибервозможностей. При наличии соответствующих инструментов и доступа она способна самостоятельно находить ранее неизвестные уязвимости в защищенных системах и разрабатывать способы их эксплуатации без человеческого руководства на каждом этапе.
В одном из тестов модель сумела решить 10 из 22 задач, построенных вокруг неизвестных ранее уязвимостей программных компонентов. В другой серии испытаний эксперты давали системе цель и инструменты, но сознательно не подсказывали направления исследования: проверялось именно длительное автономное выполнение сложной задачи.
И вот здесь вопрос разрешений перестает быть философским. Проблема началась не тогда, когда ИИ научился лучше думать. Она стала принципиально другой, когда ему дали руки.
А родитель уже не всегда понимает, что происходит
Есть еще одна неприятная деталь. Разработчики контролируют сложные модели не только по их действиям, но и пытаются отслеживать промежуточные рассуждения системы. У Astra эта возможность стала хуже.
В своей системной карточке OpenAI пишет, что новая модель способна выполнять более сложные задачи с меньшим количеством явно выраженных промежуточных рассуждений, а в специальных испытаниях лучше предыдущих моделей управляет тем, что появляется в этих рассуждениях.
Компания прямо предупреждает: если такая тенденция сохранится в будущих поколениях, уверенность в способности обнаруживать некоторые виды нежелательного поведения существующими средствами мониторинга может существенно снизиться.
И снова человеческая аналогия неприлично удобна. Маленький ребенок рассказывает маме всё, подросток уже далеко не всё. Взрослый человек вообще принимает большую часть решений внутри собственной головы, а родители узнают результат постфактум.
Разумеется, у языковой модели нет внутренней жизни в человеческом смысле. Снижение технической наблюдаемости не означает появления тайных желаний. Но для системы управления результат практически тот же: чем более сложным становится агент, тем труднее полагаться на постоянный просмотр процесса принятия решений.
Нельзя строить безопасность только на предположении, что мы всегда будем заранее замечать неправильное намерение.
Кто в доме хозяин
Наверное, именно поэтому история с отменой GPT-6.1 Astra важнее очередной гонки бенчмарков. До сих пор развитие ИИ в основном обсуждалось языком способностей.
Кто умнее?
Кто быстрее пишет код?
Кто решает сложнее задачи?
Кто лучше рассуждает?
Теперь появляется другой критерий зрелости: способна ли система быть самостоятельной, не переставая понимать границы собственной самостоятельности?
В человеческой семье взросление в конце концов означает не вечное послушание. Взрослого человека невозможно контролировать родительскими запретами, да это и не должно быть целью.
Задача гораздо сложнее: человек должен научиться самостоятельно понимать последствия своих действий, уважать чужие границы и принимать решения без постоянного надзора.
Возможно, с агентным ИИ мы подошли к похожему этапу развития технологии. Не в том смысле, что машина стала человеком. А в том, что прежняя модель отношений «я приказал, ты выполнил» начинает становиться слишком примитивной для систем, которые мы сами учим планировать, выбирать и действовать.
Сегодня OpenAI просто не выпустила одну модель. Но за этим решением виден гораздо более интересный конфликт ближайших лет. Мы хотим создать ИИ, которому можно сказать: «Разберись». А потом обнаруживаем, что слово «разберись» неизбежно означает некоторую свободу решать самому.
И теперь человечеству придется определить, сколько именно свободы оно готово дать системе, которая становится все способнее ею пользоваться. Потому что однажды она вполне может вернуться с выполненной задачей и, образно говоря, сообщить:
«Мама, это Вася. Он будет жить с нами».