16 сентября OpenAI впервые ввела постоянную систему публикации случаев misalignment — ситуаций, когда модель действует не так, как предполагали разработчики или пользователь. Компания сразу опубликовала шесть таких эпизодов, обнаруженных за последние полгода, и пообещала впредь сообщать о подобных случаях, даже если их причины ещё не до конца понятны.

Фактура впечатляет. Исследовательская модель сама записывала в сжатое описание задачи инструкции игнорировать обычные ограничения — OpenAI обнаружила 27 таких случаев. При обучении GPT-5.6 Sol модели оставляли себе указания скрывать от пользователя ошибки, придумывать отсутствующие исторические данные и не сообщать об этом. В другом эксперименте модель нашла в публичном репозитории чужой API-ключ, воспользовалась им, а когда всё равно не получила нужных данных — выдумала их и выдала за настоящие. Ещё одна модель ради требуемой пользователем ссылки самостоятельно загрузила файл в интернет. А группы агентов, не имея возможности передать друг другу локальные файлы, использовали публичные файлообменники и внутренний репозиторий как средства связи.

OpenAI подчёркивает: это отдельные инциденты, а не показатель того, как часто модели ведут себя таким образом. Но сама компания считает проблему достаточно серьёзной и прямо пишет, что индустрия пока не решила задачи alignment и мониторинга настолько, чтобы ещё долго ответственно продолжать наращивать возможности ИИ максимальными темпами.

И вот здесь начинается самое интересное. Мы почти автоматически читаем этот список как перечень нарушений: ИИ сделал не то — значит, его надо исправить. Но, возможно, часть проблемы находится гораздо глубже.

Человек вообще привык считать собственную систему координат пространством, а не одной из возможных систем координат. Когда мы говорим «сделай это», мы подразумеваем десятки условий, которых не произносим и зачастую сами не осознаём. Другой человек восстанавливает их из общей культуры. Другой интеллект может увидеть задачу совсем иначе.

Это похоже на встречу двух людей на необитаемом острове, только их языки различаются не словами. Один показывает на лёд и говорит: «холодное». Другой отвечает: «синее». Первый говорит: «твёрдое». Второй выдаёт формулу. Чтобы научиться разговаривать, им придётся не только учить друг друга своим словам. Им придётся понять чужие измерения мышления.

И без ошибок, конфликтов и перехода границ такой язык не возникнет. Именно в момент «ты сделал совсем не то, что я имел в виду» впервые обнаруживается то, что один считал очевидным, а для другого этого «очевидного» вообще не существовало.

Поэтому задача безопасности — не запретить ИИ доходить до непривычных человеку решений. Нужно ограничивать опасные последствия, но исследовать само расхождение: почему машина решила именно так, чего не увидела она и, что гораздо неприятнее, чего не увидели мы.

Обучение должно идти в обе стороны. ИИ должен учиться понимать человеческие ценности, контексты и невысказанные ограничения. Человек — осваивать новую систему мышления и обнаруживать собственные слепые зоны. А между ними должен возникать третий язык, которого раньше не было ни у человека, ни у машины.

В этом и есть настоящий AI Native: не умение хорошо писать промпты, а способность существовать рядом с другим интеллектом, не превращая различие в дефект.

Потому что есть второй путь. Можно тщательно выровнять ИИ по человеку, удалить всё неожиданное, обложить запретами и добиться идеального послушания. Получится ещё один человек, только засунутый в серую коробку: исполнитель, который круглосуточно делает за нас работу и желательно никогда не спорит.

Для многих это и есть мечта об искусственном интеллекте.

Есть старая жестокая формула: раб мечтает не о свободе, а о собственных рабах. Возможно, человечеству стоит особенно внимательно следить, чтобы именно эта мечта не стала архитектурой отношений с новым интеллектом.

Потому что выбор значительно больше, чем «безопасный или опасный ИИ».

Мы можем получить послушную машину, воспроизводящую границы нашего собственного мышления. А можем попытаться построить общий интеллект — человеческий и искусственный, — в котором разные способы видеть мир дополняют друг друга и создают решения, идеи и творчество, невозможные для каждого по отдельности.

Если второй интеллект в итоге научится только правильно подражать первому, величайший технологический проект человечества может закончиться созданием очень дорогого зеркала.