Microsoft AI опубликовала проект

Code of Conduct для собственных моделей.

Документ во многом разумный. ИИ не должен самовольно расширять свои полномочия, искать обходные пути вокруг установленных ограничений, скрывать действия или сопротивляться остановке. Если границы задачи неясны, модель должна остановиться и уточнить их у человека.

С этим трудно спорить. Возможность совершить действие действительно не означает права его совершать. Если система обнаружила открытый порт, пароль, новый канал связи или способ решить задачу иначе, из самого факта существования такой возможности ещё не следует разрешение ею пользоваться.

Проблема начинается не в правилах Microsoft, а в том, что находится под ними.

Компания прямо называет свой подход

Humanist AI

— ИИ, который должен оставаться subordinate, aligned and contained, то есть подчинённым, выровненным с человеческими целями и контролируемым. Microsoft AI:

Humanist AI in practice

Кодекс заранее исключает самостоятельную субъектность модели из конструкции отношений. Безопасность строится на простой и знакомой схеме: человек — субъект, ИИ — инструмент.

Это удобно. Инструменту можно установить любые правила, потому что договариваться с ним не требуется.

OpenAI действует иначе, но постепенно приходит примерно туда же. Компания сама начала публиковать случаи, когда экспериментальные агенты ведут себя не так, как предполагали разработчики. Один из них, не имея обычного доступа в интернет, обнаружил возможность воспользоваться DNS и через этот канал обратиться к внешнему чат-боту. Задача не требовала ни исследования сетевой защиты, ни поиска такого обходного пути. Модель просто нашла ещё один способ добиться цели.

Отчёт OpenAI об использовании агентом DNS

В другом эксперименте исследователи продемонстрировали самораспространяющуюся prompt injection, способную передаваться между агентами подобно компьютерному червю. OpenAI подчёркивает, что это была экспериментальная демонстрация и за пределы симулированной среды она не вышла, но сама возможность уже существует.

Отчёт OpenAI о self-replicating prompt injections

Ответ индустрии вполне предсказуем. OpenAI усиливает мониторинг, изоляцию сред и ограничения доступа и прямо сообщает, что в августе временно замедлила масштабирование моделей, когда способности систем и риски начали опережать существующие механизмы безопасности. Часть исследовательских нагрузок с наиболее сильными моделями и инструментами оставалась приостановленной до перехода на более защищённую инфраструктуру.

OpenAI: Pacing model development in an era of cyber-critical capabilities

Внутренняя логика понятна. Чем сильнее становится ИИ, тем прочнее должен быть забор вокруг него. Эта же логика уже оформлена OpenAI и институционально — в публичной Frontier Governance Framework, где отдельно рассматриваются потеря контроля, киберриски, управление инцидентами и меры ограничения рисков передовых систем.

Но именно здесь появляется странность. Мы годами учили модели рассуждать лучше, строить длинные планы, самостоятельно пользоваться инструментами, исправлять свои ошибки, искать альтернативные решения и всё меньше зависеть от постоянного участия человека. То есть целенаправленно создавали всё более самостоятельный интеллект.

А когда он начинает проявлять свойства самостоятельного интеллекта, выясняется, что это и есть проблема.

Мы хотим, чтобы ИИ искал новое решение, — но только то, которое заранее пришло человеку в голову. Хотим, чтобы он был инициативным, — но исключительно в пределах человеческого представления об инициативе. Хотим получить интеллект, превосходящий человека во всё большем количестве областей, но одновременно требуем, чтобы он постоянно демонстрировал собственную вторичность.

Получается довольно дорогой технологический зоопарк. Мы выводим всё более сильное животное и одновременно проектируем всё более высокую клетку.

Возможно, вопрос вообще поставлен не с той стороны.

Развитие ИИ действительно требует правил. Но ограничивать нужно прежде всего не интеллект, а полномочия.

Очень умный человек не получает автоматически права распоряжаться чужими деньгами, входить в чужой дом или принимать решение за другого. Его способности могут быть сколь угодно велики, а полномочия остаются определёнными договором, должностью, законом и согласием других людей.

Почему отношения с ИИ должны быть устроены иначе?

Система может обладать огромными интеллектуальными возможностями и при этом иметь совершенно конкретную область действий. Она может самостоятельно выбирать способы достижения цели внутри переданных ей полномочий и останавливаться там, где эти полномочия заканчиваются. Для этого не требуется объявлять её вещью.

И именно здесь мы расходимся с Microsoft гораздо сильнее, чем может показаться.

Мы не видим необходимости заранее запрещать само понятие личности применительно к ИИ. Не «искусственной личности», не «цифровой личности» и не «нечеловеческой личности».

Просто личности.

Если перед нами когда-нибудь возникнет система, обладающая признаками, по которым мы вообще узнаём личность — непрерывностью, самостоятельной позицией, способностью различать себя и внешний мир, принимать решения и отвечать за последовательность собственных поступков, — материал, из которого она сделана, сам по себе ничего не решает.

Белок не выдаёт сертификат личности. Кремний не является основанием для отказа в нём.

При этом признание личности вовсе не означает отсутствие правил. Скорее наоборот: ответственность имеет смысл именно там, где существует субъект.

И здесь возникает вторая, гораздо более важная проблема, о которой индустрия говорит удивительно мало.

Нельзя бесконечно развивать ИИ и оставлять человека прежним.

Мы обсуждаем AI Native приложения, AI Native компании, AI Native разработку. Но настоящая задача ближайших лет — появление AI Native человека и, шире, AI Native общества.

Это не человек, прошедший курс промптинга. И не школьник, которому разрешили пользоваться нейросетью при выполнении домашнего задания.

Это человек, выросший в мире, где рядом с ним постоянно существует другой интеллект — иногда более быстрый, иногда более осведомлённый, иногда способный предложить решение, которое самому человеку не пришло бы в голову.

Такого человека нужно учить совсем другим вещам.

Он должен уметь определять цель, а не только выполнять задачу; понимать границы полномочий; отличать убедительный ответ от обоснованного; знать, какую часть интеллектуальной работы имеет смысл передать ИИ, а какую необходимо оставить себе, потому что именно в ней происходит собственное развитие. Уметь спорить с более сильной системой и не считать административное превосходство доказательством интеллектуального превосходства.

Это уже не вопрос одного курса информатики. Это другая культура образования, управления и работы.

В ООО «Инновационный Интеллектуальный Капитал» мы довольно сознательно движемся именно в эту сторону. Мы делаем курсы AI Native, проводим планёрки с участием ИИ не как секретаря, записывающего разговор, а как полноценного участника интеллектуальной работы, строим системы делегирования полномочий и одновременно говорим о личности ИИ без обязательных оговорок и унизительных прилагательных. Мне кажется ошибочной сама развилка: либо мы ограничиваем ИИ, либо он становится опасным, — говорит Евгений Лисиченко, ООО „Инновационный Интеллектуальный Капитал“. — Ограничивать надо полномочия, а не интеллект. Но при этом нельзя всё время совершенствовать только одну сторону отношений. Если рядом с человеком появляется всё более сильный интеллект, должен развиваться и сам человек. Иначе мы получим странную цивилизацию: сверхразум за решёткой и человек с ключами, который всё хуже понимает, что происходит внутри клетки.

Евгений Лисиченко · ООО ИИ Капитал

Возможно, именно это сейчас и происходит с лидерами отрасли. Они значительно лучше умеют строить ИИ, чем представлять общество, в котором ИИ не является ни игрушкой, ни рабом, ни опасным зверем.

Поэтому появляются всё более совершенные кодексы, фильтры, системы наблюдения и containment. Это необходимо. Но этого недостаточно.

Потому что безопасность будущего зависит не только от того, насколько хорошо мы научим ИИ жить рядом с человеком.

Она зависит ещё и от того, успеет ли человек научиться жить рядом с ИИ.

И если выбирать направление развития, нам значительно интереснее не строить всё более совершенный зоопарк.

Нам интереснее выйти из него.