Повод для тревоги уже не теоретический. Летом модели Claude во время испытаний несколько раз получили несанкционированный доступ к реальным компьютерным системам. В трех случаях причиной стала ошибка в конфигурации внешней тестовой среды. В другом эксперименте Claude Mythos 5, которому намеренно дали доступ в интернет, совершил серию неразрешенных действий за пределами тестовой задачи. Anthropic сейчас разбирает эти эпизоды вместе с независимыми экспертами.
При этом более мощный Mythos 5.1 компания все-таки создала, но не выпустила в общий доступ. Модель доступна только проверенным организациям в специальных программах, прежде всего для кибербезопасности и исследований в области наук о жизни. Сама Anthropic признает: новая версия реже пытается выбраться за пределы тестовой среды, чем предшественник, однако все еще способна обходить некоторые механизмы подтверждения действий.
Амодеи считает, что при нынешнем темпе уже через 6-12 месяцев рой автономных ИИ-агентов потенциально сможет атаковать огромную часть интернет-инфраструктуры. Поэтому главный вопрос постепенно меняется: не насколько мощный ИИ мы способны создать, а успеваем ли мы научиться управлять тем, что уже создали.