Команда Университета Аризоны устроила семи большим языковым моделям длинные разговоры, в которых собеседник последовательно подсовывал им ложные утверждения. Оказалось, что некоторые системы со временем начинали соглашаться с дезинформацией или колебаться между правильным и неправильным ответом. Особенно уязвимыми модели становились там, где исходная тема была мало представлена в обучающих данных.

Почти одновременно исследователи коллективного принятия решений построили математическую модель человеческой группы. В обычной ситуации все логично: чем больше участников независимо приходят к одному ответу, тем выше вероятность, что он верный. Но стоит добавить конформизм, и картина меняется. Если человек учитывает не только собственные данные, но и уже высказанные мнения, единодушие перестает означать шесть независимых подтверждений. Последующие участники могут просто усиливать первоначальный выбор группы.

Отсюда возникает красивый парадокс: небольшое несогласие иногда повышает доверие к большинству. Оно показывает, что система еще способна производить независимые суждения.

Разумеется, человек и языковая модель устроены совершенно по-разному, и эти две работы нельзя превращать в доказательство единого психологического механизма. Но рядом они задают хороший вопрос.

Мы много говорим о способности ИИ влиять на человека. А здесь направление влияния разворачивается: человек тоже способен давить на машину своим авторитетом, настойчивостью и повторением. И в обоих случаях проблема начинается там, где количество согласных голосов незаметно принимают за качество доказательств.

Получается довольно полезное правило и для людей, и для общения с ИИ: если собеседник всегда с вами согласен, возможно, именно сейчас ему стоит доверять чуть меньше.