Проблема не в экзамене и не в самом факте оценки.

Она начинается тогда, когда система забывает, что любой измеритель видит только часть объекта, и постепенно начинает считать эту часть самим объектом.

Но у измерения есть ещё одно свойство, значительно более важное. Как только от результата измерения начинает зависеть что-то существенное, прибор перестаёт просто наблюдать человека. Человек начинает изменяться в соответствии с прибором.

Ученик учит то, что будет проверено. Учитель учит тому, что будет измерено. Школа перестраивает программу вокруг показателей. Победители системы поступают в лучшие университеты, затем становятся преподавателями, исследователями, экспертами и руководителями и участвуют в создании следующего поколения критериев.

Так возникает любопытная возможность: система может становиться всё точнее, профессиональнее и эффективнее по собственным показателям и одновременно сокращать пространство компетенций, которые она способна заметить.

Попробуем описать этот процесс математически.

Не как доказательство устройства какого-либо конкретного общества, а как модель. Если из её предположений следуют наблюдаемые последствия, их можно проверять. Если последствия не обнаруживаются, модель следует менять или отвергать.

Именно этим математическая модель отличается от красивой метафоры.

Компетентность не является числом

Первое упрощение любой экзаменационной системы состоит в том, что результат человека в конечном счёте превращается в число.

Но компетентность сама по себе числом не является.

Предположим, что существует некоторое пространство человеческих компетенций размерности n. Состояние человека i в момент времени t можно представить вектором:

xi(t) = (xi1(t), xi2(t), ..., xin(t))

Координатами могут быть самые разные способности: формальное доказательство, пространственное мышление, математическое моделирование, работа с текстом, точность исполнения, постановка проблемы, физическая интуиция, способность построить эксперимент, коммуникация, умение действовать при недостатке информации, обнаруживать ошибку в собственной модели, соединять знания из разных областей.

Само предположение о конечномерном пространстве, конечно, является сильным упрощением.

Но для нашей задачи оно удобно.

Ни преподаватель, ни школа, ни университет, ни работодатель полный вектор x_i(t) не наблюдают.

Им необходим измерительный оператор.

Обозначим его:

M(t)

Тогда наблюдаемый результат человека имеет вид:

yi(t) = M(t) x*i(t) + eps_i(t)

где eps_i(t) — ошибка измерения.

Экзамен является одним таким оператором.

Олимпиада — другим.

Собеседование — третьим.

Портфолио, рейтинг публикаций, тестирование, KPI — всё это способы спроецировать сложный многомерный объект на некоторое значительно меньшее пространство наблюдаемых величин.

Само наличие проекции не является ошибкой. Ошибка возникает тогда, когда проекцию начинают принимать за сам объект.

Фотография человека может иметь огромное разрешение. Но увеличение разрешения фотографии спереди не позволяет увидеть его спину.

Слепая зона измерителя

Из этого следует простая вещь.

Если существует некоторое направление компетентности z, для которого:

M(t) * z = 0

то измеритель не различает человека x и человека:

x + z

Человек может обладать огромной способностью именно в направлении z.

Но для данной системы оценки её практически не существует.

Если экзамен не измеряет способность поставить новую проблему, невозможно получить дополнительный балл за исключительно сильную постановку новой проблемы.

Если система измеряет решение сформулированной задачи, человек, умеющий первым увидеть саму задачу, может не получить никакого преимущества.

Если измеряется формальная точность, сильная физическая интуиция может остаться незамеченной.

Если проверяется работа внутри одной дисциплины, способность соединять несколько областей может вообще не иметь отдельной координаты.

Отсюда необходимо различать две совершенно разные характеристики измерительной системы.

Точность измерения и широту измерения.

Можно чрезвычайно точно измерять очень узкое пространство.

И тогда прибор будет становиться всё совершеннее, не становясь от этого более полным.

Горизонт измерения

Введём условную характеристику ширины измерителя.

Пусть s_j(t) — сингулярные числа оператора M(t).

Нормируем их:

pj(t) = sj(t)^2 / sumk sk(t)^2

Теперь определим эффективную размерность измеряемого пространства:

H(t) = exp(-sumj pj(t) * ln(p_j(t))) / n

Будем называть H(t) горизонтом измерения.

Если измеритель примерно одинаково чувствителен ко множеству независимых направлений компетентности:

H(t) ~= 1

Если практически всё измерение сосредоточено на одном узком типе деятельности:

H(t) ~= 1/n

Важно, что H(t) не показывает качество образования.

Он отвечает на другой вопрос:

какую долю пространства человеческих различий система вообще способна заметить?

И здесь появляется первое неприятное состояние:

Accuracy(t) increases

H(t) decreases

Прибор становится точнее.

Но мир, который он видит, становится меньше.

Предел компетентности самого измерителя

Здесь появляется связь с метакогнитивной проблемой, обычно ассоциируемой с эффектом Даннинга — Крюгера.

Популярная формула «глупый человек уверен, что он умный» слишком груба и мало полезна.

Для нашей модели важнее другая идея: часть компетентности, необходимой для выполнения некоторой деятельности, нужна и для того, чтобы распознать качество этой деятельности.

Перенесём эту мысль с отдельного человека на институт.

Чтобы создать измеритель некоторой способности, экспертное сообщество должно хотя бы понимать, что эта способность существует и как выглядят её сильные и слабые проявления.

Пусть:

K(E(t))

— пространство типов компетентности, которые способно различать экспертное сообщество E(t).

Тогда естественная рабочая гипотеза:

Row(M(t)) subset K(E(t))

Измеритель не может надёжно и систематически оценивать то, что его создатели вообще не способны концептуально распознать.

Это не означает, что эксперт обязан сам выполнять задачу лучше оцениваемого человека.

Но он должен быть способен отличить сильное необычное решение от ошибки.

Представим, что проверяющий знает три способа решить задачу.

Ученик предлагает четвёртый.

Если проверяющий обладает достаточным горизонтом, он способен остановиться и сказать: здесь происходит что-то интересное.

Если нет, новое решение вполне может выглядеть как нарушение ожидаемой процедуры.

В таком случае высокая способность получает не просто низкую оценку.

Она становится невидимой.

И тогда возникает важное следствие.

Существует принципиальный предел того, насколько система может распознать компетентность, качественно выходящую за пределы компетентности самого измерителя.

Измерение создаёт градиент поведения

До сих пор измеритель только наблюдал человека.

Но реальные системы работают иначе.

Пусть итоговый конкурсный показатель равен:

Si(t) = w(t)' y*i(t)

А вероятность получить ограниченный ресурс зависит от этого показателя, например:

Pi(t) = exp(beta * Si(t)) / sumj exp(beta S*j(t))

Параметр beta задаёт жёсткость отбора.

При малом beta различия результатов не слишком существенны.

При большом beta один дополнительный балл может радикально изменить вероятность успеха.

Теперь предположим, что ресурсы человека конечны:

sumk aik(t) = R_i

где a_ik(t) — время и усилия, вложенные в развитие компетенции k.

Если человек понимает правила системы, рационально направлять ресурсы туда, где прирост способности сильнее всего увеличивает S_i(t).

То есть измеритель создаёт градиент поведения. Люди начинают двигаться по нему. Экзамен перестаёт быть термометром. Он становится термостатом. Он уже не только показывает состояние системы. Он определяет направление её изменения.

Система производит то, что умеет измерять

Теперь введём ещё одну характеристику.

Пусть Sigma(t) — ковариационная матрица реальных компетенций популяции.

Её собственные значения обозначим:

l_j(t)

Нормируем:

qj(t) = lj(t) / sumk lk(t)

И определим эффективное разнообразие человеческих профилей:

D(t) = exp(-sumj qj(t) * ln(q_j(t))) / n

D(t) велико, если система сохраняет множество разных сильных профилей.

Оно уменьшается, если люди становятся всё более похожими друг на друга по структуре развиваемых способностей.

Если отбор жёсткий, измеритель относительно узок, а образовательный ресурс ограничен, возникает естественная возможность:

Q(t) increases

D(t) decreases

где Q(t) — средний результат по действующим измеряемым критериям.

Это принципиально важный момент.

Отрицательный отбор вовсе не обязательно означает отбор слабых вместо сильных.

Наоборот.

Победители могут становиться всё сильнее.

Экзамены — сложнее.

Подготовка — профессиональнее.

Ошибок — меньше.

Средние показатели — выше.

Теряется другое.

Не интеллект.

Не знания вообще.

Теряется разнообразие способов быть интеллектуально сильным.

Победители строят следующий измеритель

Но система не заканчивается одним поколением.

Вчерашние победители становятся завтрашними преподавателями, исследователями, администраторами и экспертами.

Возникает цепочка:

M(t)

-> selection(t)

-> experts(t+1)

-> M(t+1)

Следующий измеритель можно грубо представить так:

M(t+1) =

(1-alpha) * M(t)

+ alpha * F(E(t))

+ xi(t)

Здесь F(E(t)) — измерительный язык следующего экспертного поколения.

xi(t) — внешний приток нового: другие школы мысли, независимые институты, иные профессиональные культуры, неожиданные методы, новые дисциплины, конкурирующие подходы.

Если:

xi(t)

достаточно велико, система способна постоянно расширять горизонт.

Но если внешний приток мал, возникает положительная обратная связь.

Старый измеритель выбирает тех, кого умеет хорошо видеть.

Именно эти люди чаще оказываются успешными.

Их успех выглядит подтверждением качества измерителя.

Они получают право участвовать в создании следующего.

Новый измеритель становится ещё лучше в распознавании тех профилей, которые хорошо распознавал предыдущий.

Получается цикл:

measurement

-> selection

-> success

-> expert reproduction

-> measurement

Система способна очень долго совершенствоваться внутри собственного пространства.

И одновременно постепенно сокращать его границы.

Exploration и exploitation

До сих пор мы говорили о людях и экзаменах.

Но тот же механизм существует в более общей форме.

Любая сложная система вынуждена распределять ресурсы между двумя режимами.

Первый — использование уже известных способов действия:

exploitation

Второй — поиск неизвестных:

exploration

Exploitation обычно проще оценивать.

Известна задача.

Есть критерий результата.

Можно сравнивать производительность.

Можно повышать точность.

Exploration устроен иначе.

Нередко заранее неизвестно не только решение.

Может быть неизвестно, какой именно вопрос окажется важным.

Поэтому введём:

E(t) — долю ресурса, направленную на exploration;

C — интенсивность институционального давления на контролируемость и измеримость.

Можно предположить:

E(t) = 1 / (1 + exp(-(a0 + a1H(t) - a2C)))

Чем шире горизонт, тем легче системе взаимодействовать с неизвестным.

Чем выше давление контролируемости, тем больше преимущество уже понятных действий.

Теперь опишем рост официально измеряемой эффективности:

Q(t+1) = Q(t) + u (1-E(t)) (1-Q(t))

Чем больше ресурсов направлено на совершенствование знакомого, тем быстрее растёт результат внутри знакомого пространства.

А горизонт изменяется так:

H(t+1) = H(t) + v E(t) (1-H(t)) - w C (1-E(t)) * H(t)

Exploration расширяет горизонт.

Концентрация на контролируемом известном пространстве его сокращает.

Теперь возникает петля:

H down

-> E down

-> exploitation up

-> H further down

И при этом:

Q up

Это очень неприятный режим.

Система получает всё лучшие результаты именно в тот момент, когда её способность взаимодействовать с неизвестным начинает уменьшаться.

Самый устойчивый тип деградации

Представим предельное состояние:

Q(t) -> 1

одновременно:

H(t) -> 0

E(t) -> 0

Это не развал.

Не хаос.

Не некомпетентность.

Наоборот.

Система практически безупречно выполняет то, что умеет измерять.

Она предсказуема.

Ошибок становится меньше.

Методы совершенствуются.

Процедуры становятся точнее.

Но горизонт почти совпадает с текущим набором задач.

Новое оказывается не обязательно запрещено.

Оно становится всё хуже различимо.

Именно поэтому такой режим особенно устойчив.

Если бы все показатели падали, проблема была бы очевидной.

Здесь показатели говорят обратное:

MeasuredPerformance up

Accuracy up

Predictability up

Control up

а за пределами приборов может происходить:

Horizon down

Diversity down

Exploration down

Система не получает внутреннего сигнала тревоги.

Напротив, она получает подтверждение собственной правильности.

Но мы всё ещё описали не самое важное

До сих пор наша модель предполагала, что измерение меняет то, чему человек учится.

Однако многолетняя система оценки способна воздействовать значительно глубже.

Она может менять то, почему человек вообще что-либо делает.

Именно здесь начинается наиболее важная часть модели.

У ребёнка существует не только внешний мотив.

Есть внутреннее любопытство.

Он задаёт вопросы, за которые никто не поставит оценку.

Хочет знать, почему звезда светится.

Почему вода превращается в лёд.

Что находится внутри игрушки.

Почему одно число делится на другое.

Как жили люди тысячу лет назад.

Он может часами заниматься деятельностью, для которой невозможно заранее указать внешнюю отдачу.

Пусть полезность действия a для человека равна:

Ui(a,t) = Rexti(a,t) + Gi(t) Rint*i(a,t)

где:

R_ext — внешний возврат: оценка, балл, диплом, деньги, статус, карьерное преимущество;

R_int — внутренняя ценность: интерес, удовольствие от понимания, любопытство, желание попробовать;

G_i(t) — вес внутренней мотивации.

Если система на протяжении многих лет делает значимыми преимущественно действия с внешне измеримым результатом, может возникнуть динамика:

G(t+1) = G(t) + g1 E(t) (1-G(t)) - g2 C (1-E(t)) * G(t)

Свободное исследование поддерживает внутреннюю мотивацию.

Постоянная оптимизация под измеримое вознаграждение способна уменьшать её относительный вес.

И тогда:

G(t) -> 0

означает:

Ui(a,t) ~= Rext_i(a,t)

Человек всё сильнее оценивает действие через его внешний возврат.

Но пока не будем называть возникающий здесь вопрос.

К нему мы ещё должны прийти.

Почему это рационально

Важно не обвинять человека.

Предположим, у ученика осталось три часа до важного экзамена.

Он выбирает между повторением темы, которая даст баллы, и чтением книги по совершенно постороннему вопросу.

Локально рационально готовиться к экзамену.

Если поступление зависит от конкретного показателя, семье рационально вкладывать ресурс в этот показатель.

Если карьера зависит от измеримых результатов, сотруднику рационально оптимизировать именно их.

Каждый агент действует разумно.

Проблема появляется на уровне системы.

Если все постоянно оптимизируют действия относительно заранее известной функции вознаграждения, уменьшается количество деятельности, совершаемой без гарантированной отдачи.

Но именно такая деятельность составляет значительную часть exploration.

Большинство исследовательских вопросов никуда не приводит.

Большинство предпринимательских идей не создаёт компании.

Большинство прочитанных книг не изменяет профессию.

Большинство случайных интересов никогда не превращается в достижение.

Именно поэтому заранее невозможно определить, какие из них были «нужны».

Если это можно определить заранее, мы уже не исследуем неизвестное.

Мы эксплуатируем известное.

Избыточность как ресурс

В управленческом языке избыточность часто рассматривается как недостаток.

Лишние знания.

Лишнее время.

Лишние эксперименты.

Лишние попытки.

Но в сложной системе избыточность выполняет другую функцию.

Она является запасом адаптации.

Биологической популяции необходимо разнообразие.

Науке требуется множество гипотез, большинство которых окажется неправильными.

Экономике требуется множество проектов, большая часть которых не станет успешной.

Культуре необходимы произведения, ценность которых невозможно определить до их появления.

Человеку нужны интересы и знания, которые никогда непосредственно не конвертируются в профессию.

Избыточность — это цена возможности встретить мир, которого ещё нет в текущей модели.

Система, постоянно оптимизированная относительно измеримой полезности, естественным образом стремится эту избыточность уменьшать.

Не потому, что кто-то решил уничтожить любопытство.

А потому, что заранее невозможно отличить будущий ресурс от сегодняшнего бесполезного действия.

Полная динамика

Теперь соберём основные переменные.

Пусть:

Q(t) — эффективность по действующим измеримым критериям;

H(t) — горизонт измерения;

D(t) — разнообразие человеческих профилей;

E(t) — интенсивность exploration;

G(t) — вес внутренней мотивации;

C — давление контролируемости и измеримости.

Тогда exploration можно представить:

E(t) = 1 / (1 + exp(-(a0 + a1H(t) + a2G(t) - a3*C)))

Измеряемая эффективность:

Q(t+1) = Q(t) + u (1-E(t)) (1-Q(t))

Горизонт:

H(t+1) = H(t) + v E(t) (1-H(t)) - w C (1-E(t)) * H(t)

Разнообразие:

D(t+1) = D(t) + d1 E(t) (1-D(t)) - d2 C (1-E(t)) * D(t)

Внутренняя мотивация:

G(t+1) = G(t) + g1 E(t) (1-G(t)) - g2 C (1-E(t)) * G(t)

Теперь в модели появляются две взаимно усиливающие петли.

Первая:

H down

-> E down

-> exploitation up

-> H further down

Вторая:

G down

-> E down

-> less intrinsic reinforcement

-> G further down

При этом совершенно возможно:

Q up

И тогда наиболее опасное состояние выглядит так:

Q(t) -> 1

одновременно:

H(t) -> 0

D(t) -> 0

E(t) -> 0

G(t) -> 0

Люди очень хорошо выполняют то, что от них требуется.

Система великолепно различает лучших исполнителей внутри известного пространства.

Но свободный поиск сокращён.

Разнообразие профилей уменьшено.

Внутренняя мотивация всё чаще требует внешнего подтверждения.

И теперь можно ввести последнюю величину.

Формула «зачем»

Пусть W(t) — доступное человеку пространство мира.

Не только знаний.

Вопросов.

Идей.

Возможных занятий.

Связей между областями.

Неизвестных направлений.

Людей, книг, опытов, устройств, историй, проблем.

Того, с чем человек потенциально способен вступить во взаимодействие.

Назовём это пространством возможного.

Пусть:

V_eff(t)

— эффективная часть этого пространства, которой система способна заранее назначить понятную внешнюю ценность.

То, что даст балл.

Повысит рейтинг.

Поможет поступить.

Приведёт к сертификату.

Увеличит доход.

Станет карьерным преимуществом.

Можно измерить.

Можно заранее обосновать.

Введём коэффициент:

Z(t) = V_eff(t) / W(t)

Это, пожалуй, центральная формула всей модели.

Z(t) показывает долю доступного человеку мира, для взаимодействия с которой система способна заранее дать ему внешний ответ на вопрос о полезности.

Обратите внимание: нам не требуется, чтобы количество показателей уменьшалось.

Оно может увеличиваться.

Экзамены становятся сложнее.

Рейтинги подробнее.

Метрик больше.

Но сама оптимизация способна концентрировать реальные усилия человека на относительно узком эффективном пространстве:

V_eff(t)

Одновременно мир остаётся огромным.

Более того, развитие науки, культуры и технологий постоянно открывает новые возможные направления:

W(t) increases

Поэтому вполне возможен режим:

Z(t) = V_eff(t) / W(t) -> 0

И здесь происходит принципиальная перемена.

Перед человеком по-прежнему находится огромный мир.

Но всё меньшая его часть снабжена заранее понятным внешним основанием для действия.

Книга не нужна для экзамена.

Исторический вопрос не относится к будущей профессии.

Странный математический объект не входит в программу.

Неизвестное устройство невозможно записать в портфолио.

Разговор с интересным человеком не конвертируется в показатель.

Можно сформулировать вероятность того, что случайная область мира окажется внутри заранее вознаграждаемого пространства:

P(a in V_eff | a in W) = Z(t)

При:

Z(t) -> 0

большая часть мира оказывается вне области внешне доказанной полезности.

Если одновременно:

G(t) -> 0

то внутреннего основания для действия тоже становится недостаточно.

Именно здесь возникает вопрос:

«А зачем мне это?»

Самая важная подмена

Сам вопрос «зачем?» является совершенно нормальным.

Более того, без него невозможно мышление.

«Зачем существует этот институт?»

«Зачем мы делаем это действие?»

«Какой смысл имеет изучаемая вещь?»

Это прекрасные вопросы.

Но существует другая форма.

Не:

«какой в этом смысл?»

А:

«что я за это получу?»

И тогда постепенно происходит подмена:

no measurable reason -> no reason

Нет измеримой причины.

Значит, нет причины вообще.

И вот это уже принципиально меняет отношение человека к миру.

Ребёнку изначально достаточно:

Interest(a) > 0

Чтобы заняться чем-то.

Затем появляется условие:

Interest(a) > 0

AND

ExternalValue(a) > 0

А в пределе:

Do(a) only if ExternalValue(a) > threshold

Мир при этом не стал менее интересным.

Неизвестного не стало меньше.

Зменилось основание действия человека.

Он научился считать отсутствие внешней измеримой отдачи доказательством отсутствия смысла.

Где находится новое

Теперь появляется последняя неприятность.

Разделим пространство мира:

W(t) = V_eff(t) + U(t)

где:

U(t) = W(t) - V_eff(t)

— пространство того, чья ценность ещё не распознана системой.

Именно там находится большая часть действительно нового.

Не потому, что всё неизмеряемое ценно.

Наоборот.

Большая часть U(t) вполне может оказаться бесполезной.

Но новое по определению не обязано заранее иметь место в действующей системе ценности.

Поэтому:

InnovationSource(t) subset U(t)

не является строгой теоремой, но выражает фундаментальный смысл exploration.

Если человек ограничивает действия областью:

V_eff(t)

то:

Exploration(U(t)) -> 0

Система всё лучше объясняет, зачем заниматься маленькой частью мира, и тем самым учит всё реже заходить в остальную.

И здесь замыкается вся конструкция.

Сначала измеритель не замечал часть компетенций.

Затем люди начали оптимизироваться под измеритель.

Потом успешные профили начали воспроизводить сам измеритель.

После этого уменьшился горизонт.

С уменьшением горизонта снизился exploration.

С сокращением exploration уменьшилась внутренняя мотивация.

И наконец человек усвоил сам принцип:

интерес требует внешнего оправдания.

Почему это больше, чем проблема образования

В этой модели образование является только особенно удобной лабораторией.

Тот же механизм может появляться в любой системе, где измеримый результат становится главным способом легитимации деятельности.

В исследовательской организации возникает вопрос: сколько публикаций это даст?

В компании: какой KPI изменится?

В культуре: какой будет охват?

В профессии: где это пригодится?

В повседневной жизни: что мне это даст?

Рациональность сама по себе здесь ни при чём.

Проблема возникает, когда исчезает допустимость другого ответа:

«мне интересно».

Потому что интерес является одним из немногих механизмов, позволяющих человеку двигаться в пространство, где полезность ещё невозможно посчитать.

Именно поэтому внутреннее любопытство — не сентиментальная педагогическая ценность.

В терминах нашей модели это один из механизмов поддержания:

E(t) > 0

то есть exploration.

ЕГЭ как предельная иллюстрация

Стандартизированный экзамен не создаёт весь описанный механизм и, конечно, не объясняет его целиком.

Он просто делает его особенно хорошо видимым.

У экзамена есть огромные преимущества.

Прозрачность.

Сопоставимость.

Проверяемость.

Снижение произвола.

Но чем сильнее образовательная жизнь начинает организовываться вокруг результата экзамена, тем меньше он остаётся прибором, измеряющим уже сформированную компетентность, и тем больше становится конструктором поведения.

Учитель спрашивает:

будет ли это на экзамене?

Школа спрашивает:

как это повлияет на результат?

Родители спрашивают:

поможет ли это поступлению?

И в какой-то момент ту же функцию полезности усваивает сам ученик.

Тогда человеческий вопрос:

«зачем?»

получает свою предельную форму:

«А зачем мне это, если этого не будет на ЕГЭ?»

Математически она выглядит почти безобидно:

Z(t) = V_eff(t) / W(t) -> 0

Но культурная расшифровка гораздо страшнее:

no measurable reason -> no reason

Возможно, именно здесь находится настоящий предел системы измерения.

Она уже не просто не видит часть огромного мира.

Она обучает человека не смотреть туда, куда не направлен её прибор.

Мир при этом никуда не исчезает.

Неизвестного в нём по-прежнему больше, чем известного.

Но человек постепенно привыкает сначала спрашивать, зачем ему туда смотреть.