Представьте кофейню, в которую вы ходите почти каждое утро в течение многих лет. Эспрессо там неизменно хорош.
Затем в один из вторников он оказывается ужасным.
Пережженный, горький, едва питьевой.
Решите ли вы сразу, что кофейня испортилась?
Скорее всего, нет. Одна плохая чашка после сотен хороших кажется просто случайной оплошностью.
Теперь представьте, что вы впервые пробуете кофе в аэропорту и получаете точно такую же ужасную чашку. Вы можете прямо на месте решить больше никогда там ничего не покупать.
Кофе может быть одинаково плохим в обоих случаях. Меняется лишь то, что означает этот единичный опыт.
С этой проблемой сталкивается любая обучающаяся система. Ошибка показывает, что ваше ожидание не оправдалось. Но она не объясняет, был ли ошибочным ваш внутренний взгляд, изменился ли мир или вы просто столкнулись с фоновым шумом.
Ошибиться — еще не значит понять
Ошибка предсказания (prediction error) — это разница между тем, чего вы ожидали, и тем, что произошло на самом деле.
Но размер этой разницы — лишь часть картины.
Предположим, вы ожидали значение 50, а получили 70. Это различие может быть огромным в системе, где значения обычно колеблются в пределах одного-двух пунктов. В системе, где показатели регулярно прыгают на тридцать пунктов, такой результат абсолютно обычен.
Поэтому полезный вопрос звучит не только так:
Насколько я ошибся?
Но и так:
Насколько необычно так ошибиться здесь?
Это различие предотвращает гонку обучающейся системы за каждой случайной флуктуацией.
Представьте, что вы пытаетесь разобрать речь через шумное радиосоединение. Треск и помехи постоянно искажают сигнал. Если бы каждая вспышка статического шума заставляла вас пересматривать значение слов, понимание быстро стало бы невозможным.
Хороший ученик должен уметь допускать некоторую погрешность.
Шум и перемены — это разные проблемы
Существуют как минимум две совершенно разные причины, почему предсказания могут подводить.
Первая — это шум (noise).
Представьте, что вы бросаете дротики в одну и ту же мишень снова и снова. Дротики разлетаются вокруг центра, но сама мишень остается на месте. Отдельные броски варьируются, хотя генератор этих событий не изменился.
Вторая возможность — сместилась сама мишень.
Теперь прошлые наблюдения становятся гораздо менее полезными. Идеальная оценка того, где мишень висела раньше, мало чем поможет, если кто-то перенес доску на другую стену.
Поэтому обучению нужна гибкая скорость обучения (learning rate) — то, насколько сильно самое свежее наблюдение меняет следующее предсказание.
Когда результаты шумны, разумно обновлять модель медленно. Один странный результат не должен перечеркивать долгую историю.
Когда же возникают признаки того, что изменилась сама суть ситуации, свежая информация мгновенно становится гораздо более ценной.
Вертолет за облаками
Один остроумный лабораторный эксперимент делает эту проблему невероятно наглядной[2].
Представьте вертолет, скрытый за облаками. Вы не видите, где он находится.
Все, что вы видите, — это мешки с деньгами, падающие из него.
Ваша задача — поставить корзину туда, куда, по вашему мнению, упадет следующий мешок.
Мешки не падают строго в одну точку. Существует случайный разброс, поэтому вы постепенно понимаете, где примерно висит скрытый вертолет, не реагируя слишком резко на каждый отдельный занос.
Затем время от времени вертолет перемещается.
Мешок внезапно падает далеко от того места, где вы ожидали.
Теперь перед вами дилемма: был ли этот далекий бросок лишь необычно сильным порывом ветра или вертолет перелетел?
Участники этих экспериментов не используют фиксированный размер корректировки. Их поведение меняется от попытки к попытке в зависимости от того, насколько вероятным кажется смещение источника и насколько неуверенной уже является их текущая оценка[2].
Когда результат выглядит как обычный разброс, следующее предсказание сдвигается лишь немного.
Когда тот же результат выглядит как доказательство реальной точки изменения (change-point), следующее предсказание может сдвинуться кардинально.
Самое главное здесь — мозг реагирует не просто на саму ошибку. Он пытается понять, что именно породило эту ошибку.
Отслеживает ли мозг нестабильный мир?
Другие эксперименты показывают, что мозг ведет учет того, насколько изменчивой была среда в последнее время.
В одном влиятельном фМРТ-исследовании участники обучались в условиях, где правила вознаграждения то оставались стабильными, то быстро менялись[3].
Люди соответствующим образом адаптировали свое поведение. Когда среда становилась более изменчивой (волатильной), свежие результаты имели большее значение. Когда она снова стабилизировалась, долгосрочная история возвращала свое влияние.
Активность в передней поясной коре (ACC) отслеживала модельные оценки этой волатильности[3].
Это не означает, что ACC — единственный пульт управления, регулирующий скорость обучения. Но это показывает, что нейронные системы, участвующие в принятии решений, удерживают информацию о том, насколько стабильной или нестабильной кажется текущая среда.
Исследователи также предположили, что нейромодуляторные системы помогают решать эту задачу.
Одна из влиятельных теоретических моделей предложила различие между ацетилхолином и норадреналином при работе с ожидаемой и неожиданной неопределенностью[4]. В общих чертах идея заключается в том, что нервная система может разделять неопределенность, которая уже является частью шумной среды, и сигналы о том, что изменилось нечто более фундаментальное.
Биология сложнее простого правила «одно вещество — одна функция», но сама вычислительная задача остается прежней.
Иногда неопределенность означает: в мире много шума.
Иногда она означает: моя старая модель больше не работает.
Когда следует менять мнение?
В процессе обучения существует своеобразное противоречие.
Меняйте мнение слишком легко — и каждая аномалия станет новой теорией.
Меняйте мнение слишком медленно — и вы продолжите защищать модель мира, которого больше не существует.
Вот почему упрямство и гибкость не являются противоположностями в простом смысле. И то, и другое может быть полезным.
Если процесс был надежным годами, один странный результат заслуживает скепсиса.
Если неожиданные результаты продолжают появляться или известно, что среда быстро меняется, продолжение их игнорирования становится слишком дорогостоящим.
Самое сложное — понять, когда эта грань перейдена.
Хорошая обучающаяся система не верит каждой неожиданности.
Но она и не отбрасывает сюрпризы только потому, что они противоречат тому, что она уже знает.
Она продолжает задавать более глубокий вопрос:
Был ли это просто шум — или мир изменился?

Comments 0
Log in to join the conversation.
Log inStart the conversation.