Оперантное обусловливание. Научение: классическое vs

Теория-инструментального, или оперантного, обусловливания связана с именами Э. Л. Торндайка (Е. L. Thorn-dike) и Б. Ф. Скиннера (В. Е Skinner). Скиннер и Торн-дайк - виднейшие представители бихевиоризма - показали, что воздействие окружающей среды определяет поведение человека. Они рассматривают в качестве главного фактора формирования человеческого поведения культуру, содержание которой выражается в определенном наборе комплексов подкреплений. С их помощью можно создавать и модифицировать человеческое поведение в нужном направлении. На таком понимании основаны методы модификации поведения, использующиеся не только в психотерапевтической практике, но и, например, при воспитательных воздействиях.

Термины «инструментальное научение» и «оперант-ное обусловливание» означают, что реакция организма, которая формируется по методу проб и ошибок, является инструментом для получения поощрения и предполагает оперирование средой, то есть поведение есть функция его последствий. Согласно принципу оперантного обусловливания, поведение контролируется его результатом и последствиями. Модификация поведения осуществляется за счет влияния на его результаты и последствия. В соответствии со схемой оперантного обусловливания экспериментатор, наблюдая поведение, фиксирует случайные проявления желательной, «правильной», реакции и сразу же подкрепляет ее. Таким образом, стимул следует после поведенческой реакции, используется прямое подкрепление через поощрение и наказание. Результатом подобного научения является оперантное научение, или оперант. В этом случае подкрепляется не стимул, а реакция организма, именно она вызывает подкрепляющий стимул, поэтому такое научение обозначается как научение типа R. Оперантное, или инструментальное, поведение (поведение типа R) - это поведение, вызванное подкреплением, следующим за поведением. Скиннер, подчеркивая различия между респондентным и оперантным поведением, указывает, что респондентное поведение вызвано стимулом, предшествующим поведению, а оперантное поведение - стимулом, следующим за поведением. Иными словами, в классическом обусловливании стимул предшествует поведенческой реакции, а в оперантном - следует за ней.

Необходимо обратить внимание на соотношение таких понятий, как позитивное и негативное подкрепление и наказание, различать наказание и негативное подкрепление. Позитивное или негативное подкрепление усиливает поведение, наказание - ослабляет. Позитивное подкрепление основано на предъявлении стимулов (наград), которые усиливают поведенческую реакцию. Негативное подкрепление заключается в усилении поведения за счет удаления негативных стимулов. То есть всякое подкрепление (и позитивное, и негативное) усиливает частоту реакции и поведение, наказание же, напротив, уменьшает частоту реакции, ослабляет поведение. (Например, позитивное подкрепление: животное находит выход из лабиринта и получает пищу; негативное подкрепление: животное находит выход из лабиринта, где действует электрический ток, и ток выключают; наказание: животное в лабиринте упирается в тупик, и ток включают. Таким образом, первые два вида воздействия экспериментатора усиливают реакцию, поскольку являются подкреплением, а третий - уменьшает, являясь наказанием.)

Для различения стимула классического условного рефлекса и стимула оперантного условного рефлекса Скиннер предложил обозначать первый как Sd (дискри-минантный стимул), а второй - как Sr (респондент-ный стимул). Дискриминантный стимул по времени предшествует определенной поведенческой реакции, респондентами стимул, подкрепляющий определенную поведенческую реакцию, следует за ней.

Итак, сравнительные характеристики классического и оперантного обусловливания:
Классическое обусловливание S-R. Научение типа S. Классическая парадигма Павлова. Реакция возникает только в ответ на воздействие какого-либо стимула. Стимул предшествует реакции. Подкрепление связано со стимулом. Респондентное поведение - поведение, вызванное определенным стимулом, ему предшествующим.

Оперантное обусловливание R-S. Научение типа R. Оперантная парадигма Скиннера. Желательная реакция может появиться спонтанно. Стимул следует за поведенческой реакцией. Подкрепление связано с реакцией. Оперантное поведение - поведение, вызванное подкреплением, за ним следующим.

Если условный рефлекс представляет собой пассивную реакцию организма на внешнее воздействие, то оперантное обусловливание является активным поведением, которому человек или животное обучаются в определенной ситуации. Название происходит от латинского слова operatic, что в переводе обозначает действие. Обусловливание же свидетельствует о том, что обучение действию требует определенного условия. В классическом условном рефлексе ассоциативная связь формируется между двумя стимулами - условным и безусловным. Условием его формирования является обязательное следование безусловного стимула за условным. В процессе оперантного обусловливания подобная связь возникает между конкретным поведением и стимулом, который называется подкреплением.

Этот тип обучения позволяет организму менять свои действия в зависимости от тех последствий, которые оно порождает. Если следствием некоторого поведения будет что-то, что организм воспринимает как положительный результат, то оно с большей вероятностью будет повторено в будущем. Если же поведение ведет к неприятным для организма последствиям, то вероятность его повторения резко снизится. Система позитивных последствий называется подкреплением, а негативных - наказанием. Например, если маленький ребенок, случайно произнеся два раза подряд слог: “Ма”, - вслед за эти услышит восторженные слова матери и увидит счастливую улыбку, то вероятность того, что он тут же произнесет это еще раз, резко возрастет. Если же за этими звуками не последует определенных действий, то, скорее всего, они исчезнут из его набора словесных реакций.

Таким образом, подкрепление - это такое воздействие, при котором появление или исчезновение какого-то стимула в результате той или иной поведенческой реакции повышает вероятность повторения этой реакции (Год-

фруа, 1992).

Выделяют несколько типов оперантного обусловливания. Американский психолог Э. Торндайк (Thorndike, 1890) исследовал метод проб и ошибок. Он предложил эксперименты на животных в особых “проблемных” клетках. В одном из них животное помещалось в “проблемную” клетку. Оно могло выйти и взять пищу, положенную вне клетки, если нажимало на деревянную педаль. Двигаясь внутри клетки, животное случайно могло наступить на педаль. Однако после каждого открытия клетки вслед за нажатием педали время следующего нажатия сокращалось, что позволяло животному освобождаться все быстрее и быстрее. Это позволило Э.Торндайку вывести “закон эффекта”. Согласно этому закону, вероятность повторения действия, приведшего к желательному результату, резко возрастает. Если же последствия этого действия вызывают нежелательный результат, то оно будет воспроизводиться все реже и реже.

В начале века в Германии была известна лошадь по имени Умный Ганс. Ударами копыт она считала, складывала из букв слова, извлекала квадратные корни. Ее хозяин полагал, что он обучил ее думать. Однако проведенное исследование поведения животного показало, что лошадь отвечала на

основе подкрепления, которым был поворот головы хозяина, усиленный широкополой шляпой, когда он считал, что ударов копыт достаточно. В тех случаях, когда предлагались вопросы, на которые никто из присутствующих и хозяин в том числе не знали ответа, удары копыт были неопределенными.

Другой тип оперантного обучения был описан Б.Ф. Скиннером (Skinner, 1969). Он показал, что поведение у человека и животных может формироваться не только случайным образом, но и целенаправленным, постепенно за счет подкрепляющих факторов (Рис. 15.9). Такой тип обучения был назван формированием поведения путем последовательных приближений. В одном из описанных им экспериментов животные с большей вероятностью нажимали на педаль, находящуюся в клетке, если каждое нажатие сопровождалось появлением кусочка пищи. Сигналом к подобной реакции животного был вид педали, поскольку когда педаль убиралась, животное не двигало лапой, избражая это действие. Подкрепление (кусочек пищи) усиливало связь между нейрональными кругами, включенными в процесс восприятия (вид педали) и нейрональными кругами, ответственными за движение (например, нажатие на педаль).

С помощью этой модели можно объяснить очень быстрое обучение ребенка произнесению первых слов (но не как всего языка в целом) по механизму, описанному ранее. Известно, что в первые месяцы жизни дети произносят более 80 звуков, что может соответствовать звукам всех языков мира. Ребенок, перебирая различные звкосочетания, случайно говорит что-то похожее на: “Мо-мо”. Радостная мама тут же подкрепляет эти звуки поцелуем, демонстрируя всем, что ее ребенок начал говорить слово “мама”. Однако через некоторое время родительские востроги пойдут на убыль, тогда как более близкое и отчетливое произнесение вновь вызовет бурю восторгов. Так, методом последовательного приближения ребенок будет набирать свои первые слова.

Выделяют положительное и отрицательное подкрепление. Положительным подкреплением является событие, сочетающееся с каким-либо действием и ведущее к увеличению вероятности повторного его. Подкрепление тем эффективнее, чем более приближено к действию. Чем дальше оно отстоит от поведения, тем медленнее формируется поведение. Формирование действия определяется также величиной подкрепления.

Желательно, чтобы подкрепление не было слишком большим. Например, в процессе обучения животного это может быть маленький кусочек пищи, а не полная миска; при обучении ребенка или взрослого - небольшой подарок. Сытое животное перестанет обучаться, согласно русской пословице: “Сытое брюхо к учению глухо”. Если ребенку предложен большой подарок, то следующий за ним маленький вызовет лишь угашение реакции, а не ее усиление. При выработке поведения играет роль и очень большое подкрепление. Его влияние часто наблюдается у азартных игроков, которые, получив значительный выигрыш, не могут прекратить игру даже при постоянных дальнейших проигрышах. Именно поэтому, завлекая игроков в игорные дома, им сначала позволяют выиграть, а потом отыгрывают у него все,

ч то у него есть. На этом эффекте работают широко распространенные на улицах “наперсточники” и другие мошенники этого типа.

Случайное большое подкрепление может вызвать длительную стойкую реакцию у человека и животного. По этому механизму формируются суеверия. Кроме уже описанных видов выделяют вариативное. Его действие ограничено следующими условиями. Вырабатывается определенное поведение, связанное с тем или иным подкреплением. Затем подкрепление убирается и поведение ослабевает. Случайное подкрепление этого поведения вызывает резкое усиление угасшей реакции. Чем реже такого рода подкрепление, тем дольше держится восстановленная реакция. На этом механизме основано стойкое поддержание аддиктивного (зависимого) поведения, когда одна сигарета, одна рюмка, одна ссора усиливают никотиновую, алкогольную зависимость или снятие стресса путем провокации скандала (Прайор, 1995).

Эффективность формирования поведения путем последовательных приближений зависит не только от характера подкрепления, но и от других условий. Одним из них является необходимость поэтапного приближения к окончательному поведению. Таким образом, весь этап выработки поведения делится на определенные отрезки, в течение которых добиваются конкретного действия. Это действие должно быть таким, чтобы обучаемый человек или животное могли реально выполнить это задание и, следовательно, получить подкрепление. Например, желая выработать у ребенка умение красиво писать или качественно делать любую другую работу, родитель не может требовать сразу же очень хорошего ее выполнения. Сначала ребенка хвалят за то, что он просто написал палочки, затем - за то, что некоторые из них написаны ровно, затем - что большая часть написана ровно и т.д. ^Требование сразу же выполнить работу качественно может привести к тому, ito у ребенка вовсе отпадет желание ее выполнять. Точно так же, желая поменять поведение супруга, второй член семьи может постепенно наращивать свои требования, а не ставить ультиматум. Невыполнение этого условия часто является причиной неудач воспитания детей и попыток супругов

переделать друг друга.

Другим условием формирования поведения путем последовательных приближений является то, что вырабатывать его можно только по одному, а не нескольким критериям одновременно. Например, при обучении ребенка качественно читать, нельзя сразу же требовать понимания прочитанного и быстрого чтения; от жены нельзя одномоментно требовать готовить обед и готовить его вкусно. Сначала, например, можно выработать желание готовить обед, а затем вырабатывать навык готовить вкусно.

Прежде чем увеличить или повышать критерий, нужно пользоваться подкреплением текущего уровня, то есть подкреплять любые исполнения данного действия. Вводя новый критерий, лучше временно ослабить предыдущие. Например, желая научить ребенка читать быстро, на первом этапе можно пожертвовать качеством чтения и при наборе им определенной скорости начать вновь следить и за качеством понимания текста.

Еще одним условием является то, что заканчивать ежедневный курс обучения следует всегда на фоне поощрения. Если это условие нарушено и pej

бенку сегодня предъявляется требование, за которое он не получает поощрения (в виде похвалы или поглаживания), то он будет воспринимать это как наказание. Часто именно из-за этого дети, учащиеся хорошо и не получающие никакой оценки от своих родителей, начинают учиться плохо, поскольку только в этом случае взрослые начинают интересоваться успехами ребенка (Прайор, 1995).

Отрицательным подкреплением является избегание негативной реакции. Например, подпрыгивая, крыса могла бы избежать удара электрическим током, который подавался на пол клетки и сопровождался легким потрескиванием. Это потрескивание и служило сигналом животного к прыжку. Более точным было бы говорить в данном случае не об отрицательном, а об аверсивном подкреплении, поскольку оно позволяет избежать неприятного воздействия стимула. Примером отрицательного подкрепления является ситуация, когда ребенок выполняет некоторую работу не для того, чтобы получить что-то приятное, а для того, чтобы избежать неприятных для него нареканий со стороны родителей. Негативное подкрепление отличается от наказания, поскольку наказание ведет к исчезновению реакции, тогда как негативное подкрепление ведет к формированию реакции избегания.

Разрабатывая представления об оперантном обучении, Б.Ф. Скиннер пришел к выводу, что общество в процессе воспитания подрастающего поколения должно больше заботится не о подавлении социально неадекватного поведения (наказание), а о выработке социально одобряемого поведения у будущих граждан.

В настоящее время показано, что существует механизм, контролирующий

процесс подкрепления. Этот механизм подробно будет описан позднее.

(operant conditioning) Термин О. о. применительно к научению используется в двух значениях. В более узком смысле с ним связывается набор процедур, использующихся при изучении процессов инструментального обусловливания. В более широком и более фундаментальном смысле термином О. о. обозначается общий теорет. подход, к-рый использует эти процедуры и связанные с ними понятия для анализа всего спектра поведения животных и чел. Оперантные процедуры Отличительные особенности процедур О. о. можно проиллюстрировать на следующем примере. Крысу помещают в тускло освещенную небольшую клетку, находящуюся в поглощающей звуки и изолированной от внешних источников света комнате. Из одной стены этой совершенно пустой клетки выступает небольшой рычаг, и когда крыса нажимает этот рычаг, в находящуюся рядом с ним чашку падает небольшой шарик пищи. Такое устройство часто называют ящиком Скиннера по имени психолога Б. Ф. Скиннера, к-рый его впервые сконструировал. Этот пример иллюстрирует одну отличительную особенность, к-рая позволяет наиболее четко отделить оперантные процедуры от др. процедур инструментального обусловливания. Интересующее нас поведение может многократно воспроизводиться обучающимся субъектом. В отличие от процедур, связанных с дискретными попытками, таких, как научение в лабиринте, в к-ром поведение состоит из серии отдельных эпизодов, реагирование в оперантных процедурах не прерывается извне и является свободным. В связи с возможностью повторного реагирования следует отметить две вытекающие отсюда особенности процедур О. о. Во-первых, реагирование измеряется скоростью появления реакции или ее частотой. Частота реагирования рассматривается в качестве аппроксимации осн. показателя силы реакции - ее вероятности. Наклон кривой, вычерчиваемой по совокупным данным наблюдений, служит прямой мерой частоты реагирования в каждый данный момент времени. Во-вторых, предоставление возможности повторного реагирования позволяет манипулировать взаимосвязями между различными качественными характеристиками реакции (напр., количеством ее повторений или длительностью) и критическим событием, поддерживающим эту реакцию (напр., появлением пищи). Правило, к-рое описывает характеристики реакции, необходимые для возникновения критического события, называется режимом подкрепления. Различные режимы подкрепления вызывают различные паттерны реагирования. Высокая частота реагирования и сложность мн. режимов подкрепления при проведении экспериментов по О. о. требуют обычно использования автоматического оборудования, включая компьютеры. Оперантная теория В более широком значении О. о. является одним из подразделов биологии, занимающимся идентификацией средовых детерминант поведения при помощи методов эксперим. анализа. Предполагается, что поведение животных и чел. имеет свои первопричины в окружающей среде. Родовая среда обитания индивида (особи) воздействует на его (ее) поведение через посредство генетических механизмов, действие к-рых суммируется принципом естественного отбора. Этими предшествующими формами поведения занимается эволюционная биология. Прошлое и настоящее окружения индивида (особи) воздействуют на его (ее) поведение через посредство нейрохимических механизмов (до сих пор практически неизученных), действие к-рых суммируется принципом подкрепления. Анализом этих воздействий индивидуальной среды на поведение как раз и занимается О. о. И принцип естественного отбора, и принцип подкрепления предполагают, что будущее поведение м. б. понято путем изучения последствий прошлого поведения. В случае естественного отбора отбираются те формы поведения (и структуры), к-рые повышают репродуктивную способность. В случае подкрепления усиливаются те формы поведения, за к-рыми наступают критические события и для к-рых был изобретен специальный термин - подкрепления. Когда средовые детерминанты идентифицированы и описаны их функциональные связи с поведением, в окружение могут вводиться изменения, к-рые могут влиять на направление изменений текущего поведения, подобно тому как генная инженерия может влиять на ход эволюции. Из базового допущения о том, что поведение всех организмов, включая людей, в конечном счете формируется средой, вытекает ряд методологических следствий. Во-первых, так как люди и животные на протяжении своей эволюции сталкивались с родовой (видовой) средой обитания, к-рая "отбирала" их за способность к модификации поведения в пределах отпущенного им жизненного цикла (т. е. за способность к научению), общая функциональная формулировка принципа подкрепления, по-видимому, выводится из изучения любого широко представленного биолог. вида. Во-вторых, поскольку изменение в поведении возникает в рез-те контакта организма со своей средой и поскольку родовая (видовая) и индивидуальная среды могут варьировать от одного организма к др. даже при максимально контролируемых условиях, процесс изменения должен изучаться на одном организме. Выводы, осн. на усредненных групп. рез-тах, могут заслонять и искажать поведенческие процессы, протекающие у отдельного индивида (особи). В-третьих, с учетом того, что рано или поздно будет получено нейрохимическое описание механизмов, лежащих в основе изменений поведения, и в надежде на свою способность воспользоваться этим знанием, О. о. стремится к анализу поведения как продукта одних только предшествующих воздействий среды, без обращения к постулированным на основе логического вывода процессам или структурам. Считается, что теорет. конструкты этого типа отвлекают от задачи эксперим. анализа и квалифицируются как объяснения по форме, но не по существу, поскольку они часто приводят к ошибкам гипостазирования (приписывания отвлеченным сущностям самостоятельного существования) и логической замкнутости. О. о. пытается разложить взаимодействие между организмом и его средой на последовательность или ситуацию из трех элементов. Рез-том успешного эксперим. анализа является идентификация, с одной стороны, средовых событий (сигнальных, или различительных стимулов), обусловливающих возникновение данного поведения (операнта), и, с др. стороны, средовых событий (подкрепляющих стимулов, или подкреплений), необходимых для приобретения и сохранения этого поведения. Поведение, к-рое требуется для появления подкрепления, называют оперантом, подчеркивая то обстоятельство, что оно действует на складывающуюся в дальнейшем среду, чтобы вызвать определенные последствия. Наконец, изменения в средовом контроле поведения, возникающие в рез-те О. о., не обязательно ограничиваются характеристиками конкретного стимула и реакции, выявленными в ходе первоначального эксперим. анализа. Как рез-тат О. о., эти изменения чаще всего затрагивают класс стимулов, к-рые контролируют класс реакций. См. также Модификация поведения, Оперантное поведение, Режимы подкрепления Дж. У. Донахью

Определения, значения слова в других словарях:

Психотерапевтическая энциклопедия

Теория инструментального, или О. о. связана с именами Торндайка (Thorndike E. L.) и Скиннера (Skinner В. F.). В отличие от принципа классического обусловливания (S->R), они разработали принцип О. о. (R->S), согласно которому поведение контролируется его результатами и...

Оперантное обусловливание . В цирке дрессировщики побуждают зверей совершить какое-то действие, а затем хвалят их и дают маленький кусочек пищи. После того как животное научилось делать это новое действие, его побуждают к совершению следующего действия. Если действие не то, которое нужно дрессировщику, то он не дает животному кусочка пищи, т. е. не поощряет его. Животное начинает совершать разные попытки и в итоге реализует нужное действие.

· Оперантное обусловливание -научение, в ходе которого приобретение нового опыта и реализация его в поведении приводят к достижению определенной цели.

Если мы понаблюдаем за поведением собственной собаки, когда она во дворе играет с мячом, то мы заметим, что она может его кусать, прижимать к земле и отпускать или подкидывать его. В естественных условиях обитания организмы не только отвечают на стимулы, но и воздействуют на среду. Но как только организм совершил новое действие, дальнейшее появление этого действия в поведенческом репертуаре будет зависеть от того, каков был его результат. Так, собака чаще будет подбрасывать мяч, если мы будем поощрять это действие поглаживанием или кусочком лакомой пищи.

Оперантное обусловливание (от лат. о peratic - действие) означает такое научение, в ходе которого приобретение определенного нового опыта и реализация его поведении приводят к достижению определенной цели. Оно позволяет нам воздействовать на среду и присуще не только людям, но и более простым существам, так как паук или таракан. Сам термин был введен Б. Ф. Скиннером, хотя процедуру o п e рантного обусловливания использовали веками для дрессировки животных. У Скиннера также был предшественник, который вплотную приблизился к описанию этой формы научения.

На рубеже XIX и XX вв. американский исследователь Э. Торндайк пытался выяснить, существует ли у животных разум, или интеллект. Для этого он построил «проблемный ящик» (рис. 6-2), в который помещал голодных котов. Вне клетки находилась пища, как правило, рыба. Животное могло открыть дверку ящика только в том случае, если оно нажало на педаль внутри ящика или потянуло за рычаг. Но коты вначале пытались достать приманку, просовывая лапы сквозь решетку клетки. После серии неудач они обычно обследовали все внутри, производили разнообразные действия. В конце концов животное наступало на рычаг, и дверка открывалась. В результате многочисленных повторных процедур животные постепенно переставали совершать лишние действия и сразу нажимали на педаль.

Торндайк назвал это научением путем проб и ошибок, поскольку перед тем как животное научается совершать нужный акт, оно реализует множество ошибочных. Такое научение можно представить графически. На рис. 6-3 изображен график, или кривая научения, где по линии абсцисс отложено количество процедур, а по линии ординат - время, за которое животное открывает дверку. Но нему можно увидеть, что чем больше раз животное попадало в проблемный ящик, тем быстрее оно оттуда выходило или, другими словами, тем меньше совершалось ошибок перед реализацией нужного действия.

Важно остановиться на одном моменте, который был отмечен американским исследователем и возведен в ранг закона. Он обнаружил, что те действия, которые поощряются, т. е. подкрепляются, с большей вероятностью возникали в последующих пробах, а те, которые не подкреплялись, не использовались животным в последующих пробах. Другими словами, животное научалось совершать только те действия, за которыми следовало подкрепление - это и есть закон эффекта.

Каковы же были выводы Торндайка по поводу разумного поведения животных? Исследователь отрицал наличие у них каких-либо признаков интеллекта, так как научение происходит путем «слепых» проб и ошибок, а механизм научения заключается в установлении связей между стимулами и реакциями. Не вдаваясь в теоретические подробности, отметим только, что уже упоминавшееся направление - бихевиоризм - стало формироваться после публикации работ Торндайка.

Самый радикальный представитель бихевиоризма, Б. Ф. Скиннер, полагал, что оперантное поведение спонтанно и возникает без каких-либо очевидных стимулов, а реактивное поведение является следствием какого-то стимула. Оперантное поведение можно модифицировать путем подкрепления. По сути, поведение можно контролировать и им можно управлять, создав соответствующий порядок подкрепления. Скиннер много экспериментировал, в основном с крысами и голубями, и утверждал, что закономерности научения одинаковы как для животных, так и для человека.

Разберем типичный эксперимент Скиннера. Голодного голубя сажают в так называемый «ящик Скиннера» (рис. 6-4). Внутри ящика нет ничего, кроме кнопки и находящейся под ней кормушки. Голодная птица, попав в клетку, начинает все обследовать, рассматривать и в результате ударяет клювом по кнопке. Опять повторяется поиск: голубь клюет пол или кормушку, в итоге опять клюет кнопку. Так животное в течение некоторого времени несколько раз клюет кнопку. Количество клеваний по кнопке, скажем, за полчаса, условно принимают за исходный оперантный уровень. Далее включают кормушку, и теперь голубь после каждого удара по кнопке получает зернышко. Через некоторое время птица научается клевать кнопку, так как это действие подкрепляется. Чем больше она клюет кнопку, тем больше она получает пищи. Если голубь будет клевать кнопку с высокой частотой, то это действие характеризуется высоким оперант ным уровнем, если будет клевать ее редко, то действие будет иметь низкий оперантный уровень.

Оперантный уровень, таким образом, показывает уровень обученности подкрепляемому акту. Но что будет, если перестать подавать подкрепление? Как и в классическом обуславливании, произойдет угасание оперантного поведения. Приведем пример. Маленький мальчик проявлял истерические формы поведения, если родители не уделяли ему нужного внимания, особенно перед сном. Так как родителей такое поведение сильно тревожило, они все время успокаивали его и этим подкрепляли дальнейшее появление истерики. Им посоветовали перестать обращать внимание на ребенка, как бы сильно ни плакал. Отмена подкрепления в форме внимания должна была привести к угнетению, т. е. к исчезновению всех истерических проявлений, что и произошло. Плач мальчика исчез уже через одну неделю.

Процедуру оперантного обусловливания применяют для научения животных сложным формам поведения, которые не возникли бы в естественных условиях. Например, медведя можно научить водить мопед, а дельфина - прыгать через горящий круг. Поведение такой сложности можно выработать у животных, применяя процедуру формирования поведения. Для примера приведем ситуацию научения кролика потягиванию кольца.

В небольшой клетке в одном углу находится автоматическая кормушка, напротив, в другом углу, - кольцо. Голодный кролик, попав в клетку, в первые минуты все обнюхивает, становится на задние лапы и выглядывает из клетки. Экспериментатор начинает подавать кормушку с пищей. Кормушка работает с шумом, поэтому животное не сразу залезает в нее. После того как кролик привык к шуму, он уже связывает его с появлением пищи и смело залезает в кормушку за ней. Через некоторое время перестают подавать пищу, после чего кролик вновь начинает осуществлять поисковое поведение. Когда животное поворачивает в сторону кольца, снова подают кормушку с пищей. После множества реализаций поворота кролику начинают давать пищу только в том случае, если он подходит к кольцу. Когда подход к кольцу сформирован, опять перестают подавать пищу. Животное начинает поисковое поведение, повторяет все формы выученных ранее актов, начинает грызть кольцо и тянет его. Срабатывает кормушка. Через некоторое время животное уже научается потягиванию за кольцо.

В оперантном научении особую роль занимает подкрепление. Подкреплением называется любой предмет или событие, которое значимо для организма и ради достижения которого им совершается поведение. Выделяют положительное подкрепление и отрицательное подкрепление. В качестве положительного подкрепления всегда выступают биологически необходимые для организма объекты, например пища, вода, половой партнер и т. д. У людей к биологически необходимым объектам добавляются продукты культуры или культурные ценности. Отрицательное подкрепление опасно для жизни, поэтому организм пытается избежать его или предотвратить его действие. В качестве отрицательного подкрепления исследователи часто используют электрический ток или громкий звук, а процедуру научения в таких случаях принято называть аверзивным обусловливанием (от англ. aversive - отвращающий).

· Подкрепление - предмет или событие, которое значимо для организма.

Теперь нам становится понятно, почему Скиннер полагал, что поведением можно манипулировать через подкрепление. Но на самом деле все оказалось гораздо сложнее. Мак-Фарленд сообщает, что некоторые исследователи пытались научить цыплят стоять спокойно на ровной площадке, чтобы получить вознаграждение, но те все время скребли пол. Другие пытались научить свинью вкладывать в копилку особую монету. Но свинья ни за какое подкрепление не хотела научиться этому, она многократно роняла на пол монету и поднимала опять. Проводили также исследования с голубями, в ходе которых их обучали клевать кнопку либо взмахивать крыльями. Оказалось, что птицы быстрее научались клевать кнопку, если в качестве подкрепления выступала пища (положительное подкрепление), а взмахивать крыльями - если этим поведением они избегали удара электрического тока (негативное подкрепление). С точки зрения Скиннера, голуби должны были научиться клевать кнопку или встряхивать крыльями независимо от рода подкрепления.

Такой парадокс объяснили этологи - исследователи поведения животных в естественных условиях. У голубей акт клевания является частью пищевого поведения, поэтому голубь быстрее научается клевать кнопку, если за этим следует подкрепление в виде пищи. А взмахивание крыльями является частью избегательного поведения, так как птицы совершают этот акт перед тем как взлететь. Ограничения такого рода показывают, что научение связано с имеющимся опытом животного, а также с врожденными формами поведения.

Психотерапия. Учебное пособие Коллектив авторов

Инструментальное, или оперантное, обусловливание

Не все виды научения можно объяснить классическим обусловливанием. При классическом обусловливании условный и безусловный стимулы предшествуют условной реакции. Но условные связи могут также возникать между реакциями и стимулами, которые следуют за ними, другими словами, между поведением и его последствиями. Например, собака научается «служить», чтобы получить угощение; ребенок научается говорить «пожалуйста», чтобы получить конфетку. Эти реакции являются инструментами для получения какой-то награды. Инструментальное обусловливание – это процедура научения, при которой реакции приводят к награждению или желаемому эффекту.

Принципы инструментального научения открыл американский психолог Э. Трондайк примерно в то время, когда И. П. Павлов проводил эксперименты в России. Животное, обычно голодная кошка, помещалась в специальную клетку, названную «загадкой», и должна была научиться какой-то реакции – например, наступить на маленький рычаг, для того чтобы открыть дверь и выйти наружу. Когда кошке это удавалось, она награждалась пищей и вновь возвращалась в ящик. После нескольких проб кошка спокойно подходила к рычагу, нажимала на него лапой, выходила через открытую дверь и ела.

Формирование реакции происходило путем проб и ошибок, как результат выбора нужного эталона поведения и последующего его закрепления. Научение, согласно Трондайку, управляется законом эффекта. Согласно этому закону, поведение контролируется его результатами и последствиями. Поведение, которое приводит к достижению положительного результата, удовлетворению, закрепляется, и наоборот: не приводящее к положительному результату стирается или ослабляется.

Спустя несколько десятилетий после опубликований работ Трондайка, другой американский психолог, Б. Скиннер, развил его идеи. Б. Скиннер подчеркивал, что при инструментальном обусловливании животное оперирует со средой, производит какое-нибудь движение, воздействует на среду. Поэтому процесс научения этим реакциям он назвал оперантным обусловливанием.

Для изучения оперантного обусловливания Б. Скиннер изобрел экспериментальную камеру, получившую название «скиннеровского ящика». Камера полностью контролируется. Она звуко– и светонепроницаема, в ней поддерживается постоянная температура. Она содержит приспособление, которым животное может оперировать, чтобы получить вознаграждение. Например, крыса, нажимая на рычаг, получает пищу из тонкой трубочки. Скиннеровский ящик позволил изучать отношения между реакцией и ее последствиями и анализировать, как эти последствия влияют на поведение.

Оперантное обусловливание подчеркивает, что поведение есть функция его последствий. Поведение усиливается позитивным или негативным подкреплением; оно ослабляется наказанием.

Позитивное подкрепление – это предъявление стимулов, которые усиливают реакцию. Иными словами, это – награждение. Примером может служить учитель, который хвалит ребенка за прилежную учебу.

Негативное подкрепление – это процесс усиления поведения путем изъятия, удаления негативных стимулов, таких, как боль, скука, избыток тепла или холода и т. п. Примером может служить прием таблетки анальгина при головной боли. Другой пример: пациент, испытывающий страх в метро, может избежать этого переживания, оставшись дома.

Наказание . И позитивное, и негативное подкрепление усиливает частоту реакции. Наказание уменьшает частоту реакции. Часто путают наказание и негативное подкрепление, они совершенно различны. Подкрепление усиливает поведение, а наказание ослабляет его. Если ток выключается, когда крыса нажимает на рычаг, – это негативное подкрепление; оно увеличивает вероятность того, что крыса нажмет на педаль, когда ток снова включат. Но если ток включается, когда крыса нажимает на рычаг, то это наказание; менее вероятно, что крыса снова нажмет на рычаг.

Дискриминационное научение имеет место тогда, когда реакция награждается (или наказывается) в одной ситуации, но не награждается (не наказывается) в другой. В таком случае говорят, что реакция (поведение) находится под «контролем стимула». Этот процесс особенно важен в объяснении гибкости поведения в различных социальных ситуациях. Дискриминация (различение) стимулов позволяет научиться тому, что является подходящим (подкрепляемым) и неподходящим (неподкрепляемым) в данной ситуации. Например, ворчливая жена вряд ли будет бранить мужа в присутствии гостей.

Генерализация состоит в том, что поведение обнаруживается в иных ситуациях, а не только в тех, в которых оно было приобретено. Например, терапевт может помочь пациенту стать более уверенным и экспрессивным во время терапии. Но цель терапии в том, чтобы пациент стал более уверенным в реальных жизненных ситуациях, другими словами, очень важно, чтобы произошла генерализация.

При сравнении классических и оперантных условных рефлексов видно, что, во-первых, классическое обусловливание требует повторного парного предъявления нейтрального стимула (звонок) и стимула, вызывающего врожденную, безусловную реакцию (пища). Обеспечение такого предъявления достигается участием экспериментатора. В экспериментах же с оперантным обусловливанием животное само осуществляет перебор стереотипов поведения, и выбор стереотипа, приводящего к достижению результата, протекает активнее. Во-вторых, оперантные рефлексы контролируются их результатом; в экспериментах же с классическим обусловливанием появление условной реакции контролируется предъявлением предшествующего стимула. В реальной жизни большая часть обучения осуществляется по законам формирования оперантных условных рефлексов.

Из книги Пробуждение: преодоление препятствий к реализации возможностей человека автора Тарт Чарльз

8. ОБУСЛОВЛИВАНИЕ Одним из наиболее фундаментальных психологических процессов является обусловливание. Хотя мы обычно считаем, что обусловливание свойственно только низшим организмам, оно очень распространено в нашей повседневной жизни, даже если оно и не

Из книги Теории личности автора Хьелл Ларри

КЛАССИЧЕСКОЕ ОБУСЛОВЛИВАНИЕ Психологи различают две формы обусловливания в зависимости от того, какой из процессов обусловливания при этом задействован.Классическое, или павловское, обусловливание было впервые продемонстрировано Иваном Павловым в 1927 году. Когда

Из книги Психология развития [Методы исследования] автора Миллер Скотт

ЧЕЛОВЕЧЕСКОЕ ОБУСЛОВЛИВАНИЕ Но какое же отношение обусловливание имеет к человеческим существам? К вашей жизни?Я однажды попытался объяснить большую важность обусловливания в человеческом развитии моим слушателям в одной из программ «Тренинга повышения осознавания».

Из книги Социальное влияние автора Зимбардо Филип Джордж

Респондентное и оперантное поведение При рассмотрении скиннеровского подхода к личности следует различать две разновидности поведения: респондентное и оперантное. Чтобы лучше понять принципы скиннеровского оперантного научения, мы сначала обсудим респондентное

Из книги Психология автора Робинсон Дейв

Из книги 40 исследований, которые потрясли психологию автора Хок Роджер Р.

Инструментальное научение и подкрепление Когда наше поведение является инструментом изменения элементов внешнего окружения, мы обнаруживаем взаимосвязь между специфической реакцией и ее последствиями. В процессе инструментального (иначе оперантного) научения именно

Из книги Мне очень нравится курить… но я бросаю! автора Иопп Андреас

Из книги Без революций. Работаем над собой, оставаясь в гармонии автора Стивенс Майкл

ГЛАВА 3. НАУЧЕНИЕ И ОБУСЛОВЛИВАНИЕ В той области психологии, которая занимается научением и обусловливанием, проведено множество исследований с целью выяснить, как обучаются животные и люди. Ряд выдающихся психологов, имена которых широко известны за пределами наук о

Из книги Психология. Люди, концепции, эксперименты автора Клейнман Пол

Обусловливание – психическая зависимость Никотин делает нас зависимыми не только физически, перестраивая систему нейромедиаторов в мозге, он заботится и о том, чтобы у нас вырабатывалась условная реакция на многие ситуации. Под влиянием никотина мы «учимся» прочно

Из книги Психотерапия. Учебное пособие автора Коллектив авторов

Обусловливание религиозных взглядов на смерть Если мы хотим понять, почему имеем то восприятие смерти, которое имеем, и приспособить его так, чтобы оно служило нашей цели, следует избавиться от эго-я, которое такое восприятие определяет. Мы уже выяснили, как агрессивные

Из книги автора

Оперантное обусловливание и «Ящик Скиннера» Самым важным итогом научной деятельности Фредерика Скиннера стала концепция оперантного обусловливания (научения), которая заключается в том, что научение какой-либо форме поведения происходит либо методом вознаграждения,

Из книги автора

Классическое обусловливание Основы классического обусловливания были созданы в начале XX в. И. П. Павловым. В опытах И. П. Павлова условный стимул (звонок) сочетается с безусловным стимулом (кормление собаки), между ними устанавливается связь таким образом, что прежде