Добавлен: 22.05.2023
Просмотров: 287
Скачиваний: 4
Существуют два подхода к созданию искусственных нейронных сетей. Информационный подход: безразлично, какие механизмы лежат в основе работы искусственных нейронных сетей, важно лишь, чтобы при решении задач информационные процессы в НС были подобны биологическим. Биологический: при моделировании важно полное биоподобие, и необходимо детально изучать работу биологического нейрона. [10]
Алгоритмы обучения, как и вообще искусственные нейронные сети, могут быть представлены как в дифференциальной, так и в конечно-разностной форме. При использовании дифференциальных уравнений предполагают, что процессы непрерывны и осуществляются подобно большой аналоговой сети. Активационный уровень биологического нейрона определяется средней скоростью, с которой он посылает дискретные потенциальные импульсы по своему аксону. Средняя скорость обычно рассматривается как аналоговая величина, но важно не забывать о действительном положении вещей.
Если информация может обрабатываться искусственной нейросетью, то она должна храниться в весовых коэффициентах связей Wjj. Теорема Розенблата отвечает на этот вопрос положительно. В своей работе Розенблат указал также и приближенную процедуру обучения с учителем, которая шаг за шагом подстраивает синаптическую карту весов по ошибкам, измеряемым на выходе нейронной сети. Веса Wjj принято называть синаптическими, так как они имитируют силу синаптической связи между биологическими нейронами. [12]
Сеть ИНС представляет собой совокупность простых вычислительных элементов - искусственных нейронов, каждый из которых обладает определенным количеством входов (дендритов) и единственным выходом (аксоном), разветвления которого подходят к синапсам, связывающим его с другими нейронами. На входы нейрона поступает информация извне или от других нейронов. Нейроны в сети могут иметь одинаковые или разные функции возбуждения. Сигналы, поступающие на вход нейрона, неравнозначны в том смысле, что информация из одного источника может быть более важной, чем из другого. Приоритеты входов задаются с помощью вектора весовых коэффициентов, моделирующих синаптическую силу биологических нейронов. [17]
Искусственный нейрон имитирует в первом приближении свойства биологического нейрона. На вход искусственного нейрона поступает некоторое множество сигналов, каждый из которых является выходом другого нейрона. Каждый вход умножается на соответствующий вес, аналогичный синаптической силе, и все произведения суммируются, определяя уровень активации нейрона. Хотя сетевые парадигмы весьма разнообразны, в основе почти всех их лежит эта конфигурация. Эти входные сигналы, в совокупности обозначаемые вектором X, соответствуют сигналам, приходящим в синапсы биологического нейрона. Каждый вес соответствует силе одной биологической синаптической связи. [11]
Как мы видим у мозга и искусственных нейронных сетей очень много общего. А нейроны вообще состоят из одних и тех же элементов. В дальнейших главах мы более подробно познакомимся с нейронами и их устройством, а также с их обучением.
Глава 3 Понятие искусственного нейрона
Что же такое искусственный нейрон?
Рис.1
Искусственный нейрон— элемент искусственных нейронных сетей, моделирующий некоторые функции биологического нейрона. [18]
Искусственный нейрон имитирует в первом приближении свойства биологического нейрона. На вход искусственного нейрона поступает некоторое множество сигналов, каждый из которых является выходом другого нейрона. Каждый вход умножается на соответствующий вес, аналогичный синаптической силе, и все произведения суммируются, определяя уровень активации нейрона.[11]
Главная функция искусственного нейрона — формировать выходной сигнал в зависимости от сигналов, поступающих на его входы.[20]
В самой распространенной конфигурации входные сигналы обрабатываются адаптивным сумматором, который выполняет сложение сигналов, поступающих по синаптическим связям от других нейронов и внешних входных сигналов. Затем выходной сигнал сумматора поступает в нелинейный преобразователь для вычисления состояния нейрона, где преобразуется функцией активации, и результат подается на выход (в точку ветвления). [19]
Нейрон характеризуется текущим состоянием и обладает группой синапсов — однонаправленных входных связей, соединенных с выходами других нейронов. Общий вид искусственного нейрона приведен на рис.1.[18]
Нейрон имеет аксон — выходную связь данного нейрона, с которой сигнал поступает на синапсы следующих нейронов. Каждый синапс характеризуется величиной синаптической связи или ее весом wi. Текущее состояние нейрона определяется как взвешенная сумма его входов S, формула вычисления которой представлена на схеме.
Выход нейрона есть функция его состояния: y = f(s).
Активационная (характеристическая) функция — это нелинейная функция, вычисляющая выходной сигнал формального нейрона. На практике при разработке НС часто используют жесткую пороговую, линейную или сигмоидальную функцию. Выбор функции определяется спецификой поставленной задачи, либо ограничениями, накладываемыми некоторыми алгоритмами обучения. [14]
Глава 4 Виды искусственных нейронных сетей
Существует 4 вида нейронных сетей:
- Сети прямого распространения;
- Реккурентные нейронные сети;
- Сеть радиально- базисных функции;
- Самоорганизующиеся карты (сети Кохонена).
Начнем по порядку и разберем каждую из них по подробнее.
Сети прямого распространения – все связи направлены строго от входных нейронов к выходным. К таким сетям относятся: персептрон (разработанный Розенблаттом) и многослойный персептрон. [2]
Розенблатт сформулировал две теоремы, которые положены в основу самоорганизации системы. Первая утверждает, что функция памяти человека распределена случайно между бесконечным числом одинаковых ассоциирующих ячеек. Вторая теорема утверждает, что понимание окружающей обстановки любым мыслящим индивидуумом достигается путем обучения и накопления опыта. [22] В связи с этим не требуется никакой первоначальной информации для самоорганизации. Самоорганизация нейронных соединений осуществляется путем разрушения неустойчивых структур и закрепления устойчивых. Перцептрон состоит из некоторого достаточно большого числа непрерывных нейронов, называемых ассоциативными ячейками и некоторого числа распознающих ячеек, равного числу образов, которые должен распознать перцептрон. Каждая распознающая ячейка имеет два выходных канала: первый выходной канал выдает 1, если образ опознан правильно, и 0, если образ не соответствует истинному; второй канал выдает сигналы противоположные сигналам первого канала. [21]
Многослойный перцептрон представляет собой классический пример однонаправленной нейронной сети, т.е. нейронной сети, в которой отсутствуют как обратные воздействия сигналов выходных нейронов на вход сети, так и соединения между нейронами одного и того же слоя. [2] Архитектура многослойного перцептрона демонстрируется здесь на примере трехслойного перцептрона содержащего лишь один ассоциативный (скрытый) слой, образованный четырьмя нейронами связывающий входные и выходные слои сети. Использование скрытого слоя в архитектуре многослойного перцептрона диктуется соображениями достижения более адекватного соответствия множества входных сигналов набору выходных параметров сети. Увеличение количества скрытых слоев позволяет выделять статистические закономерности высших порядков, что является важным обстоятельством в случае многомерного входного сигнала. Число нейронов входного слоя и выходного слоя в многослойном перцептроне соответствует размерностям входного и выходного векторов соответственно. Количество нейронов в скрытых слоях определяется опытным путем и является результатом многократного экспериментирования с сетью. Связи нейронов входного слоя с нейронами первого последующего за ним скрытого слоя являются в общем случае выборочными (не все выходы могут иметь синаптические соединения со входами). Веса синаптических связей могут быть при этом постоянными и оставаться неизменными во время обучения. [10] Напротив, синаптические связи между нейронами ассоциативного и выходного слоев, как и между нейронами двух соседних скрытых слоев, являются всеобъемлющими, т. е. выход каждого нейрона предыдущего слоя соединен с соответствующим входом каждого нейрона последующего слоя, а значения весов подстраиваются на обучающей стадии. [3]
Рекуррентные сети являются развитием модели Хопфилда на основе применения новых алгоритмов обучения, исключающих попадание системы в локальные минимумы на поверхности энергетических состояний. Важной особенностью рекуррентных сетей является их способность предсказывать существование новых классов объектов. [17]
По архитектуре связей искусственные нейронные сети могут быть разделены на два основных класса сети прямого действия, в которых графы не имеют петель, и рекуррентные сети (сети с обратными связями). [23]
Итак, мы установили, что преобразование информации рекуррентными нейронными сетями позволяет уменьшить энергию, может приводить к появлению в их пространстве состояний притяжения, далеких по форме от образов внешнего для сети окружения. В отличие от кластеризации, осуществляемой сетями без обратных связей, появляется возможность использовать рекуррентные сети для активной кластеризации, при которой сеть творчески относится к входным векторам, осуществляя нетривиальные обобщения поступающих на ее вход сигналов. [24]
Для управляемых сетей можно выбрать прямую или рекуррентную архитектуру, используя множество обучающих правил и методов проектирования, таких как персептрон, обратное распространение, обратное распространение Левенберга, сети с радиальным базисом и рекуррентные сети. [25]
Особое семейство нейронных сетей образуют сети с радиальной базисной функцией (РБФ-сети), в которых скрытые нейроны реализуют функции, радиально изменяющиеся вокруг выбранного центра с и принимающие ненулевые значения только в окрестности этого центра. Структура радиально-базисной нейронной сети приведена на Рис.2
Рис.2 Структура радиально-базисной нейронной сети
(где xi – входы сети, y – выход сети,
- функция активации,
- веса),а функция преобразования нейронной сети выглядит так
где сi – центры в функции Гаусса, xp – элементы обучающей выборки от 1 до р
В таких сетях роль скрытого нейрона заключается в отображении радиального пространства вокруг одиночной заданной точки, либо вокруг группы таких точек, образующих кластер. Положение сигналов, поступающих от всех скрытых нейронов, которое выполняется выходным нейроном, позволяет получить отображение всего многомерного пространства. [23]
Сети радиального типа представляют собой естественное дополнение сигмоидальных сетей. Структура обычной радиальной сети включает входной слой, на который подаются сигналы, описываемые входным вектором x, скрытый слой с нейронами радиального типа и выходной слой, состоящий из одного или нескольких линейных нейронов. Функция выходного нейрона сводится к рассчитанному суммированию сигналов, порожденных скрытыми нейронами. Использование в разложении p базовых функций, где p – это количество обучающих выборок, недопустимо с практической точки зрения, поскольку количество этих выборок может быть велико, и в результате вычислительная сложность обучающего алгоритма может стать чрезмерной. Поэтому ищется оптимальное решение в пространстве меньшей размерности, которое с достаточной точностью приближает точное решение. [23]
Как правило, в качестве радиальной функции применяется функция Гаусса. При размещении ее центра в точке сi она может быть определена как
.
В этом выражении σi – параметр, от значения которого зависит ширина размаха функции. [26]
Архитектура радиальных сетей имеет структуру, аналогичную многослойной структуре сигмоидальных сетей с одним скрытым слоем. Радиальная сеть имеет фиксированную структуру с одним скрытым слоем и линейными выходными нейронами, тогда как сигмоидальная сеть может содержать различное количество слоев, а выходные нейроны бывают как линейными, так и нелинейными. Одним из простейших, хотя и не самым эффективным, способом определения параметров базисных функций считается случайный выбор. В этом случае центры сi базисных функций выбираются случайным образом на основе равномерного распределения. Такой подход допустим только, применительно к классическим радиальным сетям при условии, что равномерное распределение обучающих данных хорошо соответствует специфике задачи. [27]
Нейронные сети с радиальными базисными функциями находят применение как при решении задач классификации или аппроксимации функции многих переменных, так и при прогнозировании, то есть в тех прикладных областях, в которых сигмоидальные сети используются в течение многих лет. Они выполняют те же функции, что и сигмоидальные сети, однако реализуют иные методы обработки данных, связанные с локальными отображениями. Благодаря этой особенности обеспечивается значительное упрощение и ускорение процесса обучения. Величина влияния или протяжения радиальной базисной функции определяет ширину «колпаков» гауссовых функций с центром в каждом обучающем наблюдении. Малая величина протяжения приводит к функции с резкими пиками и малой ошибкой аппроксимации, но такая сеть не способна к обобщению и может плохо аппроксимировать наблюдения контрольного множества. Процесс обучения радиальных базисных сетей включает две стадии: процесс настройки центров базисных функций и обучение нейронов в скрытом слое, поэтому РБФ-сети обучаются достаточно быстро. [23] [27]