Файл: Направление подготовки 09. 03. 04 Программная инженерия.docx

ВУЗ: Не указан

Категория: Не указан

Дисциплина: Не указана

Добавлен: 29.10.2023

Просмотров: 756

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.
Последние слои СНС, представляющие собой комбинацию персептронов, формируются ис- ходя из решаемой задачи и желаемых выходных данных сети. Рис.1.2–Выбормаксимумаизобластиразмером2×2сшагом2Несмотрянато,чтоподобныеметодычащевсегоотносяткнаправлениюкомпьютерного зрения,операциясверткиприменимаклюбымтипамданных,которыемогутбытьпредстав- лены в числовом виде, при этом сохраняя свои преимущества. Вконтекстеобработкизвукаприменима”одномерная”свертка,гдеядроскользиттолько по направлению одной оси.
    1. 1   2   3   4   5   6   7   8   9   ...   15

Рекуррентные нейронные сети

Говоря о аудиовизуальной информации, мы имеем в виду последовательность данных (изоб- ражений в контексте видео и частот в случае аудио). Для обработки последовательностей при- менимы рекуррентные нейронные сети.Рекуррентные нейронные сети (англ. Recurrent neural network; RNN) — вид нейронных се- тей, где связи между элементами образуют направленную последовательность. Благодаря это- му появляется возможность обрабатывать серии событий во времени или последовательные пространственные цепочки. В отличие от многослойных перцептронов, рекуррентные сети мо- гут использовать свою внутреннюю память для обработки последовательностей произвольной длины [25].На рис. 1.3 представлена последовательность процессов в рекуррентных нейронных сетях. Участок нейронной сети A получает некие данные xtна вход и подает на выход некоторое значениеht,приэтоминформацияпередаетсяотодногошагакдругому.Классическаяархитектура,подразумевающаяиспользованиефункцииtanhвэлементеA, применимадлямалыхпоследовательность,таккаквслучаеотносительнобольшихпоследо- вательностейданныхнеобходимохранитьдолгосрочнуюинформацию-прииспользовании Рис.1.3–Рекуррентнаянейроннаясетьклассической рекуррентной сети долгосрочная информация должна последовательно пройти черезвсеячейки,преждечемпопастьвтекущуюобрабатываемуюячейку.Этоозначает,что ее можно легко повредить, многократно умножая на малые числа близкие к 0, что является причиной исчезновения градиента.Длярешенияданнойпроблемыбыли

разработанысетидолгойкраткосрочнойпамяти(ан- гл:Longshort-termmemory;LSTM)[26].Архитектураданнойсетиизображенанарис.1.4.В LSTM вводится ячейка C(рис. 1.5), отвечающая за хранение долгосрочной информации, и вли- яющейнаитоговыйрезультатработысети.Дляуправлениядолгосрочнойпамятьювводится три фильтра: ”фильтр забывания”, определяющий, какую информацию можно убрать из состо- яния ячейки, ”входной фильтр”, определяющий, какую информацию следует добавить в ячей- куи”выходнойфильтр”,определяющийвыходсетинабазедолгосрочнойикраткосрочной памяти - все фильтры последовательно изображены на архитектуре сети в элементе A. Рис.1.4–Cетьдолгойкраткосрочнойпамяти Тем не менее, LSTM окончательно не решает проблемы долгосрочной памяти, и имеют ана- логичную проблему ”исчезающего градиента” [27], но способны эффективно обрабатывать го- раздо более большие последовательности данных, чем классические рекуррентные нейронные сети.Рис.1.5–ЭлементAвсетидолгойкраткосрочнойпамяти
    1. 1   2   3   4   5   6   7   8   9   ...   15

Генеративно-состязательные нейронные сети

Генеративно-состязательныенейронные(англ. Generativeadversarialnetwork;GAN) сетибы- лисозданыдлярешениязадачгенерацииданныхнаподобиедругихданных(сознательноне добиваясь точного совпадения) или для генерации данных на основе данных другого типа - это может быть, например, создание изображений, содержащих определенный объект [28], или создания изображений по текстовому описанию [29], или, в нашем случае, генерация звука из видео.Идея генеративно-соcтязательных нейронных сетей заключается в использовании двух се- тей: генератора и дискриминатора [30]. Назначение дискриминатора - отличить оригинальные данныеот”подделки”,которуюсоздаетгенератор.Сетиобучаютсяодновременно-дискри- минаторстремитсяточнееотличатьоригинальныеданныеотсгенерированных,агенератор ”обмануть”дискриминатор(рис.1.6).Архитектуры генератора и дискриминатора не имеют определенных ограничений и созда- ются для решений каждой отдельно взятой задачи. Рис.1.6–АрхитектураGAN
    1. Методы представления аудиоинформации

Сточкизрениявизуальнойинформацииневозникаетпроблемприпредставлениивчис- ленном виде - каждый пиксель изображения кодируется при помощи набора чисел, определя- ющего его цвет.Но, когда мы взаимодействуем с аудиоинформацией, нам необходимо выполнить ряд пре- образований для корректного представления в численном виде.Рис.1.7–Аудиосигналввидезависимостиинтесивностиотвремени Изначальномыимеемпредставлениео

зависимости интенсивности от времени, но по-

добное представление неэффективно для последующего анализа, в данном случае применимо преобразование Фурье [31].




где f- частота, t- время

gˆ(f) = ∫ g(t) expi2πftdt(1.4)

При помощи данного преобразование мы переходим от временной шкалы к шкале частот и получаем аудиосигнал в формате зависимости коэффициента Фурье от частоты, при это мо- дуль коэффициента Фурье является амплитудой - таким образом мы получаем данные о ча- стоте и амплитуде гармонических колебаний, из которых состоит изначальный сигнал [31].

Так как мы не можем работать с непрерывными числами, нам необходимо использовать дискретное преобразование Фурье, для этого будем считать, что сигнал имеет ненулевую ин- тенсивность на конечном промежутке времени и раздели данный промежуток на Nучастков:



xˆ(k) = x(n) expi2πn
N1

kN
(1.5)


где k- частота

n=0
ИзучиврезультатыприменениядискретногопреобразованияФурье(рис.1.8),можносде- латьвывод,чтомытеряеминформацию