Файл: Направление подготовки 09. 03. 04 Программная инженерия.docx
ВУЗ: Не указан
Категория: Не указан
Дисциплина: Не указана
Добавлен: 29.10.2023
Просмотров: 756
Скачиваний: 2
ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.
Последние слои СНС, представляющие собой комбинацию персептронов, формируются ис- ходя из решаемой задачи и желаемых выходных данных сети. Рис.1.2–Выбормаксимумаизобластиразмером2×2сшагом2Несмотрянато,чтоподобныеметодычащевсегоотносяткнаправлениюкомпьютерного зрения,операциясверткиприменимаклюбымтипамданных,которыемогутбытьпредстав- лены в числовом виде, при этом сохраняя свои преимущества. Вконтекстеобработкизвукаприменима”одномерная”свертка,гдеядроскользиттолько по направлению одной оси.
разработанысетидолгойкраткосрочнойпамяти(ан- гл:Longshort-termmemory;LSTM)[26].Архитектураданнойсетиизображенанарис.1.4.В LSTM вводится ячейка C(рис. 1.5), отвечающая за хранение долгосрочной информации, и вли- яющейнаитоговыйрезультатработысети.Дляуправлениядолгосрочнойпамятьювводится три фильтра: ”фильтр забывания”, определяющий, какую информацию можно убрать из состо- яния ячейки, ”входной фильтр”, определяющий, какую информацию следует добавить в ячей- куи”выходнойфильтр”,определяющийвыходсетинабазедолгосрочнойикраткосрочной памяти - все фильтры последовательно изображены на архитектуре сети в элементе A. Рис.1.4–Cетьдолгойкраткосрочнойпамяти Тем не менее, LSTM окончательно не решает проблемы долгосрочной памяти, и имеют ана- логичную проблему ”исчезающего градиента” [27], но способны эффективно обрабатывать го- раздо более большие последовательности данных, чем классические рекуррентные нейронные сети.Рис.1.5–ЭлементAвсетидолгойкраткосрочнойпамяти
где f- частота, t- время
gˆ(f) = ∫ g(t) exp−i2πftdt(1.4)
При помощи данного преобразование мы переходим от временной шкалы к шкале частот и получаем аудиосигнал в формате зависимости коэффициента Фурье от частоты, при это мо- дуль коэффициента Фурье является амплитудой - таким образом мы получаем данные о ча- стоте и амплитуде гармонических колебаний, из которых состоит изначальный сигнал [31].
Так как мы не можем работать с непрерывными числами, нам необходимо использовать дискретное преобразование Фурье, для этого будем считать, что сигнал имеет ненулевую ин- тенсивность на конечном промежутке времени и раздели данный промежуток на Nучастков:
xˆ(k) = ∑ x(n) exp−i2πn
N−1
kN
(1.5)
где k- частота
n=0
ИзучиврезультатыприменениядискретногопреобразованияФурье(рис.1.8),можносде- латьвывод,чтомытеряеминформацию
- 1 2 3 4 5 6 7 8 9 ... 15
Рекуррентные нейронные сети
Говоря о аудиовизуальной информации, мы имеем в виду последовательность данных (изоб- ражений в контексте видео и частот в случае аудио). Для обработки последовательностей при- менимы рекуррентные нейронные сети.Рекуррентные нейронные сети (англ. Recurrent neural network; RNN) — вид нейронных се- тей, где связи между элементами образуют направленную последовательность. Благодаря это- му появляется возможность обрабатывать серии событий во времени или последовательные пространственные цепочки. В отличие от многослойных перцептронов, рекуррентные сети мо- гут использовать свою внутреннюю память для обработки последовательностей произвольной длины [25].На рис. 1.3 представлена последовательность процессов в рекуррентных нейронных сетях. Участок нейронной сети A получает некие данные xtна вход и подает на выход некоторое значениеht,приэтоминформацияпередаетсяотодногошагакдругому.Классическаяархитектура,подразумевающаяиспользованиефункцииtanhвэлементеA, применимадлямалыхпоследовательность,таккаквслучаеотносительнобольшихпоследо- вательностейданныхнеобходимохранитьдолгосрочнуюинформацию-прииспользовании Рис.1.3–Рекуррентнаянейроннаясетьклассической рекуррентной сети долгосрочная информация должна последовательно пройти черезвсеячейки,преждечемпопастьвтекущуюобрабатываемуюячейку.Этоозначает,что ее можно легко повредить, многократно умножая на малые числа близкие к 0, что является причиной исчезновения градиента.Длярешенияданнойпроблемыбылиразработанысетидолгойкраткосрочнойпамяти(ан- гл:Longshort-termmemory;LSTM)[26].Архитектураданнойсетиизображенанарис.1.4.В LSTM вводится ячейка C(рис. 1.5), отвечающая за хранение долгосрочной информации, и вли- яющейнаитоговыйрезультатработысети.Дляуправлениядолгосрочнойпамятьювводится три фильтра: ”фильтр забывания”, определяющий, какую информацию можно убрать из состо- яния ячейки, ”входной фильтр”, определяющий, какую информацию следует добавить в ячей- куи”выходнойфильтр”,определяющийвыходсетинабазедолгосрочнойикраткосрочной памяти - все фильтры последовательно изображены на архитектуре сети в элементе A. Рис.1.4–Cетьдолгойкраткосрочнойпамяти Тем не менее, LSTM окончательно не решает проблемы долгосрочной памяти, и имеют ана- логичную проблему ”исчезающего градиента” [27], но способны эффективно обрабатывать го- раздо более большие последовательности данных, чем классические рекуррентные нейронные сети.Рис.1.5–ЭлементAвсетидолгойкраткосрочнойпамяти
- 1 2 3 4 5 6 7 8 9 ... 15
Генеративно-состязательные нейронные сети
Генеративно-состязательныенейронные(англ. Generativeadversarialnetwork;GAN) сетибы- лисозданыдлярешениязадачгенерацииданныхнаподобиедругихданных(сознательноне добиваясь точного совпадения) или для генерации данных на основе данных другого типа - это может быть, например, создание изображений, содержащих определенный объект [28], или создания изображений по текстовому описанию [29], или, в нашем случае, генерация звука из видео.Идея генеративно-соcтязательных нейронных сетей заключается в использовании двух се- тей: генератора и дискриминатора [30]. Назначение дискриминатора - отличить оригинальные данныеот”подделки”,которуюсоздаетгенератор.Сетиобучаютсяодновременно-дискри- минаторстремитсяточнееотличатьоригинальныеданныеотсгенерированных,агенератор ”обмануть”дискриминатор(рис.1.6).Архитектуры генератора и дискриминатора не имеют определенных ограничений и созда- ются для решений каждой отдельно взятой задачи. Рис.1.6–АрхитектураGAN-
Методы представления аудиоинформации
зависимости интенсивности от времени, но по-
добное представление неэффективно для последующего анализа, в данном случае применимо преобразование Фурье [31].
где f- частота, t- время
gˆ(f) = ∫ g(t) exp−i2πftdt(1.4)
При помощи данного преобразование мы переходим от временной шкалы к шкале частот и получаем аудиосигнал в формате зависимости коэффициента Фурье от частоты, при это мо- дуль коэффициента Фурье является амплитудой - таким образом мы получаем данные о ча- стоте и амплитуде гармонических колебаний, из которых состоит изначальный сигнал [31].
Так как мы не можем работать с непрерывными числами, нам необходимо использовать дискретное преобразование Фурье, для этого будем считать, что сигнал имеет ненулевую ин- тенсивность на конечном промежутке времени и раздели данный промежуток на Nучастков:
xˆ(k) = ∑ x(n) exp−i2πn
N−1
kN
(1.5)
где k- частота
n=0