Файл: Направление подготовки 09. 03. 04 Программная инженерия.docx
ВУЗ: Не указан
Категория: Не указан
Дисциплина: Не указана
Добавлен: 29.10.2023
Просмотров: 755
Скачиваний: 2
- 1 ... 4 5 6 7 8 9 10 11 ... 15
Нейросетевая модель генерации аудиоинформации на основе видеоин- формации
Для реализации поставленной задачи используется архитектура генеративно-состязательный нейронных сетей, то есть основными модулями будут выступать генератор - нейронная сеть, создающая мел-спектрограммы, и дискриминатор - нейронная сеть, оценивающая подлин- ность входной спектрограммы, и возвращающая оценку от нуля до единицы.-
Тренировка и использование генератора
дискриминатора, благодаря которой будут генериро- ваться более релевантные видео спектрограммы.
generator bce = −1 log(p) (2.1)
где p - оценка дискриминатора. В нашем случае бинарная кросс-энтропия принимает та- кой вид, потому что при тренировке генератора мы в качестве метки класса всегда передаем единицу (то есть мел-спектрограмма верна).
1 ∑
n
generator mse = (mi
n
i=1
где n- количество элементов в мел-спектрограмме.
— mˆ
i)2 (2.2)
generator loss = generator bce + α∗ generator mse (2.3)
где α - коэффициент, отвечающий за влияние среднего квадратичного отклонения в ошиб- ке генератора.
Полностью процесс тренировки генератора изображен на рисунке 2.1.
Рис. 2.1 – Процесс тренировки генератора
-
Тренировка и использование дискриминатора
с оригинальным видео. Ошибка дискримина- тора (2.4) формируется путем комбинации его ошибок в случае определения оригинала и под- делки - таким образом мы стремимся ускорить тренировку дискриминатора в направлении двух решаемых им задач.
В данном случае ошибки считаются по классической формуле бинарной кросс-энтропии (2.5), где в одном случае в качестве метки выступает единица (спектрограмма подлинная) и ноль (спектрограмма поддельная).
Для создания поддельной спектрограммы мы используем наш генератор, таким образом придерживаясь оригинальной идеи генеративно-состязательных нейронных сетей о одновре- менной тренировке дискриминатора и генератора.
discriminator loss = fake bce + real bce (2.4)
bce = −y log(p) + (1 − y) log(1 − p) (2.5) где y - метка спектрограммы, p - оценка дискриминатора.
Процесс тренировки дискриминатора полностью изображен на рисунке 2.3.
Рис. 2.3 – Процесс тренировки дискриминатора
- 1 ... 5 6 7 8 9 10 11 12 ... 15
Архитектура нейросетевых моделей используемых для генерации аудио- информации на основе видеоинформации
Основными моделями обработки данных являются кодировщики AudioEncoder и VideoEncoder, которыепреобразуютвходныеданныевматрицы,впоследствиииспользуемыегенератором.-
VideoEncoder
ReLU(x) = x= 0,x≤ 0
(2.6)
x,otherwise
LeakyReLU(x) =
x,x≥ 0
(2.7)
negative slope × x,otherwise
где negative slope - угол наклона для отрицательных значений.
После преобразований изображение передается в рекуррентный слой. Таким образом, вход- ное изображение преобразуется в матрицу.
Архитектура VideoEncoder изображена на рисунке 2.4.
Рис. 2.4 – Архитектура VideoEncoder
-
AudioEncoder
AudioEncoder на вход принимает мел-спектрограмму, которая представляется из себя вре- менную последовательность. Последовательность целиком обрабатывается двумя рекуррент- ными слоями и проецируется. Результатом работы AudioEncoder является матрица, описыва- ющая аудиосоставляющую входного видео.
Архитектура VideoEncoder изображена на рисунке 2.5.