Файл: Направление подготовки 09. 03. 04 Программная инженерия.docx

ВУЗ: Не указан

Категория: Не указан

Дисциплина: Не указана

Добавлен: 29.10.2023

Просмотров: 753

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Введение

В наше время наблюдается очевидная тенденция на автоматизацию и делегирование боль- шого круга задач компьютеру. Данное направление развития затронуло даже, казалось бы, сугубочеловеческиезадачи,такиекаканализаудио-ивидеоинформации.Этосвязанокакс большимпрогрессомвданнойобласти,такисповышениемтребованийккомфортномусу- ществованию человека.Тема анализа изображений и звуковых сигналов хорошо изучена, данные технологии при- меняются в различных сферах деятельности человека. В то же время взаимосвязи данных ис- точников информации уделено гораздо меньше внимания. Различные визуальные события в нашей повседневной жизни обычно сопровождаются звуками. Поскольку визуальные собы-тия и звуки коррелируют, человек может инстинктивно делать выводы о звуках, наблюдая за визуальными сигналами.Вданнойработерассматриваетсязадачагенерацииаудиоинформациинаосновевидеоза- писи, не содержащей звук, что полезно для многих реальных приложений, таких как авто- матизация видеомонтажа, технологии виртуальной реальности (автоматически генерировать звук для виртуальных сцен), создание звука для немого кино и помощь людям с нарушениями зрения.Важнымаспектомявляетсянеобходимостьгенерацииаудиоинформации,соответствую- щей видеосигналам как с точки зрения периодичности (звук при ударе молотом возникает именновмоментприкосновения),такисточкизрениянеизбыточности(вовремяударамо- лотомнеобходимогенерироватьтолькозвукудара,нонечеловеческуюречьнафоне).Исходя из описанного, цель работы: Разработка метода и программных модулей генерации аудиоинформации на основе видеозаписи.
  1. Анализ существующих решений, моделей и методов генерации аудиоинформации на основе видеоинформации
    1. Применение технологий нейронных сетей для задач обработки аудио- визуальной информации

Таккаквнашевремяещенетразработанногоалгоритмическогоподходагенерациизву- ка,соответствующеговизуальномуилитекстовомуописанию,вданномнаправленииприме- няютсятехнологиинейронныхсетейимашинногообучения,чьяэффективностьврешении подобных задач доказана на практике [1—4].Нейронныесетиширокоприменяютсядляобработкивидео[5—8]иаудио[9;10]инфор- мации по отдельности. Темне менее, синхронизированная визуальная и звуковая информа- ция,содержащаясявбольшинствевидеороликов,можетбытьприменимадлясозданияболее эффективныхрешенийпоодномуизнаправлений[11;12].Используявизуальнуюинформа- циюдляоценкивработе[13]представленасетьдляизученияассоциациймеждуестествен- ными сценами и звуковым сопровождением. В работах [14] и [1] изучается взаимосвязь ви- зуальнойинформацииизвуковогосопровождениянабазеобучениябезучителянанеразме- ченных видео. В работах [15—17] реализуется разделение звуковых сигналов с использовани- емвизуально-звуковойинформации.Вработе[18]представленасистемаслежениязадвижу- щимся транспортным средством, основанную на зрительно-звуковых связях. Некоторые дру- гиевизуально-звуковыеисследованиявключаютаудиовизуальнуюсовместнуюсегментацию[19]иаудиовизуальнуюнавигацию[20].

Наиболее популярными и эффективными инструментами, используемыми при проекти- рованиинейронныхсетейдлязадачгенерациизвукаповидео,являютсясверточные[21;22], рекуррентные[21—23]игенеративно-состязательные[2]нейронныесети.
    1. 1   2   3   4   5   6   7   8   9   ...   15

Сверточные нейронные сети

Внашевремясредивсехтехнологийглубокогообучениякзадачаманализаизображений иобразовчащевсегоприменяютсясверточныенейронныесети[24].Даннаяархитектурапо- лучиласвоюпопулярностьблагодарявысокойэффективности.Сверточныенейронныесети объединяют три архитектурных идеи, для обеспечения инвариантности к изменению масшта- ба, повороту, сдвигу и пространственным искажениям:

  1. Локальные рецепторные поля.

  2. Общие синаптические коэффициенты (обеспечивают детектирование некоторых черт в любом месте изображения и уменьшают общее число весовых коэффициентов).

  3. Иерархическая организация с пространственными подвыборками
Классическаясверточнаянейроннаясеть(СНС)состоитизтрехтиповнейронов:

  1. Cверточные (convolutional) нейроны.

  2. Cубдискретизирующие (subsampling, подвыборка) нейроны.

  3. Нейроны ”обычной” нейронной сети – персептроны.
Сверточныенейроныобразуютсверточныйслойивыполняютоперациюсвертки.Сверт- качащевсегоприменяетсяктрехмернымтензорам,называемымкартамипризнаковсдвумя пространственными осями (высота и ширина), а также с осью глубины (или осью каналов). Например, для изображений в формате RGB размерность оси глубины равна трем, потому что имеется три канала цвета: красный (red), зеленый (green) и синий (blue), для черно-белых изоб- ражений ось глубины имеет размерность один.Операциясвертыванияизвлекаетшаблоныизсвоейвходнойкартыпризнаковиприменя- ет одинаковые преобразования ко всем шаблонам, производя выходную карту признаков. Эта выходная карта признаков также является трехмерным тензором: она имеет ширину и высоту. Ее глубина может иметь любую размерность, потому что

выходная глубина является парамет- ром слоя, и разные каналы на этой оси глубины больше не соответствуют конкретным цветам, скорее они представляют собой конкретные аспекты входных данных [24]. Ширину и высоту тензоров выходной карты можно описать формулой (при условии отсутствия дополнений и с шагом свертки равным одному):
(w,h) = (mWkW+ 1,mHkH+ 1) (1.1)

где (w,h) - вычисляемый размер сверточной карты, mW- ширина предыдущей карты, mH

- высота предыдущей карты , kH- высота ядра, kW- ширина ядра.

Данная формула становится очевидной, если рассмотреть метод работы свертки: выполня- ется операция скользящего окна (называемого ядром) размер которого обычно варьируется от 3×3 до 7×7, оно двигается по трехмерной входной карте признаков, останавливается в каждой возможной позиции и извлекает трехмерный шаблон окружающих признаков. Каждый такой трехмерный шаблон затем преобразуется в вектор путем умножения тензора на матрицу весов, получаемую в процессе обучения. Все эти векторы затем преобразуются в трехмерную выход- ную карту. Изобразим операцию свертки применимо к тензору с глубиной равной единице

(рис 1.1).



Рис. 1.1 – Операция свертки


Формульное описание:
xl= f( xl1 × kl+ bl) (1.2)

jijj

i

где xl- карта признаков j(выход слоя l), f() - функция активации, bl- коэффициент сдвига

jj

jпризнаков слоя lдля карты признаков j, kl- ядро свертки jкарты слоя l, × - операция свертки

входы xс ядром k.

Благодаря данной операции реализуются одни из главных преимуществ СНС: инвариант- ность изучаемых шаблонов в отношении переноса, так как ядро не изменяется при скольжении по изображению (реакция на одинаковый элемент в правом верхнем и левом нижнем углах бу- дет одинаковой), и способность ”изучать” пространственные иерархии шаблонов (первый слой просматривает небольшие локальные шаблоны, следующий уже более крупные).

Субдискретизирующие нейроны используются для агрессивного уменьшения разрешения карты признаков. Уменьшение разрешения используется для уменьшения количества коэф- фициентов в карте признаков для обработки, а также внедрения иерархий пространственных фильтров (аспектов входных данных) путем создания последовательных слоев свертки, увели- чивая долю исходных данных, покрываемых ядром.

Классический субдискретизирующие нейрон выполняет операцию Max Pooling (выбор мак-

симума) из области размером 2 × 2 (с шагом 2) (рис. 1.2).Применением подобной операции мы уменьшаем размерность карты признаков (ширина и высота) в два раза. Формально слой мо- жет быть описан формулой:
xl= f(alsubsample(xl1) + bl) (1.3) где xl- выход слоя l, f() - функция активации, al, bl- коэффициент сдвига признаков слоя

l, subsample() - операция выбора локальных максимальных значений.