Сравнение Свёрточной И Трансформерной Архитектур В Задаче Классификации Музыкальных Произведений По Жанрам На Основе Спектральных Признаков Аудиосигнала

Сравнение Свёрточной И Трансформерной Архитектур В Задаче Классификации Музыкальных Произведений По Жанрам На Основе Спектральных Признаков Аудиосигнала

Авторы публикации

Рубрика

IT-Технологии

Просмотры

3

Журнал

Журнал «Научный лидер» выпуск # 33 (286), Август ‘26

Поделиться

В статье рассматривается автоматическое определение жанра музыкального произведения по спектральному представлению аудиосигнала. На сбалансированном наборе FMA-small (восемь жанров, официальное разбиение 6 400 / 800 / 800 фрагментов) сопоставлены две принципиально разные архитектуры: компактная свёрточная сеть, обученная с нуля на log-Mel-спектрограммах, и трансформер Audio Spectrogram Transformer, предобученный на AudioSet и дообученный с частичной заморозкой энкодера. Свёрточная сеть достигла macro-F1 0,481, трансформер — 0,553 при восемнадцатикратно большем числе параметров. Показано, что модели ошибаются на разных жанровых классах, и сформулированы критерии выбора архитектуры.

Введение

Объёмы музыкального контента в стриминговых сервисах и цифровых библиотеках давно превысили порог, за которым ручная каталогизация перестаёт быть реалистичной, тогда как жанровая метка остаётся базовым элементом навигации, рекомендаций и организации архивов. Поэтому автоматическое определение жанра составляет одну из опорных задач области music information retrieval.

Первые работоспособные решения опирались на признаки, спроектированные вручную: классическая постановка Дж. Цанетакиса и П. Кука объединяла тембральные, ритмические и текстурные дескрипторы и давала точность около 61 % на наборе GTZAN [9]. Такие системы ограничены выразительной силой самого признакового описания — на полифоническом материале с сильным спектральным перекрытием качество падает. Смена парадигмы произошла с внедрением глубоких сетей, обучающихся извлекать представления прямо из спектрограммы: обзор К. Замана с соавторами фиксирует свёрточные сети и трансформеры как доминирующие архитектуры аудиоклассификации [10], К. Чой с соавторами — выигрыш гибридных свёрточно-рекуррентных моделей [2], а Ю. Гонг с соавторами предложили Audio Spectrogram Transformer (AST), достигший на бенчмарке AudioSet уровня state of the art [4].

Вместе с тем в прикладной ситуации разработчик почти всегда располагает ограниченным размеченным корпусом и ограниченными вычислительными ресурсами. Отсюда вопрос, которому посвящена работа: какой выигрыш даёт переход от компактной свёрточной сети, обучаемой с нуля, к тяжёлой предобученной трансформерной модели и какой ценой он достигается.

Материалы и методы

Экспериментальной базой служит поднабор FMA-small коллекции Free Music Archive [3]: 8 000 тридцатисекундных фрагментов, равномерно распределённых между восемью жанрами (Electronic, Experimental, Folk, Hip-Hop, Instrumental, International, Pop, Rock) по 1 000 на класс. Сбалансированность набора снимает проблему смещения модели в пользу частых классов уже на уровне данных. Использовано официальное стратифицированное разбиение авторов коллекции: 6 400 фрагментов для обучения, по 800 для валидации и тестирования. Четыре файла не декодируются вследствие повреждений MP3-потока и исключены, так что задействовано 7 996 фрагментов — 99,95 % исходного объёма.

Входным представлением выбрана логарифмическая мел-спектрограмма. Сигнал приводится к моно и частоте дискретизации 22 050 Гц, после чего к нему применяется кратковременное преобразование Фурье с окном Ханна длиной N = 2048 отсчётов (около 93 мс) и шагом H = 512 отсчётов (перекрытие 75 %). Мощностный спектр пропускается через банк из B = 128 треугольных фильтров, равномерно размещённых по мел-шкале в диапазоне 0–11 025 Гц. Сама мел-шкала аппроксимирует нелинейность слухового восприятия высоты тона:

m(f) = 2595 · lg (1 + f / 700),

(1)

где f — частота в герцах, m(f) — соответствующее значение в мелах.

Энергия в каждой мел-полосе суммируется и логарифмируется, что приводит динамический диапазон сигнала к перцептивно равномерной шкале громкости:

S(m, b) = ln (1 + Σk |X(m, k)|2 · Hb(k)),

(2)

где X(m, k) — комплексный спектр m-го кадра, Hb(k) — отклик b-го мел-фильтра, b = 1, …, B. Выбор представления опирается на результаты Ф.-Р. Штётера с соавторами, где log-Mel показал лучшую классификационную способность для глубоких свёрточных сетей [8], и на сравнение методов предобработки аудио [1]. Признаки извлечены средствами библиотеки librosa [6] и кешированы в HDF5-контейнере в формате float32.

Тридцатисекундный фрагмент даёт матрицу 128 × 1290. На вход модели подаётся окно длительностью 5 с (128 × 216 кадров): на обучении оно вырезается случайно, при валидации и тестировании берётся центральное, а предсказание для трека агрегируется усреднением softmax-вероятностей по шести непересекающимся окнам.

Первая из сравниваемых моделей — свёрточная сеть, обучаемая с нуля. Она состоит из четырёх блоков с возрастающим числом фильтров (64 → 128 → 256 → 512); каждый блок включает две свёртки 3 × 3 с пакетной нормализацией и активацией ReLU и завершается слоем max-pooling с асимметричным ядром (2 × 2, 2 × 2, 2 × 4, 1 × 4). Глобальное усреднение по частотно-временной плоскости превращает карту признаков в вектор длины 512, который после dropout с вероятностью 0,5 подаётся на полносвязный слой с softmax-выходом на восемь классов. Общее число обучаемых параметров — около 4,69 млн.

Вторая модель — Audio Spectrogram Transformer в варианте контрольной точки, предобученной на AudioSet [4]. Он разбивает спектрограмму на перекрывающиеся патчи 16 × 16, кодирует их как последовательность токенов и обрабатывает трансформерным энкодером из двенадцати слоёв. Обучение такой модели с нуля на 6 400 фрагментах заведомо привело бы к переобучению, поэтому применена частичная заморозка: эмбеддинги патчей и первые восемь слоёв энкодера зафиксированы, дообучаются последние четыре слоя и классификационная голова, что сокращает число обновляемых параметров с 86,6 млн до примерно 28 млн. Такой режим переноса сохраняет универсальные акустические признаки, выученные на AudioSet, и снижает риск катастрофического забывания [5].

Обучение свёрточной модели дополнено аугментацией обучающей выборки: SpecAugment [7] с двумя временными масками шириной до 32 кадров и двумя частотными масками шириной до 16 мел-полос, а также mixup [11] с параметром бета-распределения α = 0,2; при дообучении трансформера аугментация не применялась. Обе модели обучались с перекрёстной энтропией и оптимизатором AdamW (косинусное расписание шага, регуляризация весов 1·10⁻⁴, смешанная точность, видеокарта NVIDIA T4 с 16 ГБ видеопамяти): свёрточная сеть — с шагом 1·10⁻³ и батчем 64 (47 эпох за 40 минут), трансформер — с шагом 1·10⁻⁵ и батчем 16 (около 1,5 часа). Обучение останавливалось по macro-F1 на валидации.

Качество оценивается на отложенной тестовой выборке из 800 фрагментов (по 100 на жанр). Основной метрикой выбрана macro-F1 — среднее значение F1-меры по классам без взвешивания:

macro-F1 = (1 / K) · Σi 2 · Pi · Ri / (Pi + Ri),

(3)

где K — число жанров, Pi и Ri — точность и полнота для i-го класса. В отличие от доли верных ответов, она не маскирует систематическое проседание на отдельных жанрах. Дополнительно вычисляются accuracy, macro-усреднённые точность и полнота, top-3 accuracy и площадь под ROC-кривой в схеме «один против остальных»; доверительные интервалы получены бутстрапом по 1 000 итераций.

Результаты

Свёрточная сеть на тестовой выборке показала macro-F1 = 0,481 ± 0,032 при accuracy 0,501, top-3 accuracy 0,805 и ROC-AUC 0,836. Дообученный трансформер дал macro-F1 = 0,553 ± 0,031, accuracy 0,563, top-3 accuracy 0,813 и ROC-AUC 0,867. Разрыв по основной метрике составил 7,2 процентных пункта в пользу трансформера; сводное сопоставление приведено в таблице 1.

Таблица 1.

Результаты моделей на тестовой выборке FMA-small

Показатель

Свёрточная сеть

Трансформер (AST)

macro-F1

0,481 ± 0,032

0,553 ± 0,031

Accuracy

0,501 ± 0,034

0,563 ± 0,036

macro-Precision

0,512

0,550

macro-Recall

0,500

0,563

Top-3 accuracy

0,805

0,813

ROC-AUC (один против остальных)

0,836

0,867

Число параметров

4,69 млн

86,6 млн

Время обучения

≈ 40 минут

≈ 1,5 часа

Существенно, что при умеренной accuracy обе модели дают высокую top-3 accuracy: верный жанр попадает в тройку наиболее вероятных примерно в 80 % случаев, то есть ошибки носят характер путаницы между акустически близкими классами, а не полного промаха. Поклассовая разбивка (таблица 2) показывает, что различие между архитектурами неоднородно по жанрам.

Таблица 2.

Точность, полнота и F1-мера по жанрам

Жанр

P (CNN)

R (CNN)

F1 (CNN)

P (AST)

R (AST)

F1 (AST)

Electronic

0,61

0,52

0,56

0,66

0,73

0,69

Experimental

0,34

0,29

0,31

0,45

0,47

0,46

Folk

0,42

0,18

0,25

0,28

0,23

0,25

Hip-Hop

0,73

0,78

0,75

0,73

0,85

0,79

Instrumental

0,36

0,75

0,48

0,51

0,36

0,42

International

0,50

0,69

0,58

0,64

0,68

0,66

Pop

0,48

0,20

0,28

0,41

0,43

0,42

Rock

0,67

0,59

0,63

0,74

0,75

0,74

Среднее (macro)

0,51

0,50

0,48

0,55

0,56

0,55

Структура ошибок свёрточной сети (рисунок 1, слева) определяется поведением класса Instrumental, который выступает своего рода «магнитом»: в него ошибочно попадает 0,41 доли фрагментов Experimental, 0,25 — Pop и 0,23 — Folk, поэтому при высокой полноте (0,75) точность для этого класса составляет лишь 0,36. Наиболее уверенно распознаётся Hip-Hop (полнота 0,78), тяжелее всего даются Pop (0,20), Folk (0,18) и Experimental (0,29).

Трансформер (рисунок 1, справа) ошибается иначе. Он заметно увереннее выделяет Electronic (0,73 против 0,52), Pop (0,43 против 0,20), Rock (0,75 против 0,59) и Hip-Hop (0,85 против 0,78), однако хуже справляется с инструментальной музыкой: полнота класса Instrumental падает до 0,36, а соответствующие фрагменты рассеиваются между Hip-Hop и Experimental. Кроме того, у него возникает собственный характерный паттерн — смешение Folk и Pop (0,40).

Рисунок 1. Матрицы ошибок на тестовой выборке: слева — свёрточная сеть, справа — дообученный трансформерОбсуждение

Разрыв в 7,2 процентных пункта подтверждает преимущество предобученного трансформера, но его величину следует оценивать вместе с затратами: трансформер превосходит свёрточную сеть примерно в восемнадцать раз по числу параметров и более чем вдвое по времени обучения, и на инференсе эта разница сохраняется.

Более содержателен вывод о характере ошибок. Различие в поклассовых метриках не сводится к равномерному сдвигу качества: свёрточная сеть выигрывает на инструментальной музыке (F1 0,48 против 0,42), тогда как трансформер превосходит её почти на всех остальных классах. Разумная интерпретация состоит в том, что свёртки опираются на локальные спектральные паттерны — характер атаки, гармоническую плотность, тембровые следы инструментов, — а механизм self-attention агрегирует глобальную структуру записи. Инструментальные композиции нередко лишены выраженной структурной повторяемости, и глобальный контекст для них менее информативен. Систематически различающиеся профили ошибок — необходимое условие выигрыша взвешенного ансамбля: предварительная оценка даёт прирост macro-F1 порядка 1,5–2,5 процентных пункта.

Качественный разбор неверно классифицированных фрагментов выявил три устойчивых паттерна, общих для обеих моделей: гибридные композиции (этнический материал с фольклорной структурой, поп-рок-записи); малоинформативные участки — интро и затухающие концовки, попавшие в анализируемое окно; артефакты MP3-сжатия низкого битрейта у ряда исторических записей коллекции. Второй и третий эффекты частично компенсируются усреднением по нескольким окнам трека, тогда как первый отражает не столько недостаток моделей, сколько нечёткость жанровых границ и самих аннотаций набора, на что указывают и его авторы [3].

Отсюда следуют рекомендации по выбору архитектуры. Для облачных сервисов, где точность важнее вычислительных затрат, оправдан дообученный трансформер; для встраиваемых и edge-сценариев предпочтительна свёрточная модель, обрабатывающая пятисекундное окно за 12 мс на графическом процессоре и за 95 мс на центральном.

Заключение

В работе построены и сопоставлены две модели жанровой классификации по log-Mel-спектрограммам в единых условиях официального разбиения набора FMA-small. Компактная свёрточная сеть из четырёх блоков, обученная с нуля, достигла macro-F1 = 0,481 ± 0,032; дообученный Audio Spectrogram Transformer с частично замороженным энкодером — macro-F1 = 0,553 ± 0,031 при восемнадцатикратно большем числе параметров. Обе модели уверенно распознают ритмически выраженные жанры и затрудняются с Folk, Pop и Experimental, однако профили их ошибок различаются: свёрточная архитектура точнее на инструментальной музыке, трансформерная — на большинстве прочих классов.

Практическая ценность результата — в количественном обосновании выбора архитектуры: переход к предобученному трансформеру даёт ощутимый, но не радикальный прирост качества. Дальнейшая работа предполагает расширение выборки до FMA-medium с иерархической жанровой таксономией, взвешенное ансамблирование рассмотренных моделей и переход к двухпотоковой архитектуре, принимающей одновременно log-Mel-спектрограмму и мел-частотные кепстральные коэффициенты.

Список литературы

  1. 1. Choi K., Fazekas G., Sandler M., Cho K. A comparison of audio signal preprocessing methods for deep neural networks on music tagging // Proceedings of the 26th European Signal Processing Conference (EUSIPCO). — Rome, 2018. — P. 1870–1874.
  2. 2. Choi K., Fazekas G., Sandler M., Cho K. Convolutional recurrent neural networks for music classification // Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — New Orleans, 2017. — P. 2392–2396.
  3. 3. Defferrard M., Benzi K., Vandergheynst P., Bresson X. FMA: a dataset for music analysis // Proceedings of the 18th International Society for Music Information Retrieval Conference (ISMIR). — Suzhou, 2017. — P. 316–323.
  4. 4. Gong Y., Chung Y.A., Glass J. AST: audio spectrogram transformer // Proceedings of INTERSPEECH. — Brno, 2021. — P. 571–575.
  5. 5. Kong Q., Cao Y., Iqbal T. et al. PANNs: large-scale pretrained audio neural networks for audio pattern recognition // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2020. — Vol. 28. — P. 2880–2894.
  6. 6. McFee B., Raffel C., Liang D. et al. librosa: audio and music signal analysis in Python // Proceedings of the 14th Python in Science Conference (SciPy). — Austin, 2015. — P. 18–25.
  7. 7. Park D.S., Chan W., Zhang Y. et al. SpecAugment: a simple data augmentation method for automatic speech recognition // Proceedings of INTERSPEECH. — Graz, 2019. — P. 2613–2617.
  8. 8. Stöter F.R., Liutkus A., Burred J.J. et al. Spectral and rhythm feature performance evaluation for category and class level audio classification with deep convolutional neural networks // arXiv preprint arXiv:2503.21559. — 2025. — 24 p.
  9. 9. Tzanetakis G., Cook P. Musical genre classification of audio signals // IEEE Transactions on Speech and Audio Processing. — 2002. — Vol. 10, No. 5. — P. 293–302.
  10. 10. Zaman K., Sah M., Direkoglu C., Unoki M. A survey of audio classification using deep learning // IEEE Access. — 2023. — Vol. 11. — P. 141930–141988.
  11. 11. Zhang H., Cisse M., Dauphin Y.N., Lopez-Paz D. mixup: beyond empirical risk minimization // Proceedings of the 6th International Conference on Learning Representations (ICLR). — Vancouver, 2018. — 13 p.
Справка о публикации и препринт статьи
предоставляется сразу после оплаты
Прием материалов
c по
Осталось 2 дня до окончания
Размещение электронной версии
Загрузка материалов в elibrary
Публикация за 24 часа
Узнать подробнее
Акция
Cкидка 20% на размещение статьи, начиная со второй
Бонусная программа
Узнать подробнее