Введение
Объёмы музыкального контента в стриминговых сервисах и цифровых библиотеках давно превысили порог, за которым ручная каталогизация перестаёт быть реалистичной, тогда как жанровая метка остаётся базовым элементом навигации, рекомендаций и организации архивов. Поэтому автоматическое определение жанра составляет одну из опорных задач области music information retrieval.
Первые работоспособные решения опирались на признаки, спроектированные вручную: классическая постановка Дж. Цанетакиса и П. Кука объединяла тембральные, ритмические и текстурные дескрипторы и давала точность около 61 % на наборе GTZAN [9]. Такие системы ограничены выразительной силой самого признакового описания — на полифоническом материале с сильным спектральным перекрытием качество падает. Смена парадигмы произошла с внедрением глубоких сетей, обучающихся извлекать представления прямо из спектрограммы: обзор К. Замана с соавторами фиксирует свёрточные сети и трансформеры как доминирующие архитектуры аудиоклассификации [10], К. Чой с соавторами — выигрыш гибридных свёрточно-рекуррентных моделей [2], а Ю. Гонг с соавторами предложили Audio Spectrogram Transformer (AST), достигший на бенчмарке AudioSet уровня state of the art [4].
Вместе с тем в прикладной ситуации разработчик почти всегда располагает ограниченным размеченным корпусом и ограниченными вычислительными ресурсами. Отсюда вопрос, которому посвящена работа: какой выигрыш даёт переход от компактной свёрточной сети, обучаемой с нуля, к тяжёлой предобученной трансформерной модели и какой ценой он достигается.
Материалы и методы
Экспериментальной базой служит поднабор FMA-small коллекции Free Music Archive [3]: 8 000 тридцатисекундных фрагментов, равномерно распределённых между восемью жанрами (Electronic, Experimental, Folk, Hip-Hop, Instrumental, International, Pop, Rock) по 1 000 на класс. Сбалансированность набора снимает проблему смещения модели в пользу частых классов уже на уровне данных. Использовано официальное стратифицированное разбиение авторов коллекции: 6 400 фрагментов для обучения, по 800 для валидации и тестирования. Четыре файла не декодируются вследствие повреждений MP3-потока и исключены, так что задействовано 7 996 фрагментов — 99,95 % исходного объёма.
Входным представлением выбрана логарифмическая мел-спектрограмма. Сигнал приводится к моно и частоте дискретизации 22 050 Гц, после чего к нему применяется кратковременное преобразование Фурье с окном Ханна длиной N = 2048 отсчётов (около 93 мс) и шагом H = 512 отсчётов (перекрытие 75 %). Мощностный спектр пропускается через банк из B = 128 треугольных фильтров, равномерно размещённых по мел-шкале в диапазоне 0–11 025 Гц. Сама мел-шкала аппроксимирует нелинейность слухового восприятия высоты тона:
m(f) = 2595 · lg (1 + f / 700), | (1) |
где f — частота в герцах, m(f) — соответствующее значение в мелах.
Энергия в каждой мел-полосе суммируется и логарифмируется, что приводит динамический диапазон сигнала к перцептивно равномерной шкале громкости:
S(m, b) = ln (1 + Σk |X(m, k)|2 · Hb(k)), | (2) |
где X(m, k) — комплексный спектр m-го кадра, Hb(k) — отклик b-го мел-фильтра, b = 1, …, B. Выбор представления опирается на результаты Ф.-Р. Штётера с соавторами, где log-Mel показал лучшую классификационную способность для глубоких свёрточных сетей [8], и на сравнение методов предобработки аудио [1]. Признаки извлечены средствами библиотеки librosa [6] и кешированы в HDF5-контейнере в формате float32.
Тридцатисекундный фрагмент даёт матрицу 128 × 1290. На вход модели подаётся окно длительностью 5 с (128 × 216 кадров): на обучении оно вырезается случайно, при валидации и тестировании берётся центральное, а предсказание для трека агрегируется усреднением softmax-вероятностей по шести непересекающимся окнам.
Первая из сравниваемых моделей — свёрточная сеть, обучаемая с нуля. Она состоит из четырёх блоков с возрастающим числом фильтров (64 → 128 → 256 → 512); каждый блок включает две свёртки 3 × 3 с пакетной нормализацией и активацией ReLU и завершается слоем max-pooling с асимметричным ядром (2 × 2, 2 × 2, 2 × 4, 1 × 4). Глобальное усреднение по частотно-временной плоскости превращает карту признаков в вектор длины 512, который после dropout с вероятностью 0,5 подаётся на полносвязный слой с softmax-выходом на восемь классов. Общее число обучаемых параметров — около 4,69 млн.
Вторая модель — Audio Spectrogram Transformer в варианте контрольной точки, предобученной на AudioSet [4]. Он разбивает спектрограмму на перекрывающиеся патчи 16 × 16, кодирует их как последовательность токенов и обрабатывает трансформерным энкодером из двенадцати слоёв. Обучение такой модели с нуля на 6 400 фрагментах заведомо привело бы к переобучению, поэтому применена частичная заморозка: эмбеддинги патчей и первые восемь слоёв энкодера зафиксированы, дообучаются последние четыре слоя и классификационная голова, что сокращает число обновляемых параметров с 86,6 млн до примерно 28 млн. Такой режим переноса сохраняет универсальные акустические признаки, выученные на AudioSet, и снижает риск катастрофического забывания [5].
Обучение свёрточной модели дополнено аугментацией обучающей выборки: SpecAugment [7] с двумя временными масками шириной до 32 кадров и двумя частотными масками шириной до 16 мел-полос, а также mixup [11] с параметром бета-распределения α = 0,2; при дообучении трансформера аугментация не применялась. Обе модели обучались с перекрёстной энтропией и оптимизатором AdamW (косинусное расписание шага, регуляризация весов 1·10⁻⁴, смешанная точность, видеокарта NVIDIA T4 с 16 ГБ видеопамяти): свёрточная сеть — с шагом 1·10⁻³ и батчем 64 (47 эпох за 40 минут), трансформер — с шагом 1·10⁻⁵ и батчем 16 (около 1,5 часа). Обучение останавливалось по macro-F1 на валидации.
Качество оценивается на отложенной тестовой выборке из 800 фрагментов (по 100 на жанр). Основной метрикой выбрана macro-F1 — среднее значение F1-меры по классам без взвешивания:
macro-F1 = (1 / K) · Σi 2 · Pi · Ri / (Pi + Ri), | (3) |
где K — число жанров, Pi и Ri — точность и полнота для i-го класса. В отличие от доли верных ответов, она не маскирует систематическое проседание на отдельных жанрах. Дополнительно вычисляются accuracy, macro-усреднённые точность и полнота, top-3 accuracy и площадь под ROC-кривой в схеме «один против остальных»; доверительные интервалы получены бутстрапом по 1 000 итераций.
Результаты
Свёрточная сеть на тестовой выборке показала macro-F1 = 0,481 ± 0,032 при accuracy 0,501, top-3 accuracy 0,805 и ROC-AUC 0,836. Дообученный трансформер дал macro-F1 = 0,553 ± 0,031, accuracy 0,563, top-3 accuracy 0,813 и ROC-AUC 0,867. Разрыв по основной метрике составил 7,2 процентных пункта в пользу трансформера; сводное сопоставление приведено в таблице 1.
Таблица 1.
Результаты моделей на тестовой выборке FMA-small
Показатель | Свёрточная сеть | Трансформер (AST) |
macro-F1 | 0,481 ± 0,032 | 0,553 ± 0,031 |
Accuracy | 0,501 ± 0,034 | 0,563 ± 0,036 |
macro-Precision | 0,512 | 0,550 |
macro-Recall | 0,500 | 0,563 |
Top-3 accuracy | 0,805 | 0,813 |
ROC-AUC (один против остальных) | 0,836 | 0,867 |
Число параметров | 4,69 млн | 86,6 млн |
Время обучения | ≈ 40 минут | ≈ 1,5 часа |
Существенно, что при умеренной accuracy обе модели дают высокую top-3 accuracy: верный жанр попадает в тройку наиболее вероятных примерно в 80 % случаев, то есть ошибки носят характер путаницы между акустически близкими классами, а не полного промаха. Поклассовая разбивка (таблица 2) показывает, что различие между архитектурами неоднородно по жанрам.
Таблица 2.
Точность, полнота и F1-мера по жанрам
Жанр | P (CNN) | R (CNN) | F1 (CNN) | P (AST) | R (AST) | F1 (AST) |
Electronic | 0,61 | 0,52 | 0,56 | 0,66 | 0,73 | 0,69 |
Experimental | 0,34 | 0,29 | 0,31 | 0,45 | 0,47 | 0,46 |
Folk | 0,42 | 0,18 | 0,25 | 0,28 | 0,23 | 0,25 |
Hip-Hop | 0,73 | 0,78 | 0,75 | 0,73 | 0,85 | 0,79 |
Instrumental | 0,36 | 0,75 | 0,48 | 0,51 | 0,36 | 0,42 |
International | 0,50 | 0,69 | 0,58 | 0,64 | 0,68 | 0,66 |
Pop | 0,48 | 0,20 | 0,28 | 0,41 | 0,43 | 0,42 |
Rock | 0,67 | 0,59 | 0,63 | 0,74 | 0,75 | 0,74 |
Среднее (macro) | 0,51 | 0,50 | 0,48 | 0,55 | 0,56 | 0,55 |
Структура ошибок свёрточной сети (рисунок 1, слева) определяется поведением класса Instrumental, который выступает своего рода «магнитом»: в него ошибочно попадает 0,41 доли фрагментов Experimental, 0,25 — Pop и 0,23 — Folk, поэтому при высокой полноте (0,75) точность для этого класса составляет лишь 0,36. Наиболее уверенно распознаётся Hip-Hop (полнота 0,78), тяжелее всего даются Pop (0,20), Folk (0,18) и Experimental (0,29).
Трансформер (рисунок 1, справа) ошибается иначе. Он заметно увереннее выделяет Electronic (0,73 против 0,52), Pop (0,43 против 0,20), Rock (0,75 против 0,59) и Hip-Hop (0,85 против 0,78), однако хуже справляется с инструментальной музыкой: полнота класса Instrumental падает до 0,36, а соответствующие фрагменты рассеиваются между Hip-Hop и Experimental. Кроме того, у него возникает собственный характерный паттерн — смешение Folk и Pop (0,40).
Рисунок 1. Матрицы ошибок на тестовой выборке: слева — свёрточная сеть, справа — дообученный трансформерОбсуждение
Разрыв в 7,2 процентных пункта подтверждает преимущество предобученного трансформера, но его величину следует оценивать вместе с затратами: трансформер превосходит свёрточную сеть примерно в восемнадцать раз по числу параметров и более чем вдвое по времени обучения, и на инференсе эта разница сохраняется.
Более содержателен вывод о характере ошибок. Различие в поклассовых метриках не сводится к равномерному сдвигу качества: свёрточная сеть выигрывает на инструментальной музыке (F1 0,48 против 0,42), тогда как трансформер превосходит её почти на всех остальных классах. Разумная интерпретация состоит в том, что свёртки опираются на локальные спектральные паттерны — характер атаки, гармоническую плотность, тембровые следы инструментов, — а механизм self-attention агрегирует глобальную структуру записи. Инструментальные композиции нередко лишены выраженной структурной повторяемости, и глобальный контекст для них менее информативен. Систематически различающиеся профили ошибок — необходимое условие выигрыша взвешенного ансамбля: предварительная оценка даёт прирост macro-F1 порядка 1,5–2,5 процентных пункта.
Качественный разбор неверно классифицированных фрагментов выявил три устойчивых паттерна, общих для обеих моделей: гибридные композиции (этнический материал с фольклорной структурой, поп-рок-записи); малоинформативные участки — интро и затухающие концовки, попавшие в анализируемое окно; артефакты MP3-сжатия низкого битрейта у ряда исторических записей коллекции. Второй и третий эффекты частично компенсируются усреднением по нескольким окнам трека, тогда как первый отражает не столько недостаток моделей, сколько нечёткость жанровых границ и самих аннотаций набора, на что указывают и его авторы [3].
Отсюда следуют рекомендации по выбору архитектуры. Для облачных сервисов, где точность важнее вычислительных затрат, оправдан дообученный трансформер; для встраиваемых и edge-сценариев предпочтительна свёрточная модель, обрабатывающая пятисекундное окно за 12 мс на графическом процессоре и за 95 мс на центральном.
Заключение
В работе построены и сопоставлены две модели жанровой классификации по log-Mel-спектрограммам в единых условиях официального разбиения набора FMA-small. Компактная свёрточная сеть из четырёх блоков, обученная с нуля, достигла macro-F1 = 0,481 ± 0,032; дообученный Audio Spectrogram Transformer с частично замороженным энкодером — macro-F1 = 0,553 ± 0,031 при восемнадцатикратно большем числе параметров. Обе модели уверенно распознают ритмически выраженные жанры и затрудняются с Folk, Pop и Experimental, однако профили их ошибок различаются: свёрточная архитектура точнее на инструментальной музыке, трансформерная — на большинстве прочих классов.
Практическая ценность результата — в количественном обосновании выбора архитектуры: переход к предобученному трансформеру даёт ощутимый, но не радикальный прирост качества. Дальнейшая работа предполагает расширение выборки до FMA-medium с иерархической жанровой таксономией, взвешенное ансамблирование рассмотренных моделей и переход к двухпотоковой архитектуре, принимающей одновременно log-Mel-спектрограмму и мел-частотные кепстральные коэффициенты.
Список литературы
- 1. Choi K., Fazekas G., Sandler M., Cho K. A comparison of audio signal preprocessing methods for deep neural networks on music tagging // Proceedings of the 26th European Signal Processing Conference (EUSIPCO). — Rome, 2018. — P. 1870–1874.
- 2. Choi K., Fazekas G., Sandler M., Cho K. Convolutional recurrent neural networks for music classification // Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — New Orleans, 2017. — P. 2392–2396.
- 3. Defferrard M., Benzi K., Vandergheynst P., Bresson X. FMA: a dataset for music analysis // Proceedings of the 18th International Society for Music Information Retrieval Conference (ISMIR). — Suzhou, 2017. — P. 316–323.
- 4. Gong Y., Chung Y.A., Glass J. AST: audio spectrogram transformer // Proceedings of INTERSPEECH. — Brno, 2021. — P. 571–575.
- 5. Kong Q., Cao Y., Iqbal T. et al. PANNs: large-scale pretrained audio neural networks for audio pattern recognition // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2020. — Vol. 28. — P. 2880–2894.
- 6. McFee B., Raffel C., Liang D. et al. librosa: audio and music signal analysis in Python // Proceedings of the 14th Python in Science Conference (SciPy). — Austin, 2015. — P. 18–25.
- 7. Park D.S., Chan W., Zhang Y. et al. SpecAugment: a simple data augmentation method for automatic speech recognition // Proceedings of INTERSPEECH. — Graz, 2019. — P. 2613–2617.
- 8. Stöter F.R., Liutkus A., Burred J.J. et al. Spectral and rhythm feature performance evaluation for category and class level audio classification with deep convolutional neural networks // arXiv preprint arXiv:2503.21559. — 2025. — 24 p.
- 9. Tzanetakis G., Cook P. Musical genre classification of audio signals // IEEE Transactions on Speech and Audio Processing. — 2002. — Vol. 10, No. 5. — P. 293–302.
- 10. Zaman K., Sah M., Direkoglu C., Unoki M. A survey of audio classification using deep learning // IEEE Access. — 2023. — Vol. 11. — P. 141930–141988.
- 11. Zhang H., Cisse M., Dauphin Y.N., Lopez-Paz D. mixup: beyond empirical risk minimization // Proceedings of the 6th International Conference on Learning Representations (ICLR). — Vancouver, 2018. — 13 p.


