Введение. Нарастающая загрузка пересадочных узлов метрополитена в часы пик актуализирует задачу непрерывного мониторинга распределения пассажиров по платформе. Традиционные источники информации – инфракрасные барьеры, турникетные учётно‑аналитические комплексы – поставляют агрегированные данные о количестве вошедших и вышедших, однако не дают сведений о локальной концентрации людей. Вместе с тем именно локальная плотность (число пассажиров на единицу площади) определяет риск возникновения давки и позволяет более тонко регулировать интервалы движения поездов, управлять эскалаторными группами и маршрутами наземного транспорта в зоне вестибюлей.
Целью работы явилось построение сквозного алгоритмического конвейера, способного в оперативном режиме детектировать, идентифицировать и агрегировать траектории пассажиров для вычисления карт плотности, устойчивого к перечисленным искажающим факторам.
Смежные работы. Техники автоматического подсчёта и оценки плотности толпы на изображениях принято разделять на две большие группы: регрессионные методы, оценивающие интегральное число людей непосредственно по текстурным признакам, и детекционно‑трекинговые схемы, опирающиеся на локализацию отдельных объектов.
К первой группе относятся свёрточные архитектуры с расширенными рецептивными полями, такие как CSRNet [1], и многоколоночные сети MCNN [2], предсказывающие карту плотности без явной сегментации индивидов. На платформах метро данные модели демонстрируют удовлетворительную точность при невысокой плотности, однако в условиях сильных окклюзий их производительность заметно падает.
Методы второго направления эволюционировали от каскадов с гистограммами ориентированных градиентов до семейства одностадийных детекторов YOLO [3] и двухстадийных сетей Faster R‑CNN [4]. Сочетание детектора с трекером SORT [5] и его последующим развитием DeepSORT [6] обеспечило связывание разрозненных обнаружений в траектории. ByteTrack [7] предложил более эффективную стратегию ассоциации, опирающуюся на все боксы детекции, включая низкоуверенные, что улучшило связность треков без привлечения дополнительного признакового пространства. Тем не менее публикаций, описывающих полный конвейер от кадра до оперативной тепловой карты плотности на материале именно подземного транспорта, насчитывается немного; чаще авторы ограничиваются либо детекцией, либо интегральным подсчётом.
Предлагаемый метод. Архитектура решения выстроена из трёх последовательных этапов: детекция, трекинг и пространственное агрегирование с проективной нормализацией.
На первом этапе каждый видеокадр обрабатывается нейросетевым детектором YOLOv8m [8]. Выбор модели среднего размера продиктован компромиссом между точностью и задержкой: для практического использования на станции требуется стабильная частота не ниже 15–20 кадров в секунду. Детектор предобучен на датасете CrowdHuman и дообучен на 6 500 размеченных кадрах, снятых на трёх станциях крупного транспортного узла. Разметка включает только класс «человек»; особое внимание уделено частично видимым и сильно перекрытым экземплярам. Выход детектора – множество ограничивающих прямоугольников с показателем уверенности.
Второй этап – многообъектный трекинг – реализован алгоритмом ByteTrack. Отказ от эмбеддингов внешности, чувствительных к резкой смене ракурса и затенениям, позволил снизить вычислительный наклад и увеличить робастность. ByteTrack использует двухступенчатую схему ассоциации: сначала сопоставляются детекции с высокой уверенностью, затем оставшиеся низкоуверенные боксы связываются с неподтверждёнными треклетами. Калибровка порогов уверенности выполнена по критерию максимизации метрики MOTA на валидационной выборке. В результате каждый пассажир получает уникальный числовой идентификатор, сохраняющийся на протяжении его нахождения в поле зрения.
Платформа разбивается на полигональные зоны интереса, отвечающие функциональным сегментам: краевые линии ожидания, центральные проходы, области у эскалаторов. Для каждой зоны накапливаются положения треков в скользящем временном окне длительностью 5 секунд; численность отнесённых к зоне пассажиров делится на её физическую площадь. Результатом является вектор локальных плотностей, обновляемый с частотой поступления кадров. Для визуализации строится тепловая карта, интерполирующая значения на регулярную сетку.
Экспериментальная проверка. Вычислительные эксперименты проводились на видеозаписях, полученных с камеры наблюдения, установленной под потолком центральной части платформы. Разрешение исходных кадров 1920×1080 пикселей, частота 25 кадров в секунду. Собран корпус продолжительностью 48 часов, покрывающий будние и выходные дни, включающий интервалы с плотностью от 0,05 до 3,8 чел/м². Для количественной оценки точности аналитиками вручную размечены 12 000 кадров, равномерно распределённых по всему диапазону загрузки.
Метриками качества служили стандартные для задачи детекции и трекинга показатели: средняя точность по всем порогам mAP@0.5, доля правильно отслеженных объектов MOTA и показатель идентификационной согласованности IDF1. Соответствие автоматической оценки плотности экспертной измерялось коэффициентом корреляции Пирсона, а также средней абсолютной ошибкой в пересчёте на одну зону.
Обучение YOLOv8m продолжалось 100 эпох оптимизатором AdamW с начальной скоростью 0,001 и косинусным расписанием; применялись аугментации мозаикой, случайное горизонтальное отражение и регулировка экспозиции. Инференс выполнялся на отдельном графическом процессоре NVIDIA RTX 3060, программный стек – PyTorch 2.1, CUDA 12.1.
Количественные итоги представлены в тексте. Детектор показал mAP@0.5 = 0,917 на тестовой подвыборке; наибольшая доля ошибок приходилась на сильно перекрытые силуэты в толпе, где уверенность предсказания падала ниже 0,4. Трекер достиг MOTA = 0,784 и IDF1 = 0,813, что является высоким значением для неподготовленной среды метро. Основным источником переключений идентификаторов служили кратковременные выходы пассажиров из поля зрения за колоннами или информационными стойками. Частота обработки конвейера составила 24–26 кадров/с, то есть полностью покрывала темп поступления видеоданных.
Коэффициент линейной корреляции между автоматическим и ручным подсчётом плотности по зонам варьировался от 0,91 до 0,96 для восьми выделенных сегментов (средневзвешенное значение 0,942). Средняя абсолютная ошибка плотности не превышала 0,13 чел/м² при фоновой загрузке и возрастала до 0,31 чел/м² в моменты скоплений, где перекрытия становились критическими. Тепловые карты, сгенерированные системой, визуально совпадали с наблюдаемой картиной и позволяли мгновенно выделить зоны локального уплотнения.
Заключение. В работе представлен, реализован и апробирован вычислительный конвейер автоматической оценки плотности пассажирского потока на платформе метрополитена. Показано, что соединение детектора YOLOv8m с трекером ByteTrack и последующей гомографической нормировкой даёт значения MOTA выше 0,78 при частоте обработки, полностью покрывающей темп входного видеоряда. Пространственно‑временные карты плотности, построенные таким способом, демонстрируют высокую линейную корреляцию с экспертными данными ручного наблюдения. Метод может служить базовым звеном интеллектуальной системы управления пассажирскими скоплениями, снижая нагрузку на оперативный персонал и повышая безопасность перевозок.
Список литературы
- Li Y., Zhang X., Chen D. CSRNet: Dilated Convolutional Neural Networks for Understanding the Highly Congested Scenes // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2018. – P. 1091–1100.
- Zhang Y., Zhou D., Chen S. et al. Single-Image Crowd Counting via Multi-Column Convolutional Neural Network // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2016. – P. 589–597.
- Jocher G., Chaurasia A., Stoken A. et al. YOLOv8 // Ultralytics. – 2023. – URL: (дата обращения: 14.02.2024).
- Ren S., He K., Girshick R., Sun J. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2017. – Vol. 39, № 6. – P. 1137–1149.
- Bewley A., Ge Z., Ott L. et al. Simple Online and Realtime Tracking // Proceedings of the IEEE International Conference on Image Processing (ICIP). – 2016. – P. 3464–3468.
- Wojke N., Bewley A., Paulus D. Simple Online and Realtime Tracking with a Deep Association Metric // Proceedings of the IEEE International Conference on Image Processing (ICIP). – 2017. – P. 3645–3649.
- Zhang Y., Sun P., Jiang Y. et al. ByteTrack: Multi-Object Tracking by Associating Every Detection Box // European Conference on Computer Vision (ECCV). – 2022. – P. 1–21.
- Wang C.-Y., Bochkovskiy A., Liao H.-Y.M. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). – 2023. – P. 7464–7475.


