ДЕТЕКЦИЯ ДЕТЕЙ БЕЗ СОПРОВОЖДЕНИЯ ВЗРОСЛЫХ В ЗОНАХ ОБЩЕСТВЕННЫХ ПРОСТРАНСТВ МЕТОДАМИ КОМПЬЮТЕРНОГО ЗРЕНИЯ

ДЕТЕКЦИЯ ДЕТЕЙ БЕЗ СОПРОВОЖДЕНИЯ ВЗРОСЛЫХ В ЗОНАХ ОБЩЕСТВЕННЫХ ПРОСТРАНСТВ МЕТОДАМИ КОМПЬЮТЕРНОГО ЗРЕНИЯ

Авторы публикации

Рубрика

Информационные технологии

Просмотры

20

Журнал

Журнал «Научный лидер» выпуск # 32 (285), Август ‘26

Поделиться

В статье представлена система автоматического обнаружения детей, находящихся без сопровождения взрослых в потенциально опасных зонах общественных пространств. Предложен конвейер обработки видеопотока, объединяющий детектор YOLO26n-pose, многообъектный трекинг BoT-SORT, ансамблевую классификацию возрастной категории «взрослый/ребёнок» и конечный автомат проверки условия сопровождения.

Введение

Крупные общественные пространства (торговые центры, вокзалы, аэропорты, парки) ежедневно посещают тысячи людей, среди которых много детей. Ребёнок без сопровождения взрослого в зоне повышенной опасности особенно уязвим: по данным МВД России, ежегодно регистрируются десятки тысяч случаев безвестного исчезновения несовершеннолетних, значительная часть которых приходится на места массового пребывания людей [2]. В традиционных системах видеонаблюдения выявление инцидентов возложено на оператора, одновременно наблюдающего за десятками камер, что ведёт к задержкам и пропускам.

Детекторы семейства YOLO [5, 6] в сочетании с алгоритмами многообъектного трекинга [3, 4, 8, 9] позволяют анализировать видеопоток в реальном времени, однако ни одна из коммерческих платформ видеоаналитики не содержит модуля контроля сопровождения ребёнка взрослым. Цель работы — разработка и экспериментальная оценка модели системы автоматической детекции детей без сопровождения взрослых методами компьютерного зрения; научная новизна — ансамблевый метод классификации возрастной категории, интегрированный с конечным автоматом проверки сопровождения в единый конвейер обработки видеопотока.

1. Постановка задачи

Входные данные — видеопоток V = (f1, f2, …, fT) фиксированной камеры; выход — множество тревожных событий A(V) = {(idk, tk, xk, yk, Δtk)}, где idk — обезличенный идентификатор трека ребёнка, tk — временная метка, (xk, yk) — координаты, Δtk — накопленная длительность отсутствия сопровождения. Отображение F: V → A(V) реализуется композицией четырёх модулей:

 (1)

Detector выполняет покадровую детекцию людей с оценкой 17 ключевых точек скелета; Tracker присваивает детекциям устойчивые идентификаторы; AgeClassifier разделяет объекты на детей Dc и взрослых Da; AlertLogic проверяет условие сопровождения и формирует тревожные события. Целевой профиль: точность и полнота тревог не ниже 0,85; не более 2 ложных тревог в час на камеру; не менее 30 кадров/с; среднее время реакции не более 6 с.

2. Выбор моделей детекции и трекинга

Сравнение архитектур детекции на наборе MS COCO показало, что трансформерный RT-DETR-l [10] наиболее точен, но малопригоден для реального времени, а YOLOv9t [7] не поддерживает оценку позы. Оптимальной признана модель YOLO26n-pose [6], совмещающая детекцию и оценку 17 ключевых точек скелета за один проход и устойчиво локализующая мелкие объекты — детей на удалённом плане.

Из алгоритмов парадигмы tracking-by-detection (SORT [4], DeepSORT [8], ByteTrack [9], BoT-SORT [3]) лучшую комбинацию метрик на бенчмарке MOT17 показывает BoT-SORT. Устойчивость идентификаторов (в системе — до 60 кадров) принципиальна: ребёнок может на несколько секунд скрываться за другими посетителями, и без сохранения идентификатора любое перекрытие сбрасывало бы таймер отсутствия сопровождения.

3. Ансамблевая классификация возрастной категории

Ни один метод классификации возраста не покрывает все сценарии видеонаблюдения: эвристика по высоте рамки (точность ≈ 65 %) неприменима при единственном объекте в кадре; методы по пропорциям скелета (≈ 75 %) чувствительны к перекрытиям; классификатор лица (≈ 88 %) не работает при съёмке сверху. Поэтому применён ансамбль: шесть независимых оценщиков формируют оценки si в диапазоне [0; 1] (0 — «ребёнок», 1 — «взрослый»), агрегируемые взвешенным голосованием по множеству A активных на данном кадре оценщиков:

(2)

Состав оценщиков и их веса приведены в таблице 1. Высотные оценщики используют нормализацию по перспективе; оценщики по скелету опираются на антропометрические закономерности (отношение высоты тела к высоте головы растёт с возрастом от ≈ 4 у младенца до 7–7,5 у взрослого); классификатор лица — MobileNetV2 с каскадным детектором Виолы – Джонса; шестой голос — дообученный на классы adult/child детектор YOLO26s, запускаемый раз в три кадра.

Таблица 1.

Оценщики ансамбля классификации возраста и их веса

Оценщик

Источник признаков

Вес

Head-to-body ratio

отношение высоты головы к росту (скелет)

3,0

Относительная высота

высота bbox относительно других людей

3,0

YOLO26s direct

прямая детекция классов adult/child

2,5

Абсолютная высота

высота bbox с поправкой на перспективу

2,0

Pose-пропорции

отношение ног к торсу, ширина плеч

1,0

ML по лицу

MobileNetV2 по изображению лица

1,0

 

Решение принимается сравнением S с порогом 0,5; при пустом множестве активных оценщиков объект помечается «unknown». «Мерцание» метки подавляется скользящим средним по десяти оценкам и гистерезисом (0,5 ± 0,1); дополнительно учитывается сидячая поза и выполняется групповая коррекция каскадной ошибки.

4. Логика обнаружения инцидентов

Для каждой пары «ребёнок c — взрослый a» вычисляется минимальное расстояние между гранями их ограничивающих прямоугольников:

(3)

где δx, δy — горизонтальная и вертикальная щели между прямоугольниками (при пересечении d = 0). Критерий сопровождения формулируется через минимум по множеству взрослых:

 (4)

где R — радиус сопровождения (200 пикселей, ≈ 1,5–2 м — типовая дистанция присмотра). Поскольку однократное нарушение не должно вызывать тревогу, решение формализовано конечным автоматом NORMAL → COUNTING → ALERTED: тревога формируется при накоплении времени нарушения свыше τ = 5 с, а ложные срабатывания подавляются сохранением состояния при кратковременной потере трека.

Тревожные события журналируются в формате JSON Lines с доставкой по веб-хуку; персональная идентификация не выполняется, что соответствует Федеральному закону № 152-ФЗ [1]. Статистика инцидентов накапливается в тепловой карте H с экспоненциальным затуханием:

 (5)

где γ = 0,995 — коэффициент затухания. Карта накладывается на кадр цветовой схемой JET и помогает выявлять систематически небезопасные участки планировки.

5. Метрики качества и оперативности

По числу истинно положительных (TP), ложноположительных (FP) и пропущенных (FN) тревог при сопоставлении с эталонной разметкой вычисляются точность и полнота:

 (6)

Дополнительно используется абсолютная характеристика — частота ложных тревог (False Alarm Rate):

 (7)

где NFP — число ложных тревог, Th — продолжительность наблюдения в часах. Оперативность характеризуется средним временем реакции:

 (8)

6. Программная реализация

Система реализована на Python (Ultralytics — YOLO26 и BoT-SORT; PyTorch и ONNX Runtime — классификатор лица; OpenCV — обработка видео; FastAPI — веб-интерфейс) по модульному принципу. Рабочее место оператора — веб-приложение с размеченным видеопотоком, журналом тревог и настройкой параметров; клиенту достаточно браузера. Развёртывание — в Docker-контейнере, инференс — на сервере с GPU NVIDIA; корректность модулей подтверждена 20 модульными тестами (pytest).

7. Обучение моделей и экспериментальные результаты

Детектор возрастной категории YOLO26s обучен на наборе Adult-Child (Roboflow, 3610 изображений); достигнуто mAP@50 = 0,78, что достаточно для вспомогательной роли в ансамбле. Классификатор лица MobileNetV2 обучен на объединённой выборке UTKFace и FGNET с порогом 12 лет; на валидации достигнуты accuracy = 0,97 и F1(child) = 0,91; модель экспортирована в ONNX.

Проверка системы проведена на собственной выборке: 6 видеофрагментов суммарной длительностью ≈ 22 мин, ≈ 18 эталонных эпизодов. Абляционное исследование (таблица 2) подтвердило целесообразность ансамбля: ни один отдельный оценщик не достигает требуемых 80 % точности, тогда как полный ансамбль обеспечивает 88 %.

Таблица 2.

Абляционное исследование точности классификации возраста

Конфигурация

Accuracy

Абсолютная высота bbox

0,66

Относительная высота bbox

0,70

Pose-пропорции скелета

0,74

Head-to-body ratio

0,76

YOLO26s direct

0,79

ML по лицу (подвыборка с видимым лицом)

0,86

Полный ансамбль (6 оценщиков)

0,88

 

Качество обнаружения инцидентов оценивалось на уровне эпизодов (таблица 3). Среднее время реакции 5,6 с складывается из порога накопления нарушения (5 с) и задержки конвейера (≈ 0,6 с); производительность 35–37 кадров/с на сервере с GPU NVIDIA превышает частоту типовых источников видеонаблюдения (25 кадров/с).

Таблица 3.

Качество обнаружения инцидентов и производительность

Метрика

Требование

Достигнуто

Точность тревог Palert

≥ 0,85

0,87

Полнота тревог Ralert

≥ 0,85

0,85

Частота ложных тревог FAR, событий/час

≤ 2

1,2

Среднее время реакции Treact, с

≤ 6

5,6

Скорость обработки (GPU NVIDIA), кадров/с

≥ 30

35–37

 

Полученные значения предварительны: объём выборки ограничивает статистическую значимость. К ограничениям относятся снижение точности классификатора лица на дальних планах, чувствительность высотных оценщиков к установке камеры, деградация в плотной толпе и при слабой освещённости, отсутствие поддержки PTZ-камер и ночного режима.

Заключение

Разработана и экспериментально проверена модель программной системы автоматической детекции детей без сопровождения взрослых в потенциально опасных зонах общественных пространств. Конвейер «детекция и оценка позы (YOLO26n-pose) → трекинг (BoT-SORT) → ансамблевая классификация возраста (шесть оценщиков) → конечный автомат проверки сопровождения» обеспечил точность классификации возраста 88 %, точность тревог 87 % при полноте 85 %, частоту ложных тревог 1,2 события в час и среднее время реакции 5,6 с при 35–37 кадрах в секунду, что удовлетворяет всем установленным требованиям.

Система может быть интегрирована в существующие системы видеонаблюдения и не выполняет персональной идентификации. Направления развития — расширение обучающих и тестовых выборок, ночной режим, многокамерные конфигурации, автоматическая калибровка перспективы, интеграция с системами оповещения.

Список литературы

  1. Сиротин В. П., Архипова М. Ю., Куликова С. В. [и др.]. Социальная инженерия и информационная безопасность : монография. — Москва : Эдитус, 2023. — 263 с. — ISBN 978-5-00217-066-1
  2. Состояние преступности в Российской Федерации : официальная статистика / Министерство внутренних дел Российской Федерации [Электронный ресурс]. — URL: https://мвд.рф/dejatelnost/statistics (дата обращения: 25.02.2026)
  3. Aharon N., Orfaig R., Bobrovsky B.-Z. BoT-SORT: Robust Associations Multi-Pedestrian Tracking // arXiv preprint arXiv:2206.14651. — 2022. — DOI: 10.48550/arXiv.2206.14651
  4. Bewley A., Ge Z., Ott L., Ramos F., Upcroft B. Simple Online and Realtime Tracking // IEEE International Conference on Image Processing (ICIP). — 2016. — P. 3464–3468. — DOI: 10.1109/ICIP.2016.7533003
  5. Redmon J., Divvala S., Girshick R., Farhadi A. You Only Look Once: Unified, Real-Time Object Detection // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). — 2016. — P. 779–788. — DOI: 10.1109/CVPR.2016.91
  6. Ultralytics YOLO26 : официальная документация [Электронный ресурс]. — URL: https://docs.ultralytics.com (дата обращения: 10.05.2026)
  7. Wang C.-Y., Yeh I.-H., Liao H.-Y. M. YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information // arXiv preprint arXiv:2402.13616. — 2024. — DOI: 10.48550/arXiv.2402.13616
  8. Wojke N., Bewley A., Paulus D. Simple Online and Realtime Tracking with a Deep Association Metric // IEEE International Conference on Image Processing (ICIP). — 2017. — P. 3645–3649. — DOI: 10.1109/ICIP.2017.8296962
  9. Zhang Y., Sun P., Jiang Y. [et al.]. ByteTrack: Multi-Object Tracking by Associating Every Detection Box // European Conference on Computer Vision (ECCV). — 2022. — P. 1–21. — DOI: 10.1007/978-3-031-20047-2_1
  10. Zhao Y., Lv W., Xu S. [et al.]. DETRs Beat YOLOs on Real-time Object Detection // arXiv preprint arXiv:2304.08069. — 2023. — DOI: 10.48550/arXiv.2304.08069
Справка о публикации и препринт статьи
предоставляется сразу после оплаты
Прием материалов
c по
Осталось 4 дня до окончания
Размещение электронной версии
Загрузка материалов в elibrary
Публикация за 24 часа
Узнать подробнее
Акция
Cкидка 20% на размещение статьи, начиная со второй
Бонусная программа
Узнать подробнее