Сравнительный анализ методов сжатия представлений 3D Gaussian Splatting для интерактивной визуализации

Сравнительный анализ методов сжатия представлений 3D Gaussian Splatting для интерактивной визуализации

Авторы публикации

Рубрика

Информационные технологии

Просмотры

3

Журнал

Журнал «Научный лидер» выпуск # 31 (284), Август ‘26

Поделиться

3D Gaussian Splatting (3DGS) обеспечивает интерактивный синтез новых ракурсов, но хранение миллионов гауссовых примитивов ограничивает передачу и запуск сцен. Сопоставлены LightGaussian, Compact-3DGS, C3DGS, CompGS и HAC/HAC++ по механизму сжатия, размеру, качеству, FPS и сложности декодирования. Методы классифицированы по прореживанию, квантованию, сокращению сферических гармоник и энтропийному кодированию. Гибридные схемы дают максимальное сжатие, но могут требовать дообучения или специального декодера. Для веб- и XR-систем наряду с размером критичны время первого кадра, скорость рендеринга и поддержка платформы. Численные данные взяты из первичных публикаций.

1. Введение

3D Gaussian Splatting (3DGS) описывает сцену набором трёхмерных гауссовых примитивов и формирует изображение их проекцией и дифференцируемой растеризацией [6]. В отличие от нейронных полей излучения, явное представление обеспечивает интерактивный синтез новых ракурсов при высокой детализации.

Такая явность одновременно создаёт ресурсное ограничение: сцена содержит миллионы примитивов с координатами, формой, ориентацией, прозрачностью и цветом. В исходной конфигурации 48 из 59 параметров приходятся на коэффициенты сферических гармоник [7, 9], поэтому модели занимают сотни мегабайт, а крупные сцены — несколько гигабайт [4, 10]. Это осложняет передачу по сети и повышает требования к оперативной и видеопамяти.

Поскольку публикации используют разные реализации, сцены, GPU и контейнеры, их размеры и FPS нельзя напрямую ранжировать [1, 9]. Цель работы — сопоставить репрезентативные методы сжатия 3DGS и оценить их применимость для интерактивной визуализации. Использованы анализ первичных публикаций, классификация и обобщение экспериментальных результатов.

2. Основы 3D Gaussian Splatting и причины ресурсоёмкости

Сцена 3DGS представляется множеством анизотропных гауссиан. Для i-го примитива задаются центр μᵢ, ковариация Σᵢ = RᵢSᵢSᵢᵀRᵢᵀ, непрозрачность αᵢ и коэффициенты сферических гармоник, определяющие зависящий от направления цвет cᵢ [6, 10]. При рендеринге примитивы проецируются, сортируются по глубине и смешиваются.

Gᵢ(x) = exp[-1/2 (x - μᵢ)ᵀΣᵢ⁻¹(x - μᵢ)], C(x) = Σᵢcᵢα̃ᵢ(x)Πⱼ<ᵢ(1 - α̃ⱼ(x)),

Здесь α̃ᵢ(x) объединяет непрозрачность и значение проекции гауссианы в пикселе. Ошибка координат, масштаба или прозрачности влияет не только на локальный вклад, но и на видимость последующих примитивов, поэтому геометрические параметры чувствительны к грубому квантованию [6, 9, 10].

Ресурсная стоимость определяется числом гауссиан, крупным блоком сферических гармоник и операциями проекции, сортировки и смешивания на каждом кадре. Прореживание уменьшает и файл, и нагрузку на растеризатор; квантование прежде всего сокращает хранение и трафик памяти. Методы оценивают по размеру, PSNR, SSIM, LPIPS и FPS, а для интерактивных систем также важны декодирование, пиковая память и время первого кадра.

3. Классификация методов сжатия

В 3DGS.zip различаются компактизация, сокращающая число примитивов, и сжатие, уменьшающее число битов представления [1]. Практические методы сочетают: 1) прореживание и маскирование; 2) скалярное или векторное квантование; 3) сокращение сферических гармоник либо компактное нейронное представление цвета; 4) пространственное и энтропийное кодирование. Наибольшие коэффициенты дают гибридные схемы.

Сравниваются LightGaussian [5], Compact-3DGS [7], C3DGS [10], CompGS [9] и HAC++ как развитие HAC на основе Scaffold-GS [3, 4, 8]. Все работы содержат результаты на Mip-NeRF 360 и описывают декодирование, охватывая основные классы сжатия. LapisGS [11] отдельно рассматривается как прогрессивное представление для сети.

4. Анализ выбранных методов

4.1. LightGaussian

LightGaussian постобрабатывает обученную сцену: удаляет примитивы по глобальной значимости, снижает порядок сферических гармоник и применяет VQ к 60 % наименее значимых SH-векторов; остальные атрибуты хранятся в FP16 [5]. После 5000 шагов адаптации на Mip-NeRF 360 размер уменьшается с 782 до 45 МБ, FPS растёт со 144 до 237, а PSNR меняется с 27,40 до 27,13 дБ. Путь рендеринга остаётся близким к исходному, но требуется многостадийное дообучение.

4.2. Compact-3DGS

Compact-3DGS встраивает сжатие в обучение: маска удаляет избыточные гауссианы, масштаб и вращение кодируются остаточным VQ, а видозависимый цвет вычисляется MLP по многомасштабной хеш-решётке [7]. Постобработка включает 8-битное квантование, Morton-сортировку и энтропийное кодирование. На Mip-NeRF 360 итоговый размер равен 29,1 МБ против 746 МБ; версия без постобработки занимает 48,8 МБ и даёт 128 FPS против 120 FPS, поэтому максимальную компактность нельзя напрямую связывать с измеренным ускорением.

4.3. C3DGS

C3DGS сочетает прореживание, sensitivity-aware VQ формы и направленного цвета, quantization-aware fine-tuning и хранение координат в FP16 [10]. Гауссианы сортируются по Z-кривой, а индексы и атрибуты сжимаются DEFLATE; предусмотрен растеризатор на Rust и WebGPU. На Mip-NeRF 360 размер снижается с 795,26 до 28,80 МБ, PSNR — с 27,21 до 26,981 дБ. Ускорение до 4 раз относится к сравнению разных конвейеров, а не только к квантованию.

4.4. CompGS

CompGS применяет K-means VQ цвета, масштаба и вращения, оставляя координаты и непрозрачность индивидуальными. L1-регуляризация создаёт невидимые примитивы, которые удаляются, а индексы сортируются и сжимаются аналогом RLE [9]. Вариант 16K на Mip-NeRF 360 сокращает размер с 778 до 18 МБ, повышает FPS со 149 до 346 и изменяет PSNR с 27,42 до 27,03 дБ; число гауссиан снижается с 3,30 млн до 845 тыс. Версия 32K обучается примерно в 1,4–1,7 раза дольше базы.

4.5. HAC и HAC++

HAC использует якорную структуру Scaffold-GS, хеш-решётку пространственного контекста, адаптивное квантование, маски и арифметическое кодирование [3, 8]. После декодирования решётка удаляется. HAC++ добавляет внутрякорный контекст, смесь гауссовых распределений для оценки вероятностей и GPCC-кодирование координат [4].

На Mip-NeRF 360 HAC++ low rate занимает 8,34 МБ против 750,9 МБ и показывает 151 против 99 FPS; PSNR меняется с 27,46 до 27,60 дБ, LPIPS — с 0,222 до 0,253. High rate занимает 18,48 МБ и лучше сохраняет SSIM и LPIPS. Декодирование длится 15,77–30,86 с, поэтому минимальный трафик сопровождается заметной задержкой первого показа.

Последовательное контекстное декодирование сложнее распараллелить, чем обращение к кодовой книге, поэтому HAC++ особенно выгоден при однократной загрузке с последующим кэшированием.

5. Сопоставление опубликованных результатов

Для численного среза выбран Mip-NeRF 360 [2], использованный во всех пяти работах. Прямой рейтинг некорректен из-за различий в базовых моделях, коде, GPU и рендерерах, поэтому размер и FPS сопоставляются только с базой внутри каждой публикации.

LightGaussian и C3DGS преобразуют готовую сцену с дообучением, тогда как Compact-3DGS, CompGS и HAC++ теснее встроены в обучение. Кодовые книги упрощают распаковку; контекстное арифметическое декодирование обычно эффективнее по размеру, но усложняет запуск.

Даже на одном наборе данных базовый размер меняется от 750,9 до 795,26 МБ, а PSNR — от 27,21 до 27,46 дБ. Поэтому коэффициенты в таблице рассчитаны относительно базы той же работы, а FPS не используется для межстатейного рейтинга.

Таблица 1.

Данные авторов методов на Mip-NeRF 360

Метод

Размер, МБ; сжатие
(база → метод)

PSNR, дБ

SSIM

LPIPS

FPS
(база → метод)

LightGaussian
[5]

782 → 45;
17,4×; среднее 15×

27,40 → 27,13

0,813 → 0,806

0,217 → 0,237

144 → 237

Compact 3DGS
+ PP [7]

746 → 29,1;
25,6×

27,46 → 27,03

0,812 → 0,797

0,222 → 0,247

120 → не указано¹

C3DGS [10]

795,26 → 28,80;
26,23ײ

27,21 → 26,981

0,815 → 0,801

0,214 → 0,238

не сводится³

CompGS 16K [9]

778 → 18;
43,2×

27,42 → 27,03

0,813 → 0,804

0,217 → 0,243

149 → 346

HAC++ low rate [4]

750,9 → 8,34;
90,0×; среднее >100×

27,46 → 27,60

0,812 → 0,803

0,222 → 0,253

99 → 151

HAC++ high rate [4]

750,9 → 18,48;
40,6×

27,46 → 27,82

0,812 → 0,811

0,222 → 0,231

99 → 130

¹ Без постобработки: 48,8 МБ и 128 FPS. ² Для C3DGS приведён авторский средний коэффициент по сценам. ³ Ускорение до 4× относится к иному конвейеру. Данные из [3–5, 7, 9, 10].

По размеру лидирует HAC++ low rate, но его LPIPS хуже исходного и запуск требует контекстного декодирования. CompGS 16K сочетает 43-кратное уменьшение с более чем двукратным ростом FPS. LightGaussian удобен для готовой сцены, Compact-3DGS комплексно перестраивает атрибуты, а C3DGS выделяется браузерным форматом.

Высокие коэффициенты достигаются совместным удалением примитивов, кодированием повторяющихся атрибутов и использованием статистической зависимости индексов. Рост PSNR у HAC++ связан с иной структурой и обучением, а не с потерей данных как таковой.

6. Применимость для интерактивной визуализации

Для локального приложения рациональны CompGS и LightGaussian: первый даёт меньший файл, второй удобен как оптимизация готовой сцены. Для браузера лучше всего документирован C3DGS с WebGPU-рендерером [10]. HAC++ сильнее сокращает трафик, но десятки секунд декодирования могут перекрыть выигрыш при коротком сеансе.

В XR критичны частота обновления, видеопамять и предсказуемая задержка: C3DGS привлекателен аппаратной растеризацией, а HAC++ — для заранее загруженного контента. При переменной пропускной способности LapisGS передаёт сцену базовым и улучшающими слоями, позволяя начать рендеринг до полной загрузки [11]. Поскольку реальные флуктуации сети не оценивались, это прогрессивная архитектура, а не готовая система адаптивного стриминга.

7. Ограничения сравнительного анализа

Работа не воспроизводит обучение и рендеринг и потому сохраняет различия экспериментальных протоколов. FPS зависит от GPU, разрешения и растеризатора, а PSNR, SSIM и LPIPS не отражают время первого кадра, пиковую память, мерцание и субъективное качество в шлеме. Рекомендации раздела 6 выведены из архитектуры методов и не подтверждены испытаниями на целевых веб-, мобильных и XR-устройствах.

Заключение

Сжатие 3DGS требует сочетания механизмов: прореживание снижает число примитивов и нагрузку на растеризатор, VQ устраняет повторяемость формы и цвета, сокращение сферических гармоник уменьшает крупнейший блок атрибутов, а контекстное и энтропийное кодирование снижают стоимость индексов. HAC++ даёт минимальный размер, CompGS сочетает сильное сжатие с ростом FPS, LightGaussian оптимизирует готовую сцену, Compact-3DGS меняет представление атрибутов, а C3DGS лучше всего документирует браузерную эксплуатацию.

Максимальный коэффициент сжатия не универсален: локальному приложению важны FPS и простота декодирования, вебу — размер и время первого кадра, XR — стабильная задержка, сети — прогрессивность. Для корректного сравнения нужен единый протокол, включающий полный размер потока, декодирование, пиковую память, энергорасход и качество при движении камеры на мобильных и XR-платформах.

Список литературы

  1. 1. Bagdasarian M. T., Knoll P., Li Y.-H., Barthel F., Hilsmann A., Eisert P., Morgenstern W. 3DGS.zip: A Survey on 3D Gaussian Splatting Compression Methods // Computer Graphics Forum. 2025. Vol. 44, no. 2. Art. e70078. DOI: 10.1111/cgf.70078.
  2. 2. Barron J. T., Mildenhall B., Verbin D., Srinivasan P. P., Hedman P. Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2022. P. 5470–5479. DOI: 10.1109/CVPR52688.2022.00539.
  3. 3. Chen Y., Wu Q., Lin W., Harandi M., Cai J. HAC: Hash-Grid Assisted Context for 3D Gaussian Splatting Compression // Computer Vision – ECCV 2024. LNCS 15065. P. 422–438. DOI: 10.1007/978-3-031-72667-5_24.
  4. 4. Chen Y., Wu Q., Lin W., Harandi M., Cai J. HAC++: Towards 100X Compression of 3D Gaussian Splatting // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2025. Vol. 47, no. 11. P. 10210–10226. DOI: 10.1109/TPAMI.2025.3594066.
  5. 5. Fan Z., Wang K., Wen K., Zhu Z., Xu D., Wang Z. LightGaussian: Unbounded 3D Gaussian Compression with 15x Reduction and 200+ FPS // Advances in Neural Information Processing Systems. 2024. Vol. 37. P. 140138–140158. DOI: 10.52202/079017-4447.
  6. 6. Kerbl B., Kopanas G., Leimkühler T., Drettakis G. 3D Gaussian Splatting for Real-Time Radiance Field Rendering // ACM Transactions on Graphics. 2023. Vol. 42, no. 4. Art. 139. DOI: 10.1145/3592433.
  7. 7. Lee J. C., Rho D., Sun X., Ko J. H., Park E. Compact 3D Gaussian Representation for Radiance Field // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024. P. 21719–21728. DOI: 10.1109/CVPR52733.2024.02052.
  8. 8. Lu T., Yu M., Xu L., Xiangli Y., Wang L., Lin D., Dai B. Scaffold-GS: Structured 3D Gaussians for View-Adaptive Rendering // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024. P. 20654–20664. DOI: 10.1109/CVPR52733.2024.01952.
  9. 9. Navaneet K. L., Pourahmadi Meibodi K., Abbasi Koohpayegani S., Pirsiavash H. CompGS: Smaller and Faster Gaussian Splatting with Vector Quantization // Computer Vision – ECCV 2024. LNCS 15087. P. 330–349. DOI: 10.1007/978-3-031-73411-3_19.
  10. 10. Niedermayr S., Stumpfegger J., Westermann R. Compressed 3D Gaussian Splatting for Accelerated Novel View Synthesis // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024. P. 10349–10358. DOI: 10.1109/CVPR52733.2024.00985.
  11. 11. Shi Y., Morin G., Gasparini S., Ooi W. T. LapisGS: Layered Progressive 3D Gaussian Splatting for Adaptive Streaming // Proceedings of the International Conference on 3D Vision. 2025. P. 991–1000. DOI: 10.1109/3DV66043.2025.00096.
Справка о публикации и препринт статьи
предоставляется сразу после оплаты
Прием материалов
c по
Остался последний день
Размещение электронной версии
Загрузка материалов в elibrary
Публикация за 24 часа
Узнать подробнее
Акция
Cкидка 20% на размещение статьи, начиная со второй
Бонусная программа
Узнать подробнее