Павленко Богдан Викторович – младший научный сотрудник, аспирант, ФГБНУ «Институт проблем искусственного интеллекта», 283048, г. Донецк, ул. Артема, д. 118 б. Область научных интересов: системы распознавания образов, нейронные сети, мультимодальные модели.
УДК: 004.932.2 DOI: 10.24412/2413-7383-2025-4-39-71-83 Язык: Русский
Аннотация: В данной работе предлагается метод мультимодального объединения признаков с использованием изображений с беспилотной воздушной платформы (БПЛА) и закодированных метаданных. Рассматривается применимость предлагаемого подхода к задачам регрессии значений положения БПЛА и классификации объектов на снимках с минимальным набором известных метаданных. Для регрессии введён механизм интерполяции значений высоты, позволяющий более точно связать разницу визуальных представлений снимка с его высотой и обеспечить большую устойчивость к изменениям высоты и углов поворота камеры БПЛА. Для регулирования вклада текстовой модальности использован метод, обеспечивающий случайное игнорирование текстовых признаков и уменьшающий переобучение на текстовую модальность дополнительно с регуляризацией ошибкой выравнивания признаков и коэффициентом ее влияния на общую ошибку модели. Для классификации применен тот же подход с сравнением нескольких вариантов текстовых шаблонов. Проведены эксперименты на выборках аэрофотосъёмки с вариацией высоты и углов ориентации камеры, которые показали, что предложенный подход превосходит простую конкатенацию признаков, подтверждены выдвинутые гипотезы об улучшении обобщающей способности модели с применением рассматриваемых методов.
Пикалёв Я. С. Обнаружение ключевых объектов и перекрёстная геолокализация: Анализ наборов данных и методологические перспективы //Проблемы искусственного интеллекта.2024. Т. 35. № 4. С. 25-37.
Пикалёв Я. С. Ермоленко Т. В. О нейронных архитектурах извлечения признаков для задачи распознавания объектов на устройствах с ограниченной вычислительной мощностью // Проблемы искусственного интеллекта. 2023. №. 3 (30). С. 44-54.
Sheng K. Zhan H. Xie Z. Chen H. Xu Y. Tang L. Luo B. GeoText-1652: A Benchmark for Language- Aware Cross-View Geo-Localization // European Conference on Computer Vision (ECCV). 2024.
Xu Y. Zhang Z. He W. Wang J. Luo B. A Survey of Open-Vocabulary Object Detection for UAV Imagery // Drones. 2025. Vol. 9, No. 1. P. 12. DOI: 10.3390/drones9010012.
Sun X. et al. Spatial-LLaVA: Enhancing Large Language Models with Spatial Referring Expressions for Visual Understanding //arXiv preprint arXiv:2505.12194. – 2025.
Ye J. et al. Where am I? Cross-View Geo-localization with Natural Language Descriptions //arXiv preprint arXiv:2412.17007. 2024.
Павленко, Б. В. Методика создания набора аэрофотоснимков для задачи перекрёстной геолокализации / Б.В. Павленко, Я.С. Пикалёв // Проблемы искусственного интеллекта. 2024. №4(35). С. 101-112. DOI:10.24412/2413-7383-2024-4-101-112. Подход к мультимодальному объединению данных в задачах регрессии… П
Пикалёв Я. С. Обнаружение ключевых объектов и перекрёстная геолокализация: Анализ наборов данных и методологические перспективы //Проблемы искусственного интеллекта. 2024. Т. 35. №. 4. С. 25-37.
Зуев В. М. Иванова С. Б. Оценка собственного местоположения аппарата на основе анализа видеоизображения //Проблемы искусственного интеллекта. 2024. Т. 33. №. 2. С. 21-28.
Ji Y. et al. Game4loc: A uav geo-localization benchmark from game data //Proceedings of the AAAI Conference on Artificial Intelligence. 2025. Т. 39. №. 4. С. 3913-3921.
Xu W. et al. Uav-visloc: A large-scale dataset for uav visual localization //arXiv preprint arXiv:2405.11936. 2024.19:06
Yang Y. Newsam S. Bag-of-visual-words and spatial extensions for land-use classification //Proceedings of the 18th SIGSPATIAL international conference on advances in geographic information systems. 2010. – С. 270-279. Kim W. Son B. Kim I. ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision // arXiv preprint, arXiv:2102.03334, 2021.
Huang S. et al. Language is not all you need: aligning perception with language models. arXiv //Preprint posted online February. 2023. Т. 27.
Tan H. Bansal M. LXMERT: Learning cross-modality encoder representations from transformers [Электронный ресурс] // arXiv preprint arXiv:1908.07490. 2019. URL: https://arxiv.org/abs/1908.07490 (дата обращения: 18.09.2025).
Radford, A. Kim, J. W. Hallacy, C. Ramesh, A. Goh, G. Agarwal, S. Sastry, G. Askell, A. Mishkin, P. Clark, J. Krueger, G. Sutskever, I. Learning Transferable Visual Models From Natural Language Supervision // arXiv preprint arXiv:2103.00020, 2021. URL: https://arxiv.org/abs/2103.00020
Qu G. et al. Stripnet: Towards topology consistent strip structure segmentation //Proceedings of the 26th ACM international conference on Multimedia. 2018. С. 283-291.
Faghri F. et al. MobileCLIP2: Improving Multi -Modal Reinforced Training // тarXiv preprint arXiv:2508.20691. 2025.
Cui B. Liu Z. Yang Q. UAV-YOLO12: A Multi-Scale Road Segmentation Model for UAV Remote Sensing Imagery // Drones. 2025. Т. 9. №. 8. С. 533.
Less Wright, Nestor Demeure et al. Ranger: synergistic combination of RAdam + Lookahead for the best of both [Электронный ресурс] // GitHub / arXiv preprint. 2019. URL: https://arxiv.org/abs/2004.01461 (дата обращения: 18.09.2025).
Liu L. Jiang H. He P. Chen W. Liu X. Gao J. Han J. On the Variance of the Adaptive Learning Rate and Beyond [Электронный ресурс] // arXiv preprint. – 2019. – № arXiv:1908.03265. – URL: https://arxiv.org/abs/1908.03265. (дата обращения: 18.06.2025).
Zhang M. R. Lucas J. Hinton G. Ba J. Lookahead Optimizer: k steps forward, 1 step back [Электронный
Выпуск: 4(39)'2025 Раздел: Искусственный интеллект и машинное обучение Как цитировать: Б. В. Павленко. ПОДХОД К МУЛЬТИМОДАЛЬНОМУ ОБЪЕДИНЕНИЮ ДАННЫХ В ЗАДАЧАХ РЕГРЕССИИ И КЛАССИФИКАЦИИ НА СНИМКАХ С БПЛА // Проблемы искусственного интеллекта. - 2025. - № 4 (39). - С. 71-83. - https://paijournal.guiaidn.ru/ru/2025/4(39)-7.html