Публікація: Пошук небезпечних подій у відеоархівах спостереження за текстовим описом на основі моделей глибокого навчання
Завантаження...
Дата
Автори
Назва журналу
ISSN журналу
Назва тому
Видавець
ХНУРЕ
Анотація
This paper explores the application of vision-language alignment models for prompt-based retrieval of dangerous events in surveillance video archives. Traditional anomaly detection requires extensive labeled data and retraining for each scenario. The proposed approach leverages contrastive pretraining (CLIP, InternVideo2) and LLM-driven anomaly scoring (LAVAD, Holmes-VAD) to enable natural-language retrieval of hazardous events without fine-tuning. We analyze AnomalyCLIP's zero-shot anomaly recognition and Holmes-VAD's explainable detection on UCF-Crime, XD-Violence, and UCA benchmarks. A cascaded architecture combining lightweight CLIP-scoring with LLM-driven semantic verification is proposed for scalable, interpretable surveillance.
Опис
Ключові слова
відеоспостереження, відеоархіви, пошук подій, небезпечні події
Цитування
Кит М. О. Пошук небезпечних подій у відеоархівах спостереження за текстовим описом на основі моделей глибокого навчання // Радіоелектроніка та молодь у XXI столітті : матеріали 30-го Міжнар. молодіж. форуму, 22–24 квітня 2026 р. Харків, 2026. Т. 7. С. 295-297.