Публікація:
Пошук небезпечних подій у відеоархівах спостереження за текстовим описом на основі моделей глибокого навчання

Завантаження...
Зображення мініатюри

Дата

Автори

Назва журналу

ISSN журналу

Назва тому

Видавець

ХНУРЕ

Дослідницькі проекти

Організаційні одиниці

Випуск журналу

Анотація

This paper explores the application of vision-language alignment models for prompt-based retrieval of dangerous events in surveillance video archives. Traditional anomaly detection requires extensive labeled data and retraining for each scenario. The proposed approach leverages contrastive pretraining (CLIP, InternVideo2) and LLM-driven anomaly scoring (LAVAD, Holmes-VAD) to enable natural-language retrieval of hazardous events without fine-tuning. We analyze AnomalyCLIP's zero-shot anomaly recognition and Holmes-VAD's explainable detection on UCF-Crime, XD-Violence, and UCA benchmarks. A cascaded architecture combining lightweight CLIP-scoring with LLM-driven semantic verification is proposed for scalable, interpretable surveillance.

Опис

Ключові слова

відеоспостереження, відеоархіви, пошук подій, небезпечні події

Цитування

Кит М. О. Пошук небезпечних подій у відеоархівах спостереження за текстовим описом на основі моделей глибокого навчання // Радіоелектроніка та молодь у XXI столітті : матеріали 30-го Міжнар. молодіж. форуму, 22–24 квітня 2026 р. Харків, 2026. Т. 7. С. 295-297.

DOI

Схвалення

Рецензія

Доповнено

На які посилаються