Галлюцинации VLM в zero-shot детекции: ложные тревоги о дыме и решение на уровне промпта
nulla_dies_sine_linea 13 минут назад Галлюцинации VLM в zero-shot детекции: ложные тревоги о дыме и решение на уровне промпта Средний 12 мин 599 Искусственный интеллект Машинное обучение * Обработка изображений * Кейс...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: nulla_dies_sine_linea 13 минут назад Галлюцинации VLM в zero-shot детекции: ложные тревоги о дыме и решение на уровне промпта Средний 12 мин 599 Искусственный интеллект Машинное обучение * Обработка изображений * Кейс Из песочницы Ранняя детекция дыма и огня — частая и ценная задача уличной видеоаналитики. Камера может заметить возгорание раньше, чем люди на улице или оператор. Обучать отдельную модель детекции — это датасет, разметка и время, а возгорания в кадре выглядят слишком по-разному, чтобы быстро покрыть все случаи.
Поэтому, когда сценариев детекции в рабочих проектах стало слишком много, я решила попробовать короткий путь, попросить VLM (языковую модель, умеющую работать с изображениями) найти дым текстовым промптом в zero-shot режиме, то есть вообще без обучения под задачу. Первой моделью взяла Qwen3. 5-9B — VLM среднего размера, порядка 9 млрд параметров.
Технические детали
Схема простая: на вход — кадр и промпт «найди дым, верни bbox», на выходе — JSON с координатами. Детектор настраивается текстовым описанием, в этом всё преимущество подхода. На тестовых видео с уличных и панорамных камер с реальным дымом система работала хорошо.
А вот проверка на заведомо чистых видео (обычные дворы с парковкой, газоном, деревьями, людьми, магазинами) закончилась неожиданно: ложные сработки на 70 % кадров, на отдельных видео до 96 %. В статье разбираю, почему это произошло, какие известные приёмы промпт-инжиниринга не помогли и как проблема решилась изменением одного промпта: доля ложных тревог на проблемных камерах снизилась с 70 % кадров до нуля, FPR (доля ложных срабатываний на негативных кадрах) на независимом бенчмарке — с 10. 6 % при recall выше 80 %.
Основной вывод экспериментов: задача детекции складывается из двух решений — «есть ли объект» и «где он», и их объединение в один шаг ответа VLM и один формат вывода может вызывать ложные срабатывания, когда объекта в кадре нет. Тестовые данныеКоротко о том, на чём всё измерялось. Наборов два:Негативная выборка — видео с реальных уличных камер, в основном дворы, порядка двух тысяч кадров.
Отраслевые последствия
Отсутствие дыма и огня на них проверено вручную, поэтому каждое срабатывание на этом наборе — ложное. Именно на нём измерены все «70 % ложных» и весь перебор промптов. Кадры внутри одного видео сильно коррелированы, поэтому дальше мы смотрим не только на долю кадров, но и на число уникальных объектов, вызвавших срабатывания.
Размеченный бенчмарк — тысячи изображений с ручной разметкой, подобранных под наш домен: позитивы (дальний дым и огонь над лесом и полем, пожары зданий и автомобилей, задымление на улицах) и негативы со сходными сценами. На нём считались итоговые recall, precision и FPR. Варианты промпта подбирались на негативной выборке и отдельном небольшом размеченном наборе с настоящим дымом, не пересекающемся с бенчмарком.
Сам бенчмарк использовался только для итоговой оценки. Данные не академические, а ориентированные на реальные условия эксплуатации.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






