
TAPe+ML: детекция, классификация и теперь и сегментация SOTA‑уровня в 0.1M параметров
oopatow 17 минут назад TAPe+ML: детекция, классификация и теперь и сегментация SOTA‑уровня в 0.1M параметров Сложный 8 мин 625 Искусственный интеллект Машинное обучение * Data Engineering * Data Mining * Кейс кадр из...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Вот важная новость с фронта ИИ: oopatow 17 минут назад TAPe+ML: детекция, классификация и теперь и сегментация SOTA‑уровня в 0. 1M параметров Сложный 8 мин 625 Искусственный интеллект Машинное обучение * Data Engineering * Data Mining * Кейс кадр из фильма Космическая Одиссея 2001Мы собрали модель, которая одновременно решает детекцию, классификацию и сегментацию, и при этом остается радикально легче и экономичнее по ресурсам, чем любые современные SOTA‑архитектуры. На COCO и RF100‑VL мы получаем качество детекции уровня крупных transformer‑детекторов при сотнях раз меньшем числе параметров, а на LVIS – покрытие и точность масок, недостижимые для YOLO‑семейства без переобучения, все это в режиме близком к real‑time на массовом железе.
В терминах «качество / параметры / латентность» наша модель находится в области, где у крупных конкурентов просто нет сопоставимых точек: либо они хуже по качеству при сопоставимой скорости, либо требуют на порядки больше параметров и железа, чтобы выйти на похожие цифры. Из практических применений, которые напрямую следуют из нашей архитектуры в контексте сегментации: более стабильные маски для трекинга объектов между кадрами, надежная опора для downstream‑моделей, которым нужна не грубая, а по-настоящему точная граница объекта (классификация частей объекта, контроль качества, генеративные пайплайны), а также сценарии, где COCO‑style маски слишком грубы для задачи, а полноценные SAM‑подобные модели слишком тяжелы для работы в реальном времени. ДисклеймерМы уже рассказывали про TAPe+ML – наше единое ядро распознавания (единственное в мире), которое делает детекцию и классификацию на, скажем, новых единицах информации (мы их прозвали T-bits), гораздо информативней, чем сырые пиксели, при этом обходясь моделью размером меньше 100 тысяч параметров и показывая результаты, превосходящие SOTA.
Технические детали
Следующим шагом мы закрыли последний пробел в нашей архитектуре – сегментацию. И сделали это не как отдельную надстройку, а как встроенную часть того же ядра. Как устроена сегментация внутри TAPe+MLСтандартный путь для большинства детекторов – иметь отдельную «голову» сегментации, которая либо генерирует маску из фиксированного набора прототипов (как в YOLO‑seg), либо использует полноценный transformer‑decoder (как в RF‑DETR‑Seg или Mask DINO).
Обе схемы работают, но обе платят цену: либо разрешением маски, либо количеством параметров и латентностью. Мы можем себе позволить (потому что знаем его) другой путь – маски пиксельного уровня, без роста числа параметров и без отдельного тренировочного цикла. В нашей архитектуре сегментация – это замена отдельной субмодели поиска заднего фона.
Раньше эта субмодель просто отделяла «что не фон» от «что фон»; теперь она делает то же самое, но контурным образом – рисует замкнутые границы объектов на уровне пикселей, и именно эта область становится тем, на что «смотрят» остальные субмодели для наведения и классификации.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.





