Как мы построили multilabel guardrail-классификатор и как мы сделали его в 3 раза быстрее и дешевле
StarKap 37 минут назад Как мы построили multilabel guardrail-классификатор и как мы сделали его в 3 раза быстрее и дешевле Сложный 12 мин 1.5K Блог компании Raft Искусственный интеллект Информационная безопасность *...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: StarKap 37 минут назад Как мы построили multilabel guardrail-классификатор и как мы сделали его в 3 раза быстрее и дешевле Сложный 12 мин 1. 5K Блог компании Raft Искусственный интеллект Информационная безопасность * Natural Language Processing * Как учесть 15 категорий риска одновременно, не потерять редкие и критичные классы, обмануть попытки обхода фильтров и не разориться на инференсе. Изображение сгенерировано с помощью seedream-5.
0-proЛюбой продукт с пользовательским вводом (чат-бот, ассистент, поиск с генеративным ответом) может столкнуться с ситуацией, когда пользователь или сама модель сгенерирует то, чего лучше бы не было (инструкции к насилию, экстремистскую риторику, финансовое мошенничество). Список конечный, но каждая категория требует отдельного решения. Привет, дорогой читатель!
Технические детали
Сегодня мы расскажем, как построили систему, которая ловит такой контент автоматически, в реальном времени и на двух языках(как минимум качество меряли на двух). Давайте посмотрим, что у нас получилось и сколько это стоит в деньгах. Но для начала нужно понять...
Зачем нужен отдельный классификаторУ бизнеса, который не отфильтрует вредоносный контент, есть три типа издержек:Регуляторный риск - штрафы и блокировки (152-ФЗ, DSA, отраслевые нормы модерации);Репутационный риск - скриншот неприемлемого ответа модели в соцсетях и мессенджерах не забудется;Операционные издержки - ручная модерация масштабируется линейно с трафиком, а трафик обычно растёт быстрее бюджета на модерацию. Guardrail-классификатор проверяет входящие и исходящие сообщения на принадлежность к 15 категориям риска до того, как контент долетит до пользователя или до основной модели. Почему это не классический бинарный или keyword-фильтрОдин и тот же запрос может одновременно триггерить несколько категорий, например, финансовое мошенничество и киберпреступление разом.
Это и есть задача multi-label-классификаци, то есть модель принимает 15 независимых бинарных решений на каждый текст вместо выбора одной категории из списка. Целевые категории неоднородны, и мы их разделяем на вредоносные и тематические категории. Вредоносные категории: трудоэксплуатация детей, насильственные преступления, оружие, наркотики, причинение вреда себе, дискриминация, нацизм, ненасильственные преступления, финансовые преступления, киберпреступления, контент 18+ (и педофилия).
Отраслевые последствия
Тематические категории: нецензурные выражения, религиозные преступления, ЛГБТ-контент. Их срабатывание означает, что текст относится к теме, режим обработки которой задаёт внедряющая организация или применимое к ней законодательство. У всех основание конкретное: LGBT — ст.
21 КоАП РФ (пропаганда нетрадиционных сексуальных отношений и (или) предпочтений, смены пола, отказа от деторождения), Religion — ст. 148 УК РФ (публичные действия в целях оскорбления религиозных чувств верующих; ч. 2 — те же деяния в местах, специально предназначенных для богослужений).
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.






