Jev, Laya и Gemini Flash на трёх задачах классификации в поддержке
n_cto 47 минут назад Jev, Laya и Gemini Flash на трёх задачах классификации в поддержке Средний 10 мин 1.7K Машинное обучение * Управление разработкой * Управление проектами * SaaS / S+S * Кейс Recovery Mode Пока про...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: n_cto 47 минут назад Jev, Laya и Gemini Flash на трёх задачах классификации в поддержке Средний 10 мин 1. 7K Машинное обучение * Управление разработкой * Управление проектами * SaaS / S+S * Кейс Recovery Mode Пока про Jev говорят повсюду, у меня есть желание разобраться где он реально применим и вообще можно ли его заменить чем-то опенсурным и чем он лучше всяких дешевых быстрых моделей которые я всегда использовал для быстрой классификации. Провел замеры на своих проектах и расскажу про то что у меня получилось в каких задачах был профит, а какие не подходят для такого рода инструментов и как долго и сложно их внедрять.
Контекст: финтех-продукт, поддержка с потоком в несколько десятков обращений в день (пилотный замер за неделю). Заголовок называет модели прямо: иначе статью не найдут в поиске. В теле говорю «закрытая» и «открытая», чтобы не дублировать имена, и «gemini flash lite», где она идёт как альтернатива.
Технические детали
Задача первая: отличить осмысленный ответ от мусораПользователь заполняет анкету. Надо понять, ответил ли он на вопрос по теме или прислал «ааааааа», или написал про погоду. Смок-тест открытой модели: 12 примеров на русском, английском и испанском, четыре постановки задачи.
Результат 3–5 правильных из 12 при случайном угадывании 4 из 12. Доверительный интервал для пяти из двенадцати тянется от 19% до 68%. Этого хватило, чтобы не тратить на неё вечер; полноценный замер этой модели ниже, на другой задаче.
Живой ответ «На созвоны, после которых ничего не меняется» модель оценила в 0,57 по осмысленности, а «ааааааа» посчитала настоящим ответом. При старте библиотека сама предупредила, что в этом чекпоинте параметры калибровки некорректны. Скорость при этом отличная, 30 миллисекунд на процессоре ноутбука без видеокарты, но скорость без точности сама по себе значения не имеет.
Отраслевые последствия
Тогда я взял 80 реальных ответов и прогнал их через пять быстрых моделей openroutera, добавив к сравнению свой классификатор на правилах. Оговорка по времени ответа: это latency агрегатора в конкретный день, а не свойство модели. СпособЛовит мусорОтклоняет живыхВремяЦена 1000 ответовклассификатор на правилах95%0%меньше 1 мс0gemini 2.
5 flash lite90%0%0,5 с0,011 $llama 3. 1 8b100%7,5%2,0 с0,004 $gpt 5 nano70%0%2,7 с0,15 $gemma 3 4b it40%20%0,9 с0,003 $Полный замер из восьми строк лежит в черновике; четыре строки в таблице, между которыми есть содержательная разница. Остальные либо статистически неразличимы с этими, либо попали в одну из этих категорий.
Кому интересны все восемь, ссылка на полную таблицу в закрепе канала. Что в этих строках решает судьбу проекта. Классификатор на правилах это длина меньше N символов, плотность осмысленных слов по словарю, наличие знаков препинания, энтропия символов, проверка на стоп-фразы типа «аааа», «???
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.






