Сравниваем LLM, 12 тестов для китайских рабочих лошадок: MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro
Irvin_Nivri 6 минут назад Сравниваем LLM, 12 тестов для китайских рабочих лошадок: MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro Средний 98 мин 125 Блог компании BotHub Искусственный интеллект Читальный зал...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: Irvin_Nivri 6 минут назад Сравниваем LLM, 12 тестов для китайских рабочих лошадок: MiniMax M3, LongCat 2. 5-Pro и DeepSeek V4 Pro Средний 98 мин 125 Блог компании BotHub Искусственный интеллект Читальный зал Научно-популярное Тестирование IT-систем * Обзор В первой статье цикла мы гоняли по нашим тестам Opus 4. 1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.
5 Pro, в третьей спустились в средний класс, а в четвёртой вывели на ринг китайские флагманы. В комментариях к прошлой части нас спросили о том, что происходит этажом ниже: флагманы флагманами, а работать людям приходится на моделях попроще. Сегодня спускаемся на пару ступеней ниже.
Технические детали
Принцип отбора снова меняется, и снова осознанно. В прошлый раз мы вынесли цену за скобки и брали топов четырёх лабораторий. Сегодня наоборот: собираем четвёрку по стоимости токена, чтобы участники играли в одной лиге по деньгам.
Это те модели, которые ставят в прод, когда счёт идёт не на один запрос, а на сотню тысяч в месяц. DeepSeek V4 Pro в этом списке выглядит немного странно— месяц назад она проходила у нас по разряду флагманов. Но по цене токена она попала ровно в этот диапазон, а заодно даёт нам то, чего в цикле ещё не было: одну и ту же модель, прогнанную по одним и тем же двенадцати промптам с интервалом в месяц.
Забегая вперёд, это оказалось самым интересным в статье. Методика не меняется. Никаких бенчмарков и маркетинга — только реальные будничные задачи.
Отраслевые последствия
Тестируем через агрегатор нейросетей BotHub: он работает по API, а этот метод избавлен от подпорок и костылей, которые неявно помогают моделям в их веб-интерфейсах. Затраты по-прежнему измеряем в CAPS — внутренней валюте BotHub, привязанной к числу затрачиваемых токенов. Курс тот же, что и в прошлой статье: 1 рубль = 6370 CAPS.
Победителя, как и раньше, чаще всего будем определять субъективно, уж простите нам эту вольность. Все материалы прикладываем, ответы моделей приводим полностью под катом, так что вы можете не согласиться с нашим мнением и выбрать своего фаворита. Итак, в сравнении участвуют:MiniMax M3 — рабочая модель MiniMax, лаборатории, которая известна в основном видеогенерацией, а текстовую линейку тянет параллельно.
0 — модель Meituan, самого неожиданного игрока на этом поле: компания занимается доставкой еды. 5-Pro — линейка Xiaomi, зашедшей в LLM позже всех и сразу с прицелом на устройства. DeepSeek V4 Pro — старшая модель DeepSeek.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.




