Qwen3.8-27B на своей карте против 304B по API
daniel_ivanov 23 минуты назад Qwen3.8-27B на своей карте против 304B по API Простой 3 мин 663 Искусственный интеллект Open source * Обзор Суббота, вечер. Хотел за час выяснить, какую из двух свежих моделей ставить себе...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. daniel_ivanov 23 минуты назад Qwen3. 8-27B на своей карте против 304B по API Простой 3 мин 663 Искусственный интеллект Open source * Обзор Суббота, вечер. Хотел за час выяснить, какую из двух свежих моделей ставить себе - Qwen3.
8-27B или DeepSeek V4 Flash 0731. Вышло семь часов и три новых строки в мой бенчмарк :)МодельБаллПрошлоtok/sTTFTQwen3. 8-27B, NVFP4, своя карта0.
Технические детали
8-27B, тот же вес по API0. 9 сDeepSeek V4 Flash 0731, по API0. 0 сПервые две строки - одна и та же модель.
Разница в задержке - почти пятикратная. Бенч свой: 50 задач, собранных из моей же двухмесячной работы. Не чистые задачи по коду - это лишь 45% того, что я реально пишу, это стратегические документы и архитектурные решения.
Судей трое, сид заморожен, каждый прогон пишет манифест. Первый прогон сначала соврал, и виноват был яПервый прогон - 134 секунды до первого токена, 1. 79 ₽ за решённую задачу - худшее, что вообще появлялось у меня в результатах.
Отраслевые последствия
Решил, что дело в ZDR (а я использую на OR только такие модели) и пошёл проверять. У модели на весь OR один провайдер. Модель вышла два дня назад, её поднял один хостер, и его собственная публичная статистика всё объясняет: P99 по сквозной задержке - 788 секунд, ошибки структурированного вывода - 13.
Прогнал через свою карту (Селектел, спасибо! ) и на своей карте прогон выдал 27 секунд TTFT, это уже результат. Еще граблиОтвет не поместился в reasoning window.
Задача arch-001 получила ровно 0 - все три судьи по нулю, ответ пустой. Дефолтные 4096 токенов ушли в reasoning целиком, до ответа дело не дошло: finish_reason=length, content=None (телеметрию допилила два дня, чтобы не получать больше таких проблем). Сохранённого сырого файла на этот прогон у меня не осталось - я стопнул его на шестой задаче из пятидесяти, а харнесс пишет сырые результаты только после полного цикла.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.





