Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Tialian 25 минут назад Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег Средний 16 мин 415 IT-инфраструктура * Искусственный интеллект Финансы в IT DevOps * Анализ и проектирование систем...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Вот важная новость с фронта ИИ: Tialian 25 минут назад Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег Средний 16 мин 415 IT-инфраструктура * Искусственный интеллект Финансы в IT DevOps * Анализ и проектирование систем * Аналитика Из песочницы Все цифры сняты с работающего стенда: потребление токенов — за календарную неделю по данным шлюза, метрики движка — кумулятивно за период аптайма (11 426 обработанных запросов). Продолжение — про выбор модели по замерам, а не по бенчмаркам — будет отдельной статьёй. Для кого эта статьяДля тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов.
Здесь конфиги, цифры и грабли, а не введение в трансформеры. Что вы унесёте: историю пяти последовательных конфигураций с тем, что каждая дала и чего стоила; рабочий набор флагов vLLM под одну карту Blackwell; три неочевидных бага и обходы; разбор реального счёта с отношением вход/выход 452:1. Главный вывод, если дальше читать некогда: на агентской нагрузке кэш префикса решает больше, чем выбор модели, размер карты и всё остальное вместе взятое.
Технические детали
Мы шли к этому через четыре промежуточных стенда и потратили лишние месяцы, потому что не понимали, что именно меряем. СтендПараметрЗначениеGPURTX PRO 6000 Blackwell 96 GB (sm120)Владение железомаренда, 131 000 ₽/месМодельQwen3-Coder‑Next‑FP8, 80B MoE / 3B активных, 262K контекстаДвижокvLLM 0. 1 в DockerШлюзLiteLLM 1.
0 + PostgresФронтnginx + TLSПользователи25 подключено, 16 активных (ежедневно, постоянный поток запросов)TTFT (среднее)1. 4 сПрофиль нагрузкиагентский кодинг: 1С/BSL, ReactJS, Java, PHP. Claude Code и Claude Desktop в режиме third‑partyОграничениезакрытый контур, код заказчиков не покидает периметрПоследняя строка — не формальность, а причина существования стенда.
Как мы сюда пришли: пять конфигурацийЭто не хронология ради хронологии. Каждый переход что‑то ломал, и понятно это становилось только на следующем шаге. Qwen3 30B, dense, без MoE.
Отраслевые последствия
Кэширование работало из коробки, стенд вёл себя предсказуемо. Проблема была одна и непреодолимая: на реальных задачах модель не тянула — не замыкала агентский цикл, требовала ручных подталкиваний. Qwen3-Coder‑Next 30B, MoE.
Качество выросло, стенд остался живым. Но модель для 24-гигабайтных карт на 96 GB занимала четверть железа — мы гоняли малолитражку в грузовике. Qwen3-Coder‑Next 80B, MoE.
Та же архитектура и tokenizer, вся обвязка перенеслась один в один — переход занял вечер. Качество стало приемлемым.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.





