Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

kotafey 36 минут назад Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090 6 мин 1.1K Искусственный интеллект Настройка Linux * Компьютерное железо Плотная 27B-модель на двух RTX 3090 в...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: kotafey 36 минут назад Qwen3. MTP и тензорный параллелизм в llama. cpp: 75 ток/сек на двух RTX 3090 6 мин 1.
1K Искусственный интеллект Настройка Linux * Компьютерное железо Плотная 27B-модель на двух RTX 3090 в llama. cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна.
Технические детали
Значит, где-то узкое горлышко, и надо разобраться, что и где подкрутить. Оказалось, что горлышек несколько, и все они снимаются флагами запуска: те же веса — 75 токенов в секунду. Ниже каждый флаг описан одинаково: зачем, что писать, что даёт, где ломается.
В конце — готовый docker run. Стенд: 2× RTX 3090 (24 ГБ, PCIe 4. 0 x16, без NVLink), Threadripper 3960X, 121 ГБ RAM, Ubuntu 26.
cpp:full-cuda, build 10666. 8-27B (плотная, мультимодальная, с MTP-головой внутри GGUF). 8 ток/с на генерации, два запроса по 262 144 токена одновременно, качество на моих тестах не изменилось.
Отраслевые последствия
Почему 32 — это не «упёрлись в железо»Плотная модель на каждый токен читает все веса. 1 ГБ, память 3090 — ~936 ГБ/с. При послойном разбиении карты работают по очереди: 12 ГБ / 936 ГБ/с ≈ 12.
7 мс на токен, потолок ≈ 39 ток/с. 4, то есть 83% от потолка. Сам потолок низкий, и его двигают ровно две вещи: читать веса на обеих картах одновременно и получать больше одного токена за проход.
Включить MTP-спекулятивное декодированиеЗачем. 8 лежит слой Multi-Token Prediction (blk. *) — встроенная draft-модель.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.



