Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8-27B. Что реально ускоряет, а что нет
VladimirVP 28 минут назад Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8-27B. Что реально ускоряет, а что нет Средний 7 мин 1K Машинное обучение * Искусственный интеллект macOS * Natural Language Processing *...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. VladimirVP 28 минут назад Локальный агент для кода на Mac: MTPLX + pi + Qwen3. Что реально ускоряет, а что нет Средний 7 мин 1K Машинное обучение * Искусственный интеллект macOS * Natural Language Processing * Кейс Я хотел, чтобы кодовый агент работал целиком на ноутбуке, без облака: локальная модель, локальный сервер, агент в терминале. Главная боль с самого начала — скорость.
Агент постоянно перечитывает длинный контекст и много «думает», и на локальном железе это превращается в минуты ожидания на каждую задачу. Я взял MTPLX — сервер для Apple Silicon, который обещает двух-трёхкратное ускорение генерации за счёт встроенных в модель голов multi-token prediction (MTP). Посадил на него агента pi и прогнал одну и ту же сложную задачу в разных режимах.
Технические детали
Ниже — что получилось, с цифрами, провалами и граблями. Коротко:MTP действительно ускоряет генерацию в 3 раза (21 → 63 ток/с на коротком промпте), но в реальной работе агента получается около 34 ток/с. На сложной задаче время решения — 10–16 минут, и больше всего оно зависит от того, сколько модель решит думать, а не от настроек сервера.
Отключать или урезать размышления не выгодно: без них модель не довела код до рабочего состояния, на low вышло даже медленнее. SSD-кеш и квантование KV-кеша на этой задаче ничего заметного не дали. СтендЖелезоMacBook Pro, M4 Max, 128 ГБ unified memoryСерверMTPLX 2.
3 (приложение для macOS)МодельYoussofal/Qwen3. 8-27B-MTPLX-Optimized-Speed, 4 бита, ~20,7 ГБ весовКонтекст262 144 токенаПрофиль MTPLXturbo, глубина черновика D3Агентpi 0. 1, чистая установка без расширенийКак работает MTPLXОбычная генерация — один проход модели на один токен.
Отраслевые последствия
Спекулятивное декодирование сначала дёшево «угадывает» несколько следующих токенов, а потом одним проходом большой модели проверяет их все. Если угадано верно, за один проход получаем несколько токенов. Обычно для угадывания нужна вторая, маленькая модель.
8 угадыватель встроен: это MTP-головы, которые учились вместе с моделью. MTPLX использует их напрямую, так что лишней памяти под черновую модель не нужно. Проверка точная: распределение ответа не меняется, меняется только скорость.
У MTPLX есть встроенный подбор глубины черновика. Вот что он показал на моём Mac:$ mtplx tune AR 21. 99x BEST Тройное ускорение генерации — это реально.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.






