
Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo
PetrUfa 1 час назад Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo Средний 11 мин 1.3K Машинное обучение * Open source * Видеокарты Linux * Windows * Туториал Согласно...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. PetrUfa 1 час назад Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo Средний 11 мин 1. 3K Машинное обучение * Open source * Видеокарты Linux * Windows * Туториал Согласно опубликованным бенчмаркам, Ornith‑1. 0‑35B показала себя лучше Qwen3.
5‑397B‑A17B в тех тестах, где модель должна не просто написать код, а самостоятельно работать в терминале и пользоваться инструментами. 1 с Terminus‑2 разница составила 64,2% против 53,5%. 5‑397BOrnith − QwenTerminal‑Bench 2.
Технические детали
1, Terminus‑264,253,5+10,7Terminal‑Bench 2. 1, Claude Code62,848,6+14,2SWE‑bench Verified75,676,4−0,8SWE‑bench Pro50,451,6−1,2SWE‑bench Multilingual69,369,30,0NL2Repo34,636,8−2,2ClawEval Avg69,870,7−0,9SWE Atlas — QnA37,120,4+16,7SWE Atlas — RF29,718,4+11,3SWE Atlas — TW27,818,5+9,3Ornith не сильнее Qwen во всех задачах: на SWE‑bench Verified, SWE‑bench Pro, NL2Repo и ClawEval Qwen немного впереди. Но для локального coding‑агента результат выглядел интересно.
Ornith занимает на порядок меньше памяти и обучалась именно под agentic coding — работу с терминалом, инструментами, памятью и повторными попытками после ошибок. Мы проверили модель на открытом срезе из 43 задач. В него вошли tool calling, генерация кода, исправление репозиториев, работа с памятью и длинным контекстом:КлассРезультат OrnithSimpleQA4/5BFCL Orion Safe9/9BFCL Memory1/1HumanEval+17/17PersistBench3/3NIAH4/4SWE‑bench Python2/2SWE‑bench Multilingual0/1TheAgentCompany0,8333/1Итого40,8333/43Локальный прогон подтвердил, что модель хорошо подходит для агентного кодинга.
После этого появилась другая мысль: Ornith явно можно ускорить на Ubuntu‑машине с Ryzen AI MAX+ 395, Radeon 8060S и пропускной способностью памяти до 256 ГБ/с. Модель занимала около 19–21 ГБ, помещалась в общей памяти целиком, но выдавала только 68–74 ток/с. Для увеличения скорости нужно было перебрать следующие гипотезы:изменить K‑quant matvec и число строк, обрабатываемых одним Vulkan dispatch;объединить MUL_MAT_ID dispatch и подобрать размер workgroup;проверить graphics queue вместо compute queue;подобрать batch и ubatch;уменьшить KV‑cache с Q8 до Q4;добавить MTP и подобрать глубину draft;селективно переквантовать самые тяжёлые expert‑тензоры;использовать exact n‑gram reuse на повторяющемся agent/code‑трафике.
Отраслевые последствия
Один Vulkan‑патч дал меньше процента. Рабочий результат получился только из комбинации MTP, n‑gram reuse, селективной квантизации и настроек runtime: 79,661 ток/с на полном 43‑task прогоне и 99,088 ток/с на повторяемом code‑потоке без потери балла. Железо и исходная скоростьДля получения убедительного результата в работе участвовали две разные машины:КомпонентUbuntu‑серверWindows‑ноутбукCPU/APUAMD Ryzen AI MAX+ 395Intel Core i7‑13650HXGPURadeon 8060S, Vulkan gfx1151RTX 4060 Laptop, 8 GiBRAM128 GiB DDR5 UMA63,74 GiBRuntimellama.
cpp b9994, Vulkanllama. cpp b10066 CUDA; LM Studio 2.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.




