Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков

Vtmpas 29 минут назад Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков Средний 18 мин 960 Блог компании RWB Искусственный интеллект Машинное обучение * Big Data *...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. Vtmpas 29 минут назад Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков Средний 18 мин 960 Блог компании RWB Искусственный интеллект Машинное обучение * Big Data * Ретроспектива Обучение LLM — это в первую очередь инфраструктурная задача: нужен пайплайн, который можно перезапускать с новыми данными, архитектурой или другим расписанием обучения и получать повторяемый внутри команды результат. В этом материале — рассказ команды обучения и инференса моделей RWB о том, как мы с нуля, без загрузки pretrained-весов, обучили текстовую модель на основе гибридной архитектуры Qwen3. 5-2B-Base и какие выводы сделали по пути — от сборки датасетов до чтения графиков онлайн-оценки.
Кратко о результатах:Собрали внутренне повторяемый pretrain-пайплайн на Megatron-LM и обучили гибридную архитектуру Qwen3. 5-2B — сначала на 1 трлн токенов, затем на 11 трлн с трёхфазным доменным блендом. Обучали только текстовую часть.
Технические детали
В эксперименте на 1 трлн токенов проверили, что модель ведет себя стабильно, получили адекватные метрики на основных бенчмарках и поняли, что необходимо добавить больше математических датасетов в собранный бленд данных. В наших двух запусках MMLU в разных форматах вопроса вёл себя по-разному: completion-form (CF) раньше выходил на плато, а multiple-choice form (MCF) стартовал медленнее, но продолжал расти до конца decay-фазы. В одном парном эксперименте с модифицированным attention-слоем XSA (Exclusive Self-Attention) на Qwen3-1.
7B получили Δ val loss = −0,009 и +1,6 п. на MMLU ценой примерно 5–10% throughput. Повторные полные прогоны на разных seed пока не проводили.
Финальный эксперимент на 11 трлн токенов дал сопоставимые с нашим внутренним замером Qwen3. 5-2B-Base метрики на commonsense-бенчмарках. Отметим, что эти цифры сравнимы только внутри зафиксированного eval-протокола.
Отраслевые последствия
Слабым местом остаётся качество модели на математических и логических задачах, и это мы планируем исправить, расширив коллекцию доменных датасетов. ВведениеРанее наша команда выпустила семейство post-train моделей BerryLM, дообученных на русский язык. На момент публикации крупнейшая модель, BerryLM-XL, вошла в топ-3 бенчмарка MERA.
Все модели этой серии широко применяются в продуктах Wildberries: в ИИ-ассистенте для покупателей, сравнении и поиске товаров, а также в инструментах, помогающих продавцам готовить ответы на отзывы и вопросы покупателей. Кроме того, модели BerryLM используются для автоматизации ряда внутренних процессов RWB. Следующий шаг для команды - проверить, насколько сложно самостоятельно собрать полный цикл pretrain с нуля и каких результатов можно добиться на открытых датасетах.
Для компании собственный пайплайн обучения особенно важен: он позволяет контролировать состав данных и добавлять доменные знания для конкретных бизнес-задач. Сразу скажем, что в рамках этой задачи мы не ставили целью обучить base-модель, которая обошла бы открытые аналоги.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






