GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями

Shakirov_Emil 28 минут назад GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями Средний 19 мин 873 Блог компании Сбер Обзор Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Вот важная новость с фронта ИИ: Shakirov_Emil 28 минут назад GigaChat 3. 5 Reasoning — первая в России открытая модель с рассуждениями Средний 19 мин 873 Блог компании Сбер Обзор Привет, Хабр. Мы выпускаем GigaChat 3.
5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Веса и код запуска на huggingface, также модель можно попробовать в giga. Главное, что изменилось в обучении: после SFT модель целиком прошла через online RL.
Технические детали
Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты, и другие), каждый со своей наградой, которые потом собрали обратно в одну модель. Как это устроено и на чём мы набили шишки, рассказываем ниже. Где прирост больше всего относительно GigaChat 3.
5 Instant:GPQA-Diamond: 61,11 → 82,32AIME-2026, mean@32: 67 → 92IFBench Loose Prompt: 43,66 → 77,00Полная таблица с внешними моделями и eval-конфигами приведена в разделе 3. Если вам нужен только запуск, то сразу переходите к разделу 4. Если интересно, как учить reasoning-модель на RL и почему это заняло у нас больше 9 месяцев, то читайте по порядку.
Как мы учили модельЕсли коротко, то обучение выглядело так: взяли SFT-чекпоинт, из него вырастили шесть отдельных моделей (по одной на домен), и каждую учили online RL со своей наградой; потом собрали шесть моделей обратно в одну через on-policy distillation. Дальше подробно и по порядку: зачем вообще нужен online RL, как устроены эксперты и награда, что происходило внутри каждого домена и как всё склеили. Пайплайн обучения: SFT-чекпоинт, шесть экспертов на online RL, OPD в одну модель1.
Отраслевые последствия
1 Зачем вообще нужен online RLНа этапе SFT мы показываем модели готовые решения и просим их воспроизводить. Она запоминает, как выглядит правильный ответ, но не то, как до него дойти. Дайте задачу, которой не было в обучающей выборке, и разница видна сразу: модель уверенно начинает, повторяет знакомую структуру рассуждения и сыплется на третьем шаге, не заметив, что противоречит сама себе.
Online RL устроен иначе. Мы даём модели задачу, она решает её сама, мы оцениваем результат и сдвигаем веса в сторону тех попыток, которые сработали. Повторяем тысячи раз.
Слово «online» означает, что обучающие данные модель производит сама по ходу дела, а не берёт из собранного заранее датасета. Постепенно закрепляются приёмы, которые повышают шанс дойти до ответа: перепроверить промежуточный результат, вернуться на шаг назад, зайти с другой стороны. Это и называют рассуждением.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.




