Воспроизведение grokking и проверка сохранённых моделей

Igor_Rybakoff 15 минут назад Объяснить с Воспроизведение grokking и проверка сохранённых моделей Средний 5 мин 175 Искусственный интеллект Машинное обучение * Кейс Нейросеть может почти идеально отвечать на примеры, на...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. Igor_Rybakoff 15 минут назад Объяснить с Воспроизведение grokking и проверка сохранённых моделей Средний 5 мин 175 Искусственный интеллект Машинное обучение * Кейс Нейросеть может почти идеально отвечать на примеры, на которых обучалась, и при этом проваливаться на новых. Это простое различие — «запомнил ≠ обобщил» — и есть удобная точка входа в феномен grokking: модель сначала запоминает обучающую выборку, а способность обобщать появляется значительно позже. В Grokking Lab я хотел не просто получить красивую кривую обучения, а собрать воспроизводимый эксперимент: фиксировать конфигурацию, seed, milestones, checkpoints и измеренные метрики, а затем проверять сохранённые состояния повторным forward pass.
Поэтому основной принцип проекта — evidence first: сначала измерение и проверяемый артефакт, затем интерпретация. «Запомнил ≠ обобщил»: высокая точность на train ещё не означает generalization. «Запомнил ≠ обобщил»: высокая точность на train ещё не означает generalization.
Технические детали
Задача намеренно простая: (a + b) mod 113. Модель получает два числа и должна предсказать результат сложения по модулю 113. Это удобно для исследования: правильный ответ однозначен, а train и validation можно разделить так, чтобы отличить запоминание конкретных пар от применения общей закономерности.
Базовая конфигурация: один Transformer-слой, d_model=128, 4 attention heads, d_mlp=512, ReLU, без normalization и dropout; full-batch AdamW, learning rate 0. 0; 30% таблицы для обучения и 70% для validation; 40 000 optimizer steps. Замороженный пакет seed 42 и полные архивы seed 43 и 44 доступны в публичном репозитории; прямые ссылки приведены в конце статьи.
Что произошлоSeed 42 достиг порога memorization на шаге 200. Generalization candidate был зафиксирован на шаге 25 600, stable plateau — на 26 500. Финальные train и validation accuracy после 40 000 шагов равны 1.
Отраслевые последствия
Между быстрым запоминанием и поздним обобщением — более 25 тысяч шагов обучения. Дополнительные подтверждённые запуски той же постановки дали ту же качественную картину, но с другим временем перехода: seed 43 — 302 / 32 300 / 33 200; seed 44 — 416 / 23 000 / 23 900 для memorization / grokking candidate / plateau соответственно. Все три запуска завершились с train accuracy 1.
0000 и validation accuracy 1. Критерии заданы заранее: memorization означает train accuracy ≥0. 98, generalization candidate — первое измеренное достижение validation accuracy ≥0.
Плато фиксируется после 10 последовательных проверок выше или на пороге 0. При интервале 100 шагов это 900 шагов между первой и десятой проверками. Разрешение измерений различается: для исторического seed 42 шаг memorization определён по сетке логирования через 100 шагов; для seed 43 и 44 он проверялся после каждого optimizer step.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.



