Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 параметров (v1.1.0)
Maktordev 8 минут назад Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 параметров (v1.1.0) Средний 2 мин 117 Машинное обучение * Искусственный интеллект JavaScript * Node.JS *...
Bir sonraki Claude Opus 31 Aralık 2026'ya kadar en az 1500 puanla çıkış yapacak mı?
Вот важная новость с фронта ИИ: Maktordev 8 минут назад Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 параметров (v1. 0) Средний 2 мин 117 Машинное обучение * Искусственный интеллект JavaScript * Node. JS * Алгоритмы * Туториал Продолжая тему Крошечной Языковой Модели на Nodejs мы поймем где проходит граница ее возможностей.
На примере Крошечной Языковой Модели (TLM) из 2 160 параметров мы проведём воспроизводимый эксперимент и увидим в цифрах: знакомый шаблон - 99,93%, перестановка токенов - 81,69%, неизвестная структура -? По следам обсуждения моего автограда на Node. js в ML-сообществе и отличного фидбека от инженеров на Hashnode (привет Ahmet Özel), я добавил в проект небольшое исследование границы между запоминанием и обобщением в версии 1.
Технические детали
Я зафиксировал seed 42 и добавил финальную frozen evaluation из четырёх проверок:точный обученный шаблон;знакомые токены в новом порядке;полностью отложенный шаблон, не участвовавший в loss;сохранение 14 отношений, изученных до adaptive SFT. РезультатыПроверкаPromptОжидалосьОтвет моделиРезультатMin target PSeen template / seen ordercan cat read ? 93%Seen tokens / new ordercat can read ?
69%Held-out templatedoes cat know read ? 46%Original-task retention14 исходных отношений14/1414/14PASS99. 46% это не accuracy, а минимальная вероятность правильного target-токена в ответе.
Для original-task retention модель сохранила 14/14 правильных ответов, то есть exact-match accuracy составила 100%, а минимальная вероятность target-токена - 99. На held-out вопрос:does cat know read ? модель вместо ожидаемого:cat cannot read.
Отраслевые последствия
ответила:cat can fly. Логи с held-out template Где проходит граница возможностей модели? В этом запуске практическая граница проходит между MEMORIZATION/локальным переносом и настоящей GENERALIZATION.
Модель уверенно воспроизводит обученный шаблон и справляется с небольшой перестановкой знакомых токенов, но новый шаблон вопроса уже разрушает выученное поведение. Падение минимальной вероятности правильного target-токена наглядно показывает эту границу:99. 46% Такой предел ожидаем для модели всего с 2 160 параметрами, восьмимерными embeddings, двумя attention heads, двумя Transformer-блоками и учебным миром из 24 токенов.
Причина не только в количестве весов: корпус содержит очень мало языковых конструкций. Дополнительные нейроны, более широкие embeddings или новые Transformer-блоки могли бы помочь, однако без более крупного и разнообразного набора данных они способны лишь точнее запомнить те же примеры. Таким образом, эксперимент показывает:уверенное запоминание обученного поведения;ограниченный перенос на изменённый порядок токенов;провал на неизвестной структуре вопроса;отсутствие catastrophic forgetting благодаря rehearsal - сохранены все 14/14 исходных отношений.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.




