GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей

ideavi 12 минут назад GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей Простой 7 мин 275 Искусственный интеллект Машинное обучение * Natural Language Processing * Хранение данных *...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: ideavi 12 минут назад GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей Простой 7 мин 275 Искусственный интеллект Машинное обучение * Natural Language Processing * Хранение данных * Тестирование IT-систем * Аналитика Кратко: на классе задач «в работе всплыла проблема — каким изменением её уже чинили»:GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев,YandexGPT Pro 5. 1 — в 61%,Claude Opus 5 с обычным поиском — в 41%. Модели никто не трогал: разница целиком в том, доехал ли до модели нужный факт в контексте.
Важная оговорка про метрику, которая есть статье: Claude Opus 5 с той же памятью даёт 68% — больше всех в замере. Сравнение в заголовке про другое: обе стороны реального выбора «остаться на своей модели или мигрировать на зарубежную» сегодня работают на обычном поиске — по словам или по смыслу, без связей между записями. Связи здесь — типизированные рёбра между записями: «эту проблему закрыло вот это изменение», «за этой задачей последовала вон та», «здесь речь про тот же объект».
Технические детали
Дальше в статье видно, сколько дают именно они: поиск по смыслу сам по себе — 46%, вместе со связями — 84%. Хранится это в обычном PostgreSQL, без расширений: почему голая EAV-модель на таких данных разваливается и какие три слоя пришлось добавить, чтобы она держала нагрузку, я разбирал отдельно. Ниже — методика, полная таблица по семи моделям, сырые данные и, главное, разбор того, какая часть прироста настоящая, а какая держится на устройстве самого замера.
Последнее я вынес наверх, потому что в прошлый раз этот вопрос задали первым же комментарием, а ответы в комментариях читают немногие. Мы делаем конструктор баз данных и приложений Интеграм, и сама разработка идёт с ИИ-агентом — хочется поднять его эффективность и уменьшить количество ошибок, особенно повторяющихся. Слой памяти вырос из этой задачи как побочный проект, причём идею нам подсказал сам агент: он регулярно упирался в то, что уже было решено, и однажды на вопрос «ДОКОЛЕ?
» предложил хранить не переписку, а связи «жалоба → изменение, которое её закрыло». Что мерялиЗадача самая обычная для поддержки и разработки: пришла жалоба — найти изменение, которое эту проблему уже закрывало. Корпус — реальный рабочий проект: 4618 задач и изменений, русский язык.
Отраслевые последствия
100 вопросов, правильный ответ известен заранее из истории проекта. Проверка автоматическая — сверяется номер. ИИ-судью не спрашиваем: оценка не «плывёт» между прогонами, и её может перепроверить кто угодно.
2310 обращений к моделям: 7 моделей × (30 + 100 + 100 + 100).
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.






