RuntimeNodes: как мы, ML‑щики, стали писать рантайм

ilnurKh 48 минут назад RuntimeNodes: как мы, ML‑щики, стали писать рантайм 13 мин 1.2K Блог компании Яндекс Машинное обучение * Высоконагруженные системы * Анализ и проектирование систем * Управление разработкой *...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Вот важная новость с фронта ИИ: ilnurKh 48 минут назад RuntimeNodes: как мы, ML‑щики, стали писать рантайм 13 мин 1. 2K Блог компании Яндекс Машинное обучение * Высоконагруженные системы * Анализ и проектирование систем * Управление разработкой * «LLM‑содержащие продукты» — это далеко не только вызов модели. Чтобы её ответ оказался полезным, нужно правильно распознать интент, найти подходящую информацию, отобрать нужные фрагменты и уместить их в контекстное окно.
Кроме того, сами механизмы поиска и отбора данных приходится постоянно настраивать. Всё становится ещё сложнее по мере прихода к итеративным сценариям. Бизнес‑логика, которая готовит входные данные для LLM и обрабатывает её ответы, всё сильнее и сильнее срастается с самой моделью.
Технические детали
На примере LLM‑ответов в поисковой выдаче Яндекса расскажу, как мы ускорили такие эксперименты, научились работать с бизнес‑логикой как с ML‑артефактом и зачем нам для этого понадобились ещё один DSL и представление вычислений в виде графа. Цикл разработкиЧтобы разобраться, с какими проблемами мы сталкиваемся, сначала нужно пояснить, как устроены такие проекты, из каких этапов состоит разработка и какие команды в ней участвуют. Один из продуктов, над которыми мы работаем, — быстрые ответы Алисы AI в поисковой выдаче.
Типов таких блоков много. Для популярных запросов используются заранее рассчитанные ответы, но значительную часть быстрых ответов Алиса AI формирует в рантайме. И сегодня мы поговорим о разработке алгоритмов (или пайплайнов — чаще будем применять это слово, потому что работа идёт на относительно высоких уровнях абстракции) построения таких ответов.
Чтобы получать качественные ответы, нам нужно выполнить ряд условий:Определить, подходит ли запрос для ответа с помощью LLM. Модель должна не просто суметь сформировать ответ — этот ответ должен быть полезен пользователю. Понять, где и как искать данные.
Отраслевые последствия
Часто достаточно документов, которые уже попали в поисковую выдачу. Именно так был собран базовый набор документов для заметной доли запросов в тестовой выборке. Затем отдельные алгоритмы выбирают из них релевантные фрагменты и отсеивают лишнее.
Это необходимо, потому что токенный бюджет на входе модели ограничен. Кроме того, сокращение средней длины контекста снижает стоимость инференса. Расширить поиск, если исходного запроса недостаточно.
Для этого запрос можно переформулировать и поискать документы по нескольким его вариантам. Выбрать и настроить модели. Сюда входят обучение моделей и подбор параметров их применения.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






