
Первый опыт малоресурсного перевода: Data dojo 2026
wertiba 53 минуты назад Первый опыт малоресурсного перевода: Data dojo 2026 Средний 9 мин 1.9K Python * Яндекс API * Алгоритмы * Машинное обучение * Исследования и прогнозы в IT * Ретроспектива Из песочницы Проявляйся в...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Значимый прорыв формирует отрасль ИИ: wertiba 53 минуты назад Первый опыт малоресурсного перевода: Data dojo 2026 Средний 9 мин 1. 9K Python * Яндекс API * Алгоритмы * Машинное обучение * Исследования и прогнозы в IT * Ретроспектива Из песочницы Проявляйся в том, что делаешь! Всем привет привет, месяц назад закончилась тренировка Data dojo 2026 по малоресурсному переводу, которая проходила в рамках масштабного мероприятия Яндекса YOUNG CON.
Здесь я бы хотел рассказать про само соревнование, ключевые идеи и, конечно, про моё решение, которое обеспечило мне топ-23 из 400+ участниковМой планОписание соревнованияМетрика Описание обеих задач:Условия Идеи и хронологияВалидация и тюнингИтоговая стратегия и результатКак это видели авторы: итогиПолезные ссылкиОписание соревнованияКак я уже сказал ранее, соревнование проводилось в рамках тренировки DATA DOJO с 21 мая по 4 июня. Участником предлагалось решить 2 задачи: задача A — машинный перевод с английского на русский, задача B — малоресурсный перевод с русского на абхазский. Для обоих задач в качестве бейзлайна предоставлялась Gemma-4-E2B, решение проверялось на серверах Яндекса на GPU L4 (24 GB VRAM); 16 GB RAM без доступа к интернету на закрытом тесте.
Технические детали
Разрешалось отправлять до 4 посылок ежедневно. Кстати, приватного теста не было, поэтому итоговый результат считался по публичному лидерборду по лучшему решению участников. МетрикаИллюстрация, наглядно показывающая расчёт метрики BLEU ScoreОбе задаче оценивались по метрике BLEU, конкретно использовалась библиотека scarebleu.
Что конкретно она означает? Алгоритм ищет совпадения слов и фраз (n‑грамм). Оценка варьируется в диапазоне от 0 до 1, но конкретно здесь умножалась на 100 для удобства подсчёта.
Более подробно про неё почитать можно здесь. Задача A: Перевод с английского на русскийУсловия: задача AСовременные LLM уже отлично справляются с переводом отдельных слов и предложений, но вот при переводе больших абзацев или даже текстов могут возникать проблемы:Теряется согласованность текста: например, глаголы, относящиеся к одному объекту, могут иметь разный род в разных частях текстаНарушается общая стилистика текстаНеверно переводятся термины в разных частях: например, в тексте про Github предложение «Button „Fork“ will help» может быть переведено как «Кнопка „Вилка“ поможет»Именно исходя из этих недостатков, главной задачей было обеспечить максимально качественный перевод английских абзацев на русский язык в относительно маленьких моделях. Тестовый набор содержал 69 примеров, средняя длина составляла 846 символов (162 слова, или в районе 10 предложений).
Самый длинный пример содержал 2229 символов (401 слово, 34 предложения).
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.





