Найти человека по голосу среди 134 тысяч записей
GG1KENOBI 21 минуту назад Найти человека по голосу среди 134 тысяч записей Средний 12 мин 769 Искусственный интеллект Машинное обучение * Хакатоны Python * Программирование * Обзор Имея на руках всего три оставшихся...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Вот важная новость с фронта ИИ: GG1KENOBI 21 минуту назад Найти человека по голосу среди 134 тысяч записей Средний 12 мин 769 Искусственный интеллект Машинное обучение * Хакатоны Python * Программирование * Обзор Имея на руках всего три оставшихся слота для отправки, наша команда вошла в последние часы дататона. Всю предыдущую неделю мы наращивали ансамбль, который встал на отметке 0. Каждая новая модель приносила от силы одну-две тысячных прироста и требовала лишних полутора часов инференса.
Восьмая архитектура не имела смысла. Поэтому мы прекратили возиться с моделями и переключились на то, как из уже посчитанных векторов строится индекс соседей. Рассчитывали попасть куда-то в диапазон 0.
Технические детали
7042 и десятое место среди 93 участников. Это рассказ о неделе работы с голосовыми эмбеддингами: что за задача перед нами стояла, почему она оказалась неожиданно трудной, где мы потеряли два дня и почему прорыв в итоге пришёл совсем не с той стороны, откуда его ждали. ЗадачаДано: 134 697 аудиофайлов в формате FLAC, полностью лишённых меток, имён дикторов и любых сопутствующих данных.
Просто неструктурированная груда записей. Цель: для каждой отдельной записи отыскать десять других фрагментов, принадлежащих тому же человеку. Обратите внимание на то, чего здесь намеренно нет.
Нет заранее заданного списка дикторов, из которого следует выбирать. Нет эталонных образцов голоса. Содержание речи не имеет значения и не анализируется.
Отраслевые последствия
И это не задача «установления личности»: система уклоняется от вопроса «кто это» и вместо него решает «какие ещё дорожки в этом массиве принадлежат тому же голосу». В литературе такая постановка называется speaker retrieval и отличается от двух более привычных. Верификация спрашивает: «эти два фрагмента произнёс один и тот же человек?
» - бинарный вопрос, управляемый порогом. Идентификация спрашивает: «кто из N известных дикторов это сказал? » - задача с закрытым множеством.
Наша же задача поиск по открытому корпусу, где и запросы, и ответы находятся внутри одного анонимного массива. Метрика оценки - Precision@10. Для каждого запроса мы смотрим первую десятку результатов и считаем, сколько из них действительно принадлежит искомому диктору.
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.






