В Южной Корее представили российские научные исследования в области генеративного ИИ
Исследователи и инженеры «Яндекса» представили серию научных работ на International Conference on Machine Learning (ICML) — одной из крупнейших международных конференций по машинному обучению, которая проходит в Сеуле (Южная Корея). Все статьи приняты в основную программу конференции, рассказали в компании.
Одна работа «Яндекса» получила статус Spotlight — его присваивают статьям, получившим наиболее высокие оценки программного комитета. В этом году такой статус получили 536 работ — всего 2,2% всех поданных. Научная работа посвящена графовым нейросетям — моделям, которые анализируют не только объекты, но и связи между ними, например между пользователями и товарами, документами или участками дорожной сети. Исследователи разработали новые программные модули, которые позволяют гораздо эффективнее использовать память видеокарт, отметили в компании. В экспериментах им удалось ускорить вычисления в 8,5 раза, сократить пиковое потребление памяти до 76 раз, а отдельные операции — в 3,9–10 раз.
Другая работа посвящена ускорению обучения больших языковых моделей методом конвейерного параллелизма. При таком обучении часть видеокарт простаивает в ожидании других устройств, а асинхронные схемы позволяют устранить эти простои. Ранее считалось, что из-за задержки градиентов такие схемы фундаментально нестабильны для языковых моделей.
Исследователи «Яндекса» показали, что деградация качества связана не с самой задержкой, а с выбором алгоритма оптимизации. Классический AdamW чувствителен к устаревшим градиентам, тогда как современные методы, такие как Muon, устойчивы к задержке. Для дополнительного снижения ошибки асинхронного обновления исследователи внедрили легковесную коррекцию на уровне шагов оптимизатора. В итоге на моделях Mixture of Experts размером 10 млрд параметров, обученных на 200 млрд токенов, асинхронный метод достиг качества, идентичного синхронному обучению.
В отдельной статье специалисты компании предложили два новых алгоритма оптимизации — SoftSignum и SoftMuon. Такие алгоритмы определяют, как модель обновляет свои параметры во время обучения. В экспериментах новые методы стабильно превосходили несколько распространенных подходов, включая AdamW.
Часть исследований посвящена данным, с которыми работают поисковые и рекомендательные системы. Для графовых задач специалисты разработали модель GraphPFN, предварительно обученную более чем на 1,6 млн синтетических графов. После адаптации под конкретную задачу она превосходит другие рассмотренные подходы на большинстве реальных наборов данных.
Также «Яндекс» совместно с другими исследователями предложил подход, который позволяет использовать небольшое количество размеченных данных вместе с большим объемом неразмеченных. Такой метод помогает обучать модели на задачах, где получение новых размеченных данных слишком дорого или занимает много времени, — например, в медицине и промышленности.
ICML ежегодно собирает исследователей ведущих университетов, научных центров и технологических компаний мира. В этом году на ICML подали 23 918 научных работ — в два раза больше, чем годом ранее, рассказали в «Яндексе». В основную программу вошли 6 352 статьи — 26,6% от общего числа заявок.