Перейти к основному содержанию
Реклама
Прямой эфир
Общество
Художник Уляшев и его экс-супруга обменялись обвинениями в краже и растлении
Армия
Минобороны РФ показало кадры продвижения штурмовых групп к Дружковке в ДНР
Общество
Пропавший с семьей Сергей Усольцев несколько раз менял паспорт
Мир
Специалисты рассказали о роли фитопланктона в производстве кислорода
Общество
АТОР рассказала об ухудшении ситуации с оформлением шенгена в Грецию
Общество
На Кубани создадут мобильные группы для защиты предприятий от атак ВСУ
Общество
На форуме «Территория смыслов» обсудили подготовку молодых политиков
Мир
Дуров поставил аватар в образе боевика после обвинений в содействии терроризму
Мир
Зеленский впервые прибыл в Польшу после обострения отношений из-за УПА
Общество
Журова увидела в заявлении Зеленского о Крыме намек на обмен территориями
Общество
Онищенко призвал отменить норматив 15-минутного приема у врача
Новости компаний
«Яндекс» оценил экономический эффект от повышения эффективности вычислительной инфраструктуры
Авто
Автоэксперт посоветовал не заправлять машину после «щелчка»
Армия
Армия России поразила два судна с военным грузом для ВСУ в порту «Южный»
Мир
Французский адвокат де Вель опроверг свою причастность к делам Павла Дурова
Армия
ВС РФ за сутки уничтожили четыре ракеты «Нептун» и 619 беспилотников ВСУ
Общество
«Единая Россия» формирует стандарт государственной поддержки студенческой семьи
Мир
Автор саундтрека к фильму «Драйв» Kavinsky умер в возрасте 50 лет

В Южной Корее представили российские научные исследования в области генеративного ИИ

0
EN
Фото: ИЗВЕСТИЯ
Озвучить текст
Выделить главное
Вкл
Выкл

Исследователи и инженеры «Яндекса» представили серию научных работ на International Conference on Machine Learning (ICML) — одной из крупнейших международных конференций по машинному обучению, которая проходит в Сеуле (Южная Корея). Все статьи приняты в основную программу конференции, рассказали в компании.

Одна работа «Яндекса» получила статус Spotlight — его присваивают статьям, получившим наиболее высокие оценки программного комитета. В этом году такой статус получили 536 работ — всего 2,2% всех поданных. Научная работа посвящена графовым нейросетям — моделям, которые анализируют не только объекты, но и связи между ними, например между пользователями и товарами, документами или участками дорожной сети. Исследователи разработали новые программные модули, которые позволяют гораздо эффективнее использовать память видеокарт, отметили в компании. В экспериментах им удалось ускорить вычисления в 8,5 раза, сократить пиковое потребление памяти до 76 раз, а отдельные операции — в 3,9–10 раз.

Другая работа посвящена ускорению обучения больших языковых моделей методом конвейерного параллелизма. При таком обучении часть видеокарт простаивает в ожидании других устройств, а асинхронные схемы позволяют устранить эти простои. Ранее считалось, что из-за задержки градиентов такие схемы фундаментально нестабильны для языковых моделей.

Исследователи «Яндекса» показали, что деградация качества связана не с самой задержкой, а с выбором алгоритма оптимизации. Классический AdamW чувствителен к устаревшим градиентам, тогда как современные методы, такие как Muon, устойчивы к задержке. Для дополнительного снижения ошибки асинхронного обновления исследователи внедрили легковесную коррекцию на уровне шагов оптимизатора. В итоге на моделях Mixture of Experts размером 10 млрд параметров, обученных на 200 млрд токенов, асинхронный метод достиг качества, идентичного синхронному обучению.

В отдельной статье специалисты компании предложили два новых алгоритма оптимизации — SoftSignum и SoftMuon. Такие алгоритмы определяют, как модель обновляет свои параметры во время обучения. В экспериментах новые методы стабильно превосходили несколько распространенных подходов, включая AdamW.

Часть исследований посвящена данным, с которыми работают поисковые и рекомендательные системы. Для графовых задач специалисты разработали модель GraphPFN, предварительно обученную более чем на 1,6 млн синтетических графов. После адаптации под конкретную задачу она превосходит другие рассмотренные подходы на большинстве реальных наборов данных.

Также «Яндекс» совместно с другими исследователями предложил подход, который позволяет использовать небольшое количество размеченных данных вместе с большим объемом неразмеченных. Такой метод помогает обучать модели на задачах, где получение новых размеченных данных слишком дорого или занимает много времени, — например, в медицине и промышленности.

ICML ежегодно собирает исследователей ведущих университетов, научных центров и технологических компаний мира. В этом году на ICML подали 23 918 научных работ — в два раза больше, чем годом ранее, рассказали в «Яндексе». В основную программу вошли 6 352 статьи — 26,6% от общего числа заявок.

Читайте также
Прямой эфир