Перейти к основному содержанию
Реклама
Прямой эфир
Общество
Художник Уляшев и его экс-супруга обменялись обвинениями в краже и растлении
Мир
Зеленский и Туск обсудили визит украинского лидера в США
Общество
Пропавший с семьей Сергей Усольцев несколько раз менял паспорт
Спорт
Украина подала апелляцию на решение МОК о восстановлении прав ОКР
Общество
АТОР рассказала об ухудшении ситуации с оформлением шенгена в Грецию
Происшествия
В торговом центре «Павелецкая Плаза» была объявлена эвакуация
Общество
На форуме «Территория смыслов» обсудили подготовку молодых политиков
Армия
Силы ПВО за день сбили 150 украинских дронов над регионами России
Мир
Зеленский впервые прибыл в Польшу после обострения отношений из-за УПА
Общество
Житель США за сутки вылечил позвоночник в Москве после отказа в других странах
Общество
Онищенко призвал отменить норматив 15-минутного приема у врача
Общество
В Екатеринбурге задержали второго подозреваемого в избиении ученого Зезина
Авто
Автоэксперт посоветовал не заправлять машину после «щелчка»
Армия
Армия России поразила пункт управления ВСУ в Херсонской области
Мир
Французский адвокат де Вель опроверг свою причастность к делам Павла Дурова
Мир
Американский певец Джаред Лето отверг обвинения в сексуальном насилии
Общество
«Единая Россия» формирует стандарт государственной поддержки студенческой семьи
Общество
Средняя зарплата в России в мае превысила 110 тыс. рублей

В Южной Корее представили российские научные исследования в области генеративного ИИ

0
EN
Фото: ИЗВЕСТИЯ
Озвучить текст
Выделить главное
Вкл
Выкл

Исследователи и инженеры «Яндекса» представили серию научных работ на International Conference on Machine Learning (ICML) — одной из крупнейших международных конференций по машинному обучению, которая проходит в Сеуле (Южная Корея). Все статьи приняты в основную программу конференции, рассказали в компании.

Одна работа «Яндекса» получила статус Spotlight — его присваивают статьям, получившим наиболее высокие оценки программного комитета. В этом году такой статус получили 536 работ — всего 2,2% всех поданных. Научная работа посвящена графовым нейросетям — моделям, которые анализируют не только объекты, но и связи между ними, например между пользователями и товарами, документами или участками дорожной сети. Исследователи разработали новые программные модули, которые позволяют гораздо эффективнее использовать память видеокарт, отметили в компании. В экспериментах им удалось ускорить вычисления в 8,5 раза, сократить пиковое потребление памяти до 76 раз, а отдельные операции — в 3,9–10 раз.

Другая работа посвящена ускорению обучения больших языковых моделей методом конвейерного параллелизма. При таком обучении часть видеокарт простаивает в ожидании других устройств, а асинхронные схемы позволяют устранить эти простои. Ранее считалось, что из-за задержки градиентов такие схемы фундаментально нестабильны для языковых моделей.

Исследователи «Яндекса» показали, что деградация качества связана не с самой задержкой, а с выбором алгоритма оптимизации. Классический AdamW чувствителен к устаревшим градиентам, тогда как современные методы, такие как Muon, устойчивы к задержке. Для дополнительного снижения ошибки асинхронного обновления исследователи внедрили легковесную коррекцию на уровне шагов оптимизатора. В итоге на моделях Mixture of Experts размером 10 млрд параметров, обученных на 200 млрд токенов, асинхронный метод достиг качества, идентичного синхронному обучению.

В отдельной статье специалисты компании предложили два новых алгоритма оптимизации — SoftSignum и SoftMuon. Такие алгоритмы определяют, как модель обновляет свои параметры во время обучения. В экспериментах новые методы стабильно превосходили несколько распространенных подходов, включая AdamW.

Часть исследований посвящена данным, с которыми работают поисковые и рекомендательные системы. Для графовых задач специалисты разработали модель GraphPFN, предварительно обученную более чем на 1,6 млн синтетических графов. После адаптации под конкретную задачу она превосходит другие рассмотренные подходы на большинстве реальных наборов данных.

Также «Яндекс» совместно с другими исследователями предложил подход, который позволяет использовать небольшое количество размеченных данных вместе с большим объемом неразмеченных. Такой метод помогает обучать модели на задачах, где получение новых размеченных данных слишком дорого или занимает много времени, — например, в медицине и промышленности.

ICML ежегодно собирает исследователей ведущих университетов, научных центров и технологических компаний мира. В этом году на ICML подали 23 918 научных работ — в два раза больше, чем годом ранее, рассказали в «Яндексе». В основную программу вошли 6 352 статьи — 26,6% от общего числа заявок.

Читайте также
Прямой эфир