«Яндекс» оценил экономический эффект от повышения эффективности вычислительной инфраструктуры
- Новости
- Новости компаний
- «Яндекс» оценил экономический эффект от повышения эффективности вычислительной инфраструктуры
За полгода «Яндексу» удалось сэкономить 9,2 млрд рублей благодаря инженерной оптимизации вычислительной инфраструктуры. Компания направила высвободившиеся ресурсы на масштабирование разработок в области искусственного интеллекта, сообщили в ее пресс-службе.
Одно из ключевых направлений программы оптимизации — динамическое перераспределение вычислительных ресурсов. Когда пользовательская нагрузка снижается, свободные мощности автоматически перераспределяются на решение других задач. Например, ночью, когда пользовательская активность снижается и нагрузка на сервисы уменьшается, графические процессоры (GPU) автоматически подключаются к обучению новых моделей. Это практически исключает простой дорогостоящих вычислительных ресурсов.
Дополнительную экономию обеспечила оптимизация самих моделей. Часть моделей перевели на архитектуру MoE (Mixture of Experts, «смесь экспертов»), которая для обработки каждого запроса задействует только часть нейросети.
Также инженеры использовали подход, при котором небольшую модель обучают на основе уже обученной более крупной модели, а также квантизацию, позволяющую выполнять вычисления в более эффективном формате. Одновременно в компании ускорили загрузку данных для обучения моделей, распараллелили вычисления, внедрили кэширование повторяющихся вычислений и технологию EAGLE, которая позволяет быстрее генерировать ответы за счет прогнозирования нескольких следующих токенов.
Программа охватила не только инфраструктуру для искусственного интеллекта, но и вычислительные мощности, обеспечивающие работу остальных сервисов компании. Специалисты улучшили работу серверов с центральными процессорами (CPU), которые обеспечивают поиск, подбор рекомендаций и выполнение других ресурсоемких задач. Для этого они применили технологии оптимизации компиляции PGO и BOLT, которые анализируют реальную нагрузку сервисов и помогают процессорам выполнять больше операций без увеличения используемых ресурсов за счет более точной организации программного кода.
Кроме того, инженеры пересмотрели правила хранения данных на всех этапах их жизненного цикла. Для этого были оптимизированы правила хранения, устранено избыточное дублирование данных, протестированы новые алгоритмы сжатия и внедрены инструменты, которые автоматически находят неиспользуемые таблицы, поля и резервные копии, а также помогают рациональнее распределять данные между разными типами хранилищ (HDD, SSD и другими). В результате нагрузка на инфраструктуру сократилась, был выстроен единый процесс постоянного поиска и устранения «потерь» вычислительных ресурсов.
Как сообщили в «Яндексе», компания регулярно проводит технические и бизнес-аудиты использования вычислительных мощностей, чтобы повышать эффективность существующей инфраструктуры и направлять высвобождающиеся ресурсы на развитие технологий искусственного интеллекта и новых продуктов.
Программу реализуют инженеры бизнес-группы поисковых сервисов и ИИ совместно с командой внутренней инфраструктуры «Яндекса». Многие изменения удалось внедрить сразу во всех продуктах благодаря единой ML-платформе — комплексу технологий, который охватывает весь цикл работы с моделями: от обучения до эксплуатации. Это позволяет быстрее внедрять инженерные решения и эффективнее использовать существующую инфраструктуру, подчеркнули в компании.