Новости Статьи Российское ПО VMware Veeam StarWind vStack Microsoft Citrix Symantec События Релизы Видео Контакты Авторы RSS
Виртуализация и виртуальные машины

Все самое нужное о виртуализации и облаках

Более 6560 заметок о VMware, AWS, Azure, Veeam, Kubernetes и других

VM Guru / News / Оптимизация развертываний AI с помощью VMware Cloud Foundation - максимальная производительность, эффективность и гибкость в мультитенантных средах

Оптимизация развертываний AI с помощью VMware Cloud Foundation - максимальная производительность, эффективность и гибкость в мультитенантных средах

23/09/2026

Поддержите VM Guru!

USDT / TRC20, адрес: TCDP7d9hBM4dhU2mBt5oX2x5REPtq9QdU1




Пост:

VMware Cloud Foundation (VCF) обеспечивает операционную эластичность и эффективность использования ресурсов, необходимые современным масштабируемым AI-средам, и помогает превратить аппаратную AI-систему в частную, гибкую и готовую к AI инфраструктуру корпоративного уровня. На фоне резкого роста стоимости оборудования для центров обработки данных за последний год ИТ-директора компаний стремятся выжать максимум из каждого компонента своих ЦОД. VCF помогает предприятиям повысить загрузку ресурсов и оптимизировать AI-инфраструктуру.

Платформа VMware Cloud Foundation (VCF) недавно получила сертификацию NVIDIA для гипервизоров. VMware vSphere 9.1 (и все последующие релизы vSphere 9.x) теперь является сертифицированным NVIDIA гипервизором (NVIDIA-Certified Hypervisor) с производительностью AI-нагрузок, близкой к bare metal.

Команда Broadcom Performance провела обширные тесты производительности, демонстрирующие эффективность и гибкость VCF при выполнении AI-нагрузок в различных конфигурациях. Для разъяснения результатов опубликован технический документ (white paper) и готовится серия из четырех статей:

  • Часть 1 (эта статья): максимальная производительность, эффективность и гибкость в мультитенантных средах
  • Часть 2: максимальная загрузка GPU для наилучшей совокупной стоимости владения
  • Часть 3: максимальная загрузка CPU и памяти для наилучшей совокупной стоимости владения
  • Часть 4: использование разделения времени (time-slicing) для оптимизации пропускной способности инференса

Ниже представлена первая часть этой серии.

В мультитенантной среде каждым тенантом может быть подразделение, проект или внешний заказчик, и все тенанты используют одно и то же оборудование. VCF предоставляет необходимые возможности изоляции, оптимизации ресурсов и самообслуживания, которые делают AI более эффективным и безопасным в эксплуатации.

Основные тезисы:

  • VCF позволяет гибко развертывать множество вариантов облачных AI-архитектур, отвечающих требованиям корпоративного управления и обеспечивающих максимальное использование облачных ресурсов.
  • Для строгой изоляции и безопасности рабочие нагрузки каждого тенанта можно развернуть в отдельной виртуальной машине. В качестве альтернативы они могут работать в одной ВМ, но быть изолированы в контейнерах. GPU могут выделяться виртуальным машинам через passthrough GPU, vGPU или MIG vGPU, и любой из этих способов применим как при совместном использовании ВМ тенантами, так и при размещении их в отдельных ВМ.
  • В экспериментах с инференсом LLM было показано, что две разные архитектуры развертывания обеспечивают практически одинаковую пропускную способность и задержку.

Оптимизация развертывания AI-нагрузок в мультитенантных средах

VCF поддерживает множество гибких архитектур развертывания ИИ-систем, которые помогают максимально загрузить GPU и сохранить высокую производительность, одновременно обеспечивая изоляцию, безопасность и высокую доступность частных ИИ-облаков.

Для ресурсоемких ИИ-нагрузок, полностью потребляющих вычислительные ресурсы и память сервера, ИТ-администраторы могут с помощью VCF выделять отдельные физические серверы, что повторяет развертывание на bare metal, но при этом сохраняет доступ ко многим возможностям VCF. В предыдущей публикации было показано, что VCF демонстрирует лидирующие в отрасли результаты в бенчмарках MLPerf Inference 5.1 на различных GPU и CPU, включая NVIDIA H200 и B200, а также Intel Xeon с ускорением AMX, и на различных типах AI-нагрузок, включая Speech-to-Text (Whisper), Text-to-Video (Stable Diffusion XL), большие языковые модели (Llama3.1 405B, Llama2 70B, Llama3 8B), графовые нейронные сети (R-GAT) и компьютерное зрение (RetinaNet).

Во многих реальных сценариях вычислительные ресурсы корпоративных частных облаков большую часть времени недозагружены, поскольку рабочие нагрузки легкие (например, низкая интенсивность запросов на инференс или малый размер батча). Выделение отдельного оборудования под такие нагрузки приводит к значительной неэффективности и раздувает операционные расходы. В подобных случаях консолидация нескольких рабочих нагрузок на общем оборудовании критически важна для устойчивой и экономически эффективной эксплуатации частных AI-облаков.

В мультитенантных средах VCF ИТ-администраторы могут развертывать тенантов и управлять ими вручную либо через VCF Automation (модели развертывания тенантов описаны здесь). В зависимости от требований предприятия к безопасности и изоляции, управлять AI-нагрузками можно следующими способами:

Нагрузки тенантов в отдельных ВМ (изоляция на уровне ВМ):

  • Безопасность и сценарий использования: оптимально при строгих требованиях к безопасности и изоляции.
  • Конфигурация: рабочие нагрузки каждого тенанта развертываются в отдельных ВМ. GPU выделяются виртуальным машинам через прямой проброс (passthrough) GPU или NVIDIA vGPU. С vGPU виртуальной машине можно выделить целый GPU или его часть (дробное выделение), что позволяет совместно использовать ресурсы GPU между ВМ разных тенантов. Пример такой изоляции показан в правом столбце на рисунке 1. Эта конфигурация полностью поддерживается как VCF Automation, так и при ручном управлении.

Нагрузки тенантов в одной ВМ (изоляция на уровне контейнеров):

  • Безопасность и сценарий использования: оптимально для сред с более низкими требованиями к безопасности, где приоритетом являются консолидация нагрузок и упрощение управления AI-облаком.
  • Конфигурация: рабочие нагрузки разных тенантов консолидируются в одних и тех же ВМ, которым GPU могут назначаться через прямой проброс (passthrough) или vGPU. Пример такой изоляции показан в левом столбце на рисунке 1 (ниже). Совместное размещение нагрузок нескольких тенантов в одной ВМ поддерживается только при ручном управлении тенантами (VCF Automation требует, чтобы каждый тенант размещался в выделенной ВМ).

Сравнение производительности двух вариантов развертывания

Для наглядности был проведен эксперимент, в котором рабочей нагрузке одного тенанта изначально выделяются все четыре GPU системы, как показано в первой строке рисунка 1 («1 workload»). Если предположить, что эта нагрузка сильно недозагружает GPU (как видно по загрузке потоковых мультипроцессоров GPU на рисунке 2), на сервере можно разместить больше нагрузок для повышения утилизации GPU, как показано во второй («2 workloads») и третьей («4 workloads») строках рисунка 1. В левом столбце представлены тестовые сценарии, в которых нагрузки всех тенантов находятся в одной ВМ, в правом — нагрузки каждого тенанта в отдельной ВМ.

Для имитации AI-нагрузки тенанта запускался MLPerf Inference с нагрузкой Llama3.1 8B при интенсивности 35 запросов на инференс в секунду на системе Dell PowerEdge XE7745 с двумя 64-ядерными процессорами AMD EPYC 9555 (всего 256 логических ядер), 768 ГБ памяти и четырьмя GPU NVIDIA RTX Pro 6000 96 ГБ. Каждая из этих нагрузок инференса выполняется внутри контейнера. Поскольку при такой легкой нагрузке GPU были недозагружены, на том же сервере удалось разместить до четырех аналогичных нагрузок, как показано на рисунке 1. При одновременной работе всех четырех нагрузок суммарная нагрузка на серверы составляет 140 запросов в секунду. Подробности экспериментальной установки, включая программное обеспечение, оборудование, конфигурацию ВМ и рабочие нагрузки, приведены в техническом документе.

Рисунок 1: тестовые сценарии с нагрузками в одной ВМ и нагрузками в отдельных ВМ. В обоих случаях GPU назначаются ВМ через passthrough GPU или vGPU.

Эксперименты проводились как с passthrough GPU (рисунок 2), так и с vGPU (рисунок 3), чтобы продемонстрировать, что VCF поддерживает оба варианта для мультитенантных развертываний.

Основные результаты экспериментов:

  • Увеличение числа одновременных нагрузок на одном сервере с 1 до 4 позволило повысить пропускную способность инференса системы почти в четыре раза (примерно с 4500 до 18000 токенов в секунду), как показано на рисунках 2 и 3. Нагрузка определяется количеством одновременных запросов к движку инференса.
  • Загрузка потоковых мультипроцессоров (Streaming Multiprocessor) GPU выросла до 71% при четырех тенантах вместо 36–38% при развертывании только одного тенанта.
  • Разница в пропускной способности между двумя способами изоляции нагрузок (изоляция на уровне ВМ и изоляция на уровне контейнеров) практически отсутствовала.

Сравнение производительности при развертывании с passthrough GPU

Рисунок 2: производительность тенантов в отдельных ВМ и тенантов в общей ВМ с passthrough GPU.

Сравнение производительности при развертывании с vGPU

Рисунок 3: производительность тенантов в отдельных ВМ и тенантов в общей ВМ с vGPU.

Заключение

VCF — гибкая, эффективная и безопасная платформа для управления частным AI (Private AI) в мультитенантных корпоративных средах. Предоставляя ИТ-администраторам выбор между изоляцией на уровне ВМ для строгих требований безопасности и изоляцией на уровне контейнеров внутри общей ВМ для упрощения управления, VCF отвечает самым разным операционным и инфраструктурным потребностям.

Результаты экспериментов наглядно показывают, что консолидация нескольких легких, недозагруженных рабочих нагрузок на общем оборудовании решает распространенную проблему недоиспользования ресурсов практически без потерь производительности — независимо от того, распределены ли тенанты по отдельным ВМ или объединены в одной ВМ.

VCF позволяет предприятиям оптимизировать AI-инфраструктуру, обеспечивая высокую доступность, надежную безопасность и максимальную эффективность использования GPU. Это помогает компаниям контролировать затраты на AI-инфраструктуру.

Интересное:





Зал Славы Рекламодателя
Ближайшие события в области виртуализации:

Быстрый переход:
VMware Basis Veeam Kubernetes VMachines Enterprise Offtopic Broadcom Microsoft Cloud StarWind NAKIVO vStack Gartner Vinchin Nakivo IT-Grad Teradici VeeamON VMworld PowerCLI Citrix VSAN GDPR 5nine Hardware Nutanix vSphere RVTools Security Code Cisco vGate SDRS Parallels IaaS HP VMFS VM Guru Oracle Red Hat Azure KVM VeeamOn 1cloud DevOps Docker Storage NVIDIA Partnership Dell Virtual SAN Virtualization VMTurbo vRealize VirtualBox Symantec Softline EMC Login VSI Xen Amazon NetApp VDI Linux Hyper-V IBM Google VSI Security Windows vCenter Webinar View VKernel Events Windows 7 Caravan Apple TPS Hyper9 Nicira Blogs IDC Sun VMC Xtravirt Novell IntelVT Сравнение VirtualIron XenServer CitrixXen ESXi ESX ThinApp Books P2V VCF Labs VMmark AI Monitoring VKS vMotion Memory vSAN DSM HCX Explore Backup Operations Workstation Avi esxtop VMConAWS Private AI Certification NVMe vDefend VCDX Tanzu Update Russian Ports Live Recovery CloudHealth NSX Chargeback Aria VCP Intel Community Ransomware Stretched Network VMUG VCPP Data Protection ONE V2V DPU Omnissa EUC Skyline Host Client GenAI Horizon SASE Workspace ONE Networking Tools Performance Lifecycle AWS API USB SDDC Fusion Whitepaper SD-WAN Mobile SRM ARM HCI Converter Photon OS VEBA App Volumes Workspace Imager SplinterDB DRS SAN Open Source iSCSI Partners HA Monterey RDMA vForum Learning vRNI UAG Support Log Insight AMD vCSA NSX-T Graphics HCIBench SureBackup Docs Carbon Black vCloud Обучение Web Client vExpert OpenStack UEM CPU PKS vROPs Stencils Bug VTL Forum Video Update Manager VVols DR Cache Storage DRS Visio Manager Virtual Appliance PowerShell LSFS Client Availability Datacenter Agent Book Photon Cloud Computing SSD Comparison Blast Encryption Nested XenDesktop VSA vNetwork SSO VMDK Appliance VUM HoL Automation Replication Desktop Fault Tolerance Vanguard SaaS Connector Event Free SQL Sponsorship Finance FT Containers XenApp Snapshots vGPU Auto Deploy SMB RDM Mirage XenClient MP iOS SC VMM VDP PCoIP RHEV vMA Award Licensing Logs Server Demo vCHS Calculator Бесплатно Beta Exchange MAP DaaS Hybrid VPLEX UCS GPU SDK Poster VSPP Receiver VDI-in-a-Box Deduplication Reporter vShield ACE Go nworks iPad XCP Data Recovery Documentation Sizing Pricing VMotion Snapshot FlexPod VMsafe Enteprise Monitor vStorage Essentials Live Migration SCVMM TCO Studio AMD-V Capacity KB VirtualCenter NFS ThinPrint Tiering Upgrade Troubleshooting VCAP Orchestrator ML Director SIOC Bugs ESA Android Python Hub Guardrails CLI Driver Foundation HPC Optimization SVMotion Diagram Plugin Helpdesk VIC VDS Migration Air DPM Flex Mac SSH VAAI Heartbeat MSCS Composer
Полезные постеры:

Постер VMware vSphere PowerCLI 10

Постер VMware Cloud Foundation 4 Architecture

Постер VMware vCloud Networking

Постер VMware Cloud on AWS Logical Design Poster for Workload Mobility

Постер Azure VMware Solution Logical Design

Постер Google Cloud VMware Engine Logical Design

Постер Multi-Cloud Application Mobility

Постер VMware NSX (референсный):

Постер VMware vCloud SDK:

Постер VMware vCloud Suite:

Управление памятью в VMware vSphere 5:

Как работает кластер VMware High Availability:

Постер VMware vSphere 5.5 ESXTOP (обзорный):

 

Популярные статьи:
Как установить VMware ESXi. Инструкция по установке сервера ESXi 4 из состава vSphere.

Типы виртуальных дисков vmdk виртуальных машин на VMware vSphere / ESX 4.

Включение поддержки технологии Intel VT на ноутбуках Sony VAIO, Toshiba, Lenovo и других.

Как работают виртуальные сети VLAN на хостах VMware ESX / ESXi.

Как настроить запуск виртуальных машин VMware Workstation и Server при старте Windows

Сравнение Oracle VirtualBox и VMware Workstation.

Работа с дисками виртуальных машин VMware.

Диски RDM (Raw Device Mapping) для виртуальных машин VMware vSphere и серверов ESX.

Где скачать последнюю версию VMware Tools для виртуальных машин на VMware ESXi.

Как перенести виртуальную машину VirtualBox в VMware Workstation и обратно

Что такое и как работает виртуальная машина Windows XP Mode в Windows 7.

Подключение локальных SATA-дисков сервера VMware ESXi в качестве хранилищ RDM для виртуальных машин.

Как поднять программный iSCSI Target на Windows 2003 Server для ESX

Инфраструктура виртуальных десктопов VMware View 3 (VDI)

Как использовать возможности VMware vSphere Management Assistant (vMA).

Интервью:

Alessandro Perilli
virtualization.info
Основатель

Ратмир Тимашев
Veeam Software
Президент


Полезные ресурсы:

Последние 100 утилит VMware Labs

Новые возможности VMware vSphere 8.0 Update 1

Новые возможности VMware vSAN 8.0 Update 1

Новые документы от VMware

Новые технологии и продукты на VMware Explore 2022

Анонсы VMware весной 2021 года

Новые технологии и продукты на VMware VMworld 2021

Новые технологии и продукты на VMware VMworld 2020

Новые технологии и продукты на VMware VMworld Europe 2019

Новые технологии и продукты на VMware VMworld US 2019

Новые технологии и продукты на VMware VMworld 2019

Новые технологии и продукты на VMware VMworld 2018

Новые технологии и продукты на VMware VMworld 2017



Copyright VM Guru 2006 - 2026, Александр Самойленко. Правила перепечатки материалов.
vExpert Badge