ИИ и виртуализация. Мифы и реальность.
Искусственный интеллект сегодня — основной драйвер цифровой трансформации бизнеса, превратившийся из «игрушки миллиардеров» в реальный рабочий инструмент для очень широкого спектра задач. Но вместе с ростом популярности ИИ появилось и множество мнений о том, где и как его правильно внедрять. Часто можно услышать: «аренда «облачного» сервера для искусственного интеллекта — это дорого», «без собственных GPU-серверов не обойтись», «виртуализация неэффективна в ИИ-задачах»... Так ли это на самом деле?
Мы собрали четыре мифа об ИИ в «облачной» среде и рассказываем, как виртуализация помогает решать задачи, которые раньше казались под силу только крупным корпорациям.
Миф 1. «Для обучения нейросетей нужно покупать собственные GPU-серверы — облако не справится с нагрузкой»
Действительно, для обучения нейросетей требуются мощные GPU (например, Nvidia Tesla A100). Но покупать их в собственность — это миллионные инвестиции, которые окупаются только при гарантированной интенсивной эксплуатации на длительный срок. Чаще всего, компании идут на эти затраты опасаясь двух факторов:
1) Используя ускорители «облачных» провайдеров потребитель рискует потерять производительность инфраструктуры из-за переподписки виртуализированных ресурсов.
Это опасение, в первую очередь, связано с самой логикой работы виртуализированных систем и имеет историческую подоплеку. Но, технологии не стоят на месте и, на сегодняшний день, продукты-лидеры рынка гипервизоров показывают буквально 10% разницу в производительности по сравнению с bare-metal инсталляциями. Более того, большинство российских провайдеров предоставляют видеокарты без переподписки. В их числе и Дата Центр «STACK24».
2) При работе в «облаке» можно скомпрометировать или потерять чувствительные для бизнеса данные.
Действительно, если бесконтрольно использовать нейросети, находящиеся в свободном доступе, то есть риск скомпрометировать чувствительные данные организации. Именно поэтому большинство наших корпоративных клиентов выбирает инфраструктурный подход и разворачивает локальные модели на виртуализированных мощностях ЦОД-а.
Все продукты ведущих игроков рынка виртуализация (например, «VMware») созданы с учетом необходимости максимальной изоляции клиентских инстансов друг от друга. Без этой логики виртуализация, как метод разделения процессов и задач, не имеет смысла и существованию. В связи с этим, работа с локальными моделями на наших мощностях выглядит разумным решением, перекрывающим собой вопросы из плоскости безопасности, производительности и экономики.
Миф 2. Аренда GPU в «облаке» провайдера очень дорого обходится конечным клиентам.
Откровенно говоря, данный миф имеет в своем основании вполне реальный фундамент. И, по мнению команды Дата-Центра STACK24, мифом может называться довольно условно. Причиной тому, на наш взгляд, являются два фактора, которые своим существованием как укрепляют данный миф, так и развенчивают его. Вот они:
1) На начальном этапе использования ИИ-моделей IT-специалистам (DevOps-ам, например) было довольно сложно сориентироваться в том, на сколько мощными и производительными должны быть GPU-ускорители для решения той или иной задачи. В связи с этим, чаще всего, применялась простая логика «больше не меньше». Безусловно, данная логика имеет мощнейшую аргументацию со стороны девелопмента, но, с точки зрения FinOps, обоснованно вызывает много вопросов.
2) Как нам всем хорошо известно, производство чипов для GPU-ускорителей не успевает за спросом на них. В связи с этим, периодически возникает дефицит на рынке. Конечно, это влияет на стоимость (как закупочную, так и конечную) и на доступный ассортимент.
Беря во внимание оба этих фактора, мы понимаем, что, на начальных этапах эксплуатации, отсутствие выбора и опыта совершенно не способствовало оптимальному выбору инфраструктуры под ИИ-задачи. Сегодня ситуация изменялась в лучшую сторону. И опыт наработали, и ассортимент у большинства «облачных» провайдеров расширился. Например, наш Дата Центр на своем сайте предлагает 3 разные модели видеокарт для решения большого спектра задач.
Миф 3. «Данные тяжело переносить в облако — проще оставить все on-premise».
Действительно, объем датасетов для ИИ может составлять сотни терабайт и петабайты, но современные инструменты миграции, гибридные сценарии и продуманная сервисная модель провайдера снимают проблему перемещения данных. Например, дата-центр STACK24 предоставляет своим клиентам СХД для решения задач переезда данных. Более того, клиенты нашего ЦОД-а имеют возможность реализовать гибридную модель инфраструктуры, где могут присутствовать клиентские СХД как накопители, а виртуальные машины, развернутые на мощностях дата-центра, выступают вычислителями. С учетом линии 10 Гбит/с линков в «облачном» кластере это существенно ускоряет процедуру миграции. Более того, гибридная модель позволяет оставить «горячие» данные on-premise, а для обучения использовать облачные серверы с GPU, подключив их через локальную сеть дата центра. Так вы не копируете данные в облако полностью, но получаете доступ к мощностям.
Миф 4. «Управлять ИИ в облаке сложно, нужна супер-команда».
Бытует мнение, что для работы в облаке нужно нанимать инженеров по виртуализации, настройке сетей, распределенному обучению... На самом деле, консоль проприетарного гипервизора (в том числе и настройка сетевой связности посредствам предустановленного виртуального роутера) позволяет в очень короткие сроки запустить проект практически любого масштаба силами одного ИТ-специалиста. В итоге, вместо того чтобы тратить время на настройку инфраструктуры, команда разработчиков практически сразу начинает с экспериментов и быстрее приходит к результату.
Реальность, а не мифы: какой путь выбрать?
Облако сегодня перешло в ранг инструмента, который дает максимальную гибкость там, где требования к ИИ-инфраструктуре меняются очень быстро. Оно подходит:
- Для стартапов и R&D — можно начать с малого, быстро протестировать гипотезы.
- Для бизнес-проектов, где CAPEX-затраты необоснованны из-за неопределенного срока эксплуатации.
- Для бизнеса, который хочет сфокусироваться на разработке, внедрении и эксплуатации продукта, а не на строительстве GPU-ферм — управляемые сервисы экономят штат, время и деньги.