До недавнего времени запуск модели ИИ на Kubernetes напоминал игру в угадайку. То, что работало у одного поставщика облачных услуг, могло не сработать у другого из-за различий в драйверах графических процессоров, настройках сети или алгоритмах автомасштабирования. Это становится серьезной проблемой по мере того, как организации переходят от использования ИИ в инновационных лабораториях к его внедрению в производственную среду.
Стандартизация рабочих нагрузок ИИ на Kubernetes стала неотложной приоритетной задачей отрасли.
Цель программы соответствия Kubernetes AI от Cloud Native Computing Foundation (CNCF) — стандартизировать способ запуска рабочих нагрузок ИИ и машинного обучения на Kubernetes, который уже используют 80% предприятий для управления резкими колебаниями трафика.
В этом выпуске я встретился с Джонатаном Брайсом, исполнительным директором CNCF, на самой крупной на сегодняшний день конференции KubeCon + CloudNativeCon, прошедшей в марте этого года в Амстердаме. Мы поговорили о том, как эта программа соответствия ИИ устраняет изолированность и зависимость от поставщиков за счет повышения переносимости, предсказуемости и готовности к производственному использованию.
«К концу 2026 года из объема вычислительных ресурсов, выделенных для рабочих нагрузок ИИ, две трети будут использоваться для инференции, а одна треть — для обучения. Три года назад соотношение было полностью обратным», — говорит Брайс. «Ситуация меняется очень быстро, и к концу десятилетия на вычисления будет выделяться 93 гигаватта вычислительной мощности», что превышает совокупную мощность всех остальных вычислений.
Это признак того, что ИИ достигает следующей стадии зрелости, когда модели обучены, и теперь дело дошло до реальных сценариев использования. Но это не обходится без проблем. Обучение обычно происходит ночью партиями, в то время как инференция происходит в режиме реального времени и работает постоянно.
Однако, если спросить Джимми Сонга, вице-президента по экосистеме открытого исходного кода в Dynamia.AI, Kubernetes является идеальной средой выполнения для инференции ИИ, поскольку обеспечивает «эластичное, экономичное обслуживание моделей с низкой задержкой, поддерживающее автомасштабирование с учетом GPU, управление версиями и наблюдаемость». Более того, он заходит так далеко, что заявляет: «Инференция ИИ повторяет путь облачных микросервисов, только базовые вычисления перешли с ЦП на графические процессоры».
Эта совместимость гарантирует, что каждый кластер Kubernetes действительно способен справляться с высокими требованиями графических процессоров (GPU), тензорных процессоров (TPU) и сложного планирования задач искусственного интеллекта — без необходимости настройки под каждого облачного провайдера.
Учитывая это, неудивительно, что три крупнейших облачных провайдера — Red Hat и Nvidia — первыми получили этот знак соответствия Kubernetes AI с момента запуска программы в ноябре 2025 года. Крупный европейский облачный провайдер OVHcloud — еще один ранний последователь, что свидетельствует о новом ажиотаже вокруг KubeCon Europe 2026 в контексте суверенитета облачных сред.
«Рынок растет настолько быстро, что спрос огромный, — отмечает Брайс, — поэтому все, что можно сделать для ускорения внедрения на этом рынке, помогает всем крупным игрокам».
С учетом этого в марте этого года llm-d был запущен в инкубаторной программе CNCF, поскольку он предоставляет предварительно интегрированную, нативную для Kubernetes распределенную референсную среду и менеджер оркестрации, чтобы преодолеть разрыв между высокоуровневыми плоскостями управления и низкоуровневыми механизмами инференции.
«Он интегрирует vLLM, который является открытым движком для обслуживания инференции, в кластер Kubernetes, где он принимает гораздо более конкретные решения и предлагает варианты развертывания, которые в данный момент требуются программой соответствия», — говорит Брайс. Затем проект llm-d будет сотрудничать с программой соответствия CNCF AI, чтобы еще больше обеспечить взаимодействие в экосистеме облачных решений с открытым исходным кодом.
Ничто не является окончательным, так как все развивается слишком быстро.
«Мы начинаем с довольно небольшого набора требований, касающихся тех вещей, которые, как вы знаете, будут присутствовать во всех средах», — объясняет Брайс. Как только компания присоединяется к сотням других, которые уже прошли стандартную программу соответствия Kubernetes, первый набор стандартов, специфичных для ИИ, касается предоставления ускорителей в кластер Kubernetes стандартным способом, чтобы рабочая нагрузка могла сказать: «Мне нужен ускоритель типа X. Мне нужно иметь столько-то ускорителей на столько-то времени, и это обеспечивается функцией Kubernetes под названием DRA, или динамическое распределение ресурсов», — новой функцией Kubernetes, запущенной в конце 2025 года.
По мере расширения программы и стабилизации разработки на основе ИИ, продолжает он, появятся новые требования к сетям и хранилищам, поэтому этим компаниям придется пройти повторную сертификацию. По мере того как программа будет становиться более зрелой, изменится и периодичность повторной сертификации.
Программа по ИИ движется в направлении набора средств автоматизации тестирования, чтобы упростить проверку соответствия, но Брайс просит членов сообщества облачных технологий присоединиться к рабочей группе, чтобы помочь. Особенно тех, кто представляет различные отрасли.
«Программа действительно определяется людьми, которые в ней участвуют, чтобы оставаться очень близкой к потребностям реального мира», — говорит Брайс, при этом придерживаясь «общего знаменателя того, что нужно каждой среде, а затем, если есть дополнительные требования к безопасности или нормативные требования, выходящие за рамки этого».
Подписывайтесь на наш канал в Телеграм
⚡ Подписаться