Модуль предоставляет возможность развёртывания и управления LLM на собственной GPU-инфраструктуре организации без глубокой экспертизы в администрировании GPU-кластеров.
Возможности
Централизованное управление GPU-ресурсами — объединение серверов и кластеров в единый пул с планированием нагрузки
Поддержка ведущих inference-движков (vLLM, SGLang, ollama) с оптимизацией под задачи низкой латентности и высокой пропускной способности
Мониторинг и аналитика — отслеживание утилизации GPU, потребления токенов и статуса моделей в реальном времени
REST API в OpenAI-совместимом формате для возможности встраивания в существующие решения