火山引擎推出云原生多云 GPU 算力调度解决方案
来源 | 火山引擎云原生团队
近年来,随着人工智能(AI)技术在各个领域的广泛应用,企业对 GPU 的需求也急剧增长。然而,由于 GPU 硬件和云上算力的供给受限,导致目前市场上出现了供不应求的情况,并为企业客户带来以下问题:
单一云厂商 GPU 资源可能无法满足需求,需要从多家云购买 GPU,对接多云环境,并分发算力任务;
云厂商库存不透明,算力任务只能通过试错的方式进行库存验证,需要实现复杂的任务故障重调度机制;
考虑 GPU 资源成本较高,期望通过少量常驻资源满足日常算力需求,任务突发时进行弹性扩容。
方案说明
为应对 GPU 资源短缺,在需求端,人工智能公司、游戏公司等 GPU 需求较大的企业往往会综合考虑成本、稳定性等因素选择服务商或购置多路云服务。面对这种局面,如何高效调度多云云上算力,是建设稳定智算底座的重要环节。
火山引擎分布式云原生 DCP 可以实现算力业务的统一分发,根据业务需求,包括 GPU 规格、资源用量、云厂商和区域等因素,平台会将业务实例自动调度到多云集群的 GPU 服务器或弹性容器中运行。
全域调度效率高:通过多云集群纳管和统一分发入口,实现多云环境 GPU 资源调度。在云厂商资源库存不足时,系统能够自动重调度,无需人工干预。
按需低成本:通过应用的全域弹性伸缩能力,仅在算力业务需要时购买和调度 GPU 资源,以实现成本节约。
全场景负载支持:支持无状态、有状态和离线负载类型的多云分发,并具备对 CPU/GPU 多计算资源全局调度感知能力。
调度策略灵活:可根据不同维度的优先级顺序调度,例如优先调度弹性容器、云厂商等。同时支持在多云环境中并发调度,在资源紧缺时提高 GPU 购买成功率。
场景案例
A 客户是一家专注于 AI 视频创作的公司,通过先进的 AI 数字人技术和智能剪辑技术,为用户提供高效便捷的视频创作解决方案。用户可以通过 APP 上传文字、音视频等素材,并选择数字人模板,平台将自动为用户生成数字人视频。
在 A 客户平台的业务处理流程中,后台服务接收到用户请求后,通过任务调度器将任务分发到多云集群中的计算服务进行处理。任务处理完成后,制作完成的视频将反馈给用户。其中处理核心业务的计算服务可以通过分布式云原生平台 DCP 进行统一调度、弹性、观测和迁移,具体实现以下场景目标:
跨云分发:跨云分发初始服务实例,并优先调度到集群中的预付费 GPU 节点,满足日常算力需求;
弹性伸缩:服务实例因突发任务,GPU 使用率超过阈值时,可自动触发弹性扩容,优先扩容弹性容器;
库存不足重调度:服务实例因 GPU 库存不足导致扩容失败时,在集群内会按照弹性容器 → 后付费节点优先级调度,库存仍不足时,实例会自动跨区域/云厂商调度;
GPU 观测:对多云环境服务实例的 GPU 使用情况等观测指标统一采集、展示与告警配置;
故障迁移:当服务实例因集群故障导致无法正常调度,故障实例可自动迁移到其他健康集群,并可支持自定义故障条件(如基于监控指标、事件等)。
分布式云原生平台 DCP
火山引擎分布式云原生平台(Distributed Cloud Native Platform,DCP)是一款企业级云原生统一管理平台,覆盖多云多 Kubernetes 集群管理、容灾、迁移等场景。无论用户的应用构建在何种云上,DCP 都能实现 K8s 的统一管理与运维,并最大限度地减少区域近端用户的延迟,打破单个集群的可伸缩性限制。
感兴趣的企业用户可以扫码联系我们,开通并感受全新多云管理体验!
扫码咨询
火山引擎云原生团队主要负责火山引擎公有云及私有化场景中 PaaS 类产品体系的构建,结合字节跳动多年的云原生技术栈经验和最佳实践沉淀,帮助企业加速数字化转型和创新。产品包括容器服务、镜像仓库、分布式云原生平台、函数服务、服务网格、持续交付、可观测服务等。