2025 VDC 互联网技术会场 vivo专家共话业务赋能实战经验 | 附PPT下载
在公众号对话框回复【2025VDC】获取2025VDC 互联网技术会场议题相关资料。
议题相关技术文章后续将在公众号发布,敬请关注。
2025年度vivo开发者大会于10月10日成功举办。此次大会延续了“同心•同行”主题,开设主会场及11大分会场。在互联网技术分会场上,多位vivo专家针对拨测&融合流量管理、微服务架构与Dubbo性能优化、全链路多版本环境落地、GPU容器与AI训练平台等方面分享了vivo最新的探索和实践成果,同广大线上与会者共议最新趋势下的业务智胜之道。
01智驱流量,效赢增长
在飞速发展的互联网信息化时代下,抓住并充分利用“流量”将为业务增长带来“泼天”富贵,已成为共识。如何通过真实、海量的数据为精细化流量管理提供坚实的数据基础,并基于这些数据,打造一个集成本、质量、效率于一体的融合流量管理平台,进一步为业务赋能,也成了各行各业的关注焦点。
vivo互联网拨测监控负责人莫瀚
在数据决策基石构建之后,vivo互联网运维平台研发负责人周建华分享了如何在基石上搭建一座‘融合流量管理’的大厦。和很多公司一样,vivo采用了私有/公有云结合的混合云架构。虽然该架构十分典型,但也会带来复杂难管理、成本压力高、质量挑战大、运维效率低和安全风险高五大核心挑战。他表示,vivo通过打造融合流量管理平台,实现了统一纳管、智能决策、安全防护和监控自动化,不仅运维效率大幅提升,用户体验也得到改善。同时他还透露,未来将聚焦AI驱动的深度优化、流量管理的持续深化、打通网络质量和业务指标的关联,进行持续探索。
02 微服务架构探索,Dubbo性能优化
随着用户规模的扩大和业务范围的全球化,vivo启动微服务化以赋能业务增长,通过全网治理,收敛Dubbo作为Java技术栈RPC框架。面对业务规模的快速扩张,为保障系统的高性能与稳定性,vivo在Dubbo路由与负载均衡的性能优化方面进行了多方位的实践。
针对Dubbo路由的优化与扩展,vivo互联网Java中间件架构师张振威在会上介绍,vivo首先针对多机房场景通过建设就近路由能力,显著降低了RT敏感性业务的请求延迟,增强了业务的可用性与多机房容灾能力;其次针对路由链,从精简链路和引入位图缓存结构两大方向进行了系统性优化,大幅提升路由执行效率。
03 全链路多版本环境管理,效率与并发的飞跃
04 GPU容器与AI训练,让业务更稳定更高效
GPU平台是大模型时代的重要基础设施,vivo的GPU平台架构由物理层、容器平台层和AI工程层组成,支撑vivo的智能计算业务。
vivo互联网容器架构师陈瀚
vivo互联网容器架构师陈瀚表示,容器平台在大规模GPU集群,通过架构与性能优化、自动化运维等稳定性建设措施,为AI平台提供了坚实的算力底座。容器平台在多维度探索降本提效解决方案,提升整体利用率,降低业务成本。其中单卡维度的自研虚拟化技术实现多容器无干扰共享,做到"一卡三用"。在单服务维度的GPU弹性伸缩方案自动应对负载变化,减少闲置与运维负担。在多服务维度的训推潮汐部署方案实现资源分时复用,缓解训练资源短缺。在多机多卡维度通过RDMA容器降低跨节点通信时延。
vivo Al工程架构师刘东阳则表示,VTraining训练平台是在容器能力之上构建,支撑vivo手机的蓝心小V等核心产品的大模型训练业务。在大规模训练稳定性实践中,通过减少基础设施高频故障、完善任务故障处置流程两大措施,成功实现了机器每日故障率从2%降低到1‰的突破,千卡任务有效训练时长从60%提升到99%,达到行业一流水平。另外,平台在GPU利用率提升实践中,通过低优任务、训推潮汐部署、GPU虚拟化等策略,深度适配差异化业务场景,实现了资源的高效复用。
vivo Al工程架构师刘东阳
未来,容器平台将重点建设多集群调度、在离线GPU混部、GPU资源池化等能力,AI训练平台则聚焦大模型训练稳定性、训练全流程支撑与GPU资源精细化运营。致力于让vivo智能计算业务更加稳定、资源利用更加高效。
=END=
在公众号对话框回复【2025VDC】获取2025VDC 互联网技术会场议题相关资料。
议题相关技术文章后续将在公众号发布,敬请关注。