高可用架构

构建中国AI时代的底座:专访腾讯云操作系统首席架构师杜震

自2010年启动以来,TencentOS Server 已走过15年发展历程。从最初服务腾讯内部核心业务的基础平台,到如今面向金融、政务、互联网等多个关键行业的国产自主操作系统,TencentOS Server 伴随腾讯技术演进经历了多轮技术跨越与战略升级。随着AI浪潮的到来,操作系统正在从“底座”角色走向更主动的智能协同,在算力调度、资源优化、模型加速等领域发挥着前所未有的价值。

在本次专访中,高可用架构特邀腾讯云操作系统首席架构师杜震,围绕TencentOS Server在AI战略、技术创新、生态构建与未来愿景等关键议题进行深度对话,探讨一款国产操作系统如何在快速变化的智能时代中建立独特优势,并走向更广阔的市场空间。

●采访者: 高可用架构编辑 美旭

●受访嘉宾: 腾讯云操作系统首席架构师 杜震

✦ ✧ ✦

采访者: 杜老师您好,我是【高可用架构】编辑美旭,非常感谢您在百忙之中接受我们的采访。本次对话将围绕三个核心主题展开:TencentOS Server 的 AI 战略愿景、技术创新路径,以及市场定位与价值体现。首先,能否请您先做一个简要自我介绍?

杜震: 美旭你好,我是杜震,腾讯云操作系统首席架构师,主要负责 TencentOS Server 的产品设计、核心功能研发及商业化方向推进。在操作系统和虚拟化领域,我有超过十年的从业经验,也曾主导多项面向金融、政务等行业的复杂系统替代与迁移项目。很高兴借这个机会和大家分享我们的技术理念与实践经验。

Image

腾讯云操作系统首席架构师 杜震

✦ ✧ ✦

采访者:在刚刚结束的GIAC大会上,腾讯云团队展示了qGPU在提升GPU利用率以及TACO-LLM在大模型推理加速方面的能力。请问,TencentOS Server在AI领域的整体战略定位是什么?是作为高效的底层资源调度与加速平台,还是计划向上延伸,打造从内核到AI框架、模型部署与管理的全栈式解决方案?另外,AI加速版的TencentOS Server能为企业级用户带来哪些典型价值?未来在AI方向的重点会是更深入的协同优化,还是拓展到如多模态、端侧AI等新兴场景?

杜震:我们的AI战略可以归纳为两个核心方向:“OS for AI” 和 “AI for OS”,TencentOS Server 在这两个方向上都已取得扎实进展,并将持续发力。

●OS for AI:即通过底层操作系统的优化,更好地支撑AI模型运行。我们开发了如 qGPU、TACO-LLM 等关键能力,qGPU 能有效提升小模型对GPU资源的复用率,而TACO-LLM 则专注于大模型推理的加速,显著优化了吞吐与延迟表现。这些能力已集成到AI加速版操作系统中,用户安装后即“开箱即用”,无需自行整合复杂依赖。

●AI for OS:即利用AI能力增强操作系统本身的可用性与智能化体验。例如用户可通过自然语言与系统交互,借助AI助手自动执行命令,提升运维效率。此外,我们还在推进“可编程调度器”,通过AI动态分析服务器负载,实现自适应的资源调度策略,进一步提升系统智能化水平。

为了让企业级用户更便捷地获取这些能力,我们推出了集成AI特性的独立操作系统镜像,部署即启用,不再需要用户手动配置依赖、调参等复杂操作,极大降低了AI技术的使用门槛。同时,配套文档和工具链也大幅提升了部署和迁移的效率。

在典型应用场景上,AI加速版TencentOS Server主要面向两类需求:

1. 提升AI运行性能:如训练推理更高效、资源复用率更高。

2. 增强操作系统智能体验:借助AI提升运维便捷性、系统响应能力和资源调度智能化。

面向未来,我们将从两个方向持续推进:

●纵向深化协同优化:进一步紧贴开源社区与前沿模型演进,持续迭代底层推理框架与内核调度能力,巩固我们的加速优势。

●横向拓展新场景:探索多模态AI、端侧AI等新兴领域所需的系统级支持能力,为下一代智能计算场景提前布局。

Image

综合来看,TencentOS Server 不仅是一个高效的AI运行底座,也正在成长为中国市场上极少数拥有从内核到AI框架完整自研能力的“AI原生操作系统”,这正是我们在业界的独特竞争力所在。

✦ ✧ ✦

采访者: GIAC大会上,腾讯云提到CPU利用率提升15-45%、内存成本降低30%的亮眼成果。团队如何平衡资源利用率与业务稳定性的潜在冲突,例如内存交换延迟风险?我们的内核调度算法和资源隔离机制与业界其他方案相比有何独特之处?

杜震: 这个优化工作可以追溯到我们几年前推动“自研业务上云”战略时的系统性演进。为了实现云原生化,我们大规模推进了自研业务的容器化部署,而背后的核心目标,就是通过软硬件深度解耦、调度策略精细化,从而最大化服务器资源利用率,降低运营成本。

Image

在这一过程中,操作系统团队与容器团队紧密协同:容器层在上层实现应用调度和资源编排,操作系统则在底层提供关键的资源隔离和调度机制。我们围绕这一目标研发了一系列能力,例如离在线业务混部、内存压缩与卸载机制,以及如前所述的qGPU等异构计算资源利用优化。

以“离在线混部”为例,这是提升资源利用率的典型场景。在线业务对延迟极为敏感,需尽量避免资源争抢;而离线任务则计算密集但容许被打断。传统部署中二者隔离运行,资源利用率偏低。为打破这种资源孤岛,我们在内核中开发了完善的隔离与抢占机制,确保混部运行既能提升离线利用率,又不影响在线业务的实时性。

我们自研的 BT 调度算法 是其中关键创新之一。它通过设置专门的调度类,将在线和离线进程在调度层级上彻底分离,在线调度类拥有绝对优先级——只要在线业务有调度需求,即可100%抢占CPU资源,确保延迟控制在毫秒级甚至更低。从实测结果看,我们能将在线业务的资源干扰率控制在1%以内,甚至低于0.5%。

这与传统Linux社区的 CFS(完全公平调度器) 明显不同。CFS设计强调进程公平性,适用于一般用途场景,但在离在线混部环境中可能导致在线业务受到不必要的干扰。我们的做法是在调度架构上主动引入“资源等级分离”理念,从根本上保证关键业务的优先级。

此外,我们还在CPU、IO、内存和网络四大维度构建了一整套“软隔离 + 强抢占”机制,保障资源调度的弹性和确定性。这些机制形成了一个精密的底层调度生态,使得在极限资源利用条件下,仍能保障高优业务的服务质量。

总结来说,TencentOS通过创新的调度算法和资源管控机制,在性能与稳定性之间找到了平衡点,这正是我们与业界通用方案最大的差异化所在。也正因为如此,我们才能在保障业务连续性的前提下,大幅提升整体集群的资源利用效率。

✦ ✧ ✦

采访者: 腾讯云提出了SWAP Table概念,计划彻底重构SWAP流程。推动这一变革的初衷是什么?最大的挑战是社区接受度还是技术复杂度?SWAP Table统一后,能为上层业务带来哪些超越当前性能优化的价值?

杜震: 这个问题其实与我们前面讨论的“资源利用率提升”密切相关。在内存压缩和卸载场景中,系统需要将内存中的数据置换至后备设备,如NVME磁盘或ZRAM等慢速介质,这一过程即涉及到SWAP操作。而我们在实际研发中发现,传统SWAP机制存在多项性能瓶颈:如高延迟、低成功率,以及长时间运行后导致的页面碎片严重,从而严重影响内存压缩与卸载的整体效率和效果。

这些问题在Linux上游社区已被关注多年,已有近十年历史,但始终缺乏彻底的解决方案。因此我们决定对SWAP机制进行结构性重构,引入全新的SWAP Table架构。其初衷很明确——解决真实业务场景中暴露出的核心瓶颈,提升内存管理效率。

具体优化方面,我们做了两项关键突破:一是将页面扫描复杂度从O(n)降至O(1),带来数量级的性能提升;二是对整个页面替换流程中的大锁机制进行了重构,显著减少锁竞争导致的性能卡点。这些改进使得整体并发吞吐能力提升了约400%。

Image

由于该方案几乎替代了原有的SWAP分配器,其合入上游的难度和影响都不小。不过,最终方案顺利被Linux上游社区接受,也说明了我们团队在技术能力和工程可行性上的扎实基础。

至于挑战,最大的阻力来自技术本身。一方面,这项工作要求我们对现有SWAP机制有极深入的理解,才能精准识别优化点;另一方面,还需强大的验证能力支撑我们在高负载、复杂业务场景下测试效果。幸运的是,腾讯具备两大优势:一是有能力扎实推进这类底层技术优化,二是有海量实际业务可作为验证场景,从而确保方案不仅“能跑”,而且“能用好”。

SWAP Table重构带来的最大价值,是显著提升内存置换效率,从而使内存压缩和卸载真正成为高效可用的能力。这直接带动硬件资源利用率的提升,并最终在业务层面转化为实际的成本节约和系统稳定性的增强。我们希望这项底层革新,能为上层业务打下更强韧、更智能的基础。

✦ ✧ ✦

采访者:我们了解到,腾讯云近期在某大型单位成功完成了3000套CentOS的“原地替换”项目,实现了100%的替换成功率。在这个看似平滑的迁移背后,团队一定做了大量兼容性保障与风险预案。能否分享一下,为实现这一成果,最大的技术与流程挑战是什么?对于那些因特定软硬件依赖暂时无法迁移的“硬骨头”客户,我们又采取了哪些支持策略?

杜震:的确,如今CentOS用户在业界仍非常广泛。自从CentOS宣布停服后,原有用户面临无法获取安全更新(如CVE修复)等风险,因此“原地替换”成为他们迫切的需求。与重装操作系统相比,原地替换可以避免应用重部署、环境重配置,从而大大降低实施成本和业务中断风险。

要实现高质量的原地替换,我们面临的第一个挑战来自迁移工具本身。工具不仅要支持替换过程中的自动化操作,还要具备回滚能力——一旦替换过程中出现问题,能快速恢复现场。此外,替换前还需做全面的兼容性扫描,识别哪些软件包可替换、哪些不可替换,并制定相应策略。这些都对工具的稳定性和灵活性提出了高要求。事实上,我们在多个项目中不断实践和迭代优化迁移工具,以确保在不同环境下都能实现“可用、好用、稳用”。

Image

第二个挑战来自实际的集群拓扑与业务依赖。在这类大型项目中,往往不是替换一台两台服务器,而是上千台组成的业务集群。这些节点之间可能存在复杂的依赖关系,例如主备节点、上下游模块、负载均衡结构等,因此必须制定细致的迁移顺序。例如:在分布式数据库场景下,我们通常先从数据节点(Data Node)着手,最后才替换控制节点,确保业务不中断。容器场景则需提前迁移Pod,清空节点再替换,最后再迁回业务。

这些复杂关系不是工具层面能自动识别的,而是需要我们团队深入了解客户业务逻辑,制定量身定制的迁移方案,并在整个过程中持续保障业务连续性。

针对“硬骨头”客户——即存在特定软硬件依赖、短期无法迁移的系统,我们的策略是“两步走”:

1. 前置适配与验证:如果必须迁移,我们会协调客户提供真实运行环境,用于前期适配和测试,确保上线前万无一失。

2. 阶段性保留与柔性应对:对于暂时无法迁移的系统,我们建议先保留在原环境中运行,同时做好监控和风险评估。若将来系统生命周期结束或替代条件成熟,再通过重装或替代方式逐步完成迁移。

对于这种极端依赖型场景,确实没有“灵药”,但通过提前介入、细致排查、稳健迭代,我们能在技术和运维两端协同发力,为客户提供最实际可行的解决方案。最终目标,就是用最少代价,确保最大业务连续性。

✦ ✧ ✦

采访者: TencentOS Server自2010年创立,支撑了腾讯核心业务。过去15年最重要的技术跨越和战略决策是什么?未来5-10年,战略愿景是成为内部基石还是市场领先的商业操作系统?

杜震: TencentOS的研发始于2010年,至今已有15年。在这段历程中,我们经历了数次关键的技术跨越和战略转型:

第一阶段,是立足于腾讯内部应用的支撑平台。当时我们使用的是外部采购的操作系统(如SUSE),不仅成本高,也缺乏定制空间。因此我们决定自研操作系统,一方面建立自主技术体系,另一方面也希望节省订阅费用。这一阶段的目标非常明确,就是要承载和支撑腾讯的核心业务系统,并实现全面替代。

第二阶段,是通过腾讯云平台将操作系统产品化,并向外部客户输出。我们开始将TencentOS推向更多行业客户,包括互联网企业和传统企业,让它真正走出腾讯,走向市场。

第三阶段,是“自研业务全面上云”。2019至2020年,腾讯云提出资源利用率提升的战略目标,操作系统团队也随之展开大规模优化工作。我们从CPU、内存、I/O到GPU资源调度全面优化,开发了大量特性与工具,以提高系统整体效能。

第四阶段,是操作系统社区化的推进。我们主导成立了OpenCloudOS社区,一方面将腾讯积累的操作系统能力对外开放和赋能,另一方面也通过社区协同发展,增强与软硬件系统的适配能力,构建更具生态活力的开源平台。

第五阶段,是拥抱AI浪潮。在AI大模型、大算力应用普及的背景下,我们进一步迭代操作系统能力,从内核调度到推理加速、再到多模态场景支持,为AI提供底层支持能力。这一系列变革,让TencentOS成为适配新时代业务需求的“智能化操作系统”。

展望未来,我们的战略方向也已比较清晰:

●短期目标是构建全链路自主可控的操作系统,尤其在软件包的构建、引入、扫描与供应链安全方面形成闭环。目前我们已经启动并发布了TencentOS Server V4版本,在这一方向上初见成效。

●中期重点是持续聚焦AI方向,不断增强与完善内核调度、推理加速、系统弹性等关键能力,使TencentOS成为AI时代真正具备“算力操作系统”特性的产品。

●长期愿景则包括探索和拥抱更多新兴技术浪潮,如多模态智能、边缘计算等,持续思考操作系统在下一代业务场景中扮演的角色。

至于“是内部基石还是商业化产品”,我认为这不是非此即彼的问题。我们始终坚持“两手都要抓、两手都要硬”。一方面,TencentOS必须持续支撑腾讯的核心业务和技术演进,是我们内部体系不可或缺的基础设施;另一方面,我们也下定决心,全力推进操作系统商业化,努力成为面向全行业、真正可落地的国产操作系统主力军。这正是当前我们最核心、也最具挑战性的战略任务之一。

✦ ✧ ✦

采访者:CentOS停服为国产操作系统带来了巨大机遇,也引发了激烈竞争。在众多竞争者中,您认为TencentOS Server最核心、最难以被复制的竞争力是什么?我们的护城河体现在哪里?

杜震: 我们最核心、最难被复制的竞争力,正是前面提到的那些深厚的技术积累与差异化功能特性。这些能力不是短时间内就能打造出来的,也不是靠单一团队可以独立完成的。它背后依托的是整个腾讯强大的技术体系,以及长期在实际业务场景中持续打磨和验证的过程。

TencentOS Server并不仅仅是一个软件产品,它是建立在腾讯海量业务之上、不断适应真实生产环境演进的操作系统。这意味着我们不仅是操作系统的开发者,还是其深度使用者与运营者。这种“研发+应用一体化”的模式,推动我们不断发现问题、优化特性,并形成真正可落地、可复制、可扩展的技术能力。

更重要的是,腾讯具备独特的大规模业务场景,包括高并发、低延迟、大模型推理等极端需求环境,使得我们的操作系统在AI资源调度、系统性能优化等方面积累了独一无二的实践经验。放眼整个业内,很难找到另一个像腾讯这样体量的平台,能够如此系统性地验证一套国产操作系统的全栈能力。

因此,我们的护城河不仅在于技术本身,更在于“技术+场景+验证”形成的闭环优势。这是其他传统操作系统厂商很难复制的。

✦ ✧ ✦

采访者:目前TencentOS Server已经在金融、政务等多个关键行业落地,而这些行业对安全性与稳定性的要求几乎是“零容忍”。您能否分享一次在服务这类客户时遇到的典型技术挑战?您和团队是如何从技术和流程层面应对并赢得客户信任的?

杜震: 我们曾服务于某家国有大型银行,其核心任务是实现关键应用系统的国产化替代,涵盖硬件、操作系统和数据库三个层面。该项目最终选择了海光服务器、腾讯自研数据库,以及TencentOS Server,构成一套完整的全栈国产化解决方案。

在实施过程中,我们面临的最大挑战来自于国产软硬件与传统国外方案在性能和稳定性方面的差距。为了在存储性能上有所突破,客户选用了NVME设备,以提升数据磁盘的读写速度。但NVME硬盘缺乏硬件Raid支持,可用性较差,容错能力也弱于SATA盘。

针对这一痛点,我们为客户开发和优化了软件Raid能力,弥补NVME设备在稳定性上的短板,既保留其高性能优势,又保障了数据可靠性。同时,为应对金融级业务高并发、高吞吐的严苛要求,我们不仅开发了核心功能,还构建了配套的硬件监控体系——用于实时监测磁盘寿命、读取异常、坏块情况等关键指标,确保故障可预测、可预警、可应对。

这一套完整的技术方案,从前期与客户的联合调研、设计,到后续部署与验证,充分展示了我们团队的系统能力和服务深度。最终,也正是凭借这种“技术+流程”的双重保障,让客户对我们建立了高度信任。

✦ ✧ ✦

采访者: 操作系统的成功离不开强大的软件生态。除了兼容RHEL/CentOS生态之外,TencentOS Server在构建自身的开发者与合作伙伴生态方面有哪些长远规划?又如何吸引更多独立软件开发商(ISV)和开发者基于TencentOS Server进行开发和认证?

杜震: 我们主要依托OpenCloudOS社区来推动生态建设。相比其他社区,OpenCloudOS有两个显著特点:一是包容开放,二是坚持中立合作。腾讯本身不涉及硬件商业化,因此我们与市场上的各类硬件厂商始终保持开放态度。截至目前,我们已与114家国内南向硬件厂商建立合作关系,累计上下游合作企业超过1200家,完成深度适配的软硬件厂商超过300家,社区的活跃用户和贡献者超过7000人,并设有100多个领域兴趣小组。

Image

生态建设的首要目标,是为TencentOS Server的商业化打下坚实基础。我们正持续与大量ISV开展合作,通过技术适配和生态认证支持他们的软件运行于TencentOS环境。同时,我们也设有激励机制,对完成适配的ISV在资源、认证和曝光上给予支持,提升其参与积极性。

更进一步,在实际项目中,我们会将ISV纳入联合解决方案体系,为他们创造实际业务机会。例如,我们会将ISV推荐给有应用需求的客户,反之ISV也可为我们带来项目机会。他们不仅是合作伙伴,也可能成为生态经销商,获得项目利润分成。这种从“认证适配”到“业务共赢”的合作路径,进一步激发了ISV与我们共同构建生态的动力。我们希望通过这种技术与商业双轮驱动,打造一个健康、可持续的操作系统生态圈。

✦ ✧ ✦

采访者: 非常感谢杜老师今天的深入分享。通过这次交流,我们对TencentOS Server在AI时代的战略定位、技术演进路径以及生态构建有了更加全面和深入的了解。

杜震: 谢谢高可用架构和GIAC大会,也谢谢美旭的精彩提问。很高兴有机会分享我们在操作系统领域的一些实践和思考,期待未来能有更多交流与合作。

参考阅读

本文由高可用架构原创,技术原创及架构实践文章,欢迎通过公众号菜单「联系我们」进行投稿。