百度智能云网络智能化运维系统设计和实践
点击蓝字,关注我们
本文系统介绍了百度智能云在网络智能化运维领域的整体架构设计与落地实践。
在架构层面,构建了清晰的三层体系:AI 基建层整合多源数据、提供 AI 必备工具组件;AI Agent 核心层基于大模型实现任务理解、工具调用与自主决策;AI 业务场景层则面向具体运维需求封装可复用的智能服务。
依托该架构,文章重点呈现了两大类实践成果:一是「网络数字工程师」,通过 AI Agent 自动执行故障排查、变更验证、健康巡检等高价值运维任务;二是「数据智能」,支持以自然语言交互方式完成跨域数据分析、根因推理与可视化大屏自动生成。
实际应用表明,该系统大幅降低人工干预频次,提升响应速度与决策质量,为云原生 AI 时代的智能运维提供了可扩展、可落地的工程范式。
凌晨三点昏暗的灯光、永远响不完的告警电话、反复核对的配置命令、故障时被催问的焦灼——这些场景,每一位网络工程师都刻骨铭心。身处云原生 AI 时代,面对数以万计的设备与千万级的端口规模,以及业务侧日益严苛的质量要求,传统运维「依赖经验 + 堆砌人力」的模式早已难以为继。
今天,我们拒绝空泛的概念,只谈最务实的话题:我们为什么要做网络智能化运维?以及我们如何将网络工作进行智能化改造?
1. 先聊聊那些「扎心」的运维痛点——你是否也在经历?
运维做得越久,越能体会那种「痛在身上,急在心里」的滋味。以下这些来自网络工程师的真实吐槽与畅想,也是传统网络运维向 AI 时代迈进时,最亟待打破的壁垒。
被禁锢的工作模式:为何不能更快捷?
我厌倦了必须掏出电脑、敲击一堆复杂命令才能查看问题的日子。我期望的 AI 时代,手机即是作战终端——无论是在用餐还是通勤,只需简单的自然语言交互,就能完成故障排查、隔离与止损。让运维从「重型终端」解放,转向「随时随地」。
被割裂的数据孤岛:为何获取真相这么难?
为了验证一个机房的网络异常,我往往需要跨越 5 个以上的平台,反复输入查询条件,在碎片化的数据中艰难拼凑真相。我期望平台能「读懂」我的意图,不再是我去一个个系统里「找数据」,而是想要的数据能自动“找上门”。
被琐事淹没的价值:为何总在救火?
我们在这个劳动密集型的怪圈里陷得太深,每天被海量的收尾工作和琐碎杂事填满,根本无暇顾及网络的深度分析与架构优化。我们急需一套具备「自闭环」能力的系统,自动消化那些繁琐的重复性工作,让工程师从“搬砖”中抽身,去构建一个更具鲁棒性的网络。
2. 网络智能化运维的必要性
随着百度网络规模的持续扩大,叠加客户对高品质运维服务的迫切诉求,网络运维(NetOps)体系朝着智能化方向加速进化是必然趋势。从传统人力驱动的运维模式,到智能运维体系的转型,其主要历经了四大关键阶段:
面对指数级增长的网络规模与极致的 SLA 挑战,AIOps 绝非锦上添花,而是我们唯一的突围方向:
这是必选项,也是新机遇:通过 AI 重构运维的模式,实现工作质量和效率的提升,已是行业生存的底线。这既是挑战,更是契机——它让网络运维有机会走出机房的阴影,从被动的「救火队员」转变为主动的「价值创造者」。
跳出设备,俯瞰全局:我们要摒弃「管好设备就行」的狭隘视角,真正的专家,懂得向上理解业务痛点,向下参透硬件原理。唯有打通「芯片-网络-应用」的全栈脉络,实现数据的多点互通,我们才能建立起不可替代的竞争壁垒。
工具在变,人的灵魂不变:AI 不会淘汰工程师,它淘汰的是只会敲命令的机械劳动。未来的网络专家,胜在判断力、审美与提问能力。让我们把繁琐交给 AI,把智慧留给架构——这才是人机协同的终极形态。
智能化从来不是要通过取代来「做减法」,而是要给网络工程师加 BUFF「做乘法」。
3. 网络智能化运维架构
如下图所示,通过「业务场景驱动 + AI Agent 自主决策 + 基建能力支撑」的三层架构,构建了网络智能化运维体系的整体框架。基于该框架,实现运维流程的自动化、智能化闭环,覆盖故障排查、数据可视、咨询服务、交付提效等核心场景,该能力不仅赋能网络运维同学的工作提效,也会助力传输运维、建设交付等兄弟团队的同学,做到网络团队一体化智能运维。
在进入智能化运维时代前,必须先具备 AI 基建的能力,其中包含三个核心的组件: 数据、工具和流程。
数据:在 AI 时代要想 Agent 能按照预期返回真实可靠的答案,网络数据是所有行动的基础,所以我们在做 AI 能力之前先针对设备软硬件、SysLog、拓扑、IP 等 CMDB 数据,进行深度优化,提升数据的有效性。
工具:在拥有了可靠的数据之后,就可以基于数据开发更多精细化、具备处理逻辑的工具。在过去两年,我们利用数据做了大量的平台级自动化工具,其中包括监控、定位、止损、巡检、变更等运维必备的工具。在拥有了成熟的工具平台前提下,再将工具注册到 MCP Server 中,使网络工具具备通过大模型或者 Agent 直接调用的能力,Agent 从此有了「手脚」。
流程:在面对每个任务场景,如何应用数据和工具按照预期执行,且每次都能得到可靠的处理结果,那就需要最关键的组件 workflow,它是一个贯彻 SOP 线上化的最佳方式。我们基于 BPMN 搭建了 BNE ——百度网络流程引擎,让网络工程师具备了灵活拖拉拽的线上化编排能力。而这种工作流较为固化,无法应对诸如业务报障、故障排查等灵活多变的场景,所以我们借助 Multi-Agent 的框架将 LLM 能力嵌入进 BNE 中,从此网络工程师具备构建智能体工作流(Agentic workflows)的能力,工作流从此有了「思维逻辑」。
在 AI 基建层之上,是实现智能化运维的 AI Agent 核心层,该层是所有应用场景的决策中枢,该层基于 AI 基建的能力,借助大模型和垂类小模型的推理能力,实现「意图识别 → 任务规划 → 工具执行」的智能化全流程,达到用户场景和意图的自主决策。
意图识别模块(Host Agent + 网络 RAG)
功能:
无状态服务(如部分微服务组件):可直接横向扩展,再进行数据迁移与服务切换;
网络 RAG:结合运维知识库(设备信息、拓扑数据、故障案例、配置基线),增强大模型的领域理解能力,避免幻觉。
技术支撑:通用大模型 + 网络领域知识库(存储于向量数据库)。
任务规划模块(Plan-Act 框架)
功能:
Planner Agent:将复杂需求拆解为可执行的步骤序列,如排查某机房是否存在故障,可以将其拆分成不同的步骤:查看设备质量探测数据→查询对应设备是否存在异常 SysLog→查询机房是否有变更→如果存在故障,给出故障处理建议;
Actor Agent:按步骤序列调度不同的子 Agent 或者工具执行,并监控执行结果;若某步骤失败(如获取设备日志失败),自动调整流程(如切换获取日志方式),具备动态重规划的能力。
技术支撑:该环节需要更强的推理能力,所以在任务规划中将会使用推理大模型,如 Deepseek R1。
工具执行模块(ReAct 框架)
功能:
子 Agent:基于任务类型,将其拆解为工具调用组合,通过「思考 → 行动 → 观察」的循环,从工具库中筛选工具,并执行(如质量数据指标查询、设备日志查看),最后根据工具的反馈调整后续动作;
工具库:基于 MCP Server 的自动化工具集合,接入网络数据和工具,如 CMDB 数据、网管工具 API;
技术支撑:子 Agent 规划(按任务类型调度专用 Agent)+ 工具执行引擎(标准化工具接口,支持插件化扩展)。
在 Agent 能力实现时,更偏向于多种类型的大模型共同协同的过程。意图识别中主要使用通用大模型,负责「自然语言交互与基础意图理解」;而任务规划中更偏向于使用推理大模型,如基于网络运营数据集训练后的 Deepseek-R1,负责「复杂任务规划与逻辑推理」;在特定场景需要微调训练后的垂类小模型,才能更加理解网络知识和设备命令,以及域内网络拓扑。
基于 AI Agent 核心层框架,任何一个网工都可以根据自身的业务场景,快速搭建子 Agent,实现场景智能化改造,达到了低成本化、全员化的能力。下面是从相对大的场景分类进行枚举,而更多的「BUFF 组合技」,应该留给真正的使用者去想象和实现:
故障排查与闭环场景:把「老手艺」变成「团队能力」,专家经验得以沉淀,如一句话完成所有故障检测数据核查,将故障问题闭环交接给数字工程师,由其代劳处理。
数据可视与分析场景:让数据「说话」,告别「经验猜故障」,如设备软硬件数据一键可视,AI 自动分析生成图表,或者一句话生成网络重保大屏。
问题咨询与服务场景:把「机械活」交给机器,成为高效的助理,如获取一些 IP 的信息,快速给出 IP 是公网 IP 还是网内 IP ,列出 IP 的相关信息和关联设备。
交付敏捷与提效场景:交付调试不再是工作量密集区,如链路调测或者设备上架,机房现场一线人员直接感知设备状态,无需登录设备,就可以快速确认连线正确性,及时调整和修复。
4. 网络智能化运维场景说明
为了更直观的说明我们在网络智能化运维工作的改变,下面将从网络数字工程师、数据智能两种角度阐述我们的落地方法。
4.1. 场景 1:网络数字工程师
背景
网络工作中包含着故障处理与分析、信息查询与统计、设备交互与实施等大量亟待 AI 提效的场景,如果评价一个最接近百度运维工程师的 AI 产品,那一定就是数字员工。这也是未来网络工作范式革新的雏形,从工程建设、资源规划到问题咨询、数据洞察,通过它绝大多数网络需求可以得到满足,真正意义上成为网络团队的「贾维斯」。
目前我们已经启动了对应的核心项目:网络工作室 NetStudio,旨在成为所有网络同学工作中的「贾维斯」,也是网络的 No.1 号数字员工。
实现方式
NetStudio 定位为面向网络从业者的 AI 原生统一工作台,致力于打造集「Visual Studio Code 级工具能力 + Cursor(或百度 Comate)式智能辅助」于一体的网络交互新范式 —— 彻底突破传统 CLI/GUI 的设备交互局限,以 LUI(语言用户界面)为核心交互基础,重塑网络工作的交互体验与效率边界,推动工作模式实现颠覆性变革。
用户可将 NetStudio 作为日常工作核心入口,通过自然语言直接与网络设备、工具平台进行高效交互,典型场景如下:
设备数据可视化查询:一句话即可获取设备状态数据(含流量、硬件状态、协议状态、监控日志、互联拓扑等),系统将以图形化方式直观呈现,相关信息在单次会话中一站式聚合展示,彻底摒弃传统网工需通过设备 CLI 与多个平台反复切换、多次交互的繁琐模式;
跨域数据联动分析:打通光传输网(OTN)与业务网数据壁垒,打破独立数据源限制。例如光传输发生故障时,可通过自然语言直接查询交换机侧关联端口状态变化(如「北京到广州 XX 传输倒换,交换机侧抖动的端口有哪些?」),实现问题快速定位;
智能解析与信息统计:支持一句话触发设备日志智能解析与统计分析,或针对设备软硬件信息进行定向分析(如「请给出某型号设备不同软件版本的故障事件统计及分析」),无需人工繁琐筛选处理,大幅提升数据分析效率。
如下图所示为 NetStudio 数字员工的实现架构,该架构以网络智能化运维框架为模板进行整体设计,网络AI基建中的数据、工具、流程模块通过 Scenario Agent 接入AI Agent 核心层,在 AI Agent 核心层通过搭建 Host Agent、Planner Agent、Act Agent、Conclusion Agent、Scenario Agent 对外提供 AI 服务,最后网络业务的 AI 场景通过 Scenario Agent 去完成场景的设计和适配。
在架构中,Host Agent 会根据用户问题先调用 Planner Agent 生成执行计划 Plan,Act Agent 负责执行 Plan 去调度不同专业领域下的 Scenario Agent,最后将所有的结果反馈给 Conclusion Agent,由其负责进行最终结果的总结和呈现。同时,Agent 具备自我进化能力,可主动对接各类自动化工具与平台采集数据(如设备健康状态、巡检结果、运行数据等),能基于数据分析输出决策建议,在授权范围内自动执行相关操作(如巡检任务触发、异常问题处置等)。
其中在 Scenario Agent 中,针对复杂问题场景,我们引入 Agentic Workflows(智能体工作流)—— 这是一种由 AI 智能体驱动的新型工作流范式。它通过智能任务分解、按需工具调用、动态决策调度与持续迭代优化,实现复杂任务的端到端自动化处理。
其核心优势在于赋予工作流自主决策能力、明确目标导向性与灵活环境适应性,与传统依赖固定预设规则的工作流形成本质区别,能够更高效地应对网络运维中的复杂多变场景。如下图是 Agentic workflows 设计上的基本框架:
落地效果举例 1 :故障排查场景
本示例主要展示基于 Agentic workflow 设计的故障排查 Agent 落地效果。对于常规的故障处理包含了大量的信息查询、检索、整理工作,最终要对所有相关数据信息进行分析、总结并给出结论,甚至完成最后的维修动作,这些恰巧是当前大语言模型(LLM)+ MCP 擅长的领域,现在我们可以通过 NetStudio 一句话实现机房故障查询、分析、总结建议。如下图所示,是机房故障排查子 Agent 中设计的 Agentic workflow。
当我们想要知道一个机房是否存在故障时,可以选择通过如流公众号进行故障排查,如下图所示,展示了收集到的各个模块数据,以及故障推断的结论和行动建议。
当我们发现存在故障告警时,可以快速根据事件单 ID 对其所涉设备进行快速分析,如下图是通过 NetStudio 交互的过程:
落地效果举例 2:故障推进场景
本示例主要展示故障推进 Agent 落地效果,常规的线上化处理流程相对固化,且故障处理的推进还是由人工处理。如示例,我们对传统光纤故障运维流程进行智能化改造,在 Agentic Workflow 中,使用特定节点进行 AI 机器人唤起,让机器人主动介入&持续跟进后续的人工待办节点,这步也是最有「AI 味儿」的环节,机器人可以根据自然语言自主判断并调用对应工具,推动故障全自动化闭环,甚至异常的处理和升级。由机器人自主推动的故障处理过程,不再局限于被动式响应的问答模式,而是可以做到类真人的工作者。如下图所示,展示了传统的光纤故障处理过程:
相对传统的光纤故障处理流程,下图展示通过自然语言交互实现故障协同推进的应用示例,AI 机器人「小光」可直接与链路供应商开展智能化沟通,全程跟进故障处理进度、同步关键信息,高效推动故障闭环修复。
最后,附上 NetStudio 交互页面,可更直观地感受这一全新交互模式带来的体验升级。
4.2. 场景 2:数据智能
背景
在高度数字化的时代,网络已突破成本中心的传统定位,跃升为驱动业务增长的核心引擎。我们所掌控的日志、流量、成本、IP 等数据,绝非孤立的运维指标,而是蕴藏巨大价值的战略数据富矿。通过深度挖掘与智能分析,这些数据能够构建起洞察全局的战略决策仪表盘,为网络架构优化、资源精准扩容、成本精细化管控提供科学依据,真正实现决策先于问题发生的前瞻性运维。典型的应用场景如下:
故障预判场景:IDC 内光模块部署量已达千万级规模,硬件故障频次随之攀升,对 AI 大模型训练等高敏感业务的稳定性构成显著威胁。光模块数据作为故障信息的核心载体,亟待通过数据智能技术挖掘链路抖动的共性规律,为故障精准预判筑牢数据根基。
成本管控场景:流量带宽是业务成本控制的核心抓手,唯有建立流量与业务的精准映射关系,才能实现带宽需求的科学评估与合约的动态优化,推动带宽资源利用效率最大化。
运维提效场景:网络故障的本质是节点间的访问异常,结合机房网络拓扑可视化能力,运维人员可直观掌握网络结构及动态变化,大幅缩短故障定位时间,提升运维决策效率。
为了深度挖掘数据中的价值,我们期望数据先能展示出来。然而,传统模式下数据的可视化路径,始终面临高成本、低响应的严峻挑战。无论是日常运维数据分析,还是重大活动网络重保,一张定制化数据大屏的落地,往往需要历经「需求提报 - 方案评审 - 研发实现 - 功能测试」的冗长流程。跨部门协作的人力消耗大、交付周期长,难以匹配业务快速迭代的节奏,成为掣肘数据价值释放的关键瓶颈。
AI 时代的到来,为这一困境带来了颠覆性转机。过去难以规模化落地的定制化需求,如今在 AI 技术的赋能下迎刃而解。我们构想这样一种创新模式:以自然语言描述或极简配置指令为输入,由 AI 精准理解业务意图,自动生成精准、美观、可交互的数据大屏。这种模式不仅能将开发资源从重复低效的定制工作中彻底解放,更能赋予业务人员「按需所见」的即时数据分析能力,让每一位网络专家都成为数据价值的「策展人」。以此为起点,数据的潜在威力将被充分释放,引领网络运维从被动响应的传统模式,迈向主动预判、智能决策的全新阶段。
数据 AI 可视化实现方式
在数据AI可视化的实现路径中,我们使用了百度开源的前端低代码框架 Amis(秒哒同款),同时借助 LLM 实现了多样的前端渲染。如下图所示,是AI可视化前端的实现架构,整个过程只需要三步 :
依托 MCP 完成所有后端数据的接入,并通过 RAG+ 网络数据湖,实现所有数据模块的关联查询及格式化处理;
基于低代码框架 Amis + 大语言模型能力 完成定制化数据展示组件;
根据自然语言意图,多 Agent 协作,最终绘制数据大屏绘制。
只需这三步我们可以完成所有想要的数据可视化,无论是用于一次性工作、统计汇报、数据分析,都可以实现分钟级的创建和销毁。
在架构中使用的 amis,是一个低代码转化成前端语言的组件,简单说,amis 是可以把「写 React 组件代码」变成了「写 JSON 配置」,框架会自动把 JSON 转成对应的 React 组件,并渲染出来。
拿一个表单页面举例,如果用 React 组件,通常需要写成如下这样:
<Pagetitle="页面标题"subTitle="副标题"><Formtitle="用户登录"><InputTextname="username"label="用户名" /></Form></Page>
把以上配置方式转换成 amis JSON,则需要写成如下这样:
{"type": "page", // 对应React的<Page>组件"title": "页面标题", // 对应Page的title属性"subTitle": "副标题", // 对应Page的subTitle属性"body": { // Page的子组件(对应<Page>的子元素)"type": "form", // 对应React的<Form>组件"title": "用户登录",// 对应Form的title属性"body": [ // Form的子组件(对应<Form>的子元素){"type": "input-text", // 对应React的<InputText>组件"name": "username", // 对应InputText的name属性"label": "用户名" // 对应InputText的label属性}]}}
附 Amis 的官方介绍文档,供查阅:https://aisuda.bce.baidu.com/amis/zh-CN/docs/index
落地效果举例:客户网络重保大屏
今年双 11,我们首次推出 AI 全流程生成的云客户专属网络重保大屏,产品一经亮相便超预期交付,不仅彻底颠覆了传统网络可视化「功能单一、呈现乏味」的固有印象,更实现「随用随生成」的灵活体验,为云客户网络提供了高效、直观的保障。
如下图所示,为「一句话生成可视化数据大屏」的完整交互流程:
如下图所示,为某客户双 11 网络重保期间,通过 AI 生成的专属网络大屏:
过去受限于「人力投入成本过高」而难以落地的网络可视化需求,如今在 AI 技术的深度赋能下,已具备规模化落地的成熟条件,为网络可视化开辟了全新路径。未来,我们将持续深化并拓展 AI 可视化能力,推动其从特定场景向全量场景延伸,使数据展示更加智能、数据分析统计更加智能。
5. 网络智能化运维总结
从网络智能化 Agent 调用数据可知, 25 年 11 月 AI 模型调用总量达 17.49 万次,较 10 月的 2.98 万次实现 486.9% 的环比激增。这一关键数据标志着网络智能化运维需求已正式迈入快速扩张期,AI 驱动的运维新模式正逐步成为网络工作的新形态。
而且经过我们的计算,相对传统的运维模式,智能化的运维模式价值非常凸显:
从单任务成本看,按照当前 token 市场价计算,AI 完成单任务成本仅 0.65 元/次,而对于传统人工+工具的成本是 16 元/次,ROI(投资回报率)超 23 倍;
从单任务耗时看,AI完成单任务耗时仅 30 秒/次,传统人工+工具的单任务耗时是 8 分钟/次,问题处理时效提升16倍。
同时,AI 服务高达 95% 的响应准确率,能够有效规避因运维人员经验、专业能力参差不齐导致的问题处理偏差,从源头保障运维操作的标准化与可靠性。依托 AI 技术的核心赋能,实现了「人力配置不变、运维效能倍增」的关键突破,即便面对网络规模的持续扩大与运维场景的日趋复杂,也能凭借智能+自动化的处理能力游刃有余的应对压力,以低成本、高效率、高准确率的三重优势,为网络运维工作注入可持续的智能化动力,推动运维模式实现从「被动响应故障」到「主动预判风险、精准处置问题」的跨越式升级。
未来网络将坚定走「AI+」深度融合之路,把AI技术全面嵌入网络的全生命周期中。我们的核心目标,是打造一张具备弹性、自愈、自优化的下一代网络 —— 它不仅要筑牢业务运行的「稳定基石」,更要成为驱动业务模式创新、价值突破的核心引擎。锚定 2028 年,我们计划推动网络团队实现从「高度自动化」到「自主决策智能化」的跨越:遇故障处变不惊,做变更无人值守,值班再无「午夜凶铃」。
未来 3 年,我们的规划蓝图如下:
2026 年(高度自动化):单点智能,辅助决策,以「替代重复」为核心,靠故障自愈、数字人值班等能力,把团队从日常工单、告警中解放出来,聚焦架构设计等更高价值的任务;
2027 年(智能化服务):协同智能,主动预测 / 预防,以「激发新需求」为方向,让网络变成「随时、按需、意图驱动」的智能服务,通过信息检索、生成式变更等能力主动响应需求;
2028 年(认知化决策):自主驱动,自动运行,以「超越人类」为目标,实现网络架构的自我演进与优化,借助故障预测、网络数字孪生等能力,挖掘人类专家难以洞察的深层规律。
6. 可预见的展望
AI 正加速进化为工程师的「超级助手」,通过接管重复劳动与革新人机交互,驱动运维从「人力密集」向「智力密集」深度转型。这不仅让工程师回归战略决策核心,更推动智能化运维跨越网络边界,赋能全行业核心场景。
END
推荐阅读