AIOps:从告警到智能体运维控制面
过去 30 天,AIOps 这条线最值得看的,不是又多了几个“自动根因分析”功能,而是运维对象变了。
Datadog 在一季报里把 MCP Server、Bits AI Security Agent、GPU Monitoring 一起推到 GA;Dynatrace 把 MCP 连接器、Telemetry Pipeline、AI-native progressive delivery 放进同一组业务亮点;Honeycomb 专门推出 Agent Observability;ServiceNow 和 IBM 则都在讲“控制塔”或“AI 运营模式”。
这些新闻拼起来看,AIOps 正在从“用 AI 看系统”,变成“用可观测、权限、策略和因果关系,管住会行动的 AI”。视频号解说如下, 欢迎订阅
需求不是少告警,而是可追责
以前的 AIOps 主要处理三件事:告警收敛、异常检测、根因定位。它解决的是人被噪声淹没的问题。
现在企业要处理的是另一件事:AI agent 已经开始写代码、查日志、调用工具、改配置、触发流程。系统故障不再只是某个服务延迟升高,也可能是一个 agent 选错工具、重复重试、拿到过宽权限,或基于过期上下文做了错误处置。
所以我更关注 Honeycomb 这类“看清 agent 每一步做了什么”的产品化动作,也关注 OpenTelemetry 在 5 月毕业,以及 GenAI 语义约定继续推进。标准化遥测一旦站住,AIOps 厂商就不能只卖漂亮大屏,必须回答:一次模型调用、一次工具调用、一次权限放行、一次回滚,能不能被统一追踪和复盘。
真正的变化在控制面
Datadog 一季度收入同比增长 32% 到 10.06 亿美元,Dynatrace 四季度 ARR 达到 20.54 亿美元、同比增长 18%,这些数字说明可观测性预算还没有被 AI 挤掉,反而被 AI 复杂度重新抬高。
但预算流向会变。传统 APM 看应用,日志平台看事件,ITSM 看流程,安全系统看身份。智能体运维需要把这些重新接起来:谁让 agent 动手、agent 基于什么证据动手、动到了哪一层资源、结果有没有越权或扩大故障。
IBM 在 Think 2026 里把 Instana、Turbonomic、Cloud Pak for AIOps、Concert 放到同一套观测与管控模型里,ServiceNow 扩展 AI Control Tower,也是同一个方向:AIOps 的价值点正在从“发现问题”前移到“约束行动”。
这也是我对近月 AIOps 的核心判断:行业正在把“自动化运维”拆成两层。底层是开放遥测和实时拓扑,上层才是智能体。没有底层语义,智能体只是更会写查询语句;有了控制层,智能体才可能进入生产处置。
未来的证据
我会盯四个指标。
第一,OpenTelemetry GenAI 语义约定能否从“可用”走向大规模一致采用。谁掌握标准输入,谁就更容易进入企业 AIOps 主链路。
第二,MCP 会不会成为运维上下文进入 coding agent、SRE agent 的常用接口。Datadog 和 Dynatrace 都在推,这说明竞争点已经进入“把生产上下文喂给智能体”。
第三,控制塔产品能否真正落到权限、审批、回滚和成本核算,而不是停留在资产清单。ServiceNow 的 AI Control Tower 增强功能预计 2026 年 8 月 GA,值得继续看客户落地质量。
第四,中国智算中心和大型 ICT 厂商会不会把“算、网、存、云、安、维”做成一体化运维智能体。新华三 5 月发布的灵犀运维智能体就是这类信号。它未必代表行业答案,但说明 AIOps 已经从软件运维扩展到 AI 基础设施运维。
AIOps 这轮变化的关键,不是机器能不能替人值班,而是企业敢不敢让机器在生产系统里行动。答案不会来自一个更大的模型,而会来自可观测标准、实时拓扑、权限边界和可复盘的控制链。