程序员老鬼

awesome-LLM-AIOps:运维想用大模型,别只盯着聊天框

做运维的朋友看到这个仓库,估计会有点感觉。

线上一炸,告警先刷屏,日志一坨,群里开始问“谁刚发版了”。你说想用 AI 提效吧,问题是从哪下手?让大模型直接看日志?做 RCA?还是写 postmortem?很多人第一步就卡住了。

GitHub 上这个 awesome-LLM-AIOps,就是把 LLM + AIOps 相关论文和工业材料攒到一起,目前仓库页面显示 525 stars。项目本身按三块拆:Incident Management、Log Analysis、Infrastructure Management,不是那种随便堆链接的收藏夹。

Image

东哥觉得最有用的是故障管理这一块。

它不是只讲“根因分析”四个字,而是从 incident lifecycle、incident reporting、Root Cause Analysis,到 mitigation、postmortem、AIOps 问答都列出来了。你真在公司里做过值班就知道,故障处理不是找一个 root cause 就结束,前面告警怎么聚合,后面复盘怎么写,中间 SOP 怎么接上,都是麻烦事。

日志分析这边也挺实在,Log Parsing、Log Anomaly Detection、Logging Statement Generation 都有。这个方向我会多瞅两眼,因为很多团队的日志不是没数据,是格式乱、字段飘、traceId 有时有有时没有,AI 一上来就“智能分析”,大概率先被脏数据噎住。

Image

还有 Infrastructure Management,里面提到 Benchmark、Vision、Infrastructure-as-Code、LLM Training Platform。这个先别急着幻想全自动运维,东哥更关心权限边界、回滚、执行前确认这些老问题。Agent 真要碰生产环境,没审计日志、没 dry-run、没 fallback,我是不敢让它自己动手的。

这仓库适合两类人:一类是运维、SRE,想知道大模型到底能插到哪几个环节;另一类是做 AI 应用的,别老做聊天机器人了,看看真实系统里的告警、日志、工单、SOP 怎么连起来。

GitHub地址:Jun-jie-Huang/awesome-LLM-AIOps