字节跳动技术团队

字节跳动ByteBrain 2025年11篇顶会,三年降成本10个亿

近年来,字节跳动基础架构团队持续在AI for Infra/System布局,旨在使用AI技术优化云计算系统,并取得了显著成果。2025年刚刚过去4个月,基础架构ByteBrain团队已经有11篇论文在AI for Infra领域的顶会发表或接收,其中CCF-A类会议10篇(SIGMODx3, VLDBx4, EuroSys, FSE, WWW各1篇),ICLR 1篇(ICLR暂未进入CCF列表,但是公认的机器学习三大顶会之一)。

学术论文仅仅是ByteBrain团队的副产出,工业界最重要的是业务收益。ByteBrain利用大模型(LLM)优化火山引擎稳定性,重要oncall提效26%,基于运筹优化算法对系统成本进行优化,近三年节省成本超10亿人民币。除此之外,ByteBrain还在异常检测,根因分析,AI for DB,DB for AI,Text2SQL, LLM Multi-Agent等方向取得了较好进展,例如把预训练语言模型应用在NDV(Number of Distinct Values)预测上,可以无需采样数据进行NDV估计,该项技术是领域内第一个基于语言模型进行NDV估计的工作,可以在无需访问原始数据的情况下达到开箱即用的效果,成果发表在SIGMOD25,并正集成到生产环境中。

在AI时代,字节跳动把大模型等相关技术规模化应用在了云计算和IT基础设施的优化中,并乐于分享最新的研究成果,反馈在开源社区和顶级学术会议上(详见本文附录)。这些成果的发表也表明字节跳动正走在该领域(AI for Infra)的前列。

关于字节跳动ByteBrain团队:

ByteBrain是字节跳动的AI for Infra服务平台,旨在利用AI,特别是机器学习、大模型和运筹优化技术,对基础架构和系统的全生命周期进行自动优化。优化对象包括:数据库、存储、大数据系统、虚机、容器、网络、运维和稳定性等。ByteBrain的主要方向为AIOPS、AI4DB、运筹优化、LLM4Infra四大方向,功能模块包括容量规划、资源调度、系统调参、异常检测、根因分析、慢SQL优化、Text2SQL、LLM-AGENT等。ByteBrain团队正在招聘相关方向的研究员和实习生。

联系方式:[email protected]

截止25年4月份ByteBrain团队的学术论文(* corresponding author):

PLM4NDV: Minimizing Data Access for Number of Distinct Values Estimation with Pre-trained Language Models

SIGMOD, 2025

Xianghong Xu, Xiao He, Tieying Zhang*, Rui Shi, Lei Zhang, Jianjun Chen

AdaNDV: Adaptive Number of Distinct Value Estimation via Learning to Select and Fuse Estimators

VLDB, 2025

Xianghong Xu, Tieying Zhang*, Xiao He, Haoyang Li, Rong Kang, Shuai Wang, Linhui Xu, Zhimin Liang, Shangyu Luo, Lei Zhang, Jianjun Chen

Adaptive and Efficient Log Parsing as a Cloud Service

SIGMOD, 2025

Zeyan Li, Jie Song, Tieying Zhang*, Tao Yang, Yingjie Ye, Pengfei Duan, Jianjun Chen

Data-Agnostic Cardinality Learning from Imperfect Workloads

VLDB, 2025

Peizhi Wu, Rong Kang, Tieying Zhang*, Jianjun Chen, Ryan Marcus, Zachary G. 

Ives

TickIt: Leveraging Large Language Models for Automated Ticket Escalation

FSE, 2025

Fengrui Liu, Xiao He, Tieying Zhang*, Jianjun Chen, Yi Li, Lihua Yi, Haipeng Zhang, Gang Wu, Rui Shi

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

VLDB, 2025

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang*, Jianjun Chen, Rui Shi, Dan Pei*

Flow-of-Action: SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis

WWW, 2025

Changhua Pei, Zexin Wang, Fengrui Liu, Zeyan Li, Yang Liu, Xiao He, Rong Kang, Tieying Zhang*, Jianjun Chen, Jianhui Li*, Gaogang Xie, Dan Pei

E2ETune: End-to-End Knob Tuning via Fine-tuned Generative Language Model

VLDB, 2025

Xinmei Huang, Haoyang Li, Jing Zhang*, Xinxin Zhao, Zhiming Yao, Yiyan Li, Tieying Zhang*, Jianjun Chen, Hong Chen, Cuiping Li

Learning to Communicate Through Implicit Communication Channels

ICLR, 2025

Han Wang, Binbin chen, Tieying Zhang, Baoxiang Wang

ABase: The Multi-Tenant NoSQL Serverless Database for Diverse and Dynamic Workloads in Large-scale Cloud Environments

SIGMOD, 2025

Rong Kang, Yanbin Chen, Ye Liu, Fuxin Jiang, Qingshuo Li, Miao Ma, Jian Liu, Guangling Zhao, Tieying Zhang, Jianjun Chen, Lei Zhang

Towards VM Rescheduling Optimization Through Deep Reinforcement Learning

EuroSys, 2025

Xianzhong Ding, Yunkai Zhang, Binbin Chen, Donghao Ying, Tieying Zhang*, Jianjun Chen, Lei Zhang, Alberto Cerpa, Wan Du