值得一提的是,TISA 动态调度架构论文《Dynamic Scheduling for AI Accelerators via TISA》正式入选 ISCA 2026,这也是国内AI芯片公司在ISCA上的重要突破。要知道,ISCA如同计算机体系结构界的Nature,是该领域历史最久、最具影响力的会议,这代表奕行智能的核心技术路线已经获得国际同行的正式认可。可以说,让有AI算力需求的玩家们“花小钱办大事”,在AI时代更好地把握机遇方向上,奕行智能实现了一次重要突破,给产业破局提供了一种新的思路。01.芯片买了钱花了,为什么效率提升跟不上?解密TISA三项核心突破当前,各类前沿AI芯片单卡算力动辄达到几PFLOPS(每秒千万亿次浮点运算)甚至几十PFLOPS,峰值算力大幅提升,但相比算力的大幅提升,芯片算力利用率的提升却远未达到理论峰值。从AI芯片内部结构来看,矩阵计算单元、向量计算单元,以及数据搬运单元协同运行,三者各司其职,同时持续满负荷运转才能实现最高效率。但当前AI芯片中主流采用的“编译时静态调度”模式,会在在程序运行前就把所有任务的执行顺序一次性排定。这就像工厂厂长提前排好了生产计划,却不考虑工人临时请假、设备临时故障、原料临时缺货等情况(对应芯片运行时的带宽争用、温控降频等随机扰动),很容易造成流水线“空转干等”。即便部分现代GPU在线程束(warp)调度等底层机制上引入动态调度,但这些机制仅在极细的指令粒度上运作,仅能解决CUDA Core内部的指令调度问题,无法协调数据搬运单元TMA、Tensor Core与CUDA Core三者的并发执行,仍存在局限性。相比之下,TISA架构是如何突破这一瓶颈的? 整体来看,主要是三项关键技术创新。首先是语义保留编译器,其作为“翻译官”,可以做到不丢失“背景信息”。传统编译器把AI模型翻译成芯片指令,往往会丢弃算子类型、依赖关系等关键语义信息,就像转述菜谱是只说操作步骤,却不说每一步需要用什么材料、什么厨具、目的是什么。而奕行智能的编译器在翻译每一步时都会刻意保留这些“上下文”,让芯片执行的每一个计算任务都有完整说明,这是后续智能调度的信息基础。第二个重要创新是给每一个计算任务都附带一张标准化“任务说明卡”,实现Tile级指令集TISA,说明卡会注明计算类型、所需硬件、依赖数据结果等信息,借此,芯片在运行时不再需要“猜测”就能精准判断和规划任务的并行和等待。形象地来看,在AI计算过程中,AI编译器会将大算子切分为可独立调度、并行执行的小块,抽象成为一个个“Tile(数据块)”,就像把一座积木城堡拆解为一个个积木块,在保证计算完整的同时,能显著提升调度灵活性与硬件利用率。这已经成为目前行业的共识,2025年Tile编程范式迎来爆发:从英伟达发布CUDA 13.1与cuTile工具链到北大开源TileLang获得“国产Triton时刻”的赞誉,再到DeepSeek更宣布新模型算子优先用TileLang做精度基线。可以说,让Tile抽象成为行业共识,既能适配AI模型特性,又能充分挖掘芯片并行潜力。第三是构建芯片的“实时大脑”,奕行智能对其命名为冲突感知运行时调度器,这也是整套系统的核心。调度器持续监控芯片上所有计算单元的状态,一旦发现某个单元空闲,会立刻从待执行任务中找出满足条件的任务推送过去,整个决策过程极为迅速,从判断到下发仅需几纳秒,不会给芯片带来额外负担,但可以大幅降低各单元“空等”时间。相比在软件层通过算法进行运行时调度有微秒级延迟,奕行智能的动态调度在硬件层实现,速度可以快100到1000倍,每一个调度决策可以保证在纳秒级内完成,减少延迟带来的损失,可以说,TISA也一定程度上代表了其软硬协同能力。从实际案例测试来看,在目前大模型推理中公认最先进的注意力机制实现FlashAttention-3中,相比CUDA版,TISA版本代码量减30%,同步调用减少50%,性能达到手调基线的95%以上,并且由编译器自动生成的,无需任何手工优化。