原
公众号

原力注入

原力注入受原力觉醒和依赖注入(Dependency injection)启发,希望通过本平台及我们的努力将云原生技术的原力注入给广大技术从业者。

440 篇已收录文章

这个来源的文章

按发布时间排序

Kimi K3 注意力机制深度解析:KDA、Gated MLA 与 AttnRes 的混合架构

2.8 万亿参数的 Kimi K3 原生支持 1M token 上下文窗口。它的注意力系统不是单一种类的升级,而是三种机制的协同设计:69 层 KDA负责高效长上下文处理,24 层 Gated MLA 提供全局精确检索锚点,Attention Residuals 则将"注意力"从序列维度扩展到模型深度维度

阅读全文 :Kimi K3 注意力机制深度解析:KDA、Gated MLA 与 AttnRes 的混合架构

Key-Key Semantic Affinity:用 Key 向量替代注意力分数的 KV Cache 重要性评估

本文系统性地介绍了 Key-Key Semantic Affinity:一种用 Key 向量自身语义距离替代 QK^T 注意力分数的 block 重要性评估方法。它的核心思想简洁而深刻:Key 向量不只是 Query 的"被动匹配目标",它们自身携带了足够的语义信息来回答"哪些 block 重要"这一问题

阅读全文 :Key-Key Semantic Affinity:用 Key 向量替代注意力分数的 KV Cache 重要性评估

Attention Sinks 与 KV Cache 淘汰策略:滑动窗口为什么不够?

KV Cache 随序列长度线性膨胀——百万级上下文下,单请求的 KV 就能吃掉几十 GB 显存。PagedAttention 通过按需分配 block 解决了"怎么高效存",但它不回答"存不下了怎么办"。当 GPU 显存耗尽,推理系统必须选择:谁的 KV 块被牺牲?

阅读全文 :Attention Sinks 与 KV Cache 淘汰策略:滑动窗口为什么不够?