为什么 GPU 生成每个 token 时利用率不到 5%?——Prefill 与 Decode 深度拆解
本文用一个贯穿始终的具体例子——「4 个 token 的 prompt、d_model=4096、32 个注意力头」——把两个阶段中每一步的矩阵形状和计算量都标清楚。
阅读全文 :为什么 GPU 生成每个 token 时利用率不到 5%?——Prefill 与 Decode 深度拆解
原力注入受原力觉醒和依赖注入(Dependency injection)启发,希望通过本平台及我们的努力将云原生技术的原力注入给广大技术从业者。
本文用一个贯穿始终的具体例子——「4 个 token 的 prompt、d_model=4096、32 个注意力头」——把两个阶段中每一步的矩阵形状和计算量都标清楚。
阅读全文 :为什么 GPU 生成每个 token 时利用率不到 5%?——Prefill 与 Decode 深度拆解GPU 间数据传输不是 API 调用的问题——是三条物理路径 × 四种编程方法 × 拓扑前提条件的组合选择。选错路径的代价从 21× 到 119× 不等。
阅读全文 :GPU 通信别乱选:从 P2P 到统一内存,一次实测踩出 100 倍性能坑从打击最头疼的问题出发:OOM、数据传输慢、拓扑困惑。以 Linux 内存管理(虚拟内存、DMA、大页)为对照,系统拆解 GPU 内存机制——页表与 MMU、NVLink vs PCIe、Unified Memory、GPUDirect Storage。无需 CUDA 背景,每一节都有 CPU↔GPU 类比,把黑盒讲透
阅读全文 :AI Infra - GPU 之 CUDA 内存管理入门国产 GPU 上能训练出世界第一的 AI 模型吗?摩尔线程用 MusaCoder 给出了答案。在 64 台 MTT S5000 上完成全栈强化学习训练后,27B 的 MusaCoder 在 KernelBench 上超越 Claude Opus 4.7 等所有对手,登顶全球第一。模型与论文均已开源。
阅读全文 :摩尔线程开源 MusaCoder:首个基于国产 GPU 全栈训练的算子生成大模型,KernelBench 登顶全球第一大模型正在进入飞速发展阶段,最新趋势十分清晰:一边是模型能力继续向推理、视觉、工具调用扩展,另一边是开源生态和应用框架快速成熟,让普通科研同学也能真正上手搭建自己的LLM应用。
阅读全文 :奇书!读完后彻底搞懂LLM…Chunked Prefill 把「一个长 batch」切成「一串短 batch」。每个 batch 只有几十到几百毫秒,长请求不再能独占 GPU。新请求随时能被下一个短 batch 收编入队,不必等长 prefill 跑完,解决了"长 prefill 一次性计算数十万 token,阻塞其他请求生成"的调度问题
阅读全文 :SGLang Chunked Prefill — 原理与代码实现从一段代码审查的故事出发,拆解 Skill 的六种面孔、五种设计模式和从单点工具到Skill Suite的演化路径。结合 awesome-skills 的 17 个实战案例与《图解 Skill》的方法论,讲清一件事:如何才能不只是"会用 skill",而是能像搭积木一样设计自己的 skill 系统
阅读全文 :Skills 从入门到精通随着大模型参数规模迈向万亿级、训练数据集突破数十 TB,GPU 的算力增长远远甩开了数据管道的供给能力。
阅读全文 :cuFile Skill:揭开 NVIDIA GPUDirect Storage 神秘面纱本文从 ELF 基础知识出发,介绍一套专门为此设计的分析技能——elf-analyzer、binary-reverse和 linux-pwn。这三个技能将专业的二进制分析知识编码为 AI 可执行的指令,不用记住几十个命令行参数,也能像资深工程师一样拆解 ELF 文件的秘密。
阅读全文 :ELF 分析 Skill:轻松掌握 Linux 二进制文件格式 ELF 的秘密v1.1.1 到 v1.1.7 的七个版本迭代,核心围绕两条主线:可控性——让你看见并控制评审的全过程;可集成性——让 OCR 成为 AI 编码工作流的原住民。本文聚焦这些最有价值的新能力。
阅读全文 :OpenCodeReview 新功能:让 AI 代码评审从"能审"到"审得准、接得住"本文以 ECC(Everything Claude Code)为参考实现,拆解它如何用 61 个 Subagent、246 个 Skill、45 个 Hook 和一套 SQLite 状态存储,将 Claude Code 从一个"好用的命令行工具"升级为团队级工程底座,并从中提炼出四条可直接迁移到任何项目的实践原则。
阅读全文 :从 Vibe Coding 到 Harness Engineering:GitHub 195k ECC (Everything Claude Code) 项目详解量化是将浮点权重/激活值映射到低比特整数的压缩技术。核心矛盾是范围 vs 精度——scale 越小精度越高但覆盖范围越小,一个 outlier 就能拉大 scale 导致大量正常值被"挤压"到几个量化级别。本文以手算加可视化方式,让读者快速立即量化的原理。
阅读全文 :模型量化:从手算推演到可视化验证一条命令,让 LLM 在你的代码仓库里做一次真正专业的代码评审——不只是扫一遍 diff,而是读文件、搜调用链、按语言切换检查清单、把评论精确挂到行号上,并把全过程记录下来供你复盘。
阅读全文 :OpenCodeReview:让 AI 代码评审从"能用"到"好用"!面向传统研发团队的 AI-Native 转型 核心立场不是“让 AI 全自动替代团队”,而是“让 AI 成为需求梳理、建模分析、规范生成、代码实现、自动验证与运行治理的增强器”。最终决策、风险承担、上线责任与跨团队仲裁仍由明确的人工 Owner 承担。
阅读全文 :AI Native 研发流程和应用架构系统梳理从昇腾 NPU 硬件特性到上层框架编程的完整知识链路,覆盖环境搭建 → 架构原理 → 框架实战 → 工具链 → 进阶开发六大主题。
阅读全文 :华为 NPU 编程实战入门《大型语言模型的工作原理》由Booz Allen Hamilton的三位AI专家合著,是一本面向广泛读者的LLM入门书。全书以清晰逻辑拆解大模型的核心机制,涵盖预训练、微调、RAG、评估、对齐及可靠性设计等关键议题,提供可落地的技术路径。
阅读全文 :仅200页PDF,彻底搞懂LLM!工程师写作的难点,不在于缺少表达欲,而在于如何把复杂技术信息写得清楚、准确、可执行。《这就是工科写作》提供的,正是一套面向工程沟通的写作框架。
阅读全文 :让工程师写出一手好文章:读《这就是工科写作》AI Native ≠ 处处用 LLM:它是把“新颖决策”交给 Agent、“程序性知识”交给 Skill、“确定性能力”交给 Tool(经强类型协议如 MCP 暴露),并以治理平面统一预算、审计与回滚的分层的架构方法论。
阅读全文 :AI Native ≠ 处处用 LLM:一张图说清 Agent / Skill / Tool 三层金字塔