原
公众号

原力注入

原力注入受原力觉醒和依赖注入(Dependency injection)启发,希望通过本平台及我们的努力将云原生技术的原力注入给广大技术从业者。

441 篇已收录文章

这个来源的文章

按发布时间排序

大模型训练与推理框架的 GPU 镜像构建深度解析(CUDA 环境)

本文选取了四个经典的开源组件:vLLM (高吞吐推理)、Hugging Face TGI (生产级推理)、Llama.cpp (端侧/CPU推理) 以及 DeepSpeed (大规模分布式训练),通过对其完整 Dockerfile 的深度剖析,揭示它们如何构建带有 CUDA 运行时的容器镜像。

阅读全文 :大模型训练与推理框架的 GPU 镜像构建深度解析(CUDA 环境)

一文算清 LLM 推理显存:权重 + KV Cache + 额外开销,怎么做才不翻车?

本文拆解LLM推理显存三大来源:模型权重、KV Cache与运行时开销,给出可复现的KV Cache通用公式与单Token增量估算,解释并发与上下文为何线性吃显存,并用 Qwen3-0.6B + A100-40G 做容量规划示例,推导最大可容纳 Token 与并发上限,帮助部署不再“爆显存”。

阅读全文 :一文算清 LLM 推理显存:权重 + KV Cache + 额外开销,怎么做才不翻车?

好书推荐|《动手构建大模型》:一部面向真实工程世界的大语言模型系统化实践指南

《动手构建大模型》是一部立场明确、结构完整、工程取向清晰的大语言模型实践指南。它不追求浮夸的「一夜精通」,而是通过扎实而系统的内容组织,帮助读者逐步建立对 LLM 应用工程的整体认知框架,并在真实项目中不断迭代验证。

阅读全文 :好书推荐|《动手构建大模型》:一部面向真实工程世界的大语言模型系统化实践指南

NVIDIA Inference Context Memory Storage:为长上下文与 Agentic AI 推理打造的 G3.5 上下文存储层

NVIDIA Inference Context Memory Storage (ICMS) 是 NVIDIA Rubin 平台面向推理场景引入的一类上下文存储基础设施,旨在将推理上下文(Key-Value, KV cache)作为一种 AI 原生数据类别进行高效复用与共享。

阅读全文 :NVIDIA Inference Context Memory Storage:为长上下文与 Agentic AI 推理打造的 G3.5 上下文存储层

从数据仓库到湖仓一体:现代数据架构的演进与原理

本文以银行案例为主线,阐述数据架构从数仓、数据湖到湖仓一体的演进。分析数仓的实时性瓶颈及数据湖的“沼泽化”痛点,详解 Lakehouse 如何利用 Table Format 技术融合数仓管理能力与数据湖灵活性,实现流批一体与高效数据治理。

阅读全文 :从数据仓库到湖仓一体:现代数据架构的演进与原理