DeepSeek-V3 在 32 张 H20 GPU 集群上的部署方案【理论分析篇】
在 32 张 H20 上,采用 TP=8 / EP=4 / DP=1 能稳态提供 30-40k tokens/s,并在通信-计算重叠、EP 路由与编译优化到位时,有机会达到 50k tokens/s 与 TTFT < 1.2s 的目标。
阅读全文 :DeepSeek-V3 在 32 张 H20 GPU 集群上的部署方案【理论分析篇】
原力注入受原力觉醒和依赖注入(Dependency injection)启发,希望通过本平台及我们的努力将云原生技术的原力注入给广大技术从业者。
在 32 张 H20 上,采用 TP=8 / EP=4 / DP=1 能稳态提供 30-40k tokens/s,并在通信-计算重叠、EP 路由与编译优化到位时,有机会达到 50k tokens/s 与 TTFT < 1.2s 的目标。
阅读全文 :DeepSeek-V3 在 32 张 H20 GPU 集群上的部署方案【理论分析篇】KubeSphere 是一个以 K8s 为内核的云原生分布式操作系统,提供多租户容器平台、全栈 IT 自动化运维和简化的 DevOps 工作流。其独特的可插拔扩展机制和分层架构设计为企业级容器平台提供了创新的解决方案。
阅读全文 :KubeSphere 4.x 架构设计与扩展机制深度分析(一)本方案基于 DeepSeek-V3 模型的技术特点和业务需求,采用 vLLM 推理框架设计了一套高性能、稳定、经济的模型部署方案。通过合理的架构设计、并行策略和监控体系,满足大规模推理服务的性能要求,可以作为实际部署的理论指导。
阅读全文 :DeepSeek-V3 MoE 模型基于 vLLM + NVIDIA H20 的企业级部署方案【理论篇】Python 编程新经典:从基础到高级的 Pythonic 编程指南系统性学习 Python 惯用模式与最佳实践!
阅读全文 :Python 编程新经典:从基础到高级的 Pythonic 编程指南本方案基于 `DeepSeek-V3` 模型的技术特点和业务需求,采用 `vLLM` 推理框架设计了一套高性能、稳定、经济的模型部署方案。通过合理的架构设计、并行策略和监控体系,满足大规模推理服务的性能要求。
阅读全文 :DeepSeek-V3 MoE 模型基于 vLLM + Ascend 910B2 的推理部署方案【理论篇】本文将深入分析 NVIDIA K8s Device Plugin 的实现原理,通过源码解析的方式,详细介绍其架构设计、核心组件以及关键特性的实现机制。
阅读全文 :Nvidia K8s Device Plugin 原理解析和源码分析NVIDIA Container Toolkit 作为 GPU 容器化的重要基础设施,其架构设计和实现方式为其他专用硬件的容器化提供了重要参考,推动了整个容器生态系统向更加标准化、安全化的方向发展。
阅读全文 :NVIDIA Container Toolkit 原理分析与代码深度解析llm-d 是一个 Kubernetes 原生的分布式推理服务栈,为大规模生成式 大语言模型(LLM) 提供成熟路径,实现最快的价值实现时间和在大多数硬件加速器上的竞争性性价比。
阅读全文 :云原生高性能分布式 LLM 推理框架 llm-d 介绍(K8s + vLLM)Local Path Provisioner 在功能上相对简单,但它填补了 Kubernetes 在本地存储动态供应方面的空白,为开发者和运维人员提供了一个实用的工具。
阅读全文 :Local Path Provisioner 简介NCCL 测试验证工具说明文档(更新版)注意:性能部分指标的解释和计算方法可能会根据具体的硬件配置和网络环境
阅读全文 :NCCL 测试验证工具说明文档(更新版)《大语言模型》不仅是一本关于技术的书,更是一本关于未来的书,一本关于我们自己的书。在这个AI与人类智能交相辉映的时代,读懂这本书,就是读懂未来。现在就开始阅读,与AI共舞,在智能革命的浪潮中找到属于你的位置。
阅读全文 :当AI开始"反向测试"人类:《大语言模型》揭示智能革命的深层奥秘Qwen2-VL-7B-Instruct 是阿里云研发的大规模视觉语言模型,可以以图像、文本、视频作为输入,并以文本作为输出。本文介绍了在华为昇腾环境的入门部署和验证,供大家参考!
阅读全文 :Qwen2-VL-7B-Instruct 昇腾部署入门指南(基于 docker run)本文介绍了基于LangGraph的StateGraph构建短期记忆区,并以 InMemoryStore 存储长期记忆,使智能体具备信息存取能力。通过 RAG 与多工具选择实现高效提取与调用,辅以摘要机制和上下文隔离,优化长对话与任务执行。
阅读全文 :基于上下文工程的LangChain人工智能智能体应用《MCP开发从入门到实战》是一本全面系统的MCP技术指南。本书旨在为读者提供一份关于MCP的实用指南,帮助读者顺利打通从MCP基础知识到高级应用的完整学习路径。这本书不仅是技术手册,更是通往AI应用开发新世界的钥匙。
阅读全文 :好书推荐 - 《MCP开发从入门到实战》nccl_ib_test.sh 是一个专业的 NCCL InfiniBand 网络测试验证工具,用于验证和测试 NCCL 在 InfiniBand 网络环境下的性能和配置。
阅读全文 :NCCL InfiniBand 测试验证工具说明文档ib_bandwidth_monitor.sh 是一个专门用于监控和计算 InfiniBand 网络实际传输速率的脚本。它通过读取 InfiniBand 设备的性能计数器,实时计算网络的发送和接收速率,并以 SAR 风格格式输出。
阅读全文 :InfiniBand 网络带宽监控脚本使用说明ib_health_check.sh 是一个专业的 InfiniBand 网络健康检查脚本,基于 Ubuntu 服务器 IB 网络分析报告开发。该脚本专注于检查和诊断,不会修改任何系统配置,所有优化建议需要用户手工执行。
阅读全文 :InfiniBand 网络检查脚本使用说明IB 是一种高性能、低延迟的网络互连技术,专为高性能计算 (HPC)、数据中心和企业级应用设计。IB 架构由 InfiniBand Trade Association (IBTA) 标准化,提供了比传统以太网更优越的性能特性。
阅读全文 :InfiniBand 网络理论与实践在云原生时代,应用的弹性伸缩能力是保证服务质量和资源效率的关键。Kubernetes HPA 作为容器编排平台的核心功能,提供了基于指标的自动扩缩容能力。本文通过理论分析、环境配置和实践案例三个维度,全面展示 HPA 的技术价值和应用方法。
阅读全文 :Kubernetes HPA 原理与实践