G
公众号

Geek Savvy

GeekSavvy是一个聚合AI极客的年轻化社区.用Geek视角见识行业趋势、技术创新和市场动态�

391 篇已收录文章

这个来源的文章

按发布时间排序

QwQ-32B用更小尺寸,比肩全球最强开源推理模型R1

1. 模型性能:拥有320亿参数,性能可与6710亿参数(370亿被激活)的DeepSeek-R1媲美。在AIME24数学能力评测集、LiveCodeBench代码能力评估中表现相当,在LiveBench、IFEval、BFCL测试里得分超越DeepSeek-R1。 2. 训练方式:基于冷启动开展大规模强化学习,初始…

阅读全文 :QwQ-32B用更小尺寸,比肩全球最强开源推理模型R1

全球首款通用型Agent「Manus」

「核心亮点速览」 1. 突破性性能表现 在权威GAIA基准测试中大幅超越OpenAI等业界巨头,展现通用Agent领域绝对技术优势,重新定义行业标杆。(这含金量,真的牛[666]) 2. 全华人顶尖团队 完全由中国开发者团队自主研发(也就是Monica团队),印证华人在AGI前沿领域的顶级研发实力,未依赖海外技术支援…

阅读全文 :全球首款通用型Agent「Manus」

DeepSeek第四天一次性开源3个项目

DeepSeek在开源周第四天开源三个用于大规模AI模型并行计算优化的项目,包括DualPipe、EPLB和Profile-data。 1. 开源项目介绍 DualPipe:一种双向流水线并行算法,能让前向、后向计算的计算 - 通信阶段完全重叠,减少“流水线气泡”。在多设备训练时,数据双向流动,提升设备活跃度与资源利…

阅读全文 :DeepSeek第四天一次性开源3个项目

DeepSeek开源DeepGEMM,强大并不意味着复杂!

DeepSeek开源第三天,发布DeepGEMM,一个支持密集和 MoE GEMM 的 FP8 GEMM 库,为 V3/R1 训练和推理提供支持。 X 锐评: 为了理解DeepGEMM,想象一下: AI计算的世界就像一个繁华的大都市,数据在高耸的神经网络之间快速流动,就像未来城市中的汽车一样。DeepGEMM是一个时…

阅读全文 :DeepSeek开源DeepGEMM,强大并不意味着复杂!

DeepSeek第二天开源DeepE,附相关解析

开源周第二天,DeepSeek发布通信库DeepEP! DeepSeek 官方: 很高兴介绍 DeepEP——第一个用于 MoE 模型训练和推理的开源 EP 通信库。 ✅高效、优化的全员沟通 ✅节点内和节点间均支持 NVLink 和 RDMA ✅用于训练和推理预填充的高吞吐量内核 ✅用于推理解码的低延迟内核 ✅原生…

阅读全文 :DeepSeek第二天开源DeepE,附相关解析

Claude 3.7 Sonnet 和 Claude Code 提前曝光

Anthropic 官方: Claude 3.7 Sonnet:我们迄今为止最智能的模型。它是一种混合推理模型,可产生近乎即时的响应或扩展的、循序渐进的思考。 一种模型,两种思维方式。 我们还将发布一款代理编码工具:Claude Code。 Claude 3.7 Sonnet 比其前代产品有了重大升级。扩展思维模式使…

阅读全文 :Claude 3.7 Sonnet 和 Claude Code 提前曝光

DeepSeek下周开始连续5天发布开源项目

OpenAI只有一个,那就是DeepSeek! DeepSeek官方: 我们@deepseek_ai是一个探索AGI的小团队。从下周开始,我们将以完全透明的方式连续开源5个代码库,分享我们小而真诚的进展。 这些基础模块已完整记录技术文档,经过线上服务场景的实际部署验证,并历经实战检验。 作为开源社区的一部分,我们坚信…

阅读全文 :DeepSeek下周开始连续5天发布开源项目