3 月 18 日 AI 头条:高通推出第三代骁龙8s移动平台,为更多智能手机带来行业领先的终端侧AI
划重点:
高通推出第三代骁龙8s移动平台,为更多智能手机带来行业领先的终端侧AI
马斯克 xAI 宣布正开源 Grok-1 模型,体量 3140 亿参数号称“全球最大” 微软现为 Copilot Pro 提供一个月免费试用 谷歌推出 Cappy “评分”框架,可评估 AI 准确性“教模型更聪明” 消息称英伟达 Blackwell“B100”GPU 将配 192GB HBM3e 显存,B200 配 288GB 显存 微软称谷歌训练 AI 上有搜索引擎和 YouTube 两大天然资源优势 iPhone 内置 Gemini AI?消息称苹果正与谷歌谈判合作
一次学500个文件,月之暗面的Kimi 能无损处理200万汉字的上下文了
资讯详情:
马斯克旗下 AI 初创企业 xAI 今天发布新闻稿,宣布正在开源 3140 亿参数的混合专家模型 Grok-1,该模型遵循 Apache 2.0 协议开放模型权重和架构,号称是“迄今为止全球参数量最大的开源大语言模型”。
官方已经在GitHub 中发布了 Grok-1 论文源代码,但还未开源模型主体。
微软官方宣布,随着 Pro 版本的扩展,Copilot 将开放给全球更多客户。现在,Copilot Pro 在 Copilot 可用的所有 222 个国家 / 地区均可使用。
微软搜索和人工智能营销总经理 Divya Kumar 宣布:“Copilot 是您日常的人工智能伴侣,旨在为工作和生活的每个人带来生成式人工智能的力量。通过 Copilot,我们致力于为每个人提供提升创造力和工作效率的机会。”
微软宣布将免费 Microsoft 365 Web 应用中的 Copilot 纳入 Copilot Pro 订阅中,并将 Copilot 引入 Word、Outlook 和更多免费 Web 应用。
谷歌推出 Cappy “评分”框架,可评估 AI 准确性“教模型更聪明”
据谷歌官方消息,谷歌近日推出了一项名为 Cappy 的模型打分框架,该框架以 RoBERTa 语言模型为基础,主要用于检测模型输出的内容,并为相关内容打分,之后相关分数将会作为参考基准让模型学习,从而让模型更聪明。
此外,Cappy 框架也可以作为大语言模型的“候选机制”,该框架可以内置在模型中,并对模型预输出的内容生成分数,并选择分数最高的回应作为最终输出,以提高大语言模型输出内容的正确性。
消息称英伟达 Blackwell“B100”GPU 将配 192GB HBM3e 显存,B200 配 288GB 显存
英伟达将在明日举行GTC 2024 主题演讲,黄仁勋预计将宣布名为 Blackwell 的下一代 GPU 架构。
据 XpeaGPU 爆料称,明天推出的 B100 GPU 将采用两个基于台积电 CoWoS-L封装技术的芯片。CoWoS(晶圆基片芯片)是一项先进的 2.5D 封装技术,涉及将芯片堆叠在一起,提高处理能力,同时节省空间并降低功耗。
XpeaGPU 透露,B100 GPU 的两个计算芯片将连接到 8 个 8-Hi HBM3e 显存堆栈,总容量为 192GB。值得注意的是,AMD 已经提供了 192GB 的相同容量,并在其 Instinct MI300 GPU 上搭载了 8 个 HBM3 芯片。
微软称谷歌训练 AI 上有搜索引擎和 YouTube 两大天然资源优势
据 Readhub 报道欧盟委员会于今年 1 月开始针对 AI 领域展开调查,主要评估科技巨头们是否存在垄断行为。微软在接受问询时为了强调其没有反垄断行为,称谷歌在该领域有两大天然优势,该领域存在竞争。
微软在接受欧盟委员会调查时强调,谷歌目前在训练 AI 方面有两大天然优势,其一是搜索引擎提供了海量资源,其二是 YouTube 平台,提供了约 140 亿个视频,谷歌可以利用这些数据训练 Gemini 模型,而其它 AI 开发商却无法访问。
iPhone 内置 Gemini AI?消息称苹果正与谷歌谈判合作
据 DoNews 报道,知情人士透露,苹果公司就在iPhone 中内置谷歌 Gemini 人工智能引擎进行谈判,为达成一项将震撼 AI 行业的重磅协议奠定了基础。
知情人士表示,两家公司正在积极谈判,以允许谷歌的一套生成人工智能模型 Gemini,为今年苹果 iPhone 软件的一些新功能提供动力。由于讨论是私下进行的,知情人士要求匿名。
据知情人士透露,苹果最近还与 OpenAI 进行了讨论,并考虑使用其模型。
APPLE:
《MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training 》
本论文通过对图像编码器、视觉语言连接器和各种预训练数据选择的全面剖析,确定了几个关键的设计要点,并提出了一种新的预训练数据选择方法,通过大规模多模态预训练,建立了一个30B参数的多模态模型家族MM1,该模型在预训练指标上领先,并在多个基准测试中取得了竞争性能。
论文地址:
https://arxiv.org/abs/2403.09611v1
剑桥大学:
《Why do Random Forests Work? Understanding Tree Ensembles as Self-Regularizing Adaptive Smoothers》
论文提供了一种新的量化决策树集成的平滑度的方法,并对决策树集成的优势进行了进一步的解释。研究表明,决策树集成可以通过三种不同的机制提高性能,即减少噪声引起的预测方差、减少给定固定输入数据时学习函数质量的变异性,以及通过丰富可用的假设空间减少潜在的偏差。
论文地址:
https://arxiv.org/abs/2402.01502v1
《Repetition Improves Language Model Embeddings》
本文的关键思路是使用“回声嵌入”来解决自回归大型语言模型中的架构限制,从而最大化利用高质量的LLMs进行嵌入提取。本文的实验结果表明,“回声嵌入”可以在MTEB排行榜上将零-shot的表现提高9%以上,并在微调后提高约0.7%。使用Mistral-7B模型的“回声嵌入”实现了与不利用合成微调数据的先前开源模型相比的最新成果。值得注意的是,本文提出的方法非常简单,易于实现。
论文地址:
https://arxiv.org/abs/2402.15449v1
《How Transformers Learn Causal Structure with Gradient Descent》
论文证明了在简化的两层transformer中,梯度下降算法可以通过编码潜在的因果图来解决in-context学习任务。关键洞见是注意力矩阵的梯度编码了tokens之间的互信息,而最大的梯度对应于潜在因果图中的边。
论文使用一个in-context学习任务来解决transformers如何学习潜在因果结构的问题,并证明了梯度下降算法可以通过编码潜在的因果图来解决这个任务。论文还展示了transformers在这个任务上的表现,并提供了一些相关工作的参考。
论文地址:
https://arxiv.org/abs/2402.14735v1
《Language Agents as Optimizable Graphs 》
本论文的关键思路是将LLM代理表示为计算图,并使用自动图优化器来改进节点级LLM提示和代理编排,从而提高多模态数据处理的效率。本论文的亮点在于提出了一种新的自动图优化器,可以改进节点级LLM提示和代理编排,同时可以将多个计算图递归地组合成更大的复合图,从而实现代理之间的协作。作者进行了实验来验证该框架的有效性,并开源了代码。值得继续深入研究。
论文地址:
https://arxiv.org/abs/2402.16823v2