GenAI新世界

4 月 10 日 AI 头条|英特尔发布 Gaudi 3 AI 芯片:性能超越英伟达 H100,第三季度上市

Image

划重点:

  • 英特尔发布 Gaudi 3 AI 芯片:性能超越英伟达 H100,第三季度上市
  • 融合视觉能力,OpenAI 向开发人员提供 GPT-4 Turbo with Vision
  • 谷歌推出 AI 创作工具 Vids,提高用户工作效率
  • 谷歌发布代码辅助工具 Gemini Code Assist
  • 百度网盘推出AI摄影创意工具超能画布
  • 马斯克预测 AI 在两年内能超越最聪明的人类

  • 小米 Redmi Turbo 3 手机支持 AI 隔空手势与 AI 魔法消除 Pro

  • 联发科推出生成式 AI 服务 MediaTek DaVinci
  • Meta 推出 V-JEPA 模型,利用 AI 高效补充视频受遮蔽部分
  • 苹果介绍 Ferret-UI 多模态大语言模型:更充分理解手机屏幕内容
  • 华为盘古大模型将被用于新款 MateBook
资讯详情:

英特尔发布 Gaudi 3 AI 芯片:性能超越英伟达 H100,第三季度上市

英特尔官方消息,在昨天举办的Intel Vision 2024客户与合作伙伴大会上,,英特尔正式发布了Intel Gaudi 3 AI 芯片。

Intel Gaudi 3 AI 芯片通过以太网通用标准连接多达数万个加速器,为 AI 系统提供动力。与上一代产品相比,Intel Gaudi 3 承诺将 BF16 的人工智能计算能力提高 4 倍,内存带宽提高 1.5 倍。该加速器将为希望大规模部署 GenAI 的全球企业带来人工智能训练和推理方面的重大飞跃。

与 Nvidia H100 相比,Intel Gaudi 3 AI 芯片在具有 7B 和 13B 参数的 Llama2 模型以及具有 175B 参数的 GPT-3 模型中的训练时间预计平均缩短 50%3。此外,在 Llama 7B 和 70B 参数模型以及 Falcon 180B 参数模型中,英特尔高迪 3 加速器的推理吞吐量预计将比 H100 平均高出 50%,推理能效平均高出 40%。该芯片将于 2024 年第二季度面向原始设备制造商(包括戴尔科技、惠普企业、联想和超微)推出。

Image

融合视觉能力,OpenAI 向开发人员提供 GPT-4 Turbo with Vision

据letsclouds报道,OpenAI 宣布,具有视觉能力的最新 GPT-4 Turbo 模型 GPT-4 Turbo with Vision 现已通过 OpenAI API 向开发人员普遍提供。

该模型延续了 GPT-4 Turbo 系列 128,000 个 token 的窗口大小以及截止至 2023 年 12 月的知识库,最大的革新之处在于其新增的视觉理解能力。在过去,开发者需要调用不同的模型来处理文本和图像信息,而 GPT-4 Turbo with Vision 则将两者合二为一,极大简化了开发流程,并带来了广泛的应用前景。

OpenAI 也分享了一些开发者正在使用该模型的有趣案例。例如,AI 软件工程助手 Devin 利用 GPT-4 Turbo with Vision 辅助编程;健康健身应用程序 Healthify 使用该模型扫描用户饮食照片,通过图像识别提供营养分析;创意平台 Make Real 则利用该模型将用户的草图转化为可运行的网站。目前,GPT-4 Turbo with Vision 尚未应用于 ChatGPT 或开放给大众使用,不过 OpenAI 暗示该功能即将登陆 ChatGPT。

Image


谷歌推出 AI 创作工具 Vids,提高用户工作效率

据 The Verge 报道,谷歌近日发布一款 AI 创作工具,这款名为 Vids 的开发工具旨在帮助用户更轻松地制作协作、可共享的视频。

谷歌 Vids 可以轻松的帮助用户做一个演讲PPT、更新团队信息、解释一个复杂的概念。谷歌负责 Workspace 协作应用产品管理的副总裁Kristina Behr表示,谷歌的主要目标是让一切都尽可能简单。Vids 可以帮助用户生成视频内容的分镜脚本、选择风格、编辑草稿,同时还提供预录制的旁白功能,并支持项目的安全协作和共享。

Image

谷歌发布代码辅助工具 Gemini Code Assist

据谷歌官方消息,谷歌在本周二举行的 Cloud Next 大会上发布代码辅助工具Gemini Code Assist。

谷歌表示,这是一款专注于企业的人工智能代码完成和辅助工具,是对已停用的Duet AI 服务的一次重塑和更新。Gemini Code Assist将通过 VS Code 和 JetBrains 等流行编辑器的插件提供。

Gemini Code Assist包括对 Gemini 1.5 Pro 的支持,Gemini 1.5 Pro 有一个著名的百万令牌上下文窗口,允许谷歌的工具获取比竞争对手更多的上下文。谷歌表示,这不仅意味着更准确的代码建议,还能对大段代码进行推理和修改。

Image

百度网盘推出AI摄影创意工具超能画布

据36氪报道,百度网盘推出专注人像摄影的AI创意生成工具——超能画布。

据介绍,通过百度自研的图像大模型以及智能人脸融合算法,只需上传1张照片,输入一句文字指令,1分钟即可生成AI写真,批量切换几十种背景、服装,还能对人物表情、发色、画面元素进行局部重绘。

超能画布还提供了灵感联想、风格模型、追加风格、高级设置等功能,帮助用户更好地创作出符合自己需求的作品。

Image

马斯克预测 AI 在两年内能超越最聪明的人类

据cnBeat报道,特斯拉 CEO 埃隆・马斯克(Elon Musk)周一预测,AI 在明年或 2026 年就能超越最聪明的人类。

马斯克当地时间周一在社交媒体平台 X(以前称为推特)语音空间上接受了挪威主权财富基金首席执行官 Nicolai Tangen 的采访。

当被问及 AGI(通用人工智能)的发展时间表时,马斯克表示,如果你将 AGI 定义为比最聪明的人更聪明,我想可能是明年,或者两年内。

AGI 为 Artificial General Intelligence 的首字母缩写,意为人工通用智能。通用人工智能是一个人工智能理论研究领域,研究如何开发具有类人智能和自学能力的软件。其目标是让软件能够执行训练或开发目的之外的任务。

当前的人工智能(AI)技术均依靠一组预先确定的参数运行。例如,在图像识别和生成方面经过训练的人工智能模型无法构建网站。作为一项理论研究,AGI 旨在开发具有自主自我控制、合理的自我理解以及新技能学习能力的人工智能系统。它可以在创建时未进行教导的环境和情境中解决复杂的问题。具有人类能力的 AGI 仍然只是理论概念和研究目标。

马斯克还表示,xAI 正在训练 2.0 版本的 Grok,训练 Grok 2 模型需要大约 2 万块英伟达 H100 GPU,而 Grok 3 模型及更高版本则将需要大约 10 万块英伟达 H100 GPU。但由于缺乏足够多的先进芯片,Grok 的训练受到了阻碍,预计将在 5 月前完成相关工作。他补充说,虽然芯片短缺是迄今为止人工智能发展的一大制约因素,但未来一两年电力供应将至关重要。

Image


小米 Redmi Turbo 3 手机支持 AI 隔空手势与 AI 魔法消除 Pro

据中文科技资讯报道,小米 Redmi Turbo 3 手机将于 4 月 10 日 19 点发布,搭载高通骁龙 8s Gen 3 芯片。昨日,小米官方对这款新机的 AI 功能进行预热。

据介绍,Redmi Turbo 3 支持 AI 隔空手势,基于高通骁龙 8s Gen 3 芯片的旗舰 AI 技术,搭配全新升级的 AON 前置摄像头 实现 24 小时智能感知,实时响应用户操作。小米宣传其为“同档绝无仅有的 AI 实力”。

根据网上流传的设置界面信息,隔空手势 Beta 版需要手在距离摄像头 15~40 厘米处稍作停留,待屏幕上方出现手型图标后可进行手势操作,包括左右挥手、上下挥手、掌心双次按压、掌心画圈等。

此外,基于高通骁龙 8s Gen 3 芯片的旗舰 AI 技术,Redmi Turbo 3 升级 AI 魔法消除 Pro 功能,相比之前的魔法消除更快更准更智能。

Image


联发科推出生成式 AI 服务 MediaTek DaVinci

据联发科联发科官方消息,联发科4月9日举办生成式 AI 论坛,并推出其生成式 AI 服务平台 MediaTek DaVinci。目前已有 40 多家厂商加入生态系。

据介绍,该工具最初是联发科集团内部生成式 AI 工具,广泛应用于集团各个部门业务,集团渗透率 96%。

联发创新基地还发布了该平台最新繁体中文大模型 MediaTek Research BreeXe,该模型基于 Mixtral 8x7B 开发,具有节省运算资源、提升速度等优势。据介绍,该模型在繁体中文测试项目(TMMLU+、MT Bench TW)超越 GPT-3.5。

Image


Meta 推出 V-JEPA 模型,利用 AI 高效补充视频受遮蔽部分

据 Meta 官网显示,Meta 推出了一款名为“V-JEPA”的视频预测模型。Meta 首席AI 科学家 Yann LeCun 在 2022 年就推出了 JEPA(Joint Embedding Predictive Architectures)模型架构。

据介绍,相关 JEPA 架构及 I-JEPA / V-JPA 模型主打“预测能力”,号称可以以“人类理解”的方式,利用抽象性高效预测生成图片 / 视频中被遮蔽的部分。

研究人员使用一系列经过遮蔽处理的特定视频训练 I-JEPA / V-JEPA 模型,要求模型利用“抽象方式”填充视频中缺失的内容,从而让模型在填充间学习场景,进一步预测未来的事件或动作,进而达到对世界更深层次的理解。

研究人员表示,这种训练方法能够让模型专注于影片的高层次概念,而“不会钻牛角尖处理下游任务不重要的细节”,研究人员举例“人类观看内含树木的影片时,不会特别关心树叶的运动方式”,因此采用这种抽象概念的模型,相对于业界竞品效率更佳。

研究人员同时提到,V-JEPA 采用一种名为“Frozen Evaluations”的设计结构,即“模型在预训练之后,核心部分不会再改变”,因此只需要在模型之上添加小型专门层即可适应新任务,具有更高普适性。

Image

苹果介绍 Ferret-UI 多模态大语言模型:更充分理解手机屏幕内容

苹果公司近日发布研究论文,展示了 Ferret-UI AI 系统,可以理解应用程序屏幕上的内容。

以 ChatGPT 为代表的 AI 大语言模型(LLMs),其训练材料通常是文本内容。为了能够让 AI 模型能够理解图像、视频和音频等非文本内容,多模态大语言模型(MLLMs)因此孕育而生。

只是现阶段 MLLMs 还无法有效理解移动应用程序,这主要有以下几个原因:手机屏幕的宽高比,和大多数训练图像使用的屏幕宽高比不同。MLLMs 需要识别出图标和按钮,但它们相对来说都比较小。因此苹果构想了名为 Ferret-UI 的 MLLM 系统解决了这些问题。

苹果在论文中表示相比较现有的 GPT-4V,以及其它 MLLMs 模型,Ferret-UI AI 模型更为优秀。

Image

华为盘古大模型将被用于新款 MateBook

华为官方正式发出华为MateBook新品预热海报,“轻且强”成为重大看点,此外,新款 MateBook 将增加 AI 功能。

新款MateBook由AI大模型加持,可对信息进行总结,提炼关键词和摘要。华为在AI布局多年,去年HDC开发者大会上推出面向行业的华为盘古大模型3.0,预测新款MateBook使用的AI大模型就是华为盘古大模型。

今日重点论文:

瑞士EPFL信息学习与物理实验室:

《A Phase Transition between Positional and Semantic Learning in a Solvable Model of Dot-Product Attention》

论文提供了一个简单的架构,可以学习实现解决方案的位置或语义机制。在高维数据和足够的样本数量下,论文提供了非线性自注意力层的全局最小值的封闭形式描述。论文比较了dot-product attention layer和线性位置基准的性能,并证明了前者在使用语义机制时优于后者。

论文地址:

https://arxiv.org/abs/2402.03902v1


微软研究院:

《MatterGen: a generative model for inorganic materials design》

论文地址:

论文提出了一种新的生成模型 MatterGen,可以生成稳定的、多样化的无机材料,并且可以进一步进行微调以满足广泛的性质约束。实验结果表明,MatterGen 生成的结构更容易是新颖且稳定的,并且更接近局部能量最小值。论文还展示了多属性材料设计的能力,提出了具有高磁密度和低供应链风险的结构。值得进一步研究。

https://arxiv.org/abs/2312.03687v1


Meta:

《Large Language Models for Software Engineering: Survey and Open Problems》

论文地址:

论文探讨了LLM在软件工程中的应用,包括编码、设计、需求分析、维护、重构、性能优化、文档编写和分析等方面。同时,论文还指出了LLM所面临的技术挑战,如错误解决方案的问题。论文提出了一种基于混合技术的解决方案,将传统的软件工程方法与LLMs相结合,以提高LLMs在软件工程中的可靠性和效率。论文还介绍了一些相关的工作和数据集。

论文地址:

https://arxiv.org/abs/2310.03533v4


阿卜杜拉国王科技大学:

《Language Agents as Optimizable Graphs》

本论文的关键思路是将LLM代理表示为计算图,并使用自动图优化器来改进节点级LLM提示和代理编排,从而提高多模态数据处理的效率。本论文的亮点在于提出了一种新的自动图优化器,可以改进节点级LLM提示和代理编排,同时可以将多个计算图递归地组合成更大的复合图,从而实现代理之间的协作。作者进行了实验来验证该框架的有效性,并开源了代码。值得继续深入研究。

论文地址:

https://arxiv.org/abs/2402.16823v2


北京邮电大学:

《DemoFusion: Democratising High-Resolution Image Generation With No $$$》

论文使用了开源的GenAI模型,并且提出的DemoFusion框架可以轻松地扩展到这些模型上。作者还使用了多个数据集进行了实验,包括CelebA-HQ,FFHQ,LSUN等,实验结果表明DemoFusion可以在高分辨率图像生成方面取得更好的效果。此外,作者还开源了DemoFusion框架的代码,使得更多的研究者可以使用和改进该方法。

论文地址:

https://arxiv.org/abs/2311.16973v1

Image