GenAI新世界

3 月 21 日 AI 头条:GPT-5 或在今年夏季发布

Image
划重点:
  • GPT-5 或在今年夏季发布
  • 三星计划在2025年初推出 AI 芯片 Mach-1
  • Stability AI 发布 Stable Video 3D 模型
  • GitHub 发布 AI 工具,可自动修改代码漏洞
  • 英伟达有意收购 AI 基础设施虚拟化创企 Run:ai
  • 元戎启行端到端模型将搭载 DRIVE Thor芯片
资讯详情:
GPT-5 或在今年夏季发布
据 Business Insider 报道,OpenAI 或将会在今年年中推出 GPT-5,不出意外会在夏季发布。
两位熟悉该公司的匿名人士透露,一些企业客户最近已经收到了 GPT-5 和 ChatGPT 相关增强功能的演示。一位最近看过 GPT-5 版本的首席执行官形容它 "真的很棒"、"有了实质性的改进",OpenAI 利用其公司特有的用例和数据演示了新模型。
Image
三星计划在2025年初推出 AI 芯片 Mach-1
据 Sedaily 报道,三星电子在其第 55 届年度股东大会上宣布,该公司正准备在 2025 年初推出自己的人工智能加速器芯片--Mach-1。
此举意味着将与英伟达等公司展开竞争,但这家韩国公司并没有计划(至少目前没有)与英伟达的超高端人工智能解决方案(如 H100、B100 或 B200)相抗衡。三星的 Mach-1 是一款基于专用集成电路(ASIC)的人工智能推理加速器,配备 LPDDR 内存,特别适合边缘计算应用。
Image
Stability AI 发布 Stable Video 3D 模型
据 Stability AI 官方消息,Stability AI 今日推出一款大模型产品,可通过单张图像创建多视图3D模型。
Stable Video 3D 包含两个变体,其中 SV3D_u 能基于单个图像输入生成轨道视频,无需相机调节;而 SV3D_p 扩展了 SVD3_u 的功能,其可容纳轨道视图,允许沿着指定的摄像机路径创建 3D 视频。
Image
GitHub 发布 AI 工具,可自动修改代码漏洞
据 GitHub 官方消息,GitHub 现已为Advanced Security用户推出一项新的功能,可以帮助用户搜索和修改代码中的漏洞和错误。
GitHub 表示,新功能可利用 Copilot 与 CodeQL来发现并自动修复代码中的安全漏洞和编写错误。GitHub 承诺,这一新系统可以修复其发现的三分之二以上的漏洞--通常开发人员无需亲自编辑任何代码。该公司还承诺,代码扫描自动修复功能将覆盖其支持语言(目前包括 JavaScript、Typescript、Java 和 Python)中 90% 以上的警报类型。
英伟达有意收购 AI 基础设施虚拟化创企 Run:ai
据 SiliconANGLE 报道,英伟达或将收购 AI 设施虚拟化企业 Run:ai,交易额最高达10亿美元。
Run:ai 的同名工作负载管理平台近日率先获得英伟达 DGX SuperPOD 认证。其 AI 编排技术可帮助用户轻松运行 AI 和机器学习项目,满足对生成式 AI 和大模型不断增长的要求。Run:ai 将传统操作系统虚拟化同基于 GPU 的 AI 工作负载结合。其虚拟化层可有效汇集大型 GPU 集群的计算资源,并在多个 AI 工作负载上实现高效率共享。
Image
元戎启行端到端模型将搭载 DRIVE Thor芯片
元戎启行CEO周光发表了技术主题演讲,宣布已与NVIDIA达成合作,将于2025年采用NVIDIA的DRIVE Thor芯片适配公司的端到端智能驾驶模型。
据悉,元戎启行是业内首批能用 DRIVE Thor芯片适配端到端模型的企业。目前,元戎启行已经率先把端到端模型应用于量产车上,该批量产车将于今年投入消费者市场。
今日重点论文:
牛津大学:
《Accelerating the Science of Language Models》
团队研究了在固定计算预算下,使用更多样化的数据集(根据唯一样本数量划分)对自监督学习(SSL)性能的影响。我们的研究结果一致表明,增加预训练数据的多样性可以提高SSL的性能,但仅当其与下游数据的分布距离最小时。值得注意的是,即使通过网络爬取或扩散生成数据等方式实现了非常大的预训练数据多样性,分布偏移仍然是一个挑战。我们的实验很全面,使用了七种大规模数据集(如ImageNet和YFCC100M),总计超过200个GPU天。
论文地址:
https://arxiv.org/abs/2403.13808v1
香港大学:
《Editing Massive Concepts in Text-to-Image Diffusion Models》
团队提出了一个名为“扩散模型中的大规模概念编辑(EMCID)”两阶段的方法。第一阶段通过文本对齐损失和扩散噪声预测损失的双重自我蒸馏,对每个单独的概念进行内存优化。第二阶段采用多层封闭形式模型编辑进行大规模概念编辑。研究者进一步提出了一个全面的基准,名为“ImageNet概念编辑基准(ICEB)”,用于评估T2I模型的大规模概念编辑,包括自由形式提示、大规模概念类别和广泛的评估指标两个子任务。在我们提出的基准和以前的基准上进行的广泛实验表明,EMCID具有卓越的可扩展性,可以编辑高达1,000个概念,为快速调整和重新部署T2I扩散模型提供了实用的方法。
论文地址:
https://arxiv.org/abs/2403.13807v1
香港大学:
《RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition》
论文提出了一种结合CLIP和MLLMs的方法,即RAR,通过建立基于CLIP的多模态检索器来存储不同类别的显式内存,并在推理时从内存中检索相似结果,然后使用MLLMs进行排名和最终预测。论文旨在解决细粒度识别中存在的精度不足和多类别分类困难的问题,同时提高少样本/零样本识别能力。
论文地址:
https://arxiv.org/abs/2403.13805v1
GOOGLE:

《RadSplat: Radiance Field-Informed Gaussian Splatting for Robust Real-Time Rendering with 900+ FPS》

RadSplat论文试图提出一种轻量级的方法,解决复杂场景的实时渲染问题,以及减少计算量。RadSplat方法使用辐射场作为先验和监督信号,优化基于点的场景表示,通过剪枝技术减少点数,同时保持高质量,提出新的测试时间过滤方法,进一步加速渲染。论文的实验结果表明,RadSplat方法能够实现复杂场景的实时渲染,每秒渲染900多帧。此外,论文提出的剪枝技术和测试时间过滤方法可以加速渲染并减少计算量。
论文地址:
https://arxiv.org/abs/2403.13806v1
莱斯大学:

《Learning from Models and Data for Visual Grounding》

本论文旨在提高预训练的视觉-语言模型的视觉定位能力,解决图像描述和视觉定位之间的联系问题。论文提出了一种名为SynGround的新框架,通过从多个预训练模型中转移知识,结合数据驱动学习和知识迁移的方式来增强预训练的视觉-语言模型的视觉定位能力。论文的实验表明,通过SynGround框架的训练,可以将ALBEF在Flickr30k、RefCOCO+ Test A和RefCOCO+ Test B数据集上的指向游戏准确率从79.38%、69.35%和53.77%分别提高到87.26%、79.06%和63.67%。此外,论文还使用了开放词汇的目标检测器来生成合成图像和文本的合成边界框,并通过优化掩码-注意力一致性目标来微调预训练的视觉-语言模型。

论文地址:

https://arxiv.org/abs/2403.13804v1

Image