GenAI新世界

4 月 16 日 AI 头条|李彦宏称开源 AI 模型会越来越落后

Image

划重点:

  • 李彦宏称开源 AI 模型会越来越落后

  • OpenAI 将提供非高峰 GPT 使用 50% 的折扣

  • 百度发布全球首个 AI 原生操作系统DuerOS X

  • 百度李彦宏:文心一言用户数突破 2 亿,API 日均调用量突破 2 亿

  • Adobe 正在获取生成式 AI 视频工具希望与 OpenAI 的 Sora合作

  • Meta 在印度和非洲的 WhatsApp、Instagram 和 Messenger 上测试其人工智能聊天机器人

  • 三星 Galaxy AI 即将支持粤语、阿拉伯语等更多语言

  • 大模型首次接入天文望远镜:“星语 3.0”发布,基于阿里通义千问

  • 微软向阿联酋人工智能公司 G42 投资 15 亿美元

资讯详情:

李彦宏称开源 AI 模型会越来越落后

百度CEO 李彦宏今日在 Create 2024 百度 AI 开发者大会上表示,开源模型会越来越落后。

李彦宏介绍,因为基础模型文心 4.0 可以根据需要,兼顾效果、响应速度、推理成本等各种考虑,剪裁出适合各种场景的更小尺寸模型,并且支持精调和 post pretrain。这样通过降维剪裁出来的模型,比直接用开源模型调出来的模型,同等尺寸下,效果明显更好;同等效果下,成本明显更低,“所以开源模型会越来越落后”。

李彦宏还发布了文心大模型 4.0 的工具版,文心大模型的算法训练效率号称提升到了原来的 5.1 倍,周均训练有效率达到 98.8%,推理性能提升了 105 倍,推理的成本降到了原来的 1%。

Image

OpenAI 将提供非高峰 GPT 使用 50% 的折扣

据TheVerge报道, OpenAI 将提供非高峰 GPT 使用 50% 的折扣。

OpenAI 的 Batch API 现在允许用户将批量查询文件上传到 AI 模型,例如对数据进行分类或标记图像,但用户不需要立即关注。24 小时内即可获得令人期待的结果,让它们在有未使用的计算能力时运行,并使这些昂贵的 GPU 全天候运转。

Image

百度发布全球首个 AI 原生操作系统DuerOS X

在今日举行的 Create 2024 百度 AI 开发者大会上,小度科技宣布推出“全球首个 AI 原生操作系统”DuerOS X。

该系统基于百度文心大模型进行了全面升级,在多模态感知和拟人化呈现方面有了“重要突破”。通过 DuerOS X,小度的人机交互体验将实现“质的飞跃”,为用户提供更加自然、智能的交互方式。

Image

百度李彦宏:文心一言用户数突破 2 亿,API 日均调用量突破 2 亿

据百度首席执行官李彦宏在 Create 2024 百度 AI 开发者大会上透露,文心一言从去年 3 月 16 日发布,到今天是一年零一个月的时间,用户数突破了 2 亿,API 日均调用量也突破了 2 亿,服务客户数达到了 8.5 万,利用千帆平台开发的 AI 原生应用数超过了 19 万。

Image

Adobe 正在获取生成式 AI 视频工具希望与 OpenAI 的 Sora合作

据TheVerge报道,Adobe 正在为其 Firefly 系列开发生成式 AI 视频模型,该模型将为其 Premiere Pro 视频编辑平台带来新工具。这些新的 Firefly 工具以及一些拟议的与 Runway、Pika Labs 和 OpenAI 的 Sora 模型的第三方集成,将允许 Premiere Pro 用户使用文本提示生成视频并添加或删除对象(就像Photoshop 的生成填充功能),并扩展视频剪辑的长度。

与 Adobe 之前的许多与 Firefly 相关的公告不同,该公司的新视频生成工具没有确定发布日期(测试版或其他版本),只是说它们将“今年”推出。尽管这家创意软件巨头在早期视频演示中展示了自己的视频模型目前的功能,但其将 Premiere Pro 与其他提供商的 AI 模型集成的计划尚不确定。

Adobe 相反,将其视频预览中的第三方人工智能集成称为对“未来”的“早期探索”。据 Adobe 称,这一想法是为 Premiere Pro 用户提供更多选择,允许他们在为项目生成 B 卷时使用 Pika 等模型来扩展镜头,或者使用 Sora 或 Runway AI 等模型。Adobe 还表示,其内容凭证标签可以应用于这些生成的剪辑,以识别使用哪些人工智能模型来生成它们。

Image


Meta 在印度和非洲的 WhatsApp、Instagram 和 Messenger 上测试其人工智能聊天机器人

据TechCrunch报道,Meta 正在与印度和非洲部分地区的 WhatsApp、Instagram 和 Messenger 用户测试 Meta AI,这是其由大型语言模型驱动的聊天机器人。此举标志着 Meta 计划如何利用其各种应用程序的庞大用户群来扩展其人工智能产品。

Meta 宣布计划于2023 年 2 月构建和试验聊天机器人和其他人工智能工具。印度是该公司非常重要的市场,用户最近开始注意到 Meta AI 聊天机器人的出现:印度拥有超过 5 亿 Facebook 和 WhatsApp 用户,使其成为 Meta 最大的单一市场。

发展中市场的智能手机用户增长速度快于美国等发达市场(增长已趋于稳定),也是 Facebook 尝试更多服务来吸引受众的重要目标。非洲用户也报告了 WhatsApp 中出现 Meta AI 的迹象。

Meta 在一份声明中证实了这一举措。Meta 发言人告诉 TechCrunch:“我们的生成式人工智能体验正在不同阶段进行开发,我们正在以有限的能力公开测试其中的一系列体验。”

Image


三星 Galaxy AI 即将支持粤语、阿拉伯语等更多语言

据Readhub报道,三星电子宣布 Galaxy AI 即将支持更多语言,包括阿拉伯语、印尼语、俄语、澳大利亚英语、粤语和加拿大法语,将于 4 月起未来数月陆续上线,每种语言都可以在设置中,以语言包的形式下载使用。

结合既有的 13 种语言,三星将为全球更多 Galaxy 用户提供 Galaxy AI 的能力。此外,除前述语言外,三星计划在今年稍晚进一步扩大支持语言,包括罗马尼亚语、土耳其语、荷兰语、瑞典语、繁体中文和欧洲葡萄牙语。

三星电子移动通信部门总裁卢泰文表示:“三星致力于将移动 AI 普及给所有人,Galaxy AI 翻译功能的语种扩充将会帮助更多 Galaxy 用户跨越语言不通的障碍,享受来自三星提供的创新交流沟通体验。在未来,我们还将不断突破创新,带来更多出众的移动 AI 体验,让越来越多的用户能够更自如地释放自己的潜能。”

三星 Galaxy AI 目前支持的语言包括简体中文、英文(印度、英国、美国)、法文、德文、印地文、意大利文、日文、韩文、波兰文、葡萄牙文(巴西)、西班牙文(墨西哥、西班牙、美国)、泰文、越南文。

Image


大模型首次接入天文望远镜:“星语 3.0”发布,基于阿里通义千问

4 月 14 日,中国科学院国家天文台人工智能工作组发布新一代天文大模型 ——“星语 3.0”。

“星语 3.0”基于阿里云通义千问开源模型打造,目前已成功接入国家天文台兴隆观测站望远镜阵列 —— Mini“司天”。

据介绍,随着望远镜数量的不断增加,如何控制大型望远镜阵列已成为当今天文界共同面临的挑战。

以往天文观测主要依赖观测助手和科研人员的配合。科研人员往往需要根据观测所在地气象情况修改观测计划,在观测室等待数据返回并实时分析数据,再根据结果修改观测计划。重要观测目标的每个环节都需要人工参与,效率低且难以同时控制多个望远镜。

“星语 3.0”尝试解决这一难题,基于超 30 万专家订正数据完成训练。目前,“星语 3.0”已成功接入国家天文台兴隆观测站望远镜阵列 ——Mini“司天”,可实现自主控制望远镜进行观测、分析观测结果,智能地给出下一步观测建议。

Image

微软向阿联酋人工智能公司 G42 投资 15 亿美元

微软官方消息,微软公司和阿联酋人工智能(AI)技术控股公司 G42 今天宣布,微软将向 G42 战略投资15 亿美元。

此次投资将加强两家公司的合作,将微软最新的人工智能技术和技能培训计划带到阿联酋和世界其他国家。作为扩大合作的一部分,微软公司副董事长兼总裁布拉德-史密斯(Brad Smith)将加入 G42 董事会。

Image

今日重点论文:

剑桥大学:

《Why do Random Forests Work? Understanding Tree Ensembles as Self-Regularizing Adaptive Smoothers》

论文提供了一种新的量化决策树集成的平滑度的方法,并对决策树集成的优势进行了进一步的解释。研究表明,决策树集成可以通过三种不同的机制提高性能,即减少噪声引起的预测方差、减少给定固定输入数据时学习函数质量的变异性,以及通过丰富可用的假设空间减少潜在的偏差。

论文地址:

https://arxiv.org/abs/2402.01502v1


谷歌:

《HeAR - Health Acoustic Representations》

本文提出的HeAR是一种基于自监督学习的深度学习系统,通过线性探针在6个数据集上的33个健康声学任务中,将其建立为最先进的健康音频嵌入模型。本文的亮点是使用大型数据集进行自监督学习,提出了一种可扩展的深度学习系统,以解决健康声学数据的局限性和瓶颈问题。通过线性探针,本文在多个数据集上展示了HeAR的性能优越性。本文的代码和数据集已公开。

据时学习函数质量的变异性,以及通过丰富可用的假设空间减少潜在的偏差。

论文地址:

https://arxiv.org/abs/2403.02522v1


康奈尔大学:

《Diffusion Models Without Attention》

论文提出了一种名为DiffuSSM的新型架构,将注意力机制替换为更可扩展的状态空间模型骨干,有效地处理更高分辨率的图像,同时保留了详细的图像表示。论文在ImageNet和LSUN数据集上进行了全面的评估,证明了DiffuSSMs在FID和Inception Score指标上与具有注意力模块的现有扩散模型相当甚至更优,同时显著降低了总FLOP使用量。

论文地址:

https://arxiv.org/abs/2311.18257v1


蒙纳士大学:

《MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images》

本论文旨在提出一种高效的前馈3D高斯Splatting模型,通过稀疏的多视角图像进行学习,以解决3D场景重建的问题。本文提出了通过在3D空间中进行平面扫描构建代价体表示,从而准确定位高斯中心,并通过代价体中存储的跨视图特征相似性提供有价值的几何线索来估计深度的方法。
论文地址:
https://arxiv.org/abs/2403.14627v1

马里兰大学:

《LiFT: A Surprisingly Simple Lightweight Feature Transform for Dense ViT Descriptors》

本文旨在提出一种简单的自监督方法,以增强ViT特征在密集下游任务中的性能。具体而言,如何提高ViT特征的密度,以便在关键点对应、检测、分割和对象发现等任务中获得更好的性能。研究团队提出了一种名为LiFT的后处理网络,可以应用于增强任何预训练的ViT骨干网的特征。LiFT是一种快速且易于训练的自监督方法,可以在最小的额外推理成本下提高ViT特征的密度。LiFT通过多个应用可以提高特征的尺度不变性和更好的对象边界映射。
https://arxiv.org/abs/2403.14625v1

Image