GenAI新世界

5月30日 AI 头条 | OpenAI 宣布向免费用户开放大量新功能,包括自定义GPTs等

Image
划重点:
  • OpenAI 宣布向免费用户开放大量新功能,包括自定义GPTs等
  • Mistral AI 发布编程大模型 Codestral:支持 Python 等 80 多种语言
  • 腾讯发布基于混元大模型的 AI 助手腾讯元宝
  • 苹果 AI 服务器或将使用“机密计算”技术来处理数据,保护用户隐私
  • Arena Elo 基准测试显示,谷歌 Gemini 1.5 Pro 性能媲美 OpenAI GPT-4o
  • 网易有道发布子曰教育大模型全新应用
  • 普华永道将成为 OpenAI 最大的 ChatGPT 企业客户
  • Canalys 称今年 AI 手机出货占比 16%
  • 中科可控率先发布两款国芯AI工作站
资讯详情:
OpenAI 宣布向免费用户开放大量新功能,包括自定义GPTs等
据 OpenAI 官方,免费 ChatGPT 用户现在可以使用自定义 GPT、分析图表、就照片提问以及五月初 GPT-4o 新增的其他功能。虽然免费 ChatGPT 用户可以发现和使用自定义 GPT(以前只有付费用户才能使用),但他们不能创建自己的 GPT。我们已经使用过的 ChatGPT 定制版本包括按需词典和宜家购物指南。定制 GPT 的制作者还可以参与 OpenAI 于今年 3 月开始测试的收入共享计划。
Image
Mistral AI 发布编程大模型 Codestral:支持 Python 等 80 多种语言
Mistral AI 今天宣布,发布变成大模型Codestral,这是 Mistral AI 首款面向编程场景的大语言模型。
Codestral 可以熟练使用 80 多种编程语言,包括 Python、Java、C、C++、JavaScript、Bash、Swift,甚至还有 1957 年问世的 Fortran。和其它编程 LLM 类似,Codestral 可以帮助开发者完成各种功能,包括完成函数、编写测试、填充代码等等,降低代码中出现错误和漏洞的风险。
Image
腾讯发布基于混元大模型的 AI 助手腾讯元宝
在今天上午的发布会上,腾讯正式宣布发布基于混元大模型的 AI 助手腾讯元宝,目前已上架多哥应用商店。
据官方介绍,腾讯元宝是依托于腾讯混元大模型的 AI 产品,提供了 AI 搜索、AI 总结、AI 写作等核心能力,能够一次性解析多个微信公众号链接、网址,以及 PDF、word、txt 等多种格式的文档,并支持超长的上下文窗口。元宝具有强大的语言理解和输出能力,用户可以用元宝写报告、写方案、写代码等,元宝都可以准确理解,给出更多灵感,内容创作更轻松。
Image
苹果 AI 服务器或将使用“机密计算”技术来处理数据,保护用户隐私
据The Information报道,苹果计划采用“机密计算”技术,实现“黑箱处理”。
据报道,苹果已经找到了一种方法,可以在整个处理过程中始终保持用户数据的隐私性。这种方法在概念上类似于“机密计算”,这是一个行业术语,即所谓的“可信计算”,意思是数据在处理的过程中,始终保持保密状态。
据悉,在过去的三年里,苹果一直在进行一个秘密项目。该项目在内部被称为“苹果数据中心芯片”( ACDC),而该 AI 芯片可以帮助苹果实现“黑匣子”计算方式。
Image
Arena Elo 基准测试显示,谷歌 Gemini 1.5 Pro 性能媲美 OpenAI GPT-4o
LMSYS Org 最新发布的排行榜显示,Gemini-1.5-Pro-API-0514 和 Gemini-Advanced-0514 性能均已都接近 GPT-4o。
Gemini 1.5 Pro模型在5月15日的谷歌 I/O大会上正式公布,该模型上下文窗口从当前 100 万 tokens 增加到 200 万。Gemini 1.5 Pro模型现在可以处理多个大型文档,总页数可达 1500 页,或汇总 100 封电子邮件。此外,谷歌通过数据和算法改进增强了Gemini 1.5 Pro模型的代码生成、逻辑推理和规划、多轮对话以及音频和图像理解能力。
Image
网易有道发布子曰教育大模型全新应用
5月29日,网易有道举办“子曰”教育大模型媒体交流会。网易有道分享了子曰教育大模型最新技术进展及三大AI创新应用:AI全科学习助手“有道小P”APP、新一代虚拟人口语教练Hi Echo 3.0和新一代知识库问答引擎QAnything。
现场,网易有道CEO周枫表示:“当前已经是‘模型即应用’的时代,大模型的发展需要结合应用场景去迭代优化,在‘产模一体’的框架下去同步提升模型与产品。有道将继续聚焦场景开拓和应用落地,让用户能用上更‘高效’的产品,拥有更流畅的交互体验。” 
Image
普华永道将成为 OpenAI 最大的 ChatGPT 企业客户
据界面新闻报道,普华永道将成为 OpenAI 企业产品的最大客户和首家经销商。
普华永道表示,将向其 7.5 万名美国员工和 2.6 万名英国员工推出 ChatGPT 企业版。两家公司都拒绝透露交易的财务条款。普华永道去年曾宣布,计划在未来三年内向旗下美国业务的生成式 AI 技术投资 10 亿美元。
Image
Canalys 称今年 AI 手机出货占比 16%
Canalys 发布关于 AI 手机的深度报告,该报告重点探讨将生成式 AI 功能直接整合到智能手机中所带来的影响和机遇。
报告中指出,2024 年,全球 16%的智能手机出货为 AI 手机,到 2028 年,这一比例将激增至 54%。受消费者对 AI 助手和端侧处理等增强功能需求的推动,2023 年至 2028 年间, AI 手机市场以 63% 的年均复合增长率(CAGR)增长。另外,Canalys 消费者 AI 倾向指数显示,消费者对智能手机的 AI 功能的兴趣日益浓厚。
Image
中科可控率先发布两款国芯AI工作站
据36氪报道,中科可控Suma“天阔”系列AI工作站N40A与W40A近日正式发布。
据介绍,两款新品采用海光3号CPU与国产GPU“双国芯”配置,在计算性能、安全性与生态兼容能力上表现优异,可支持工程设计、模拟仿真与智能调度等应用。此外,两款新品也首次内置定制版“AI助手”功能,提供操作任务、问答对话、文生图与智能建议提示等个性化体验,推动全场景数智再升级。
Image
今日重点论文:
字节跳动:
《DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention》
本论文旨在解决视觉内容生成中的扩散模型的可扩展性和二次复杂度效率问题。论文提出了一种采用门控线性注意力变换(GLA)转换器的扩散模型,称为Diffusion Gated Linear Attention Transformers(DiG),其具有比Diffusion Transformers(DiT)更高的效率和效果。
论文地址:
https://arxiv.org/abs/2405.18428v1
特拉维夫大学
《Classifying Overlapping Gaussian Mixtures in High Dimensions: From Optimal Classifiers to Neural Nets》
本论文旨在解决高维重叠高斯混合模型数据的二元分类中贝叶斯最优决策边界的推导问题,并展示了它们如何取决于类协方差的特征值结构。同时,论文还试图通过实验验证深度神经网络是否能够学习到这些最优分类器。本论文的关键思路是通过推导贝叶斯最优决策边界的闭合形式表达式,研究高维重叠高斯混合模型数据的分类问题,并探究深度神经网络是否能够学习到这些最优分类器。
论文地址:
https://arxiv.org/abs/2405.18427v1
新加坡国立大学
《GFlow: Recovering 4D World from Monocular Video》
本文提出了GFlow框架,利用2D先验(深度和光流)将视频(3D)提升到4D显式表示,通过高斯点的流动来实现。GFlow首先将场景聚类为静止和运动部分,然后应用顺序优化过程,基于2D先验和场景聚类来优化3D高斯点的相机姿态和动态,确保相邻点之间的保真度和帧之间的平滑运动。
论文地址:
https://arxiv.org/abs/2405.18426v1
斯坦福大学
《Why are Visually-Grounded Language Models Bad at Image Classification?》
本论文探讨使用视觉语言模型(VLM)进行图像分类任务时的性能问题,发现现有的VLMs在标准的图像分类基准测试中表现不如CLIP模型。VLM的潜在空间中编码了图像分类的关键信息,但只有在有足够训练数据的情况下才能有效解码。通过将分类数据集集成到VLM的训练中,可以提高其分类性能,并将其推广到其一般能力中。
论文地址:
https://arxiv.org/abs/2405.18415v1
Image