GenAI新世界

5月15日 AI 头条|OpenAI首席科学家Ilya Sutskever 宣布离职

Image

划重点:
  • OpenAI首席科学家Ilya Sutskever 宣布离职

  • 谷歌推出Gemini 1.5 Pro模型,上下文窗口增加至200万

  • 字节跳动正式发布豆包大模型,日均处理 1200 亿 Tokens 文本

  • 百度发布全球首个 L4 级自动驾驶大模型 Apollo ADFM,称比人类驾驶更安全

  • 微软发布 MatterSim 模型:模拟材料、预测性能,AI 探索材料设计的无限可能

  • OPPO、vivo、荣耀、小米、三星、华硕、字节跳动成立智能终端大模型联盟

  • 谷歌推出新版本图片生成模型Imagen 3

  • 谷歌推出 AI 视频生成工具 Veo

资讯详情:
OpenAI首席科学家Ilya Sutskever 宣布离职
OpenAI联合创始人兼首席科学家Ilya Sutskever 今天宣布,他即将从 OpenAI 离职。
Ilya Sutskever 在X上表示,在近十年之后,他决定从OpenAI 离开。Sutskever 相信OpenAI 将会在 Sam Altman、Greg Brockman、Mira Murati 以及Jakub Pachocki 的领导下打造出既安全又有益的 AGI 通用人工智能。离职后,Ilya Sutskever 将投入一项对他意义重大的项目,相关细节会在适当的时候公开。
Image
谷歌推出Gemini 1.5 Pro模型,上下文窗口增加至200万
在今天举行的 I/O 2024 大会上,谷歌宣布推出升级版的Gemini 1.5 Pro模型,更新后的 Gemini 1.5 Pro模型将上下文窗口从当前 100 万 tokens 增加到 200 万。
Gemini 1.5 Pro模型现在可以处理多个大型文档,总页数可达 1500 页,或汇总 100 封电子邮件。此外,谷歌通过数据和算法改进增强了Gemini 1.5 Pro模型的代码生成、逻辑推理和规划、多轮对话以及音频和图像理解能力。
Image
字节跳动正式发布豆包大模型,日均处理 1200 亿 Tokens 文本
字节跳动今天举办发布会,正式发布豆包大模型,并宣布大模型价格进入“厘时代”。
字节跳动表示豆包大模型正成为国内使用量最大、应用场景最丰富的大模型之一,目前日均处理 1200 亿 Tokens 文本,生成 3000 万张图片。豆包主力模型在企业市场的定价只有 0.0008 元 / 千 Tokens,0.8 厘就能处理 1500 多个汉字,比行业便宜 99.3%。
字节还强调,豆包是字节跳动重点投入的大模型应用,豆包 App 目前在苹果 App Store 和各大安卓应用市场下载量均处于 AIGC 类应用第一名。
Image
百度发布全球首个 L4 级自动驾驶大模型 Apollo ADFM,称比人类驾驶更安全
百度 Apollo 今天在武汉百度萝卜快跑汽车机器人智行谷举办 Apollo Day 2024,发布了全球首个支持 L4 级自动驾驶的大模型 Apollo ADFM。
百度称,Apollo ADFM 基于大模型技术重构自动驾驶,可以兼顾技术的安全性和泛化性,做到安全性高于人类驾驶员 10 倍以上,实现城市级全域复杂场景覆盖。依靠自动驾驶大模型的应用实践,百度萝卜快跑已经攻克了武汉的复杂道路场景,实现了武汉城市全域、全时空场景覆盖。
Image
微软发布 MatterSim 模型:模拟材料、预测性能,AI 探索材料设计的无限可能
微软研究院科学智能中心今日宣布推出 MatterSim 模型,可以准确高效地模拟材料和预测性能,助力材料设计的数字化转型。
MatterSim 模型结合深度学习技术,学习原子之间的相互作用,在绝对零度到 5000 开尔文、从标准大气压到一千万倍大气压范围内,模拟金属、氧化物、硫化物、卤化物及其不同状态(如晶体、非晶固体和液体)等多种材料。
MatterSim 的训练过程使用了大规模的合成数据。为了获得这些训练数据,研究员们结合了主动学习、分子动力学模拟和生成模型等技术,构建了高效的数据生成方案。这种数据生成策略确保了模型对材料空间的广泛覆盖,使其能够以与第一性原理预测相当的准确度,预测材料在原子层面的能量、力和应力。

Image

OPPO、vivo、荣耀、小米、三星、华硕、字节跳动成立智能终端大模型联盟
在今日的字节跳动 2024 春季火山引擎 Force 原动力大会上,火山引擎与 OPPO、vivo、荣耀、小米、三星、华硕宣布成立智能终端大模型联盟。
OPPO 小布助手、荣耀智慧办公智能助手、小米“小爱同学”,以及华硕笔记本电脑的豆叮 AI 助手等应用,均已接入火山引擎的大模型服务。2024 春季火山引擎 FORCE 原动力大会聚焦 AI 主题,以大模型应用为核心、以 AI 落地为导向,展示火山引擎在大模型、云计算领域的实践应用,携手汽车、手机终端、金融、消费、互联网等领域的专家和企业技术带头人,共同探讨 AI 时代的转型机遇。
Image
谷歌推出新版本图片生成模型Imagen 3
谷歌今天宣布,推出新版本图片生成模型Imagen 3。
Imagen 3 能带来更高水平的图像细节,而不会在生成的图像中出现大量视觉伪影和杂质。在需要时,图像会更加逼真和栩栩如生。更新后的 Imagen 3 拥有更强大的渲染文本的能力。谷歌将这种新模式定位为创建带有文字的个性化图像的一种方式,比如贺卡或带有信息的照片。
Image
谷歌推出 AI 视频生成工具 Veo
谷歌今天宣布,推出 AI 视频生成模型 Veo。
Veo 目前还处于内部测试阶段,该模型专为视频生成而设计,能理解视觉语义和自然语言,与其他现代模型类似。将这种方法引入视频生成模型,可以创造性地定制出适合特定风格的结果。Veo 模型能够理解用户提示中的 "电影术语",如航拍和延时摄影格式。Veo 能够生成超过一分钟的 1080p 视频,这超过了 OpenAI 的 Sora 等目前最多只能生成 60 秒的模型。
Image
今日重点论文:
Meta
《Memory Mosaics》
记忆马赛克是一组联想记忆网络,共同完成感兴趣的预测任务。与变形金刚一样,记忆马赛克具有组合能力和上下文学习能力。与变形金刚不同的是,记忆马赛克以相对透明的方式实现这些能力。我们在玩具示例中展示了这些能力,并且还展示了记忆马赛克在中等规模的语言建模任务中表现得与变形金刚一样好甚至更好。
论文地址:
https://arxiv.org/abs/2405.06394v2
剑桥大学
《SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation》
大型多模态模型(LMMs)已经证明在许多任务和领域中具有灵活性和可推广性。虽然它们在科学研究中具有很强的潜力,但它们在这个领域的能力还没有得到很好的表征。科学研究的一个关键方面是理解和解释图表,这些图表作为复杂信息的丰富、压缩的来源。在这项工作中,研究提出了SciFIBench,一个科学图表解释基准。
论文地址:
https://arxiv.org/abs/2405.08807v1
摩根大通
《Prospects of Privacy Advantage in Quantum Machine Learning》
本论文旨在探讨量子机器学习模型的数据隐私问题,特别是在分布式设置中,模型梯度通常在多个参与方之间共享以实现协作学习。研究人员试图回答一个核心问题:从量子机器学习模型的梯度中恢复输入数据有多难?通过研究变分量子电路(VQC)作为学习模型,发现动力李代数(DLA)在确定隐私漏洞方面起着关键作用。研究人员发现,具有多项式大小的DLA等有利于VQC可训练性的特性也有助于从梯度中提取输入数据的详细快照。研究人员还探讨了强隐私泄漏的条件,即可以通过经典或量子辅助多项式时间方法从这些快照中恢复原始输入数据。
论文地址:
https://arxiv.org/abs/2405.08801v1
海登堡大学
《Ambiguous Annotations: When is a Pedestrian not a Pedestrian?》
论文旨在解决自动驾驶数据集标注中存在的模糊性问题,以提高机器学习模型的性能和节省训练时间和标注成本。通过排除高度模糊的数据,可以提高最先进的行人检测器的性能,作者还强调了理解数据集和研究类别属性的重要性。
论文地址:
https://arxiv.org/abs/2405.08794v1
Image