GenAI新世界

7月15日 AI 头条 | OpenAI 正秘密研发具有更强推理能力的大模型,代号草莓

Image

划重点:
  • OpenAI 正秘密研发具有更强推理能力的大模型,代号草莓
  • 4050 亿参数版 Meta Llama 3 或将在 7 月 23 日发布
  • OpenAI 被前员工举报,称其存在非法禁止员工公布安全风险的行为
  • Amazon 推出 Rufus AI 购物助手
  • 谷歌正利用大模型训练机器人,使其能够完成更多任务
  • OpenAI 科学家翁荔提出外在幻觉extrinsic hallucination 概念
  • 谷歌将推出Eureka AI 模型,具备更像人类的文本输出能力
  • 百度推出文小言AI数字人社交APP
  • 苹果已批准首个 iOS PC 模拟器
资讯详情:
OpenAI 正秘密研发具有更强推理能力的大模型,代号草莓
据 Mint 报道,OpenAI 正在研发一个代号为草莓的模型,该模型将会提高大模型的推理能力。
据悉,草莓是 Q*项目的进一步延伸,将以提高大模型的推理能力为目的。草莓将会自主、搞笑的扫描互联网,并执行OpenAI 的深度研究人物,让大模型可以解决更加复杂的现实问题。草莓的目标是在现有 AI 模型基础上进行更广泛的post-training分析,实现更接近于人类的反应。
Image
4050 亿参数版 Meta Llama 3 或将在 7 月 23 日发布
据 The Information 报道,Meta 计划在本月7月23日发布开源 AI 模型 Llama 3-405B。
据悉,该模型拥有4050亿参数,被meta 称为最强大的开源大语言模型。Llama 3-405B 是一个多模态 AI 开源模型,能够理解图像、文本等多种媒体内容。
Image
OpenAI 被前员工举报,称其存在非法禁止员工公布安全风险的行为
据 Bussiness Insider 报道,一名OpenAI 前员工向美国证券交易委员会提交了一份申诉书,指控OpenAI非法禁止员工就其技术可能给人类带来的严重风险向监管机构发出警告,并呼吁对其进行调查。
举报人称,OpenAI向其员工签发了限制性过强的雇佣协议、离职协议和保密协议,这些协议可能会导致向联邦监管机构提出对OpenAI的担忧的员工受到处罚。这些协议还要求OpenAI员工如果希望向联邦当局披露信息,必须事先征得公司同意。
举报人表示,这些过于宽泛的协议违反了长期存在的联邦法律和法规,这些法律和法规旨在保护那些希望匿名披露有关其公司的破坏性信息而不必担心遭到报复的举报人。
Image
Amazon 推出 Rufus AI 购物助手
据亚马逊官方消息,亚马逊现已向美国地区用户推出全新的 AI 助手Rufus。
Amazon 介绍,通过点击 Amazon App 的相关图标,购物者可以调出一个文本聊天界面,并可以向 Rufus 提出一系列问题,例如识别某些产品的型号,询问某些商品的详细细节,比较不同的商品和获取订单更新。
Image
谷歌正利用大模型训练机器人,使其能够完成更多任务
据 The Verge 报道,谷歌 DeepMind 研究团队近日正在尝试利用 Gemini 大模型训练机器人,让他们完成更复杂的任务。
据悉,该团队在最新发表的论文中指出,Gemini 1.5 Pro 的上下文窗口足以让用户可以更轻松地使用自然语言指令与 RT-2 机器人互动。其工作原理是拍摄指定区域的视频导览,让机器人通过 Gemini 1.5 Pro 学习当前空间的现实环境;然后,机器人可以根据观察到的情况,通过语言和图像输出来执行命令。
Image
OpenAI 科学家翁荔提出外在幻觉extrinsic hallucination 概念
OpenAI 科学家翁荔近期在Github 上发布文章,提出了一种名为 LLM 外在幻觉(extrinsic hallucination)的全新概念。
翁荔表示,模型输出应基于预训练数据集。然而,考虑到预训练数据集的规模,每一代检索和识别冲突的成本太高。如果我们将预训练数据语料库视为世界知识的代表,那么从本质上讲,我们要努力确保模型输出是真实的,并且可以通过外部世界知识进行验证。同样重要的是,当模型不知道某个事实时,它应该说出来。翁荔表示,为了避免外在幻觉的出现,研究者应该保证大模型内容符合事实,同时要保证大模型在适当的时候承认不知道答案。
Image
谷歌将推出Eureka AI 模型,具备更像人类的文本输出能力
据testingcatalog 报道,谷歌即将发布一款名为 Eureka 的 AI 大模型,目前该模型已经在LMSYS Arena上出现。
Eureka在LMSYS Arena上非凡的文本写作能力吸引了人们的注意。早期评估显示,Eureka 在生成自然语言、无缝遵从指令和完成各种任务方面的能力超过了其他模型,并取得了令人印象深刻的成绩。此外,Eureka 的输出更像是人类,此外,该模型能够出色地遵守用户定义的参数,包括字数限制。初步观察表明,Eureka 有潜力在广泛的人工智能驱动任务中提高性能。
Image
百度推出文小言AI数字人社交APP
据 Tech 星球报道,百度公司最近推出了一款名为"文小言"的AI数字人社交APP。这款应用基于先进的文心大模型技术,允许用户与AI虚拟角色进行实时沟通、互动,并建立情感联系。
文小言App采用了仿真的数字人形象,为用户带来更真实、更自然的交互体验。
进入文小言App后,用户可以在"发现"功能栏内,通过上下滑动来寻找自己喜欢的数字人聊天对象。每一个AI数字人都提供独特的聊天服务,他们可以成为用户的百科全书、生活小助手,甚至是心灵导师。在每个数字人的个人界面上,用户不仅能看到逼真的动态数字人形象,还能了解到他们的年龄、地方、性格、职业等信息,以及一段语音形式的自我介绍。这让用户对每个数字人有了更全面的了解。
Image
苹果已批准首个 iOS PC 模拟器
据 The Verge 报道,苹果公司已经批准了UTM SE 上架,这是一款用于模拟电脑运行经典软件和游戏的应用程序。
据报道,几周前苹果公司拒绝了这款应用程序,并禁止它在欧盟的第三方应用程序商店进行公证。现在,这款应用程序可免费用于 iOS、iPadOS 和 visionOS。在苹果公司 6 月份拒绝该应用后,开发商表示不会继续尝试,因为该应用 "体验不佳"。
Image
今日重点论文:
ARC:
《Reactor Mk.1 performances: MMLU, HumanEval and BBH test results》
这篇论文通过基准测试分析,介绍了ARC旗舰大语言模型Reactor Mk.1的性能结果。该模型采用了荔枝AI引擎,参数少于1000亿,具有高效和强大的组合特点。Reactor Mk.1在MMLU数据集上获得了92%的分数,在HumanEval数据集上获得了91%的分数,在BBH数据集上获得了88%的分数,超越了GPT-4o、Claude Opus和Llama 3等模型。它在处理困难任务和推理方面表现出色,成为当今尖端人工智能技术中杰出的解决方案。
论文地址:
https://arxiv.org/abs/2406.10515v1
阿里巴巴:
《DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning》
本论文旨在解决复杂数学问题的挑战,提出了一种名为DotaMath的LLM模型,通过将问题分解为简单的逻辑子任务,利用代码求解这些子任务,获得代码解释器的细粒度反馈,并进行自我反思和修正来解决复杂数学问题。这是否是一个新问题?DotaMath模型通过分解和求解逻辑子任务的方式,利用代码求解数学问题,获得细粒度的反馈和自我修正,取得了比当前领域其他开源LLM模型更好的性能表现。相比当前领域的研究,DotaMath模型的思路有新意。
论文地址:
https://arxiv.org/abs/2407.04078v2
乌得勒支大学:
《Automated Transparency: A Legal and Empirical Analysis of the Digital Services Act Transparency Database》
使用法律和实证论据,分析DSA透明度数据库的结构,发现平台在透明度实践方面有很大的自由裁量权,提出改进建议。同时,通过对透明度数据库的代表性样本进行分析,评价平台内容审核实践。论文提出了一种新的自动透明度机制(SoRs),并对DSA透明度数据库进行了分析。实验使用了131m个SoRs,对平台内容审核实践进行了评价。
论文地址:
https://arxiv.org/abs/2404.02894v2
谷歌:
《Many-Shot In-Context Learning》
论文旨在探讨在上下文中进行少量示例学习的情况下,如何将其扩展到使用数百或数千个示例的情况,并提高性能。同时,论文探索了两种新的情境:强化和无监督示例学习,以减少依赖人类生成示例的限制。论文提出了一种在上下文中进行大量示例学习的方法,称为多次学习(many-shot learning),并探索了两种新的情境:强化和无监督示例学习。这些方法可以在复杂的推理任务上实现高性能,并有效地消除了预训练偏差。
论文地址:
https://arxiv.org/abs/2404.11018v1
Image