GenAI新世界

8月28日 AI 头条|OpenAI 或在今年发布内发布 GPT-4 继任模型“猎户座”

Image
划重点:
  • OpenAI 或在今年发布内发布 GPT-4 继任模型“猎户座”
  • OpenAI 神秘模型草莓或将在今年秋季发布
  • Anthropic 宣布向 Claude 用户开放 Artifacts AI 功能
  • 智谱 AI 开源 CogVideoX-5B 视频生成模型,RTX 3060 显卡可运行
  • Cerebras Systems 宣布推出全球最快AI 推理解决方案
  • 谷歌Gemini 1.5系列模型大升级,排名提升至第六位
  • 字节辟谣成立大模型研究院传闻:暂未建立独立机构
  • 马斯克表示支持加州 AI 安全法案
  • 智谱 AI 宣布 GLM-4-Flash 大模型免费开放,支持 26 种语言
资讯详情:
OpenAI 或在今年发布内发布 GPT-4 继任模型“猎户座”
据 The Information 报道,除了擅长推理的草莓模型,OpenAI 还在秘密开发一款名为猎户座的大模型,该模型获将会成为 GPT-4 的继任模型。
据报道,猎户座的预训练数据由草莓模型生成,将拥有超过现任所有模型的推理和生成能力。此外,猎户座模型还可以以更自然地方式与人类、环境进行综合交互。
据悉,猎户座模型可能会在今年年底发布。
Image
OpenAI 神秘模型草莓或将在今年秋季发布
据 The Information 报道,OpenAI 正计划在今年秋季发布内部代号为草莓的神秘新模型。
据悉,草莓就是此前引起业内讨论的 Q* 模型,该模型将会被融入 ChatGPT 之中,作为其功能拓发布。根据此前透露的消息,Q* 将是一款专注于推理能力的模型,可以解决此前从未见过的数学问题,并且还经过训练能够解决与编程相关的问题。
报道称,这项技术对未来 AI 产品,特别是旨在解决多步骤任务的智能体,具有重要意义。
Image
Anthropic 宣布向 Claude 用户开放 Artifacts AI 功能
据 Anthropic 官方宣布,将向所有 Claude 用户开放 Artifacts。您现在还可以在 Claude iOS 和 Android 应用上创建和查看 Artifacts。
Artifacts 相当于创建了一个动态工作区,用户和 Claude 对话让其生成文档、代码、矢量图,甚至是简单的游戏过程中,Artifacts 会出现聊天界面旁边,方便用户实时查看、迭代和创建你的作品。
Artifacts 于今年 6 月推出预览版,官方称用户目前已经创建了数千万个 Artifacts。
Image
智谱 AI 开源 CogVideoX-5B 视频生成模型,RTX 3060 显卡可运行
智谱 AI 官方宣布,已开源 CogVideoX-5B 视频生成模型,相比此前开源的 CogVideoX-2B,官方称其视频生成质量更高,视觉效果更好。
官方表示大幅度优化了模型的推理性能,推理门槛大幅降低,可以在 GTX 1080Ti 等早期显卡运行 CogVideoX-2B ,在 RTX 3060 等桌面端“甜品卡”运行 CogVideoX-5B 模型。
CogVideoX 是一个大规模 DiT(diffusion transformer)模型,用于文本生成视频任务。
Image
Cerebras Systems 宣布推出全球最快AI 推理解决方案
据siliconangle 报道,Cerebras Systems 宣布 推出全球最快的 AI 推理解决方案 Cerebras Inference。
据悉,该新解决方案为 Llama 3.1 8B 提供每秒 1800 个 token,为 Llama 3.1 70B 提供每秒 450 个 token,速度是微软 Azure 等超大规模云中提供的基于英伟达 GPU 的 AI 推理解决方案的 20 倍。
除了令人难以置信的性能之外,这款新型推理解决方案的定价也比流行的 GPU 云低得多,起价仅为每百万个 token 10 美分,从而为 AI 工作负载提供 100 倍更高的性价比。
Image
谷歌Gemini 1.5系列模型大升级,排名提升至第六位
据谷歌的 AI 产品负责人 Logan Kilpatrick 表示,谷歌推出了最新的 Gemini1.5模型,其性能大幅提高。
据悉, Gemini1.5模型包括了一个小型变体 Gemini1.5Flash-8B,以及性能明显提高的 Gemini1.5Flash 和 Gemini1.5Pro。Gemini1.5Flash 的全面性能得到了“巨大提升”,而1.5Pro 在数学、编码和复杂提示方面要好得多。
新模型发布之后,大模型竞技场lmsys 发推表示,Gemini1.5-Flash 性能大幅提高,从第23位攀升至第6位,与 Llama 水平持平,性能超过了 Google 的 Gemma 开放式模型。
Image
字节辟谣成立大模型研究院传闻:暂未建立独立机构
据第一财经报道,针对字节跳动成立大模型研究院这一传闻,字节跳动辟谣表示,字节跳动有加强大模型相关研究的长期计划,但并未决定建立独立机构。
昨天有消息称,字节跳动正在秘密筹备成立一家大模型研究院目前正处于人才招揽阶段。
据悉,该研究院已经有非字节跳动的 AI 大牛加盟直接向张一鸣汇报。此外,原面壁智能核心成员秦禹嘉、原零一万物核心成员黄文灏已加入字节大模型团队,目前暂不清楚是否归属在大模型研究院。
Image
马斯克表示支持加州 AI 安全法案
据 PCmag 报道,马斯克现已表示支持加州的 AI 安全法案,该法案将为大型 AI 系统引入全新的安全和问责机制。
马斯克与人类学公司首席执行官Dario Amodei一起支持这项法案。Amodei表示,这是保护公众和提高行业透明度所必需的。其他主要参与者则表示反对,包括谷歌、Meta和OpenAI,这些企业表示,该法案这可能会扼杀创新,延缓进步。
该法案将要求花费至少 1 亿美元开发强大人工智能模型的公司在发布模型前对其进行测试,并引入一个 “关闭开关”,以便在模型发布后失控时将其关闭。
Image
智谱 AI 宣布 GLM-4-Flash 大模型免费开放,支持 26 种语言
据智谱 AI 官方消息,旗下 AI 大模型免费开放。现在只需要注册开放平台 bigmodel.cn 就可以通过调用 GLM-4-Flash 构建专属模型和应用。
据介绍,GLM-4-Flash 适用于完成简单垂直、低成本、需要快速响应的任务,具备多轮对话、网页浏览、Function Call 和长文本推理(支持最大 128K 上下文)等高级功能,同时支持包括中文、英语、日语、韩语、德语在内的 26 种语言。
智谱表示通过多种方式优化了大模型运行效率。开放平台采用自适应权重量化、多种并行化方式、批处理策略以及投机采样等多种方法,在推理层面实现模型的延迟降低与速度提升,更大并发量和吞吐量不仅提升了效率,而且让推理成本显著降低。
Image
今日重点论文:
加利福尼亚大学圣迭戈分校:
《GPT-4 is judged more human than humans in displaced and inverted Turing tests》
人们在非正式的在线对话中很难区分人类和AI,本文旨在解决这一问题并提供更准确的工具来检测对话中的AI。通过修改图灵测试的形式,评估人类和大型语言模型在区分人类和AI方面的表现,并发现所有评判者都难以在非互动情况下区分人类和AI。本文使用了两种修改版的图灵测试来评估人类和大型语言模型的表现,发现所有评判者的准确率都低于50%。同时,最好的GPT-4见证人被认为更可能是人类,这表明当前的工具难以在非互动情况下准确检测AI。
论文地址:
https://arxiv.org/abs/2407.08853v1
上海交通大学:
《LayerPano3D: Layered 3D Panorama for Hyper-Immersive Scene Generation》
本论文旨在解决生成全景式、可探索的三维场景的问题,其中场景需要满足全方位视角一致性和复杂场景层次的自由探索性。论文提出了一种名为LayerPano3D的框架,该框架将参考的二维全景图分解成多个层次,每个层次通过扩散先验从参考视角中呈现出未见空间。同时,论文还引入了一种新的文本引导锚点视角综合管道以提高全景生成的质量和一致性,并将分层三维全景作为底层表示形式,以处理复杂场景层次结构并将其提升为三维高斯以呈现详细的全方位场景。
论文地址:
https://arxiv.org/abs/2408.13252v1
洛斯阿拉莫斯国家实验室:
《Quantum Convolutional Neural Networks are (Effectively) Classically Simulable》
探讨量子卷积神经网络(QCNN)的启发式成功与简单数据集的关系,以及QML中需要使用复杂数据集的必要性。QCNN在随机初始化时只能处理输入状态的低体测量信息,并且其在低体测量子空间上的作用可以通过经典算法和数据集上的Pauli影子进行高效的经典模拟。这揭示了QML的一个更深层次问题:模型的启发式成功可能只是因为它们在简单问题上进行了基准测试,而这些问题的行为可以被经典算法进行模拟。
论文地址:
https://arxiv.org/abs/2408.12739v1
网易:
《Challenges and Responses in the Practice of Large Language Models》
这篇论文旨在回答关于人工智能领域的广泛而深刻的问题,涵盖了行业趋势、学术研究、技术创新和商业应用等多个方面。它试图为读者提供一个全面、深入和前沿的人工智能知识框架,以帮助人们掌握人工智能发展的脉搏,激发创新思维,促进产业进步。本文系统地整理和分类了来自计算能力基础设施、软件架构、数据资源、应用场景和脑科学等五个核心维度的问题,提供了对每个问题的细致而深入的答案。
论文地址:
https://arxiv.org/abs/2408.09416v2
Image