3 月 14 日 AI 头条:OpenAI 或将发布GPT-4.5 Turbo,上下文窗口大256K
OpenAI 或将发布GPT-4.5 Turbo,上下文窗口大256K
OpenAI 首席技术官:文生视频工具 Sora 数月内将公开发布,拟支持生成音频 谷歌发布 SIMA 模型:具备约 600 项游戏技能 微软 Copilot for Security 4 月 1 日上线 欧洲议会通过《人工智能法案》:禁止人工智能操纵人类行为、利用人类弱点 Meta 新建两座数据中心集群:内含超 4.9 万块英伟达 H100 GPU
资讯详情:
OpenAI 或将发布GPT-4.5 Turbo,上下文窗口大256K
有Reddit 用户发帖称, Bing 和 DuckDuck Go 等搜索引擎中已经显示了 GPT-4.5 Turbo 的产品页面索引。目前该索引点进去还是404页面,但从搜索引擎快照的内容来看,GPT-4.5 Turbo是 OpenAI 迄今为止速度最快、精度最高、可扩展性最强的模型。根据泄露的信息,GPT-4.5 Turbo的窗口大小为256,000个Token,大约相当于 200,000 个单词,是GPT-4 Turbo 128K 的两倍。
搜索引擎页面还显示,GPT-4.5 Turbo 的知识截止日期将长达 2024 年 6 月,这或许表明OpenAI 将会在这之前发布更新版本的ChatGPT。
OpenAI 首席技术官:文生视频工具 Sora 数月内将公开发布,拟支持生成音频
谷歌发布 SIMA 模型:具备约 600 项游戏技能
SIMA 的全称是“Scalable, Instructable, Multiworld Agent”(可扩展、可指导、多世界 Agent),目前仅处于研究阶段,未来可以和你一起玩游戏。SIMA 的定位并非是游戏中的 AI NPC,而是要成为你的队友,默契配合你的操作。SIMA 结合自然语言和图像识别技术,能够理解 3D 游戏世界,希望能成为玩家的默契队友。SIMA 目前拥有约 600 项基本技能,如左转、爬梯子、打开菜单使用地图等,暂时还无法实现“寻找资源和建造营地”等复杂指令,但希望未来能够进一步扩充相关的技能。
微软 Copilot for Security 4 月 1 日上线
据 cnBeta 报道,微软去年3 月宣布推出 Security Copilot 服务, 当时微软声称这是世界上第一个基于生成式 AI 的安全产品。现在,微软宣布更名后的“Copilot for Security”将于 4 月 1 日正式上线。
据介绍,这款行业领先的产品是唯一一款生成式 AI 解决方案,可帮助安全和 IT 专业人员增强其技能、进行更多协作、查看更多内容并更快地做出响应。
据市场消息,欧洲议会以 523 票赞成、46 票反对、49 票弃权的压倒性多数支持通过了《人工智能法案》,据悉,这项法案将会“具有里程碑意义”。
欧洲议会表示,该法案旨在保护基本权利、环境可持续性等方面免受“高风险人工智能”的影响,同时促进创新,以将欧洲“打造成为该领域的领导者”。
Meta 公司当地时间 12 日通过官方新闻稿公布了两座新的数据中心集群,该公司正希望通过英伟达的 GPU,在以 AI 为重点的开发中脱颖而出。
据悉,这两座数据中心的唯一目的,是在消费者特定应用领域,包含声音或图像识别,进行 AI 研究和大语言模型的开发,每个集群都包含了 24576 块英伟达 H100 AI GPU,将用于自家大语言模型 Llama 3 的训练。
今日重点论文:
微软:
《Orca 2: Teaching Small Language Models How to Reason 》
论文中提出了通过教授小型语言模型不同的解决问题的策略来提高其推理能力,相比于当前的研究,这是一种新的思路。论文使用了15个不同的基准测试数据集,共计大约100个任务和超过36,000个独特提示,证明了Orca 2在零样本设置下表现出色。此外,作者公开了Orca 2的权重,以支持对小型语言模型的开发、评估和对齐的研究。
论文地址:
https://arxiv.org/abs/2311.11045v2
阿里巴巴:
《Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation》
论文提出了一种基于扩散模型的新框架,通过引入ReferenceNet来合并细节特征,使用有效的姿势指导器来指导角色的动作,并采用有效的时间建模方法来确保视频帧之间的平滑过渡。论文的亮点包括ReferenceNet的设计、姿势指导器的引入和时间建模方法的使用,实验中使用了时尚视频和人类舞蹈合成数据集,并取得了最先进的结果。
论文的亮点包括ReferenceNet的设计、姿势指导器的引入和时间建模方法的使用,实验中使用了时尚视频和人类舞蹈合成数据集,并取得了最先进的结果。
加州大学圣巴巴拉分校:
微软:
剑桥大学: