4 月 23 日 AI 头条|微软 CEO 纳德拉:若没有微软早期支持,OpenAI 就不会存在
划重点:
微软 CEO 纳德拉:若没有微软早期支持,OpenAI 就不会存在
自动挂机“进阶玩法”,索尼新专利让 AI 模仿用户玩游戏闯关
GitLab 极狐发布人工智能编程助手 Duo Chat
华为小艺输入法 AI 帮写功能新增支持 P40 系列、Mate30 系列手机
微软聘请前 Meta 高管来加强人工智能超级计算团队
苹果收购了人工智能初创公司Datakalab
Mistral 正洽谈5亿欧元融资,估值或将达到50亿欧元
Meta 向第三方硬件制造商开放其 MR 操作系统
腾讯SaaS产品智能化升级 全面接入混元模型
亚马逊音乐推出 Maestro:AI,可创建个性化播放列表
爱奇艺CTO刘文峰:AI让每个创作者都拥有了新的新质生产力
消息称软银计划到 2025 年投资 1500 亿日元,加速 AI 大模型开发
iPhone 上本地每秒生成 12 个 tokens,微软发布 phi-3-mini 模型:38 亿参数
资讯详情:
微软 CEO 纳德拉:若没有微软早期支持,OpenAI 就不会存在
据 Benzinga 报道,微软公司首席执行官Satya Nadella近期接受采访,强调了微软在领先的人工智能公司 OpenAI 的发展中所发挥的“关键作用”。
“如果没有我们的早期支持,OpenAI 就不会存在。如今,他们已成为一家令人难以置信的公司,能参与他们的发展历程也使我们与有荣焉。” Nadella表示。
纳德拉还讨论了更广泛的 AI 领域,并称主要的科技公司之间存在“良性竞争”,为全球进步创造重要机会。“我认为,当所有的人都在相互竞争时,这是非常健康的,这意味着它为世界创造了真正的获益机会。”
自动挂机“进阶玩法”,索尼新专利让 AI 模仿用户玩游戏闯关
据DoNews报道,索尼最近申请了一种人工智能新专利,该专利可实现自动游玩部分游戏内容。
该技术将从云服务(如 PlayStation Network(PSN))获取信息,并创建一个游戏 AI 驱动系统,在玩家游玩了几个关卡后,将学习其游戏操作,并使用人工智能模型来学习模拟游戏风格。玩家在游戏中启用该模式后,系统将模拟玩家的风格进行游戏,跳过部分内容。
该模式旨在辅助玩家进行游戏,用于跳过游戏中重复或较折磨人的片段,在完成这部分游戏片段后,玩家还将收到通知反馈。
外媒 GAMERANT 表示,专利信息显示因为该系统引用了在人工智能训练期间使用来自 PSN 等云系统的数据,因此可以用于第三方游戏。该专利功能目前争议较大,索尼是否会在接下来的软件中实装该功能还未可知。
这不是索尼第一次申请 AI 功能相关专利,索尼此前也申请过如:利用 AI 动态调节游戏难度以适应长期未玩游戏突然回归的“回锅玩家”、AI 过滤“语音聊天不雅内容”等 AI 功能专利。
GitLab 极狐发布人工智能编程助手 Duo Chat
GitLab官方消息,在线代码仓库托管平台 GitLab 极狐近日宣布推出其人工智能编程助手 Duo Chat。该工具可为软件工程师和非工程师提供自然语言聊天形式的指导。
Duo Chat 助手可在 GitLab 用户界面和流行的第三方 IDE 中使用,用户还可通过自定义的方式扩展聊天功能。
GitLab 表示,开发者有 75% 的时间被用于非编写任务,包括理解和改进现有代码、对代码进行维护和测试等。而 Duo Chat 可简化这些任务的负担,提高工作效率。
根据 GitLab 的说法,该助手在开发时就考虑到了隐私问题,不使用客户数据进行模型训练;此外使用 Duo Chat 的组织还可控制其对特定文件的访问权限。
目前 Duo Chat 已可供 GitLab Premium 和 Ultimate 客户使用,单用户月度订阅费为 19 美元。
GitLab 还计划很快为 Duo Chat 补充模型个性化和自承载模型部署两项功能。
华为小艺输入法 AI 帮写功能新增支持 P40 系列、Mate30 系列手机
据ZAKER新闻报道,华为小艺输入法近日迎来更新,小艺帮写功能新增支持华为 P40 系列、Mate30 系列手机。
据介绍,小艺输入法现接入盘古大模型,其中小艺帮写功能可利用大模型的先进自然语言理解和内容辅助创作的能力,能够帮助用户高效创作、改写、润色高质量的文案内容。该功能于 2023 年 9 月对华为 Mate 60 系列手机开放支持,如今已适配支持超 30 款华为手机。
小艺输入法 App 是由华为开发的一款键盘应用程序,支持全球 170 多种语言,提供表情符号输入功能。支持 26 键、9 键、笔画输入。
该产品由键盘与主应用两部分组成。键盘是用户的主要使用界面,用户可以使用键盘进行文字输入、Emoji 表情输入等操作,同时也可以进入剪贴板等快捷功能。用户在主应用中,可以使用 Emoji 表情包、字体、声音等资源,激活其他语言并且下载词典包,对键盘进行个性化设置等。
微软聘请前 Meta 高管来加强人工智能超级计算团队
据TheVerge报道,Meta 前高管 Jason Taylor 即将加入微软 AI 超级计算团队。微软首席技术官凯文·斯科特 (Kevin Scott)在周一的 LinkedIn 帖子中表示,泰勒将担任公司副总裁和副首席技术官,帮助“构建下一代系统,推动人工智能前沿发展”。
Taylor 于 2009 年至 2022 年在 Meta 工作,最近担任该公司基础设施副总裁。根据他的LinkedIn 个人资料,他负责人工智能、数据和隐私基础设施,以及管理公司的服务器预算。2015 年至 2017 年,泰勒还担任开放计算项目基金会的主席,该组织致力于促进数据中心的开源设计。
微软和 OpenAI 需要更强大的硬件来跟上快速发展的人工智能系统。上个月,The Information的一份报告显示,微软和 OpenAI 希望建造一台价值 1000 亿美元的超级计算机,称为“Stargate”,为 OpenAI 的模型提供动力。(然而,微软的斯科特今天似乎在 LinkedIn 上的帖子中反驳了这些谣言,称最近的大多数猜测都是“错误得可笑”。)
今年 3 月,微软宣布聘请Google DeepMind 联合创始人 Mustafa Suleyman 担任新的消费者人工智能部门的首席执行官,该部门负责监管 Copilot、Bing 和 Edge。
苹果收购了人工智能初创公司Datakalab
Snowflake 公司近日发布新闻稿,宣布在 Apache 2.0 许可下,推出开源 Arctic embed 系列模型。
根据 MTEB(衡量文本嵌入模型的评估指标合集)的检索(Retrieval)排行榜,Arctic embed 系列最大模型参数只有 3.34 亿个,是唯一一个平均检索性能超过 55.9 的模型。
感兴趣的用户目前可以访问 Hugging Face 使用 Arctic embed 系列模型,后续也可以访问 Snowflake 的 Cortex 嵌入功能(目前处于私人预览阶段)中使用。
Mistral 正洽谈5亿欧元融资,估值或将达到50亿欧元
据界面新闻报道,法国 AI 公司Mistral AI 正在洽谈一笔5亿欧元的融资,融资完成后,该公司估值或将达到50亿欧元。
此前,Mistral AI 的三位创始人在首席执行官Arthur Mensch的领导下,已经完成了一轮近 4 亿欧元的融资。这次融资,让这家公司的估值达到了 20 亿欧元。
Mistral AI 由三位前 Meta 和谷歌 AI 研究人员于 2023 年 5 月创立,已经发布了多个版本的 AI 模型,推出了一款名为 Le Chat 的聊天机器人,类似于 OpenAI 的 ChatGPT。
据 the Verge 报道,Meta 已经开始向其他硬件制造商授权其 Quest 头显设备的操作系统,首批合作厂商是联想和华硕。
据悉,Meta 还在推动更多发现替代应用商店的方法。它正在使其实验性的 App Lab 商店更加突出,甚至邀请谷歌将 Play 商店引入其操作系统,该系统现在被称为 Horizon OS。此外,Meta公司还在一篇博客文章中表示,它正在开发一个空间框架,以便开发人员更轻松地将移动应用程序移植到Horizon OS。
此外,Meta 还与 Xbox 合作,限量生产以游戏为主的 Quest 头显设备。
据腾讯官方消息,腾讯宣布旗下协作SaaS产品全面接入腾讯混元大模型,除企业微信、腾讯会议、腾讯文档等产品,腾讯乐享、腾讯电子签、腾讯问卷、腾讯云AI代码助手等协作SaaS(软件即服务)产品也都已实现智能化升级。
据腾讯方面介绍,腾讯混元大模型目前已扩展至万亿级参数规模,在国内率先采用混合专家模型 (MoE) 结构。其在数学、代码、逻辑推理、多轮对话和文生图等层面性能较好,同时提供不同尺寸的模型,适应更多需要低成本和高推理性能的场景。外部开发者和企业可以通过腾讯云上API(应用程序接口)直接调用腾讯混元能力。
据腾讯表示,混元大模型的能力与SaaS产品结合,可以在具体场景中解决用户的痛点。
据 The Verge 报道,亚马逊音乐近日推出一项名为Maestro的AI功能,可以让用户通过文本创建个性化的音乐播放列表。
使用 Maestro,用户可以通过输入指令来请求特定主题或情感的音乐列表,例如“为乔迁庆典创建一个播放列表,其中包含适合感官问题的人的安静歌曲”。人工智能工具将根据用户的请求生成符合需求的音乐列表,为用户提供个性化的听歌体验。
值得注意的是,Maestro 还认识并理解提示中的表情符号,甚至可以从仅包含表情符号的提示中创建播放列表,例如“🏜️🌵🤠”。这种智能化的音乐推荐方式使得用户可以通过更加直观和轻松的方式发现新的音乐。
4月23日上午,2024爱奇艺世界·大会在北京举行。本次大会以“同心同力 共创未来”为主题,爱奇艺首席技术官刘文峰在主论坛上发表演讲。
刘文峰表示,AIGC不应被误读为与PPC、PUGC、UGC同台竞争的内容产品,反而各类内容的创作者都可以利用生成式AI的学习和生成能力,进行更高质量的创作。AI让每个创作者都拥有了新的新质生产力。因此,优秀的创意和卓越的审美会是AI时代最为稀缺的资源。
目前,爱奇艺已经将生成式AI应用于创作的各个环节,刘文峰在现场分别展示了各阶段的应用成果。在策划阶段,爱奇艺利用生成式AI为相关团队提高剧本、小说的阅读效率、创作效率和创意水平。目前剧本评估团队可以用三分之一的时间完成3倍的阅读量,相当于提高了9倍的阅读效率。此外,使用这一工具还可以直接提取世界观、故事大纲、人物介绍以及人物关系图等信息;在制作阶段,生成式AI为虚拟制作、声音制作以及资产制作提供有力支持;宣发阶段大量的广告素材文案等已经在使用AI生成,生成式AI在延伸IP价值方面的潜力也已经获得了关注。
会上,爱奇艺还展示了智能制作的最新成果,由爱奇艺自主研发的IQ Stage虚拟拍摄系统已经执行了目前业内使用虚拟拍摄量级最大、场景最多的剧集项目《大梦归离》。
作为内容行业的深度参与者,爱奇艺相信AI时代的影视内容行业将涌现出更多创新劳动者,用自己的独特创意和卓越的审美创造更多精彩的内容。
据《日本经济新闻》报道,软银计划到 2025 年投资 1500 亿日元,加速 AI 大模型的开发工作。
软银 2023 年就在生成式 AI 算力基础设施上进行了 200 亿日元的投资,此次追加投资后整体投资规模将创下日本企业历史第一。
据悉,软银目标在年内完成 390B 参数模型的开发,并在明年开始研发万亿参数级别的日语大模型。
报道指出,日本企业中 NTT 和 NEC 等已跟进 AI 模型开发热潮,但这些企业的模型产品参数规模停留在数 B 至数十 B 级别,而软银目标开发出水平世界一流且日语专用的大模型。
为了满足大模型开发的需求,软银将从英伟达大量采购 AI GPU,以将算力提升至现有水平的数十倍,并考虑向外出租算力资源。
根据日本电子情报技术产业协会去年末的研报,2030 年日本生成式 AI 市场规模将达 1.7774 万亿日元,相较去年提升约 14 倍,年化增长率达 47.2%。
微软研究院近日发布技术报告,公布了 Phi-3 系列 AI 模型,共有 mini(38 亿参数)、small(70 亿参数)和 medium(140 亿参数)三个版本。
微软表示拥有 38 亿参数的 phi-3-mini 通过 3.3 万亿个 tokens 上训练,其基准跑分性能超出 Mixtral 8x7B 和 GPT-3.5。
微软表示 phi-3-mini 模型可以部署在手机等设备上,在 27 亿参数的 Phi-2 模型上,进一步整合了严格过滤的网络数据和合成数据。
微软也坦言 phi-3-mini 模型虽然通过优质数据在语言理解和推理能力上媲美更大参数的 AI 模型,但在 TriviaQA 等某些任务上依然受到模型规模的限制。
微软还表示 phi-3-small 和 phi-3-medium 两个模型在 MMLU 上的得分分别为 75.3 和 78.2。
今日重点论文:
商汤科技研究:
《MoVA: Adapting Mixture of Vision Experts to Multimodal Context 》
论文提出了一种粗到细的范式,通过上下文感知的专家路由策略和混合视觉专家适配器,自适应地路由和融合任务特定的视觉专家,从而提高了模型的泛化能力。论文设计了一种上下文感知的专家路由策略和混合视觉专家适配器,提出了一种粗到细的范式,有效地利用了基于多模态上下文和模型专业知识的专家表示,进一步提高了泛化能力。在多个挑战性的多模态基准测试中,MoVA相比当前的最先进方法取得了显著的性能提升。论文的代码和模型已经在GitHub上开源。
论文地址:
https://arxiv.org/abs/2404.13046v1
微软研究院:
《MatterGen: a generative model for inorganic materials design》
论文地址:
论文提出了一种新的生成模型 MatterGen,可以生成稳定的、多样化的无机材料,并且可以进一步进行微调以满足广泛的性质约束。实验结果表明,MatterGen 生成的结构更容易是新颖且稳定的,并且更接近局部能量最小值。论文还展示了多属性材料设计的能力,提出了具有高磁密度和低供应链风险的结构。值得进一步研究。
https://arxiv.org/abs/2312.03687v1
华南理工大学:
《Unified Scene Representation and Reconstruction for 3D Large Language Models 》
论文提出了Uni3DR^2,通过冻结预训练的二维基础模型(如CLIP和SAM)和多尺度聚合三维解码器提取三维几何和语义感知表示特征。这种学习到的三维表示不仅有助于重建过程,还为大型语言模型提供了宝贵的知识。论文使用ScanNet数据集进行实验验证,并且在ScanQA数据集上展示了Uni3DR^2-LLM的优越性能。此外,它在ScanQA和3DMV-VQA上均优于使用附加GT点云的最先进方法。值得关注的是,论文提出的Uni3DR^2框架可以进一步推广到其他领域,如机器人视觉和增强现实等。论文开源了代码。
论文地址:
https://arxiv.org/abs/2404.13044v1
阿卜杜拉国王科技大学:
《Language Agents as Optimizable Graphs》
本论文的关键思路是将LLM代理表示为计算图,并使用自动图优化器来改进节点级LLM提示和代理编排,从而提高多模态数据处理的效率。本论文的亮点在于提出了一种新的自动图优化器,可以改进节点级LLM提示和代理编排,同时可以将多个计算图递归地组合成更大的复合图,从而实现代理之间的协作。作者进行了实验来验证该框架的有效性,并开源了代码。值得继续深入研究。
论文地址:
https://arxiv.org/abs/2402.16823v2
北京邮电大学:
《DemoFusion: Democratising High-Resolution Image Generation With No $$$》
论文使用了开源的GenAI模型,并且提出的DemoFusion框架可以轻松地扩展到这些模型上。作者还使用了多个数据集进行了实验,包括CelebA-HQ,FFHQ,LSUN等,实验结果表明DemoFusion可以在高分辨率图像生成方面取得更好的效果。此外,作者还开源了DemoFusion框架的代码,使得更多的研究者可以使用和改进该方法。
论文地址:
https://arxiv.org/abs/2311.16973v1