3 月 19 日 AI 头条:Altman 自曝全新GPT-5细节,能力提升将超乎想象
划重点:
Altman 自曝全新GPT-5细节,能力提升将超乎想象
联想与英伟达合作,推出全新混合 AI 解决方案
谷歌推出多模态 VLOGGER AI:让静态肖像图动起来“说话”
微软 Win11 Dev / Canary 渠道测试新特性:右键菜单新增 Copilot 按钮,支持文本总结
音视频AI神器“通义听悟”重磅升级:超长视频自由问,还会做思维导图
完美世界端游《诛仙世界》接入英伟达 Audio2Face 技术,可根据音频生成角色表情
美国 FTC 已就 Reddit 向 AI 公司分享用户生成内容发起非公开调
资讯详情:
Altman 自曝全新GPT-5细节,能力提升将超乎想象
Sam Altman 于当地时间3月19日做客播客节目Lex Friedman,并在采访最后透露了不少关于 OpenAI 的计划。其中还包括即将推出的大语言模型GPT-5。
据 Altman 透露,GPT-5的性能会全面提升,GPT-5和GPT-4的差距,可能会跟GPT-4和GPT-3一样大,仍旧在研究OpenAI机器人。不过目前 Altman 尚未公布 GPT-5究竟何时发布。Altman 表示,OpenAI 将会在今年推出一款新模型,但还没确定会叫什么名字。
联想与英伟达合作,推出全新混合 AI 解决方案
当地时间 3 月 18 日,全球 AI 盛会 GTC(GPU Technology Conference)2024 于圣何塞会议中心正式开幕,联想集团与英伟达在会上宣布合作推出全新混合人工智能解决方案。
联想表示,此次合作将“帮助企业和云提供商获得在人工智能时代成功所需的关键的加速计算能力,将人工智能从概念变为现实”。联想混合解决方案已经针对运行 NVIDIA AI Enterprise 软件进行了优化,官方表示能够实现“安全、受支持且稳定的生产级”AI,联想还将为开发人员提供刚刚发布的 NVIDIA 微服务,包括 NVIDIA NIM 和 NeMo Retriever。
谷歌近日在 GitHub 页面发布博文,介绍了 VLOGGER AI 模型,用户只需要输入一张肖像照片和一段音频内容,该模型可以让这些人物“动起来”,富有面部表情地朗读音频内容。
VLOGGER AI 是一种适用于虚拟肖像的多模态 Diffusion 模型,使用 MENTOR 数据库进行训练,该数据库中包含超过 80 万名人物肖像,以及累计超过 2200 小时的影片,从而让 VLOGGER 生成不同种族、不同年龄、不同穿着、不同姿势的肖像影片。
博主 PhantomOcean 北京时间今日凌晨在 X 上公布了自己的最新发现:微软Windows 11 的 Dev 和 Canary 渠道正在测试为右键菜单引入 Copilot 按钮,用户可以通过该按钮来完成文本总结等功能。
从功能方面来看,该按钮有望支持对各种各样的文档、表格或 PPT、PDF 文件进行总结,另一个子菜单则显示“发送给 Copilot”,预计为图片识别等类型功能。
阿里大模型产品“通义听悟”发布多项新功能。音视频问答助手“小悟”上线,在业界首次实现单记录、跨记录、多语言自由问,支持对单个最长6小时、一次性上百条音视频的内容理解问答,用户可对超长音视频随心提问,让AI总结任意知识点。此外,针对学习科研场景对AI工具的强烈需求,通义听悟推出“高校公益计划”,向所有中国大陆高校师生直接赠送价值数千元的500小时音视频转写时长。
完美世界游戏官宣,完美世界游戏旗下仙侠 MMORPG 端游 《诛仙世界》 接入了英伟达 Audio2Face 技术(生成式 AI 将音频转为动画技术)。
《诛仙世界》是完美世界游戏旗下首款由虚幻引擎 5 打造的仙侠 MMORPG 端游,本次展示的游戏画面片段,实装了英伟达 Audio2Face 技术,借助生成式 AI 将音频转为面部动画。
完美世界游戏官方表示,英伟达 Audio2Face 技术“提高了开发效率,呈现了更为真实的智能化游戏体验”,该技术特性如下:具有接入难度低且高自动化的特点,提高开发效率;支持多种语言,同时在生成端能够快速输出多语言口型;经过预训练的深度神经网络,会自动操纵脸部、眼睛、嘴部和头部运动,丰富角色的表情。
据 cnBeat 报道,美国联邦贸易委员会(FTC)正就该社交平台将内容向 AI 公司授权一事进行非公开调查。据外媒 Axios透露,还有其他公司也收到了 FTC 的调查信函。
Reddit 于上月申请 IPO,以每股 31~34 亿美元的价格募集最多 7.48 亿美元,总估值接近 65 亿美元。
这一社交平台表示,FTC 此次调查的重点是 Reddit 将用户生成的内容作为 AI 训练素材向第三方出售、许可与共享的行为。FTC 未来将要求这家社交平台提供更多的信息和文件,以增进对这笔交易的了解。
《GPQA: A Graduate-Level Google-Proof Q&A Benchmark 》
本论文提出了一个高质量、极具挑战性的多项选择题数据集GPQA,用于进行可扩展的监督实验,以帮助开发可靠的AI监督方法。本论文的数据集GPQA由生物学、物理学和化学领域的专家撰写,难度极高,对于即使是高技能的非专家验证者来说也很难。此外,该数据集对于最先进的AI系统也很具有挑战性。作者还使用了强大的GPT-4模型作为基准线,但其准确率仅为39%。作者希望通过该数据集进行可扩展的监督实验,以帮助开发可靠的AI监督方法。
论文地址:
https://arxiv.org/abs/2311.12022v1
乔治亚理工学院:
《Escalation Risks from Language Models in Military and Diplomatic Decision-Making》
作者们设计了一个新的战争游戏模拟和评分框架,以评估这些代理在不同情境下采取的行动的升级风险。他们发现所有五个研究的预训练语言模型都显示出升级和难以预测的升级模式。与以往研究不同的是,他们的研究提供了定性和定量的见解,并专注于大型语言模型(LLMs)。
论文地址:
https://arxiv.org/abs/2401.03408v1
《Approaching Human-Level Forecasting with Language Models》
本文开发了一种检索增强的语言模型系统,用于自动搜索相关信息、生成预测并聚合预测结果,通过大量竞争性预测平台的问题数据集进行测试,结果表明该系统的预测准确性接近或超过人类预测者的聚合结果。论文使用了竞争性预测平台的问题数据集进行测试,开发了一种检索增强的语言模型系统,该系统的预测准确性接近或超过人类预测者的聚合结果。
论文地址:
https://arxiv.org/abs/2402.18563v1
《Large language models surpass human experts in predicting neuroscience results》
本文利用大型语言模型(LLMs)对神经科学文献进行训练,可以更好地预测实验结果,甚至优于人类专家。通过创造 BrainBench 基准测试,证明了这一点。在神经科学文献上进行调整的 LLMs,BrainGPT,效果更好。实验结果表明,LLMs可以更好地预测神经科学实验结果,这为人类和LLMs共同发现新的科学发现奠定了基础。该方法不仅适用于神经科学,还可以推广到其他知识密集型领域。论文还开源了BrainBench基准测试和BrainGPT模型。
论文地址:
https://arxiv.org/abs/2403.03230v1
《Dynamical Regimes of Diffusion Models 》
论文提出了一种通过谱分析和数据中过量熵的估计来确定数据集中的分化时间和崩溃时间的方法,以此来解决扩散模型中的维度诅咒问题。论文的亮点包括通过分析高维高斯混合模型等简单模型得出的理论结果,以及对复杂情景的扩展和真实数据集的数值验证。论文还提到了开源代码和值得进一步研究的工作方向。
论文地址:
https://arxiv.org/abs/2402.18491v1