GenAI新世界

3 月 13 日 AI 头条:微软 Copilot 全面升级 OpenAI GPT-4 Turbo 模型,包括免费用户

Image

划重点:
  • 微软 Copilot 全面升级 OpenAI GPT-4 Turbo 模型,包括免费用户
  • 全球首位 AI 软件工程师 Devin 问世:能自学新语言、开发迭代 App、自动 Debug
  • Deepgram 推出文本转语音 API "Aura" 为 AI 代理提供声音
  • 专家利用 GPT-4V 模型运行该游戏《毁灭战士》
  • 生成式 AI 视频初创公司 Tavus 融资 1800 万美元,将面部和语音克隆引入任何应用程序
  • DoorDash 的新型人工智能“SafeChat+”工具可自动检测辱骂行为

资讯详情:

微软 Copilot 全面升级 OpenAI GPT-4 Turbo 模型,包括免费用户

网友 Mikhail Parakhin 发文透露,在经过一系列工作之后,微软现已针对 Copilot 用户群全面升级为 OpenAI 最先进的 GPT-4 Turbo 模型。

CopilotPro 用户如果不习惯的话还可以切换回标准 GPT-4 模型,但免费用户是没有选择权的。

Image


全球首位 AI 软件工程师 Devin 问世:能自学新语言、开发迭代 App、自动 Debug

初创公司 Cognition 近日发布公告,宣布推出全球首个 AI 软件工程师 Devin,并号称会彻底改变人类构建软件的方式。

Devin 在 SWE-bench 编码基准测试中取得了突破性的成功,展示了其执行复杂任务的能力,甚至超越了顶尖的人类工程师。

Devin 擅长长期推理能力,可以自主规划和完成软件项目,并在此过程中做出数以千计的准确决策。

Image



Deepgram 推出文本转语音 API "Aura" 为 AI 代理提供声音

据 TechCrunch 报道,Deepgram已成为语音识别领域的首选初创公司之一。今天,这家资金雄厚的公司宣布推出Aura,其新的实时文本转语音 API。Aura 将高度逼真的语音模型与低延迟 API 相结合,使开发人员能够构建实时的对话式 AI 代理。在大型语言模型 (LLM) 的支持下,这些代理可以在呼叫中心和其他面向客户的情况下代替客户服务代理。

Image


专家利用 GPT-4V 模型运行该游戏《毁灭战士》

英国约克大学研究员 Adrian de Wynter 近日发表研究论文《Will GPT-4 Run DOOM?》,探讨了如何让 GPT-4V 模型来玩《毁灭战士》游戏。

de Wynter 为此设计了一个系统,使用 GPT-4V(GPT4 的多模态衍生版本,可以接收图像作为输入)捕捉游戏引擎的画面截图,并返回游戏状态的结构化描述。

根据测试结果,目前 GPT-4V 运行《毁灭战士》游戏存在几个问题:GPT4 缺乏对象永久性,这意味着游戏中的敌人没有出现在屏幕画面中,它会忘记他们;GPT4 在推理和清晰解释自己的行为方面也很吃力,经常提供错误信息。

尽管存在这些局限性,但 de Wynter 认为,GPT4 能够在没有事先训练的情况下玩 DOOM,这一点非常了不起。

Image


生成式 AI 视频初创公司 Tavus 融资 1800 万美元,将面部和语音克隆引入任何应用程序

据TechCrunch 报道,avus是一家成立四年的生成式 AI 初创公司,帮助公司为自动化个性化视频活动创建个人的数字“复制品”,该公司已确认获得 1800 万美元的新资金,并透露正在向第三方开放其平台,以便将其软件与公司的技术。
8 月份有报道称 Tavus 筹集了“约 1800 万美元”,但细节很少。该公司现已向 TechCrunch 证实,它确实在由Scale Venture Partners领投的 A 轮融资中筹集了 1800 万美元。

Image


DoorDash 的新型人工智能“SafeChat+”工具可自动检测辱骂行为
据 TechCrunch 报道,DoorDash 被称为“SafeChat+”,它利用人工智能技术来审查应用内对话,并确定客户或 Dasher 是否受到骚扰。根据具体情况,将有一个报告事件的选项,如果您是客户,请联系 DoorDash 的支持团队;如果您是送货员,请快速取消订单。如果司机受到虐待,他们可以取消送货,而不会影响他们的评分。DoorDash 还将向用户发送警告,要求其不要使用不当语言。

该公司表示,人工智能每分钟分析 1,400 多条消息,涵盖“数十种”语言,包括英语、法语、西班牙语、葡萄牙语和普通话。团队成员将调查人工智能识别的所有事件。

Image

今日重点论文:

北京大学人工智能研究所:

《JARVIS-1: Open-world Multi-task Agents with Memory-Augmented Multimodal Language Models》

本文介绍了JARVIS-1,这是一个开放世界的代理,可以在流行但具有挑战性的Minecraft世界中感知多模态输入(视觉观察和人类指令),生成复杂的计划,并执行具体的控制。具体而言,我们在预训练的多模态语言模型上开发了JARVIS-1,该模型将视觉观察和文本指令映射到计划中。计划最终将被分配给目标条件控制器。

论文地址:

https://arxiv.org/abs/2311.05997v1


法国高等师范学院体质实验室:

《Dynamical Regimes of Diffusion Models》

本论文旨在研究大维度数据集中的生成扩散模型,探究反向生成扩散过程中的三种不同动态转变,并对其进行分析。论文提出了一种通过谱分析和数据中过量熵的估计来确定数据集中的分化时间和崩溃时间的方法,以此来解决扩散模型中的维度诅咒问题。论文的亮点包括通过分析高维高斯混合模型等简单模型得出的理论结果,以及对复杂情景的扩展和真实数据集的数值验证。论文还提到了开源代码和值得进一步研究的工作方向。

论文地址:

https://arxiv.org/abs/2402.18491v1


德国宾根大学:

《An Invitation to Deep Reinforcement Learning 》

论文的关键思路是将强化学习作为一种推广的监督学习方法,并提出了一种基于深度强化学习的算法PPO(Proximal Policy Optimization),该算法可以用于最大化非可微目标。论文的亮点包括对强化学习作为监督学习的推广的介绍,以及对PPO算法的详细解释。此外,论文还讨论了如何使用PPO算法解决控制问题、代码生成和对象检测等问题,并提供了实验结果和开源代码。

论文地址:

https://arxiv.org/abs/2312.08365v1


华中科技大学计算机科学学院:

《4D Gaussian Splatting for Real-Time Dynamic Scene Rendering》

本文提出了一种新颖的显式表示方法,包含3D高斯和4D神经体素,同时提出了一种分解的神经体素编码算法,以有效地构建高斯特征。实验结果表明,4D-GS方法在高分辨率下可以实现实时渲染,并且比之前的最先进方法具有相当或更好的质量。作者提供了更多的演示和代码。

论文地址:

https://arxiv.org/abs/2310.08528v2


乔治亚理工学院:

《Escalation Risks from Language Models in Military and Diplomatic Decision-Making》

作者们设计了一个新的战争游戏模拟和评分框架,以评估这些代理在不同情境下采取的行动的升级风险。他们发现所有五个研究的预训练语言模型都显示出升级和难以预测的升级模式。与以往研究不同的是,他们的研究提供了定性和定量的见解,并专注于大型语言模型(LLMs)。

论文地址:

https://arxiv.org/abs/2401.03408v1

Image