OpenAI的Sora在NVIDIA H100上生成1分钟视频约需12分钟据 analyticsindiamag 报道,根据 Factorial funds 的估算,OpenAI 的 Sora 每台英伟达 H100 每小时产生 5 分钟的视频,相当于每台 H100 每天产生 120 分钟的视频。
该报告进一步补充说,估计大约需要8.9万个英伟达H100 GPU来支持TikTok和YouTube上的创作者社区。将 TikTok 和 YouTube 上由人工智能生成的视频制作结合起来,可以得出每天由人工智能制作的视频总时长为 1070 万分钟。
OpenAI 发布新一批 Sora 实机视频,由部分艺术家试用生成OpenAI 今日放出了一批由 Sora 生成的实机视频,这些视频由 OpenAI 招募的一群艺术家试用生成。这批视频作者包括视觉艺术家、设计师、创意总监和电影制作人等,他们利用尚未发布的 Sora 测试版生成了一批从20秒到一分半不等的短视频。OpenAI 和艺术家们并没有透露创作这些短片的详细指令,也未分享从最初构思到最终成片的过程。据 AppleInsider 报道,苹果计划推出一款 AI 应用商店,该商店或将会在今年 WWDC 上公布。据 Melius Research 技术研究主管 Ben Reitzes 表示,苹果将在6月份为新的AI 应用商店奠定基础。这显然将包括详细说明消费者如何从各种供应商那里获得人工智能应用程序。Meta 推出SceneScript AI 视觉模型,可快速建立3D场景据 Meta 官方消息,Meta 今日推出一款名为SceneScript的视觉模型,可以使用可编程语言来快速建立3D场景。据 Meta 表示,SceneScript可以实时推断房间几何形状,并将相关数据转换为建筑学层面的近似值。高通、谷歌、英特尔或将联手开发 AI 软件,改变英伟达统治格局 The Verge 报道,由英特尔、谷歌、Arm、高通、三星和其他科技公司组成的一个小组正在开发一套开源软件,防止人工智能开发人员被锁定在英伟达的专有技术上,使他们的代码能够在任何机器和任何芯片上运行。这个名为统一加速基金会(UXL)的组织表示,该项目的技术细节应在今年下半年达到 "成熟 "状态,但没有给出最终的发布目标。该项目目前包括英特尔开发的 OneAPI 开放标准,目的是消除特定编码语言、代码库和其他工具等要求,使开发人员不再受使用特定架构(如 Nvidia 的 CUDA 平台)的束缚。努比亚 Z60 Ultra 摄影师版手机支持双向通话 AI 实时翻译努比亚官方今天宣布,旗下 Z60 Ultra 摄影师版手机将会搭载 AI 翻译功能。据官方介绍,该功能拥有两大亮点,支持 AI 双向通话实时翻译和 AI 面对面智慧翻译。目前,官方没有进一步描述 AI 翻译功能的展现形式,尚不清楚该功能是采用类似“同声传译”的形式还是“字幕翻译”形式。此外,努比亚官方还公布 Z60 Ultra 摄影师版手机的其他 AI 功能,如:融合 AI 影像大模型、AI“魔法功能”以及 AI 智慧语音功能。Stability AI 发布最新代码模型升级版本Stable Code Instruct据 Stability AI 官方消息,最新代码模型升级版本Stable Code Instruct 3B现已发布。
Stable Code Instruct3B的引入标志着Stability AI在大型语言模型(LLM)领域的一次重要调整。通过自然语言提示,这个模型能够处理各种任务,包括代码生成、数学问题解答以及其他与软件工程相关的任务。
《Towards Human-AI Deliberation: Design and Evaluation of LLM-Empowered Deliberative AI for AI-Assisted Decision-Making》本文提出了一种新的框架Human-AI Deliberation,以促进人工智能辅助决策中人类反思和讨论冲突的人工智能观点,解决了人类在决策中缺乏分析思维和表达冲突意见的问题。研究团队通过引入大型语言模型作为人类和领域特定模型之间的桥梁,设计了Deliberative AI,以实现灵活的对话交互和忠实的信息提供,从而赋予人工智能决策能力。https://arxiv.org/abs/2403.16812v1《An LLM-Based Digital Twin for Optimizing Human-in-the Loop Systems》论文旨在解决在CPS-IoT应用中,如何实时控制环境以节约能源消耗,同时又能保证人员舒适度的问题,以及如何收集人员偏好的实时反馈数据的难题。论文提出使用大型语言模型(LLMs)来处理CPS优化中动态环境和难以获得的数据的挑战。通过在购物中心中使用LLM代理来模拟不同人群(如年轻家庭、老年人)的行为和温度偏好,将聚合的温度偏好集成到基于代理的强化学习算法AitL-RL中,该算法使用LLM作为物理环境的动态模拟来学习如何在节约能源和保证人员舒适度之间平衡。结果表明,LLMs能够模拟大型开放空间中复杂的人群移动,并且AitL-RL相对于现有的设定点控制策略表现出更好的性能,这表明在CPS-IoT应用中,自适应和个性化决策是提高效率的关键。https://arxiv.org/abs/2403.16809v1《Navigating the EU AI Act: A Methodological Approach to Compliance for Safety-critical Products》本文提出了一种方法,通过利用产品质量模型来解释高风险人工智能系统的欧盟人工智能法案要求。我们首先提出了一个扩展的人工智能系统产品质量模型,包括当前质量模型未涵盖但与法案相关的属性。我们将法案要求映射到相关的质量属性,以便将其细化为可衡量的特征。然后,我们提出了一种基于合同的方法,以在利益相关者层面上推导技术要求。这有助于开发和评估符合既定质量标准,并符合法案对高风险(包括安全关键)人工智能系统规定的监管要求的人工智能系统。https://arxiv.org/abs/2403.16808v1《Exploiting Priors from 3D Diffusion Models for RGB-Based One-Shot View Planning》该论文旨在解决一次性视图规划中需要几何先验的问题,提出一种利用扩散模型作为先验的新方法,以从单个RGB图像开始进行高效的一次性视图规划。该论文的关键思路是将扩散模型作为几何先验引入到一次性视图规划中,从而实现从单个RGB图像开始高效的数据收集。论文的亮点在于使用扩散模型作为几何先验来进行一次性视图规划,从而实现了高效的数据收集。实验结果表明,该方法在物体重建质量和运动成本之间取得了良好的平衡。论文使用了模拟和真实世界的实验,但没有开源代码。https://arxiv.org/abs/2403.16803v1