GenAI新世界

7月30日 AI 头条|苹果 iOS 18.1 开发者测试版上线:新增Apple Intelligence预览

Image
划重点:
  • 苹果 iOS 18.1 开发者测试版上线:新增Apple Intelligence预览
  • 英伟达预计将在本周发布 BlackWell 样品,同时对 NIM进行更新
  • 苹果 Apple Intelligence 提供详细隐私报告
  • runway宣布Gen-3 Alpha上线图生视频功能 艺术控制力更强了
  • 阿里国际自研Agent框架支持巴黎奥运会赛事解说AI应用
  • meta推出 AI Studio 功能,允许用户自行创建 AI 形象
  • 苹果曾利用谷歌硬件训练Apple Intelligence 模型
  • META 发布开源模型 Meta SAM 2,实现视频中实时分割对象
  • 生数科技AI视频生成模型 Vidu 官网全球上线
  • Getty 携手英伟达升级 AI 文生图服务:6 秒生成 4 张照片
资讯详情:
苹果 iOS 18.1 开发者测试版上线:新增Apple Intelligence预览
苹果今天凌晨推出了 iOS18.1的开发者测试版,并为其增加了Apple Intelligence预览。
测试版用户可以通过设置开启Apple Intelligence,体验先行推出的多项 AI 功能。包括书写工具、Siri 的改进设计、在语音命令和文本输入“Siri”之间切换的选项、文字记录和其他内容的摘要、新的邮件类别和智能回复、消息中的智能回复等。   
目前只有支持 Apple Intelligence 的设备才会获得该 Beta 版推送。
Image
英伟达预计将在本周发布 BlackWell 样品,同时对 NIM进行更新
在今天凌晨的SIGGRAPH 2024 大会上,英伟达 CEO 黄仁勋透露,本周英伟达发送 Blackwell 架构的样品,这是今年首发的新款芯片架构。同时,英伟达公布了一系列软件更新,主要涉及用于优化人工智能(AI)推理的云原生微服务——Nvidia inference micro service(NIM),推动企业大规模部署 AI 模型。
今年 3 月英伟达推出 NIM 时介绍,NIM 提供经过优化的推理微服务,旨在缩短上市时间,并简化生成式 AI 模型在云、数据中心和 GPU 加速工作站的任何位置的部署。英伟达今日宣布更新扩大了 NIM 推理微服务库,涵盖了物质世界环境、高级视觉建模和各种垂直应用。同时宣布与 Hugging Face 合作,帮助开发人员使用托管在 Hugging Face Hub 上的开源 AI 模型快速制作原型。   
此外,英伟达推出基于 OpenVDB 的 fVDB,利用现实世界的 3D 数据,打造空间智能。推出 Isaac Lab,为不同的训练环境提供模块化的高保真模拟,提供物质世界 AI 功能和 GPU 驱动的物质世界模拟。
Image
苹果 Apple Intelligence 提供详细隐私报告
据 9to5mac 报道,苹果公司周一开始推出苹果智能功能的预览版,首批测试版包括 iOS 18.1 和 macOS Sequoia 15.1。该公司已经详细介绍了这些功能的工作原理及其背后的隐私机制。
Apple Intelligence 是该公司对其基于人工智能的新功能的称呼。例如,用户现在可以要求系统重新措辞文本,总结信息或电子邮件。这些功能可与设备上和在线语言模型一起使用。不过,为了确保用户的隐私,苹果用自己的芯片创建了私人计算模块(PCC),以端到端加密方式在线处理请求,这样就连公司也无法访问这些数据。   
处理完成后,所有数据将被永久清除。
Image
runway宣布Gen-3 Alpha上线图生视频功能 艺术控制力更强了
据 runway 官方消息,runway现已发布了 Gen-3 Alpha 图像转视频功能。
此更新允许用户使用任何图像作为视频生成的第一帧,可以单独使用,也可以为图片增加问题是便于后续的视频生成。
图像转视频是一项重大更新,它极大地提高了艺术控制力和生成的一致性。   
Image
阿里国际自研Agent框架支持巴黎奥运会赛事解说AI应用
据36氪报道,一批AI技术正在2024巴黎奥运会赛场大显身手。其中,今年奥运会期间将上线首个(奥运领域)大模型应用,这项AI应用由阿里国际参与研发。
据介绍,阿里国际AI团队研发的Agent框架支持了巴黎奥运会赛事解说的AI概念产品,在解说员场景提供AI服务。它能够快速对相应的数据库或文档进行查询搜索,通过数学运算或复杂的推理,回答解说员的具体问题。   
Image
meta推出 AI Studio 功能,允许用户自行创建 AI 形象
据 Meta 官方消息,Meta 已经在美国地区推出 AI Studio 功能,供用户创建自己的 AI 形象。
AI Studio 采用 Llama 3.1 构建,任何人都可以创建和发现 AI 角色,创建者还可以将 AI 作为自己的延伸,从而获得更多粉丝的关注。用户还可以将它分享到平台中,让任何人都能在 Instagram、Messenger、WhatsApp 和网络上发现它并与之聊天。   
用户可自定义 AI 角色的名称、个性、语气、头像和标语。Meta还推出了一份分步指南,其中包含专家提示和最佳实践,帮助用户将人工智能角色变为现实。
Image
苹果曾利用谷歌硬件训练Apple Intelligence 模型
据苹果论文表示,苹果的 AI 系统Apple Intelligence 此前曾利用谷歌设计的云端芯片来进行预训练。
论文显示,苹果可能在初期阶段使用了谷歌的硬件。论文提到,苹果的基础模型(AFM)及其背后的服务器技术最初是在“v4 和 v5p 云端 TPU 集群”上构建的,使用的软件是苹果自研。
为了在 AI 领域赶超微软和 Meta 等巨头,苹果计划在未来两年内投入超过 50 亿美元用于 AI 服务器的升级,并购买数万台 AI 服务器。   
Image
META 发布开源模型 Meta SAM 2,实现视频中实时分割对象
Meta 今天宣布,发布全新开源模型Meta SAM 2,并将其分割能力扩展到了视频领域。
SAM 2 可以分割图像或视频中的任何对象,并在视频的所有帧中实时一致地跟踪该对象。现有模型无法实现这一功能,因为视频中的分割比图像中的分割更具挑战性。在视频中,物体会快速移动,外观会发生变化,还会被其他物体或场景部分遮挡。我们在构建 SAM 2 时解决了其中的许多难题。SAM 2 还可用于跟踪视频中的目标对象,以帮助更快地标注视觉数据,用于训练计算机视觉系统,包括自动驾驶汽车中使用的系统。它还能以创造性地方式,在实时或实时视频中选择对象并与之互动。
该项技术现已开源,以便其他人能够探索新的功能和用例。   
Image
生数科技AI视频生成模型 Vidu 官网全球上线
据生数科技官方消息,AI视频生成模型 Vidu 官网全球上线。Vidu 是一个利用人工智能技术,通过文本或图片生成视频的模型。
Vidu采用了团队原创的U-ViT架构,该架构融合了Diffusion和Transformer技术。这一创新的视频大模型能够快速生成长达16秒、1080P高清视频,同时在模拟真实物理世界的基础上,展现出极高的想象力和创造力。其多镜头生成能力和时空一致性是"Vidu"的显著特点。
自发布以来,"Vidu"在全球范围内取得了显著的突破,其性能已经达到了国际顶尖水平,并仍在不断地迭代和优化。这一成就得益于团队在贝叶斯机器学习和多模态大模型领域的深厚积累,以及多项原创性成果。   
Image
Getty 携手英伟达升级 AI 文生图服务:6 秒生成 4 张照片
据 Getty 官方消息,Getty 已经和英伟达官方达成合作,将联合推出一款商业文生图 AI 模型,可以在短时间内生成多张图片。
Getty Images 表示全新文生图 AI 模型部分基于英伟达 Edify 模型架构,该架构隶属于英伟达 Picasso,主要为视觉设计搭建和部署生成式 AI 模型。该模型可以在6秒之内生成4张照片质感的图片,比以前的模型性能提高了一倍,速度处于行业领先水平。
此外,AI 修图功能现已在 iStock 上推出,不久也将在 Getty Images 上推出。   
Image
今日重点论文:
Sony AI:
《Stretching Each Dollar: Diffusion Training from Scratch on a Micro-Budget》
本论文试图通过降低计算成本,解决大规模文本到图像生成模型的开发集中在具备大量计算资源的人群的问题。论文提出了一种低成本的大规模文本到图像扩散变换器模型训练方法,其中通过在训练期间随机屏蔽高达75%的图像块,来降低变换器的计算成本。论文使用预处理的图像块混合器和专家混合层来提高性能,同时证明了使用合成图像进行微预算训练的关键优势。
论文地址:
https://arxiv.org/abs/2407.15811v1
麻省理工学院:
《Autoregressive Image Generation without Vector Quantization》
本文试图通过扩展自回归模型来解决图像生成中的离散量化问题,提出了一种使用扩散过程模型的连续值自回归模型。本文的关键思路是使用扩散过程模型来代替离散量化,从而实现在连续值空间中进行自回归建模。
论文地址:
https://arxiv.org/abs/2406.11838v1
麦考瑞大学:
《A Philosophical Introduction to Language Models》
论文介绍了语言模型在组成性、语言习得、语义能力、基础、世界模型和文化知识传播方面的应用,探讨了语言模型对人工神经网络的挑战和影响。需要进一步的实证研究来更好地理解它们的内部机制。同时讨论了LLMs的可解释性问题,引入了因果干预方法,讨论了多模态和模块化扩展对LLMs的影响,提出了LLMs是否具备意识的问题,同时也探讨了LLMs是否能够用于建模人类认知的可能性。论文地址:
https://arxiv.org/abs/2405.03207v1
加州大学伯克利分校:
《Transformers on Markov Data: Constant Depth Suffices》
研究transformer在从第k阶Markov过程中建模生成过程的行为,验证其能否捕捉上下文条件分布当训练足够长时,具有固定深度和每层1个头的transformer能够在从第k阶Markov过程中绘制的序列上实现低测试损失,甚至当k增加时也能实现。
论文地址:   
https://arxiv.org/abs/2407.17686v1    
Image