昨日,阿里通义大模型公布了「空间音频生成」模型——OmniAudio。据通义团队介绍,OmniAudio 能够直接从 360° 视频生成空间音频。为了解决「如何利用全景视频生成与之匹配的空间音频」这一问题,通义实验室语音团队提出了 360V2SA(360-degree Video to Spatial Audio)任务,旨在直接从 360° 视频生成 FOA(First-order Ambisonics)音频。据悉,FOA 是一种标准的 3D 空间音频格式,能够捕捉声音的方向性,实现真实的 3D 音频再现。受限于现有的配对 360° 视频和空间音频数据极为稀缺,通义团队还为此精心设计并构建了 Sphere360 数据集。该数据集包含大量高质量的 360° 视频和相应的 FOA 空间音频。这是一个包含超过 10.3 万个真实世界视频片段的数据集,涵盖 288 种音频事件,总时长达到 288 小时。另外,OmniAudio 的训练方法分为了「自监督的 coarse-to-fine 流匹配预训练」以及「基于双分支视频表示的有监督微调」两个阶段。目前,OmniAudio 已上架 GitHub 并同步公布了代码、数据开源仓库,以及相关技术论文。项目主页:https://omniaudio-360v2sa.github.io/代码和数据开源仓库:https://github.com/liuhuadai/OmniAudio论文地址:https://arxiv.org/abs/2504.14906
马斯克:下个月交付具备自动驾驶的 Model Y
昨日,马斯克发文称,在过去几天中,在美国奥斯汀公共街道上测试无人驾驶的特斯拉 Model Y,没有发生任何交通事故,其还强调「没有驾驶员在车内」的情况下实现这一目标。同时,马斯克还透露,特斯拉将比原计划提前一个月,6 月开始实现交付具备自动驾驶能力的 Model Y 车型。据悉,特斯拉位于德州奥斯汀的超级工厂主要生产 Model Y 和 Cybertruck 两款车型,同时特斯拉确认该工厂正不断加速焕新版 Model Y 的生产流程。此前曾有报道,特斯拉已为奥斯汀超级工厂生产的 Model Y 和 Cybertruck 部署了「自动驾驶至出厂区」的功能。部署了该功能的车辆能在无需监督的情况下,自动下产线开入交付车辆停车场,从而降低人力运输成本。
据新浪科技消息,日前,胖东来创始人于东来再次将抖音账号设为私密。据悉,昨日早间,于东来曾更新抖音动态,称分享美好的理念和生活方式是为懂他的人而做,不需要支持,不要误读。于东来还解释自己半夜上传视频是因为当地信号不好,视频由网速慢慢自动上传。目前于东来的 IP 地址仍显示在西藏。此前,博主「柴怼怼」多次质疑胖东来售卖低成本玉石牟取暴利,于东来则在「五一」假期期间连续发布多条推文回应「柴怼怼」。于东来发文表示,「如果不让‘柴怼怼’这种随意污蔑伤害他人的行为受到应有的处罚,自己会主动关闭或永远离开胖东来这个企业」。同时,于东来账号也在期间将账号设为私密。