
公众号
机器之心
专业的人工智能媒体和产业服务平台
这个来源的文章
Stable Diffusion 3论文终于发布,架构细节大揭秘,对复现Sora有帮助?
透露了关于Stable Diffusion 3的更多细节
阅读全文 :Stable Diffusion 3论文终于发布,架构细节大揭秘,对复现Sora有帮助?ICLR 2024 | 为音视频分离提供新视角,清华大学胡晓林团队推出RTFS-Net
RTFS-Net 是第一个采用少于 100 万个参数的视听语音分离方法。
阅读全文 :ICLR 2024 | 为音视频分离提供新视角,清华大学胡晓林团队推出RTFS-NetICLR 2024 Oral:长视频中噪声关联学习,单卡训练仅需1天
本文提出的长视频学习方法能够以较低资源开销扩展到更广泛的视频数据中。
阅读全文 :ICLR 2024 Oral:长视频中噪声关联学习,单卡训练仅需1天精彩程度堪比电视剧,马斯克与奥特曼、OpenAI的「爱恨纠缠史」
从一开始的合作伙伴,到现在的斗争不休,两人的恩恩怨怨还在继续。
阅读全文 :精彩程度堪比电视剧,马斯克与奥特曼、OpenAI的「爱恨纠缠史」复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持
AnyGPT可以理解文本、语音、图像、音乐等多种模态交织的指令,并能熟练地选择合适的多模态组合进行响应。
阅读全文 :复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持CVPR 2024满分论文:浙大提出基于可变形三维高斯的高质量单目动态重建新方法
这是首个使用变形场将 3D 高斯拓展到单目动态场景的工作。
阅读全文 :CVPR 2024满分论文:浙大提出基于可变形三维高斯的高质量单目动态重建新方法RNN效率媲美Transformer,谷歌新架构两连发:同等规模强于Mamba
其中Griffin混合模型最高可以扩展到14B参数规模。
阅读全文 :RNN效率媲美Transformer,谷歌新架构两连发:同等规模强于Mamba大一统视频编辑框架:浙大&微软推出UniEdit,无须训练、支持多种编辑场景
UniEdit搞定多种视频编辑场景,轻松部署,对用户友好。
阅读全文 :大一统视频编辑框架:浙大&微软推出UniEdit,无须训练、支持多种编辑场景清华、哈工大把大模型压缩到了1bit,把大模型放在手机里跑的愿望就快要实现了!
把大模型放在手机里跑的愿望就快要实现了。
阅读全文 :清华、哈工大把大模型压缩到了1bit,把大模型放在手机里跑的愿望就快要实现了!