NUS、牛津、微软等9机构发布音视频智能综述:系统梳理大模型时代的AVI研究全景
用一张演化树串起十年发展,给出统一 taxonomy、三条主线与六大未来研究轴。
阅读全文 :NUS、牛津、微软等9机构发布音视频智能综述:系统梳理大模型时代的AVI研究全景
专业的人工智能媒体和产业服务平台
用一张演化树串起十年发展,给出统一 taxonomy、三条主线与六大未来研究轴。
阅读全文 :NUS、牛津、微软等9机构发布音视频智能综述:系统梳理大模型时代的AVI研究全景前 1X Technologies AI 副总裁、前 Google DeepMind 机器人研究科学家 Eric Jang 在休假期间想通了哪些事?
阅读全文 :为什么 LLM 难以直接复刻 AlphaGo 的树搜索奇迹?与其模拟下一个文本 Token,不如让机器人去模拟下一个物理世界状态。
阅读全文 :终结VLA?英伟达押注的具身新范式,首篇世界动作模型WAM综述重磅发布不要只选择最高得分的专家,而是在选择高置信专家的同时显式鼓励专家之间的多样性。
阅读全文 :ICML 2026 | 打破「回音室」效应!人大孟澄团队&华为提出集成剪枝视角下的MoE新架构它尝试把Agent从一套不断堆叠技巧的工程系统,重新变成一个可以被分析、被解释、也能够被长期积累的科学对象。
阅读全文 :ICML 2026|智能体的下半场:为什么「答对」已经不够了?在一个创新的「联合专家」模块中,同步完成未来视觉运动的预测与高精度动作序列的生成。
阅读全文 :CVPR 2026 | 突破短视,理解变化!HiF-VLA:以motion为中心打造「边想边做」的世界动作模型一个离散 word,高效统一 Agentic 与 Latent Visual Reasoning。
阅读全文 :Meta华人发布ATLAS,一个词搞定可泛化的视觉推理!Think-at-Hard(TaH):一种面向小模型的选择性潜空间迭代方法
阅读全文 :大模型也会想太多?清华等提出TaH:跳过93%无效迭代,准确率反而提升超越 π0.5、GR00T-N1.5、OpenVLA-OFT
阅读全文 :LIBERO 99%,实测第一:卧安 OneModel 1.7用一条隐式通路打通「看懂」到「做对」