
公众号
机器之心
专业的人工智能媒体和产业服务平台
这个来源的文章
人人都是导演:CineCtrl首个实现视频生成中的相机运镜与摄影效果统一控制
实现了对视频相机外参轨迹与摄影效果的独立、精细、协调控制。
阅读全文 :人人都是导演:CineCtrl首个实现视频生成中的相机运镜与摄影效果统一控制LeCun的JEPA已进化为视觉-语言模型,1.6B参数比肩72B Qwen-VL
这是第一个基于联合嵌入预测架构,能够实时执行通用领域视觉-语言任务的非生成模型。
阅读全文 :LeCun的JEPA已进化为视觉-语言模型,1.6B参数比肩72B Qwen-VL布局控制+身份一致:浙大提出ContextGen,实现布局锚定多实例生成新SOTA
将布局控制与身份保持的挑战转化为统一的上下文建模问题。
阅读全文 :布局控制+身份一致:浙大提出ContextGen,实现布局锚定多实例生成新SOTA从「金砖理论」到「The Messy Inbox」,a16z 合伙人如何看待 AI 时代的护城河?
世界模型输出的「世界」是静态资产、实时帧序列,还是驱动预测与控制的 latent state?
阅读全文 :从「金砖理论」到「The Messy Inbox」,a16z 合伙人如何看待 AI 时代的护城河?大模型「越想越错」?人大&腾讯团队用信息论揭示:什么时候该想、什么时候别想
AI推理的未来不在更长,而在更聪明。
阅读全文 :大模型「越想越错」?人大&腾讯团队用信息论揭示:什么时候该想、什么时候别想