
公众号
机器之心
专业的人工智能媒体和产业服务平台
这个来源的文章
ICLR2026|山大、理想汽车和中科院联合提出离线强化学习新范式:让Transformer学会「去其糟粕」
通过学习一个片段「剪辑师」,自动从完整轨迹中剪出最精彩的高回报子轨迹给模型学习。
阅读全文 :ICLR2026|山大、理想汽车和中科院联合提出离线强化学习新范式:让Transformer学会「去其糟粕」MLSys 2026 | StreamDiffusionV2: 将视频生成从「离线生成」带入「实时交互」,实现真正可用的生成式直播系统
这不仅是一套可运行的系统方案,更是一种面向未来实时生成场景的设计思路。
阅读全文 :MLSys 2026 | StreamDiffusionV2: 将视频生成从「离线生成」带入「实时交互」,实现真正可用的生成式直播系统AI编程助手竟成「内鬼」?SKILLJECT:当「技能包」变成「特洛伊木马」
这些看似强大的「技能包」,可能正是攻击者控制你电脑的「特洛伊木马」。
阅读全文 :AI编程助手竟成「内鬼」?SKILLJECT:当「技能包」变成「特洛伊木马」有效思考激发多模态智能体决策潜力!清华&北大&腾讯联合提出GTR训练新框架
思维引导的强化学习(Guided Thought Reinforcement, GTR)框架,通过自动化修正器提供过程引导,在 RL 训练中实时优化模型的思路,且无需依赖人类的精细标注。
阅读全文 :有效思考激发多模态智能体决策潜力!清华&北大&腾讯联合提出GTR训练新框架4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法
通过重新设计奖励函数,让模型学会「知之为知之,不知为不知」。
阅读全文 :4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论
在保持高效并行优势的同时,解锁其在复杂推理任务上的Test-Time Scaling潜力
阅读全文 :复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论