
公众号
机器之心
专业的人工智能媒体和产业服务平台
这个来源的文章
ACL 2026 Main|混合推理模型也会「钻空子」:南大移动团队提出TNT,破解「假装不思考」骗奖励
仅在奖励层面引入一个动态token上限,便将奖励欺骗概率压制在10%以内。
阅读全文 :ACL 2026 Main|混合推理模型也会「钻空子」:南大移动团队提出TNT,破解「假装不思考」骗奖励ICML 2026 | Agentic强化学习训练的信息自锁问题
为什么 RL 训练出来的 agent 还是不会主动推理?
阅读全文 :ICML 2026 | Agentic强化学习训练的信息自锁问题当AI Agent开始工作,安全该如何跟上?AgentDoG 1.5开源发布
让AI Agent在行动之前、行动之中、行动之后,都有一套可诊断、可扩展、可部署的安全机制。
阅读全文 :当AI Agent开始工作,安全该如何跟上?AgentDoG 1.5开源发布视觉latent reasoning为什么不稳?这篇论文从特征空间找到了关键缺口
GAP 让视觉 latent token 变得可读、可控、可用于推理。
阅读全文 :视觉latent reasoning为什么不稳?这篇论文从特征空间找到了关键缺口