Terminal-Bench解决率暴涨20%!华为CLI-Gym:环境交互类任务首个公开的数据Scaling方案
CLI-Gym 是第一种用于扩展 CLI 代理编码任务训练环境的公开方法。
阅读全文 :Terminal-Bench解决率暴涨20%!华为CLI-Gym:环境交互类任务首个公开的数据Scaling方案
专业的人工智能媒体和产业服务平台
CLI-Gym 是第一种用于扩展 CLI 代理编码任务训练环境的公开方法。
阅读全文 :Terminal-Bench解决率暴涨20%!华为CLI-Gym:环境交互类任务首个公开的数据Scaling方案SIE 框架的提出,为大模型推理能力的后训练提供了一条无需依赖昂贵人工标注的新路径
阅读全文 :ICLR 2026 | 上海交大提出结构化上下文环境框架,打破RL环境扩展瓶颈,激活LLM通用推理泛化高质量的 LLM Embedding Model 并不必然意味着高昂的在线推理成本。
阅读全文 :ICLR 2026|把LLM Embedding Model算力瓶颈,从Query侧彻底移走,LightRetriever来了作为计算机视觉领域的顶级会议,CVPR 2026 将于 6 月 3 日 - 7 日于美国丹佛举办。 根据邮件通知内容,CVPR 今年共有 16,092 篇投稿进入审稿流程(此数字不包括在审稿过程中被撤回或直接拒稿的论文)。程序委员会最终推荐录用 4,090 篇论文,录用率为 25.42%。 此外,CVPR 官方将于近…
阅读全文 :刚刚,CVPR 2026放榜!朋友圈刷屏Code2Bench的本质是一套可持续演进的评测基础设施。
阅读全文 :ICLR 2026 | 北航开源Code2Bench:双扩展动态评测,代码大模型告别躺平刷分当应用可以随用随建,我们还需要那个臃肿的应用商店吗?
阅读全文 :App Store模式过时了,未来属于即兴创作!Karpathy激进言论被「怼惨」在ARC-AGI-2上,3.1 Pro取得了经验证的77.1% 成绩,其推理性能是3 Pro的两倍以上。
阅读全文 :谷歌夺回王座:Gemini 3.1 Pro来了!姚顺宇:后面还有更好的「记住」每次探索的经验,在多个探索轨迹之间传递经验,实现渐进式的智能搜索。
阅读全文 :让AI智能体「记住」失败经验:微软提出Re-TRAC框架,4B性能SOTA,30B超越358B通过在数据端或模型端引入互补视角的自监督信号,稳定奖励获取,提升 RL 过程中模型奖励投机的难度
阅读全文 :ICLR 2026 | 数据缺少标注,RL还能稳定诱导模型推理吗?Co-rewarding提供自监督RL学习方案!