
公众号
机器之心
专业的人工智能媒体和产业服务平台
这个来源的文章
全球首次单机降服万亿巨模DeepSeek-V4!RL后训练框架Orbit开源!
Orbit的价值并不只在于「让大模型变得可训练」,还在于让小模型的RL后训练变得更容易。
阅读全文 :全球首次单机降服万亿巨模DeepSeek-V4!RL后训练框架Orbit开源!Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」
仅仅需要约 1000 小时 的语音训练数据,就可以在 3B 和 7B 参数规模上,实现业界最低 Modality Gap!
阅读全文 :Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统
「我们真正缺的,不只是更大的机器人模型,而是一个能把memory这件事认真评出来、训起来、再落到真机上的benchmark。」
阅读全文 :具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统T-PAMI|中国科大、合工大等提出CAPER++:让关节物体位姿感知真正迈向「又快又稳」
未来有望在家庭机器人、工业自动化以及复杂人机交互等场景中发挥更实际的价值。
阅读全文 :T-PAMI|中国科大、合工大等提出CAPER++:让关节物体位姿感知真正迈向「又快又稳」ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流
把用户的自然语言问题组织成一段可执行、可验证的地理分析流程。
阅读全文 :ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」
为多模态全能助手、长流式记忆与更复杂的人机协同,提供一个更可组合的底座!
阅读全文 :ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」