具身智能:从倒好一杯咖啡 迈向真实世界
大模型掀起技术浪潮,具身智能正随之快速崛起。尤其今年春节以来,各类面向C端应用的机器人层出不穷,从波士顿动力的机械舞者到特斯拉的Optimus,具身智能的进化轨迹正从实验室走向生活场景。人们一边发现机器人能够完成各类任务,例如跳舞、功夫,展示了出色的运动能力,一边更期待着机器人能走进日常生活,服务于人。
大家可能好奇,为什么有的团队选择跳舞?而我们选择倒咖啡?
这要从具身智能的不同研究方向说起。具体来看,具身智能主要包括三大功能板块:运动、操作和导航。机器人跳舞等属于运动能力,更偏向宏观范畴,主要考量强大的控制能力和平衡能力。但是当前具身智能走向真实复杂场景应用,面临的主要挑战是机器人的精准操作能力,比如:取物品、洗衣、做饭等,真实世界的拥有较强的操作能力,需要机器人能够应对不确定的真实环境、提高操作成功率、实现流畅的人机交互。
倒咖啡这个看似简单的动作,实则暗含具身智能的三个考验:意图理解能力、动态环境感知、毫米级的触觉反馈,涉及人机交互、意图理解、世界模型(周围环境的感知)等综合技术融合。我们选择了这个任务来做技术测试,期望实现具身智能在操作、触觉等微观层面突破。
为了让具身智能走向实际应用,首先要解决两个难题:数据荒漠与操作瓶颈。一是数据量问题,具身智能数据量较少,并且类型异构多样,有视觉、力觉、触觉等不同传感器数据,如何采集并高效利用挑战极大;二是精细化操作能力不足,真实物理世界是动态多变且具备各种约束情况,对精细化操作提出了很高要求,目前整个机器人行业都在研究更好地运用最基础的触觉信息。
基于此,京东探索研究院在三个方向进行了深入探索:
基于真实场景从0-1
打造具身智能系统技术架构
京东探索研究院开发了一套高扩展性的具身智能系统架构,解决了真实场景下多模块耦合复杂、扩展性差、难以适应新任务的挑战。基于ROS平台构建的系统通过主调度模块协调各组件,实现导航、感知、任务规划、远程操作等多种控制模式,并采用模型异步推理、GRPC协议和子母路由通信机制克服了通信延迟和推理速度问题。该架构已成功应用于咖啡机器人场景,突破了简单结构化的实验室场景局限,成功率达到80%,为具身智能技术在真实环境中的应用奠定了基础。
面向双臂灵巧手
构建高频率一体式遥操技术
开发了面向双臂灵巧手的一体式高频率遥操技术,解决了传统同构遥操方式需额外配置机械臂、不同结构机器人无法共享、扩展性及便捷性低的问题,同时克服了双臂和灵巧手一体式遥操对同步性及延迟率高要求的难题。
通过创新结合惯性动捕和视觉动捕技术的遥操设备设计,实现了机器人对人类动作的精准复刻,并借助手和臂数据透传技术优化了从动作捕捉到控制执行的高频率跟随链路。该技术具备轻量化、价格低廉和扩展性强特点,使双臂灵巧手的整体控制频率达50Hz以上,系统延时控制在50ms以内。
少量数据下
实现物体位置的泛化操作
提出了基于末端模仿的泛化操作方法,解决了传统具身操作方法需依赖大量示教数据和计算资源才能实现泛化性能的难题。
该方法聚焦于统一的操作轨迹学习,通过操作物体感知与位姿估计、预操作位姿到达和聚集物体的策略学习等核心模块,并设计了专注于物体的视觉特征提取模块增强对核心操作区域的感知,实现了在少量数据条件下的物体位置泛化操作。作为首个聚焦核心操作轨迹的学习方法,在打咖啡任务中成功率超过90%,并在多种抓取任务(拿扫码枪、抓娃娃、搬箱子等)中比基准方法提升了50%以上的成功率。
今年,京东探索研究院构建出国内首个双臂移动机器人操作数据集JD ManiData,并进行开源,同时联合多家机构推出了基于三轮数据驱动的原子技能库构建框架,解决当前具身智能数据匮乏困境。
京东探索研究院将持续优化具身智能技术以快速应用于新场景,通过整合"视觉-语言-动作"大模型与预训练和强化学习方法,提高机器人的操作成功率和泛化能力。通过倒咖啡等更多任务的不断验证,将技术扩展到更广泛的业务领域,如服务陪伴机器人、智能导购机器人、家庭机器人和取快递机器人等,加速具身智能的技术探索与产业应用。
ABOUT 京东探索研究院
京东探索研究院(JD Explore Academy)秉承“技术为本,让生活更美好”的京东集团使命,是以京东集团以各事业群与业务单元的技术发展为基础,集合全集团资源和能力,成立的专注前沿科技探索的研发部门,是实现研究和协同创新的生态平台。京东探索研究院深耕泛人工智能领域,包括“大模型”、“具身智能”、“多模态智能”,汇聚了毕业自多个国内外知名高校的多名算法科学家,从基础理论层面实现颠覆式创新,助力数智化产业发展及变革。以原创性科技赋能京东集团零售、物流、健康、科技等全产业链场景,打造源头性科技高地,实现从量变到质变的跨越式发展,引领行业砥砺前行。
推荐阅读