蚂蚁集团旗下AI科研机构蚂蚁灵波于2026年7月8日正式开源具身基座模型LingBot-VLA 2.0,该模型以突破具身智能泛化能力著称,一举支持超过20种机器人构型,标志着国内具身智能研究在"通用化"方向上取得了实质性进展。具身智能的终极目标是让机器人像人类一样,在多样化环境中自主理解任务并完成动作执行,而泛化能力不足一直是制约这一目标实现的核心瓶颈。

所谓"泛化能力",是指机器人在面对训练数据中未曾出现的场景时,依然能够做出合理反应的能力。传统机器人依赖针对特定任务的大规模数据采集,每换一种应用场景几乎意味着从零开始训练,数据成本高、部署周期长、场景适应性差。LingBot-VLA 2.0通过多构型协同训练框架,让同一个基座模型学会了理解不同机器人身体的运动约束与感知特性,从而在新品类机器人上无需重新训练即可实现有效控制。
这项突破的背后,是蚂蚁灵波在大模型与机器人控制交叉领域的长期积累。VLA(Vision-Language-Action)架构将视觉感知、自然语言理解与运动控制整合在统一框架下,机器人不仅能"看懂"环境、"听懂"指令,还能将高层意图转化为精确的电机控制信号。2.0版本在此基础上引入了物理常识推理模块,使机器人在遭遇意外障碍时能够自主规划替代路径,而非简单地停止运行。
除了技术突破,LingBot-VLA 2.0的全量开源也引发了产业界的高度关注。在具身智能领域,开源社区与商业闭源之间长期存在技术积累不对称的问题——少数科技巨头凭借数据与算力优势持续领先,而中小创业公司难以追赶。此次蚂蚁灵波选择将2.0版本完全开源,意味着全球研究者与开发者都可以在开源模型基础上进行二次开发,有望显著加速整个具身智能生态的繁荣。
从更宏观的视角来看,具身智能是实现通用人工智能(AGI)的必经之路。与单纯处理文字与图像的大语言模型不同,具身智能要求AI与物理世界直接交互,面临环境不确定性、因果推理、安全约束等多重挑战。LingBot-VLA 2.0的开源,为这一领域的研究者提供了重要的基础设施级工具,同时也展示了中国AI科研力量在前沿领域的持续创新能力。