您现在的位置:智能制造网>机器人>资讯列表>蚂蚁灵波LingBot-VA 2.0发布 具身原生全栈技术布局取得关键进展

蚂蚁灵波LingBot-VA 2.0发布 具身原生全栈技术布局取得关键进展

2026年07月14日 09:37:42 人气: 21561 来源: TechWeb.com.cn
  7月10日消息,今日,蚂蚁灵波发布业界首个具身原生世界动作模型 LingBot-VA 2.0。该模型的发布,标志着机器人基础模型正式从“基于数字世界模型构建”到“面向物理世界原生设计”的关键转变。它代表了具身智能发展的一种关键路线选择:机器人“大脑”不再依托数字世界模型能力的“嫁接”,而是从动态建模、因果预测、实时执行等与环境交互的原始需求出发,进行原生设计。
 
  得益于具身原生架构,LingBot-VA 2.0在真机测试中表现出了出色的执行速度和泛化能力。以下面这个视频为例,在不依赖任何外部拍摄设备的情况下,机器人就可以完成与人类的多轮随机对打。
 
  今年以来,世界模型与具身智能怎么融合一直是各方关注的焦点。以终为始,从物理世界的“控制执行”需求出发,就需要持续符合因果规律的“预测能力”。机器人要面对的是一个连续变化的真实世界,不仅要针对当前情况作出反应,还要理解一个动作会引发怎样的环境变化,并据此决定下一步动作。当前行业主流路线大多依托面向数字内容创作的视频生成模型,再通过微调的方式适配机器人控制任务。
 
  然而内容创作和机器人控制有着不同的出发点,内容创作更在意画质和创意,机器人控制则更在意执行效率和预测的合理性。上述这些不同导致数字世界的视频模型和物理世界的视频动作模型在设计之初就有各自的能力侧重点,强行‘微调’把前者适配成后者会带来知识遗忘、泛化性下降等副作用。
 
  LingBot-VA 2.0选择直面问题,探索一条更艰难的路——基于自回归架构从头开始预训练,通过四大核心设计构建原生基模。
 
  首先,模型引入语义视觉-动作分词器(Tokenizer)作为全新的视觉编码器,在视觉压缩过程中加入了语义与动作信息的对齐,使模型在后续的训练中更容易把“理解指令”转化为“完成动作”,有助于指令跟随与提升动作精度。其次,模型采用严格的因果预训练范式,让模型从训练一开始就使用自回归架构,确保视觉预测和动作生成完全遵循单向时间顺序。第三,引入 MoE 架构,在不牺牲推理效率的前提下有效扩大了模型容量,在性能和效率之间取得平衡。最后,通过增强的异步推理机制实现实时闭环控制,在机器人执行动作的同时预测未来状态,并利用最新真实观测不断校正下一步决策。基于这些设计,在行业普遍面临的具身世界模型执行效率低这一问题上,LingBot-VA 2.0给出了单卡150Hz实时推理效率的答卷。
 
  从“干活”的角度出发,机器人需要“看的更清楚”“想的更明白”“干的更利索”。本周,蚂蚁灵波已经连续发布和开源了多款模型,包括:面向空间感知的LingBot-Vision和 LingBot-Depth 2.0、面向“一脑多机”的动作模型LingBot-VLA 2.0、面向实时交互的 LingBot-World 2.0 和面向更高推理效率的视频生成基模 LingBot-Video。上述模型代表着蚂蚁灵波在持续探索具身原生需要的细分方向能力,而 LingBot-VA 2.0 作为集大成者扮演了收官之作的角色,也正式开启了具身原生新阶段。
 
  蚂蚁灵波CEO朱兴表示,一方面灵波将持续探索具身智能新上限,另一方面也将加速构建开放的技术生态和场景生态,助力机器人加速走向产业场景。
 
  据悉,蚂蚁灵波将于7月17日至20日在2026世界人工智能大会(WAIC)期间,全面展示全栈大脑2.0落地场景的能力。
关键词: 机器人,具身智能
全年征稿/资讯合作 联系邮箱:1271141964@qq.com
版权与免责声明
1、凡本网注明"来源:智能制造网"的所有作品,版权均属于智能制造网,转载请必须注明智能制造网,https://www.gkzhan.com。违反者本网将追究相关法律责任。
2、企业发布的公司新闻、技术文章、资料下载等内容,如涉及侵权、违规遭投诉的,一律由发布企业自行承担责任,本网有权删除内容并追溯责任。
3、本网转载并注明自其它来源的作品,目的在于传递更多信息,并不代表本网赞同其观点或证实其内容的真实性,不承担此类作品侵权行为的直接责任及连带责任。其他媒体、网站或个人从本网转载时,必须保留本网注明的作品来源,并自负版权等法律责任。
4、如涉及作品内容、版权等问题,请在作品发表之日起一周内与本网联系,否则视为放弃相关权利。

企业推荐

更多