机器人断网也能干活!谷歌推出离线VLA模型,这些国内公司有布局→

VLA模型,已经成为具身智能当前最热的技术趋势。

近日,谷歌推出了自身最强大的VLA(Vision-Language-Action,视觉-语言-动作)模型Gemini Robotics On-Device。据介绍,这款机器人端侧模型运行时无需依赖数据网络,可以完全在机器人设备本地离线运行,并在多种测试场景中实现了强大的视觉、语义和行为泛化能力,能理解自然语言指令,并完成拉开拉链、折叠衣物等高灵巧度任务。

具身智能领域的关键新范式,VLA让机器人拥有了将语言意图、视觉感知与物理动作编织成连续决策流的能力。记者梳理发现,今年以来,不仅谷歌、微软、Figure AI等海外公司相继发布了自己的VLA模型,银河通用、智元机器人、自变量机器人等国内机器人公司也已在这一领域有所布局。

“机器人版安卓”,50次演示即可学会新动作

今年3月,谷歌DeepMind团队首次推出了新一代专为机器人设计的AI模型Gemini Robotics,被视为“机器人版的安卓”。

这一模型基于Gemini 2.0打造,如同机器人的“大脑”,能够让机器人理解复杂环境、执行精细任务。在谷歌DeepMind展示的演示视频中,Gemini Robotics借助一台双臂机器人,能够流畅地折纸、拉拉链、把皮带安装到齿轮上。

而最新推出的Gemini Robotics On-Device,则是专为在机器人设备本地运行而优化的模型。业内人士分析称,具身智能的发展一直以来受限于对云计算资源的高度依赖,这使得机器人在网络不稳定或无网络的环境中难以独立作业。同时,模型体积庞大,在机器人有限的计算资源上也难以高效运行。

Gemini Robotics On-Device的发布,标志着具身智能从依赖云端算力向本地自主运行的重大转变,为机器人产业的落地应用开辟了新的路径,为机器人在更多场景中的应用提供可能。比如,机器人在无网络的工厂精准装配零件、在灾区废墟中自主救援,这些应用场景都离不开机器人端侧模型的部署。

据介绍,Gemini Robotics On-Device具备三大特点:一是专为灵巧操作的快速实验而设计;二能通过微调来适应新任务进一步提高性能;三是经过优化,可在本地运行并实现超低延迟推理。

此外,谷歌还推出Gemini Robotics SDK,帮助开发者评估Gemini Robotics在设备上的性能,包括在MuJoCo物理模拟器中进行测试。开发者只需50—100个演示即可完成模型评估,让机器人快速学习新技能。

VLA成“必争之地”,这些国内机器人公司也布局了

如果过去十年,机器人领域的焦点先后经历了“看得见”的视觉感知、“听得懂”的语言理解,那么在VLA模型出现之后,机器人开始走向“动得准”的第三阶段。

当下,VLA模型已逐渐成为具身智能行业的共识,被视为连接感知、语言与行为的通用架构。今年6月,在2025北京智源大会上,Physical Intelligence联合创始人兼CEO Karol Hausman表示,VLA是通往通用智能的重要基石,能够让机器人从互联网等多源数据中学习并转化为具体行动。

记者梳理发现,今年以来,不仅谷歌、微软、Figure AI等海外公司相继发布了自己的VLA模型,银河通用、智元机器人、自变量机器人等国内机器人公司也已在这一领域有所布局。

今年6月1日,银河通用正式推出自主研发的产品级端到端导航大模型TrackVLA。这是一款具备纯视觉环境感知、语言指令驱动、可自主推理、具备零样本泛化能力的具身大模型。而在一周后的2025北京智源大会上,银河通用又发布了全球首个面向零售场景的端到端VLA大模型GroceryVLA。

根据现场展示,在现场搭建的1比1还原真实商超场景中,当银河通用创始人兼CTO王鹤向搭载了GroceryVLA的机器人Galbot发出“我又热又饿,帮我拿点吃的”这一指令后,Galbot能够自主精确地移动到准确位置,在货架中为顾客选择饼干和饮料等食物,然后有序地拿取并送到顾客手中,全程无遥控操作,并且无事先采集场景数据。

今年3月,智元机器人发布了首个通用具身基座模型智元启元大模型(Genie Operator-1,简称GO-1),该模型采用了Vision-Language-Latent-Action (ViLLA) 架构,由VLM(视觉语言模型)和MoE(混合专家)组成,实现了可以利用人类视频学习,完成小样本快速泛化。目前,GO-1大模型已成功部署到智元多款机器人本体之中。

此外,智元机器人还联合香港大学推出UniVLA系统。据介绍,UniVLA是一个具备跨机器人本体、场景与任务泛化能力的通用策略学习系统。它通过构建以任务为中心的隐式动作空间,利用语言描述与视频示范进行策略学习,实现从“看视频”、“听指令”到“动手操作”的通用控制。

而作为国内唯一一家从创业第一天就选择了端到端统一大模型技术路线的公司,自变量机器人研发的WALL-A则是世界上最大规模的端到端统一具身大模型。这一模型突破了传统分层架构的噪声传递问题,支持从原始传感器信号到机器人动作的纵向统一和横向任务统一,跨任务泛化能力出色。

今年5月,自变量机器人宣布完成数亿元A轮融资,由美团战投领投、美团龙珠跟投。公司表示,本轮融资将用于持续加速全自研端到端通用具身智能大模型与机器人本体的同步迭代,以及未来多个应用场景的智慧化方案合作和落地。成立起不到一年半时间内,自变量机器人已完成7轮融资,累计融资金额超10亿元。据投资人介绍,公司所坚持的“大小脑统一的端到端大模型”路线,正是多家投资机构青睐自变量机器人的核心原因。

校对:廖胜超

文章来源于网络。发布者:火星财经,转载请注明出处:https://www.sengcheng.com/article/73686.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
火星财经的头像火星财经
日本频繁上演“熊出没” 新干线列车撞熊停运40分钟
上一篇 2025年6月29日 上午11:01
新紫光集团董事、联席总裁陈杰:我国有移动互联网时代的成功经验,最有能力做好AI应用创新
下一篇 2025年6月29日 上午11:01

相关推荐

  • 重庆春节旅游热度居全国城市前列 景区活动丰富多彩

    今年春节假期国内出游热情高涨,假期前两天出游订单量持续攀升。境内游方面,机票、定制游以及包含餐饮玩乐等权益的酒店套餐订单量同比大幅增长;出境游方面,订单规模在去年高基数上继续强劲增长,其中国际邮轮订单量同比增长超6倍。 飞猪数据显示,上海、北京、广州、成都、杭州、重庆、深圳、西安、南京、昆明等是假期前两天旅游热度最高的城市。绵阳、赣州、郑州、镇江、清远等城市…

    2025年1月31日
    29400
  • 预制菜在一片骂声中卖爆 便捷与性价比成选择关键

    进入2025年,许多打工人的精神状态都是人坐在工位上,却在想着家中的年夜饭。尽管很多春节习俗已经消失,但年夜饭依然是中国人过年最重要的仪式感。从准备食材到烹制菜品,家人耗费一整天的时间忙碌,最终端出满满一桌菜,全家人以美食为名实现一年一度的团聚。 预制菜似乎成了年夜饭中的“氛围破坏者”。再高端的食材也只需要最简单的烹饪方法,撕开包装袋,解冻食材,倒在锅里,只…

    2025年2月1日
    28700
  • 成都至达州至万州高铁开建 新时代铁路客站建设启动

    中铁八局负责建设营山西、渠县北、开江南及岳溪四座站房。项目启动后,将遵循“畅通融合、绿色温馨、经济艺术、智能便捷”的理念,致力于打造新时代兼具美观与功能性的铁路客站。 乐至站的建设也在同一天开始了首桩施工。这座高铁站将成为成达万高铁与成渝中线的交汇点,为当地居民提供便利出行条件,并推动乐至县的发展。 成达万高铁全线共设13个车站,包括新建7座车站(乐至、蓬溪…

    2025年2月10日
    27200
  • 一家3口被撞身亡 肇事者为何被判死缓,法律专家解析裁判逻辑

    近日,景德镇市中级人民法院对“一家3口被撞身亡案”作出一审死缓判决后,“肇事者为何被判死缓”成为网友热议的焦点。2024年10月,被告人胡某无证驾驶机动车超速闯红灯,撞上王某一家三口致其当场死亡,如此严重的后果却未被判处死刑立即执行,引发公众对量刑标准的广泛讨论。法律人士表示,死缓判决是法院综合全案情节作出的审慎决定,符合法律规定,体现了罪责刑相适应原则。 …

    2026年1月9日
    37800
  • 家政服务进入过年爆单模式 保姆价格飙升引发热议

    春节前夕,许多家庭在寻找保姆时遇到了困难。上海浦东的黄敏试用了一位保姆,但对方的工作态度和能力远低于她的预期。尽管不满意,她还是不得不高薪雇用这位保姆,因为春节临近,找到一个靠谱的保姆非常困难。 黄敏的经历并非个例。近期,多位雇主反映春节期间找保姆难、保姆涨价等问题。在某社交平台上,“年底找保姆难”成为热议话题,相关跟帖达数万条。 北京市民张洁为了留住家里的…

    2025年1月29日
    31600

发表回复

登录后才能评论
关注微信