
这意味着,机器人行业正从“一个动作训练一个模型”,走向能够理解任务、调用技能、发现错误并继续执行的通用智能系统。
今天重点解读
机器人基础模型。
机器人基础模型
机器人基础模型到底是什么
传统机器人依靠工程师提前编写程序,规定机械臂移动到什么位置、夹爪什么时候开合。这种模式适合焊接、搬运、喷涂等标准化场景,但环境、物体或者流程稍微变化,通常就需要重新调试。

机器人基础模型要改变的,就是这种开发方式。它通过大规模图像、视频、文本、仿真数据和机器人动作数据训练,让机器人理解自然语言、识别物体、判断空间关系,并生成可以直接执行的动作。
按照功能,机器人基础模型大致可以分为三层。
第一层是视觉语言动作模型,也就是VLA。它接收摄像头画面、语言指令和机器人状态,直接输出关节、末端执行器或者移动底盘的动作。

第二层是具身推理模型。它不负责每一个电机怎么转动,而是负责理解任务、制定计划、判断进度和调用底层技能,更接近机器人的高层大脑。
第三层是世界模型与端侧模型。世界模型预测动作可能带来的物理结果,帮助机器人提前判断风险;端侧模型则解决网络延迟、连接中断、数据隐私和实时控制问题。
三层能力逐步结合,机器人才能从听懂一句指令,走向连续完成几分钟甚至更长时间的复杂任务。
核心技术从动作生成走向完整闭环
机器人基础模型的第一项核心技术,是VLA。
过去,视觉识别、语言理解和动作控制,通常由不同模块完成,信息需要在多个系统之间不断转换。

VLA把三者放进同一个模型。机器人看到桌面上的杯子,听到“把杯子放进水槽”,就能直接生成连续动作。
但VLA擅长执行,不一定擅长长任务。一旦任务包含十几个步骤,或者中途出现物体滑落、位置变化,模型很容易偏离原计划。

所以,第二项核心技术是分层推理。
Gemini Robotics ER 2会持续观看机器人视频,判断任务进行到哪一步,识别抓取失败、液体洒出或者物体错位,并让机器人重新尝试失败步骤,而不是从头开始。
高层模型负责理解任务和规划步骤,底层模型负责快速、稳定地控制身体。这种分层架构,更适合复杂机器人。
第三项核心技术,是跨本体迁移。
不同机器人在手臂长度、关节数量、传感器和控制频率上差异很大。过去在一台机器人上采集的数据,很难直接用于另一台机器人。
新一代模型开始学习动作背后的通用语义,再通过少量数据适配具体本体。
英伟达GR00T、Physical Intelligence的π系列,以及国内陆续出现的跨本体VLA,都在沿着这个方向推进。
竞争重点不再只是模型参数,而是同一套能力能否跨越机械臂、轮式机器人和人形机器人。

第四项技术,是数据与持续学习。
互联网拥有海量图像和文本,但高质量机器人动作数据仍然稀缺。
一段机器人数据不仅包括画面,还包括关节位置、速度、力矩、触觉和执行结果。真实机器人采集成本高、速度慢,还可能损坏设备。
所以,行业正在同时使用真人遥操作、仿真生成、人类视频、合成轨迹和机器人自主试错。
未来模型部署得越多,收集的失败数据和修正数据越多,模型就越容易形成数据飞轮。
产业链价值向“大脑”上移
机器人基础模型的上游,包括训练芯片、端侧计算平台、摄像头、力觉和触觉传感器、机器人本体,以及仿真软件和数据采集设备。
这里最稀缺的资源,不是普通视频,而是带有动作、状态和执行结果的高质量具身数据。能够覆盖不同机器人、不同场景和不同任务的数据集,会直接影响模型的泛化能力。

中游是产业链的核心,包括基础模型研发、数据平台、仿真训练、模型微调、推理部署、任务编排和安全评测。
谷歌DeepMind、英伟达、Physical Intelligence和Meta,分别从VLA、机器人开发平台、通用控制模型和世界模型切入。国内企业则围绕全身控制、移动操作、工业场景和家庭任务,加快模型训练和本体适配。
下游包括工业制造、仓储物流、商业服务、医疗康养、家庭服务和危险环境作业。
短期内,基础模型不会直接取代传统工业控制,而会先进入变化较多、人工编程成本较高的场景,比如柔性分拣、混线装配、料箱取物、巡检和复杂物料搬运。
家庭场景空间更大,但安全、成本和长时任务成功率的要求也更高。
现阶段,机器人硬件、系统集成和现场服务,仍然占据大部分价值量。
但随着本体逐步标准化,模型授权、数据服务、端侧运行平台和技能商店的价值占比会提高。
真正掌握跨本体模型、真实数据和部署反馈的平台,有机会成为机器人产业的软件底座。
机器人基础模型靠什么赚钱
第一种模式,是模型授权和API服务。机器人厂商调用具身推理模型,完成任务拆解、视觉理解和技能调用,按照调用量、设备数量或者功能模块付费。
第二种模式,是基础模型加开发平台。企业同时提供预训练模型、仿真环境、数据管线、微调工具和端侧运行系统,帮助机器人厂商缩短开发周期。

第三种模式,是模型与机器人整机绑定。企业销售机器人,同时持续提供软件升级、任务技能和运维服务。客户购买的不再只是一台硬件,而是机器人持续学习和增加技能的能力。
第四种模式,是按结果收费的机器人服务。在仓储、清洁、巡检等场景,客户不购买机器人,而是按照工作时长、搬运数量或者完成任务付费。
这个行业最大的成本,不只是训练模型所需的算力,更在于真实数据采集、机器人损耗、人工遥操作、现场测试和安全验证。
模型可以复制,但高质量数据和真实部署经验很难快速复制。
未来行业会怎样演变
未来机器人基础模型改变的,不是让机器人多学会几个动作,而是降低每增加一种任务所需要的开发成本。过去,一台机器人对应一套程序;未来,一套基础模型可能服务多种本体,再通过少量数据适配具体场景。
行业的终局,也不会是一个模型控制所有机器人,而是通用基础模型、专业技能模型和本地安全控制,共同组成机器人的智能系统。

当机器人能够理解任务、拆解步骤、调用工具、发现错误并继续工作,具身智能才真正从自动化设备,走向可以持续学习的物理智能。
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。