图片来源/新华社
■中国经济时报记者 张一鸣 王彩娜
在人工智能浪潮下,具身智能的演变之路也在加速。2026世界人工智能大会(WAIC)期间,中国经济时报记者在中国电信人工智能研究院专访了该院领军科学家白辰甲。他表示,未来两年具身智能的产业扩张速度将十分可观。中国电信正在研发价值驱动型新一代具身大脑,依托世界模型强化机器人对真实物理世界的理解、交互反馈,打通数据闭环、模型自纠错整套体系;完整的数据与模型闭环建成后,模型能力会出现显著的涌现效应。
中国经济时报:今年被视作具身智能落地元年。您认为,当前具身智能高价值落地场景集中在哪些领域?
白辰甲:具身智能落地将遵循循序渐进的三层路径,依次为工业场景、商业场景、家庭场景,市场体量逐层扩大。长期来看,家庭场景是广阔蓝海。
第一是工业场景,当下已有大量成熟高价值应用,覆盖仓储物流、工厂上下料、3C电子加工、企业打包装箱等劳动密集型工序。这类传统自动化设备难以适配柔性多变作业需求,具身机器人可有效补位。
第二是商业场景,对机器人人机交互能力、安全标准要求大幅提升,除操作智能外,还需具备感知、交互双重智能。
第三是家庭场景,技术门槛最高,要求机器人具备通用适配能力,本体硬件、全套算法都要兼顾全天候安全。
整体来看,模型、机器人本体都需要持续迭代优化,从工业切入延伸到商业,最终落地家庭,是行业发展必经之路。
中国经济时报:这条分层落地路径,对应的时间节点是什么?
白辰甲:今年已经有基础搬运、上下料类工业机器人批量落地,同时,导览类商用机器人进入示范应用。今明两年,兼具精细插拔、微小物件操作能力的新一代具身机器人,将大规模走进工业、商业日常场景。这类机器人需要模型同时具备精细操作、环境理解、人机交互多重能力,目前实验室技术已完成验证。家庭场景落地周期更长,预计还需要三年到五年才能规模化普及。从硬件侧看,机器人本体品类持续丰富,涵盖轮式、足式、固定式机械臂,各品类再根据细分工序定制开发;行业已经形成“场景倒推硬件、硬件匹配模型”的研发思路,是产业向好的积极信号。
中国经济时报:行业规模化出货预计何时到来?
白辰甲:去年头部机器人企业全年出货量约5000台;今年头部企业出货量将突破1万台,全行业整体出货规模预计达到10万台。
同时,行业数据积累迎来关键拐点,全年有效操作数据总量有望突破百万小时,将直接驱动具身模型实现质的飞跃。依托模型、本体双向技术突破,明年至后年行业出货量有望冲击10万至20万台量级,产业扩张速度十分可观。
中国经济时报:高质量数据集是制约具身智能发展的核心瓶颈,当前数据采集环节存在哪些痛点?
白辰甲:数据采集的制约分为技术、经济两大维度。
在技术层面,行业主流发展“无感采集”方案,不打断工人正常作业流程,同步采集操作数据。目前,轻量化采集设备不断成熟,包含头环、数据手套、全身背负采集装置,可无缝融入产线、日常工作。中国电信依托全网通信优势搭建完整数据闭环体系,可在窄带宽环境下完成数据传输、存储,海量数据积累后能持续激发模型智能涌现。
在经济层面,采集成本大幅下降。去年一小时高质量操作数据采购价超千元,今年已降至百元区间。采集模式从固定专业厂房重资产采集,转为众包模式,深入产线、家庭实地采集,既丰富数据多样性,也持续压缩采集成本。
整体趋势是数据体量持续扩容,采集方式更自然、数据质量稳步提升,今年百万小时级数据集落地后,行业距离具身智能“GPT时刻”越来越近。
中国经济时报:具身模型实现通用化、无需场景微调的GPT3级别水平,大概需要多久?
白辰甲:当前国内外头部具身模型,整体能力仅对标GPT2,仅能在指定场景经过二次微调后完成任务。GPT3级别的核心标准是预训练模型具备极强泛化能力,无需针对细分场景二次适配。
想要达到该水平,预计还需要一至两年。核心变量在于全行业数据共享程度、原生具身大模型研发进度、世界模型技术迭代。我们正在研发价值驱动型新一代具身大脑,依托世界模型强化机器人对真实物理世界的理解、交互反馈,打通数据闭环、模型自纠错整套体系。完整的数据与模型闭环搭建完成大概需要一年,届时模型能力会出现显著涌现效应。
中国经济时报:当下大量资本、跨行业企业涌入具身智能赛道,您如何看待行业现状?
白辰甲:不同的跨界企业各有核心优势。自动驾驶团队可输出标准化数据闭环、大模型迭代体系;大语言、多模态研发厂商擅长超大规模训练集群调度、大脑模型迭代。
但具身智能不是单一模型项目,属于完整系统性工程,分为云端“大脑”、机器人端“小脑”、本体硬件、传输通信四大板块。大脑模型体量庞大无法直接部署在机器人终端,需要“大小脑”协同、搭配全网数据闭环迭代。
同时,系统具备安全冗余设计,即便云端“大脑”失效,终端“小脑”也可保障机器人本体基础安全。中国电信依托全网资源,在端边云协同、低时延传输环节可以提供完整支撑。
我们正在研发价值驱动型新一代具身大脑,核心是把具身大脑从“预测下一步动作”推进到“判断目标达成概率”。我们提出的Value-Action Model正是围绕这个问题展开的,它让模型不再只看“会不会动”,而是知道离目标还有多远、哪个未来更值得到达、失败后如何更新。
这里想强调一点:具身智能真正有价值的数据,往往不是平稳成功的数据,而是那些暴露模型盲区的失败数据。我们在0.9B-VLA的实证中,通过3-4小时、100次介入,可以把能力从0%起始成功率提升到90%以上,而传统微调要达到类似效果需要100倍以上的数据。这说明具身智能的核心不只是买更多机器人采更多数据,而是捕捉最有价值的失败数据,并让它高效进入模型进化。
总 监 制 丨 杨玉洋 车海刚
监 制 丨陈 波 刘卫民
审 核丨 周子勋 编 辑丨蒋 帅