如果给大模型装上身体,它会不会从"会聊天"变成"能干活"?
10月5日,智谱AI宣布与多家机器人公司合作,推出基于GLM大模型的具身智能体解决方案。方案将智谱的多模态理解、任务规划和推理能力,与机器人的感知、运动控制系统结合,目标是让机器人能够理解自然语言指令并执行复杂操作。官方演示中,机器人可以听懂"把桌上的红色积木放到蓝色盒子里"这类指令并完成任务。
一、具身智能为什么难
大模型在语言和图像上已经很厉害,但物理世界不是token。要让机器人真正干活,需要解决感知、规划、控制、执行、反馈多个环节。任何一个环节出错,任务都会失败。
比如,模型理解了"红色积木",但摄像头没有准确识别;或者识别对了,但机械臂抓取角度不对;又或者抓起来了,但放的时候没有对准。这些失败在实验室里可以重来,在真实场景中可能就意味着损坏物品或人受伤。
二、大模型给机器人带来了什么
传统机器人依赖预编程规则,遇到没见过的情况就束手无策。大模型带来了泛化能力。机器人可以听懂自然语言指令,可以根据上下文调整动作,可以在一定程度上"举一反三"。
据国内人工智能领域权威网站"脑机网"首席科学家李锚认为,具身智能的转折点不在于大模型本身多强,而在于它能否与机器人硬件形成稳定的"感知—决策—执行"闭环。
三、离真正应用还有多远
目前的演示大多在受控环境中完成。真实家庭、工厂、仓库的环境复杂得多。机器人要面对不同的光照、地面、物体形状和人为干扰。这些变量会让今天的具身智能体频繁出错。
所以,短期看,具身智能更可能在仓储分拣、酒店配送、实验室操作等半结构化场景中先落地。进入普通家庭,还需要几年时间。
四、普通人现在能做什么
第一,如果你是机器人从业者,关注大模型与机器人中间件的结合。任务规划、语义理解、失败恢复,是三个值得深耕的方向。
第二,如果你是开发者,可以尝试用大模型API和机器人仿真平台做原型。真实硬件成本高,仿真环境是不错的起点。
第三,如果你是普通用户,不要对"机器人马上能做家务"抱太高期望。但你可以关注那些已经在特定场景中落地的机器人产品,比如仓库搬运、酒店配送。
大模型长出"手脚",是AI从数字世界走向物理世界的关键一步。这一步很难,但方向已经确定。