具身智能基础模型GEN-1.5发布,零代码看演示即执行

Nashnova编辑部
Published todayAbout 3 min read

硅谷公司Generalist AI发布具身智能模型GEN-1.5,机器人观看一段3–12秒视频即可当场执行动作、无需编写代码,10项任务平均成功率59%——多位研究者将其类比为具身智能领域的「GPT-3时刻」。

01

「看一遍就会」到底是什么意思?

GEN-1.5的核心能力:给机器人播放一段3至12秒的动作演示视频,不训练、不微调,机器人当场复现动作。
这意味着→ 过去工程师编程数月才能教会机器人的单项任务,理论上压缩到一段几秒钟的视频演示,代码投入为零
10项操作任务平均成功率59%——距离工业级可靠性仍有差距,但「零代码、看一遍」的范式本身是关键突破。
02

为什么有人说这是机器人的「GPT-3时刻」?

2020年GPT-3让人们第一次看到:大模型不用针对每个任务单独训练,就能完成多种语言任务。
用大白话说= GEN-1.5在机器人领域做了类似的事——一个模型,不专门训练,直接上手干活
多位顶尖研究者做出这一类比,认为具身智能(让AI拥有物理身体、能动手操作的技术方向)正进入通用化拐点。
03

聪明钱提前押注了谁?

发布前两个月,Generalist AI完成4亿美元融资。
投资方阵容包括:斯坦福教授李飞飞(个人身份)、小米联合创始人林斌、Zoom创始人袁征,以及英伟达
这反映出 AI芯片巨头(英伟达)与顶级学者同时下注,资本对具身智能赛道的判断已从「概念」转向「可投」。
04

不只是模仿——机器人开始「即兴发挥」?

GEN-1.5最让研究者兴奋的能力不是模仿,而是涌现出的即兴策略——在没被明确教过的情况下,自主生成解决方案。
一项对照实验:仅用5分钟人类演示数据、经过1个梯度步骤的微调,机器人就学会了用刷子把积木扫进容器。
这意味着→ 关键变量是数据效率的量级提升,不是单纯堆算力——用极少数据就能解锁新技能。
05

59%的成功率,够用吗?

59%平均成功率意味着每10次操作约有4次失败,离工厂产线要求的可靠性还有明显差距。
但核心看点不在当前数字,而在成本结构的重构:如果「零代码、看一遍」的范式能持续迭代,机器人学新技能的边际成本趋近于零。
这反映出 本轮4亿美元估值逻辑的核心支撑——赌的不是今天59%,而是这条曲线的斜率。下一阶段需要真实工业场景的数据来验证。

Content is for reference only, not financial advice.

具身智能基础模型GEN-1.5发布,零代码看演示即执行 · nashnova