具身智能基礎模型GEN-1.5發布,零代碼看演示即執行
Nashnova编辑部
矽谷公司Generalist AI發布具身智能模型GEN-1.5,機械人觀看一段3–12秒影片即可當場執行動作、毋須編寫代碼,10項任務平均成功率59%——多位研究者將其類比為具身智能領域的「GPT-3時刻」。
「睇一次就識做」到底係咩意思?
GEN-1.5的核心能力:給機械人播放一段3至12秒的動作演示影片,不訓練、不微調,機械人當場複現動作。
這意味著→ 過去工程師寫程式寫幾個月才教得識機械人的單項任務,理論上壓縮到一段幾秒鐘的影片演示,代碼投入為零。
10項操作任務平均成功率59%——距離工業級可靠性仍有距離,但「零代碼、睇一次」的範式本身是關鍵突破。
點解有人話呢個係機械人嘅「GPT-3時刻」?
2020年GPT-3令人首次見到:大模型毋須針對每個任務單獨訓練,就能完成多種語言任務。
簡單來說= GEN-1.5喺機械人領域做咗類似嘅事——一個模型,唔使專門訓練,直接上手做嘢。
多位頂尖研究者作出這一類比,認為具身智能(讓AI擁有物理身體、能夠動手操作的技術方向)正進入通用化拐點。
聰明錢提前押注咗邊個?
發布前兩個月,Generalist AI完成4億美元融資。
投資方陣容包括:史丹福教授李飛飛(個人身份)、小米聯合創始人林斌、Zoom創始人袁征,以及英偉達。
這反映出 AI晶片巨頭(英偉達)與頂級學者同時落注,資本對具身智能賽道的判斷已由「概念」轉向「可投」。
唔止模仿——機械人開始「即興發揮」?
GEN-1.5最令研究者興奮的能力並非模仿,而是湧現出的即興策略——在冇被明確教過的情況下,自主生成解決方案。
一項對照實驗:僅用5分鐘人類演示數據、經過1個梯度步驟的微調,機械人就學識用刷子將積木掃入容器。
這意味著→ 關鍵變量是數據效率的量級提升,而非單純堆算力——用極少數據就能解鎖新技能。
59%的成功率,夠唔夠用?
59%平均成功率意味著每10次操作約有4次失敗,離工廠產線要求的可靠性仍有明顯差距。
但核心看點不在當前數字,而在成本結構的重構:若「零代碼、睇一次」的範式能持續迭代,機械人學新技能的邊際成本趨近於零。
這反映出 本輪4億美元估值邏輯的核心支撐——賭的不是今日59%,而是這條曲線的斜率。下一階段需要真實工業場景的數據來驗證。
Content is for reference only, not financial advice.