DeepMind發布Genie3模型:通向人工通用智慧的關鍵技術突破

新聞摘要
8月5日,Google DeepMind正式發布了Genie 3,這是一款革命性的通用世界模型,能夠透過文本提示即時生成互動式3D環境。這項技術被DeepMind視為通向人工通用智慧(AGI)道路上的關鍵里程碑。
技術突破與核心能力
Genie 3能夠以每秒24幀的速度生成720p解析度的動態世界,並可保持數分鐘的一致性。與前代產品相比,這是一個巨大的技術躍進。Genie 2的互動時間僅為10-20秒,而Genie 3可以維持數分鐘的連續互動。
自適應物理理解
Genie 3最引人注目的特性是其能夠記住之前生成的內容,從而保持物理世界的一致性——這是研究人員沒有明確編程到模型中的突現能力。該模型不依賴硬編碼的物理引擎,而是透過記憶其生成的內容來自學物理世界的運作規律——物體如何移動、下落和相互作用。
即時互動性
Genie 3的另一個突破性功能是「可提示的世界事件」,使用者可以透過文本提示動態改變模擬環境的狀態。在一個演示中,DeepMind向模型指令在滑雪場景中插入一群鹿,展示了其實時環境修改能力。
AGI發展的關鍵步驟
DeepMind研究科學家Jack Parker-Holder表示:「我們認為世界模型是通向AGI道路上的關鍵,特別是對於具身智慧體,模擬真實世界場景尤其具有挑戰性」。
DeepMind研究總監Shlomi Fruchter指出:「Genie 3是首個即時互動式通用世界模型,它超越了之前存在的狹窄世界模型,不特定於任何特定環境,可以生成從真實感到想像世界的一切」。
智慧體訓練驗證
DeepMind使用其通用可指令多世界智慧體(SIMA)對Genie 3進行了測試。在倉庫環境中,他們要求智慧體執行「接近亮綠色垃圾壓縮機」或「走向裝滿貨物的紅色叉車」等任務,SIMA在所有三個案例中都成功達成目標。
技術局限與挑戰
儘管取得了顯著進步,Genie 3仍面臨幾個技術挑戰:在共享環境中準確建模多個獨立智慧體之間複雜互動的困難、無法完美準確地模擬真實世界位置、文本渲染能力有限,以及目前只能支持數分鐘的連續互動,而不是擴展的幾個小時。
應用前景
DeepMind相信Genie 3將在AI研究和生成媒體的許多領域產生重要影響。該技術可以為教育和培訓創造新機會,不僅為機器人與自主系統等智慧體提供巨大的訓練空間,還能評估智慧體的性能並探索其弱點。
在教育領域,Genie 3最終可能成為地理、生物或歷史等學科的模擬工具。在機器人技術中,該系統可能會有助於在物理基礎環境中訓練智慧體。
產業影響
技術專家認為,Genie 3的物理建模準確性表明神經網路最終可能取代傳統物理建模,這將影響機器人技術和科學等領域。儘管目前720p 24fps的規格遠低於現代遊戲玩家的期望,但鑑於技術進步的速度,這些基本技術限制可能會在未來幾年內消失。
發布狀態
目前,Genie 3仍處於研究預覽階段,DeepMind正在探索如何在未來向更多測試人員提供這項技術。該公司與責任開發與創新團隊密切合作,以確保這項具有開放性與即時性的技術能夠安全負責地發展。
Parker-Holder將Genie 3比作AlphaGo在圍棋比賽中的「第37手」時刻,表示:「我們還沒有真正在具身智慧體方面有過『第37手』時刻,讓它們能夠在現實世界中採取新穎行動。但現在,我們有可能開啟一個新時代」。
這項突破性技術標誌著AI從簡單的內容生成向創造智慧體訓練環境的重大轉變,為通用人工智慧的發展奠定了重要基礎。