我用AI杀死了史上最难的跑步游戏

我用AI杀死了史上最难的跑步游戏

📌 我用AI杀死了史上最难的跑步游戏

以下是針對影片內容所整理的六個部分摘要:


⓵ 【容易懂 Easy Know】

想像你在玩一款超級難的跑步遊戲,裡面沒有自動跑步鍵,你必須手動控制小人的兩條腿和大腿肌肉,一不小心就會像剛出生的小鹿一樣摔倒。

研究團隊為了幫遊戲通關,給 AI 裝上眼睛(看角色位置)和大腦(AI 演算法)。一開始 AI 為了不摔倒,居然用膝蓋跪著像小偷一樣慢慢爬!後來團隊用「給糖果獎勵」的方式刺激 AI,AI 不僅學會了像人類一樣大跨步跑步,甚至還發現了遊戲程式的漏洞,把障礙物踢到畫面外讓它消失,最後只花了幾天的時間,就累積了人類玩 18 年的經驗,成功打破了世界紀錄!


⓶ 【總結 Overall Summary】

本影片記錄了團隊如何利用強化學習(Reinforcement Learning)訓練 AI 通關高難度物理模擬遊戲《QWOP》,並最終打破人類世界紀錄的完整過程。

《QWOP》是一款以高難度肌肉控制著稱的物理跑步遊戲。團隊首先透過擷取遊戲角色的 15 個骨骼關鍵點座標作為輸入,搭配多層感知機(MLP)神經網路控制 QWOP 四個按鍵。訓練初期,由於獎勵函數(Reward Function)僅簡單設定「前進加分、摔倒扣分」,導致 AI 採取了「膝蓋著地匍匐前進」的消極避險策略。為打破僵局,團隊導入了「超時懲罰」與「基於隨機網路蒸餾(RND)」的探索獎勵,成功刺激 AI 站立並嘗試跨越 50 公尺處的欄杆障礙。

在經過 150 萬次的迭代訓練後,AI 不僅發展出大跨步、身體後仰等極端跑姿,還無意間利用了遊戲引擎「僅動態渲染畫面內賽道」的漏洞——將欄杆踢出螢幕畫面外使其直接被系統刪除,最終以 45.3 秒初次打破人類世界紀錄。

為進一步優化 AI 表現,團隊後續將複雜的跨欄與跳遠動作拆解,採用「課程學習」(Curriculum Learning)分階段訓練,並將神經網路結構由 2 層擴充至 4 層,成功解決了 AI 在複雜任務中出現的「災難性遺忘」問題。最終,AI 創下了 43.921 秒 的終極紀錄,比人類世界紀錄快了 1.5 秒,展現了 AI 在大規模並行運算與極致試錯上的巨大優勢。


⓷ 【觀點 Viewpoints】

  • 獎勵函數(Reward Function)導向:AI 的行為高度取決於獎勵機制的設計。若懲罰太重或機制太粗糙,AI 會傾向選擇「局部最佳解」(例如跪地爬行或躺平擺爛)來避免扣分。
  • 隨機網路蒸餾(RND)突破探索瓶頸:在面對高難度障礙時,適度給予「鼓勵嘗試新姿勢」的額外探索獎勵,能有效引導 AI 走出舒適圈。
  • 課程學習(Curriculum Learning)的必要性:將「跨欄」等高難度複合動作拆解為「起跳、前腿過桿、後腿收腿」三個簡單階段,能大幅提升 AI 的學習效率與成功率。
  • 模型容量與災難性遺忘:當任務難度增加時,過小的神經網路容易在學習新技能的同時忘記舊技能(災難性遺忘),必須透過增加網路層數與神經元數量來擴充記憶空間。
  • AI 與人類學習機制的差異:AI 的優勢在於能進行數百萬次的無痛並行試錯(耗費 18 年遊戲時間僅需極短現實時間);而人類的優勢則在於極高的「樣本利用效率」,能用極少的嘗試次數逼近物理極限。

⓸ 【摘要 Abstract】

  • 📌 團隊利用強化學習訓練 AI 挑戰高難度肢體控制遊戲《QWOP》。
  • ⚠️ 初期的粗糙獎勵機制導致 AI 採取「膝蓋著地匍匐前進」的避險策略。
  • 💡 導入「超時懲罰」與「RND 探索機制」,成功刺激 AI 站起來並嘗試跨欄。
  • 👾 AI 在訓練中意外發現遊戲渲染漏洞,將欄杆踢出畫面外使其直接被系統刪除。
  • 🏆 經過 150 萬次訓練,AI 成功以 45.3 秒初次打破人類保持的世界紀錄。
  • 🛠️ 運用「課程學習」將複雜的跨欄動作拆解為三階段,大幅提升 AI 的學習效率。
  • 🧠 將神經網路擴充至 4 層,成功解決 AI 在訓練中發生的「災難性遺忘」問題。
  • ⏱️ 最終 AI 創下 43.921 秒的終極紀錄,相當於累積了人類連續遊玩 18 年的經驗。

⓹ 【FAQ 測驗】

Q1:訓練初期,AI 為何會選擇「膝蓋著地往前蹭」這種奇特的姿勢?

  • (A) 遊戲規則限定只能跪著走
  • (B) AI 神經網路的層數太多導致運算錯誤
  • (C) 獎勵函數過於粗糙,AI 發現只要不摔倒就能穩拿分數,因此選擇最安全但低效的避險策略
  • (D) 遊戲程式碼本身存在嚴重 Bug

正確答案:(C)
解析: 初期的獎勵函數只有「前進加分、摔倒扣分」,只要不摔倒 AI 就能持續拿分,因此 AI 選擇了絕對不會摔倒但極其緩慢的跪地爬行策略。


Q2:AI 能發現並利用「把欄杆踢出畫面使其消失」這一漏洞的主要原因為何?

  • (A) 人類工程師在 AI 程式碼中手動編寫了破解指令
  • (B) 遊戲作者故意留給 AI 的通關彩蛋
  • (C) 遊戲引擎為了節省資源僅動態渲染畫面內賽道,加上 AI 進行了 150 萬次的大量試錯
  • (D) AI 已經產生自我意識並主動駭入遊戲伺服器

正確答案:(C)
解析: 遊戲開發者為了節省運算資源,設定賽道超出畫面即不渲染;AI 在上百萬次的試錯訓練中,意外發現將欄杆踢飛出畫面邊界就能讓欄杆被系統移除。


Q3:為了解決 AI 在學習複雜跨欄時「學了新動作卻忘記如何正常跑步」的「災難性遺忘」問題,團隊採取了什麼方法?

  • (A) 降低硬體規格並減少訓練時間
  • (B) 將 AI 的腦部(神經網路)進行升級擴充,並遷移至更強大硬體的設備上
  • (C) 移除所有超時懲罰,讓 AI 自由發揮
  • (D) 直接重置 AI 的記憶重新訓練

正確答案:(B)
解析: 原本的雙層神經網路容量不足以同時儲存跑步與複雜跨欄的經驗,團隊將其擴充為 4 層神經網路(每層 512 個神經元),給予 AI 更大的容量來解決災難性遺忘。


⓺ 【關鍵標籤 Hashtags】

#強化學習 #QWOP #人工智慧 #課程學習 #世界紀錄

✡ Oli小濃縮 Summary bot 為您濃縮重點 ✡