AI 學習新事物為何如此困難?人類的「心像模擬」或許是答案
📋 Brief
這支影片深入探討AI領域的一個核心難題:「樣本效率」。也就是,如何讓模型像人類一樣,只用很少的數據就能學會新技能?影片提出,建立一個「世界模型」(World Model),讓AI能在腦中先模擬和預測,可能是通往更強大、更高效AI的關鍵路徑。
⏱️ 內容分段導航
| 時間段 | 內容摘要 |
|---|---|
| 00:00 - 01:32 | 引入核心問題:AI的樣本效率遠低於人類,需要海量數據才能學習。 |
| 01:33 - 03:39 | 提出「完美世界模型」的概念,並以牛頓力學為例,說明擁有完美模型就不需要實際試錯。 |
| 03:39 - 05:37 | 舉例說明人類如何在腦中模擬(如投籃、商業決策),並引用認知科學研究佐證。 |
| 05:38 - 08:14 | 定義控制問題與強化學習,以無人機為例,拆解狀態、動作與轉移函數。 |
| 08:15 - 12:08 | 展示如何用完美的牛頓世界模型與凸優化,完美解決無人機著陸問題。 |
| 12:09 - 17:35 | 引入對手(不確定性),使問題變得不可微,從而需要傳統的強化學習方法。 |
📖 詳細內容
01|樣本效率:AI學習的瓶頸
核心觀點: AI目前面臨兩個大挑戰:能源效率與樣本效率。樣本效率指的是模型每增加一個數據點,能變得多聰明。人類可以憑直覺快速學習,但頂尖AI模型往往需要成千上萬的數據點才能學會一件事。以RGI(一種邏輯推理測試)為例,人類能直觀地解決,但當前的前沿AI卻束手無策。
重要原話:
"intelligence as a rate of skill acquisition versus skill acquisition" (將智慧視為「技能獲得的速率」,而非「技能獲得量」。)
個人感受: 這讓我想到自己學開車和教導AI模型的差異。我大概花了一週就能在市區自如駕駛,但AI可能需要模擬數百萬公里的虛擬里程。這種差距大得讓人有點不安。
延伸思考: 如果AI始終學不會這種「快速舉一反三」的能力,它可能永遠無法真正適應混亂、多變的真實世界,只能在高度受控的環境中表現良好。
可參考的行動: 下次學習一項新技能時,有意識地記錄自己是怎麼「靠猜測和想像」就學會的,而不是靠機械式重複。例如,下棋時先在腦中推演幾步,再實際落子。
02|完美世界模型:牛頓的隱喻
核心觀點: 想像一下「完美的樣本效率」是什麼樣子?那意味著你不需要實際去環境中收集數據來學習。這聽起來不可能,但我們其實一直在這麼做——就是牛頓力學。因為我們有完美的物理模型,我們可以精確預測火箭軌道,而不需要先發射一百萬枚火箭來收集數據。
重要原話:
"Can you imagine if we needed to collect 1 million training examples of us shooting spaceships to the moon to like know how to do it?" (你能想像如果我們需要收集一百萬次向月球發射飛船的訓練樣本才能知道怎麼做嗎?)
個人感受: 這個例子非常有力。它瞬間把一個抽象的AI概念,和我們文明中顯而易見的成就(登月)連結在一起。這讓我相信,在某些領域,一個好的「心像模型」比海量數據有用得多。
延伸思考: 這暗示了AI發展的一個可能方向:與其餵給模型更多原始數據,不如幫它構建更精確的、可微分的「內部世界模擬器」。這可能比單純增大模型規模更有前途。
可參考的行動: 在做複雜決策(如投資、職業選擇)時,試著先畫出簡單的因果關係圖或進行思維實驗,在腦中模擬不同選擇的可能結果,而不是只依賴直覺或過往經驗。
03|人類的「隱形」世界模型
核心觀點: 我們的大腦,特別是新皮質,很可能就是一個卓越的世界模型。神經科學家認為,新皮質的擴張就是為了更好地進行世界建模。研究顯示,籃球運動員僅僅通過閉眼想像投籃動作,其命中率提升幅度與實際練習一小時幾乎相同。這說明了「心像模擬」的強大力量。
重要原話:
"if you take the other one and they just blindfold them and they imagine laying up a basketball, they improve it 23%." (如果你讓另一組人蒙上眼睛,想像自己在上籃,他們的命中率也提升了23%。)
個人感受: 看到這個實驗數據時我愣了一下。我一直知道「心理練習」有用,但沒想到效果這麼接近真實練習。這讓我重新思考「經驗」的本質——很多時候,我們在腦中預演的「虛擬經驗」,可能真的在重塑我們的神經迴路。
延伸思考: 如果AI能學會像人類一樣,不單是儲存數據,而是在內部建構一個可以反覆模擬、試錯、預測的動態世界模型,那它獲得的可能就不僅是知識,而是某種形式的「直覺」或「品味」。
可參考的行動: 選擇一件你正在學習的技能(如外語對話、樂器彈奏),每天花10分鐘進行純粹的「心像練習」,不實際操作,只是在腦中清晰、緩慢地模擬每一個步驟和感覺。
04|控制問題與完美世界模型的威力
核心觀點: 以無人機著陸為例,當我們擁有完美的世界模型(牛頓物理定律)和一個可微分的環境時,問題就從「強化學習」簡化為一個「凸優化」問題。我們可以精確計算出從當前狀態到目標狀態的最優路徑(如最省能源或最快),就像SpaceX火箭回收一樣。
重要原話:
"This is a world model. This is a world model." (這就是一個世界模型。這就是一個世界模型。)——講者在黑板上寫出狀態轉移函數時的強調。
個人感受: 看著他們一步步推導公式,把看似複雜的無人機控制問題,轉化為可以直接求解的數學問題,感覺很過癮。這清楚地展示了,一旦你有了正確且可微的模型,很多問題的解決方式會發生根本性的改變。
延伸思考: 這解釋了為什麼模擬器(Simulator)在機器人學和自駕車領域如此重要。一個好的模擬器本質上就是一個可微的世界模型,它允許AI在安全、低成本的虛擬環境中,用優化方法高效地學習策略。
可參考的行動: 嘗試用一個簡單的模擬遊戲或軟體(如Kerbal Space Program或一些物理沙盒),親自體驗「基於模型的控制」。感受一下,當你知道遊戲規則(世界模型)時,解決問題的方式有多不同。
05|當世界模型不再完美:強化學習的領域
核心觀點: 如果引入一個對手(如另一架無人機),環境就變得隨機且不可微。你無法知道對方下一步會做什麼,因此無法用梯度下降優化。這時,問題就從「模型預測控制」轉向了傳統的「強化學習」,需要處理價值函數、策略學習,過程複雜且低效。
重要原話:
"I can't back prop through your brain to say what you're going to do with your little drone controller, right? It's completely non-differentiable now." (我無法透過反向傳播穿透你的大腦,來預測你會用你的小無人機控制器做什麼,對吧?現在它完全不可微了。)
個人感受: 這個對比非常強烈。它讓我意識到,當前很多AI(尤其是遊戲AI)的強大,其實是在一個規則已知、可模擬的「完美世界模型」裡。一旦進入充滿未對手和未知因素的真實世界,學習效率就會斷崖式下跌。
延伸思考: 這指向了一個核心矛盾:真實世界的本質是不可微、充滿對手和隨機性的。所以,真正的突破可能在於如何構建既能利用可微優勢,又能處理不可微不確定性的混合模型。
可參考的行動: 在玩一些有對手或隨機因素的遊戲(如撲克、部分棋類)時,有意識地分析哪些環節是你可以精確建模的(對手已知的行為模式),哪些是純粹的不確定性,並思考如何分別應對。
💎 精華收穫
這支影片清晰地闡述了「世界模型」的核心思想:一個強大的AI不應該只是一個被動的數據吸收器,而應該是一個主動的模擬器,能在腦中預演因果、預測後果。從牛頓力學到人類的直覺決策,都在暗示這條路徑的潛力。然而,一旦世界變得不確定且不可微,這條路就困難重重,而這正是當前強化學習面臨的深淵。未來的突破,或許就藏在如何弥合這個鴻溝之中。
由 PotatoLearning Hub 自动生成