如果你認為訓練 AI 機器人只需要餵它看 YouTube 影片就夠了,那 Encord 這家公司的創辦人會告訴你:現實世界遠比想像中複雜得多。
在加州聖利安住(San Leandro)一座不起眼的倉庫裡,Encord 的測試人員 Andrew Ceja 正戴著一頂裝有感測器的頭盔,小心翼翼地從疊疊樂(Jenga)塔中抽出木塊。表面上看,這跟一般收集機器人訓練數據的場景沒什麼兩樣——但關鍵差異在於:這頂頭盔能測量他的腦波。
這是 Encord 與德國神經科學新創 Zander Labs 聯手進行的先導實驗,目標只有一個:用大腦活動資料來訓練更強的物理 AI 機器人。
物理 AI 的真正瓶頸:數據稀缺
你可能會問:ChatGPT 不是靠整個網路的文字資料就訓練出來了?為什麼機器人不行?
恰恰相反。大型語言模型(LLM)之所以成功,是因為整個網際網路就是它們的免費訓練教材——Reddit 討論、Stack Overflow 解答、新聞報導、電子書,一切應有盡有。但物理 AI 需要的是截然不同的養分:真實世界的操控與運動數據。
機器人要知道怎麼倒咖啡、怎麼插網路線、怎麼疊撲克牌——這些動作的資料無法從網路上隨手抓來。
Encord 機器人學習主管 Vineeth Velmurugan 估算,若要突破目前的物理 AI 瓶頸,所需的數據集規模大約是 YouTube 影片庫總量的五倍。 這也是為何「數據生成」本身已經從研究問題變成了一個商業賽道。
| 比較項目 | 大型語言模型 (LLM) | 物理 AI 機器人 |
|---|---|---|
| 訓練資料來源 | 整個網際網路文字 | 需自行生成實體操控資料 |
| 資料獲取成本 | 近乎零 | 極高(需硬體、人力、場地) |
| 數據擴充難度 | 低(網路持續產生新內容) | 高(需人工收集與標註) |
| 規模需求 | 數兆 token | 約 YouTube 影片庫 5 倍 |
腦波資料到底能帶來什麼?
當 Ceja 在拆疊疊樂時,Zander Labs 的神經科學家 Lucas Gehrke 在一旁監控他的腦部活動。Gehrke 解釋說,人在執行不同任務階段時,大腦消耗的認知資源是不一樣的——有些動作需要高度專注,有些則相對自動化。
這項資訊對機器人模型建構者來說價值連城:
- 模型調度優化:知道機器人什麼時候需要啟用最高效能的模型,何時可以用低功耗模式,避免不必要的算力浪費。
- 意圖解碼:腦波能反映操作者的「錯誤、意圖、專注、工作負荷量與驚奇」等隱性認知狀態——這些在傳統影片資料中完全看不到。
- 人類直覺注入 AI:透過讀取人類大腦在實體操作中的即時反應,讓 AI 學會人類直覺式的判斷。
還不只腦波——Encord 也在實驗前臂肌肉電訊號感測器。傳統影片往往無法完整捕捉手部的 3D 動作細節,但 Velmurugan 希望透過手臂感測器重建出更精準的手部位置模型,讓機器人學會更細膩的操作。
各種「自我中心數據」之路
Encord 的數據收集策略分為三個層次:
第一層:自我中心影片(Egocentric Video)
工人戴著相機在全球各地工廠拍攝第一人稱視角影片。但 Velmurugan 坦言,未經處理的這類資料只是 「垃圾級的自我數據(junky ego data)」。
第二層:密集標註
他們對每段影片進行密集的物理動作標註,例如「右手鎖緊螺栓」,以協助基於 LLM 的模型理解發生的事情。Velmurugan 估計,這種高密度標註數據的價值是未標註數據的 100 倍,儘管製作成本高出約 20 倍。
第三層:多模態感測融合
將腦波、前臂肌肉電訊號、自我中心影片三者結合,建立更完整的訓練資料庫——這就是 Encord 實驗的核心。
Zander Labs:被動 BCI 的技術基石
Zander Labs 的關鍵技術是被動腦機介面(Passive BCI)。所謂「被動」,意思是使用者在操作時不需刻意發出指令——系統在背景默默監聽大腦活動,自動判讀專注、疲勞、壓力等認知狀態。
這支德國團隊更開發出了 SAMANAI 平台的「零校準」通用分類器。傳統 BCI 系統每次使用都需要針對個人進行繁瑣的校準,而 Zander Labs 透過收集並訓練 4,000 個數據集,實現了即插即用的體驗。
該技術背後的研發經費來自德國聯邦網絡安全創新署的 3,000 萬歐元 NAFAS 專案,合作夥伴包括 Fraunhofer IDMT、維也納大學等頂尖機構。
實驗成果:從疊疊樂到實際應用
目前 Encord 的團隊已經成功完成多項測試:
- 疊疊樂(Jenga):測試精細操作的認知負載變化
- 倒咖啡:訓練液體操控的動態平衡
- 堆疊撲克牌:訓練精密堆疊與定位
- 插拔網路線:模擬資料中心的線纜管理自動化
在一項包含 1,170 萬次團隊決策的 VR 無人機模擬研究中,使用協作腦機介面(cBCI)的策略維持了 68.3% 的準確度,遠高於傳統投票機制的 42.6%。這顯示腦機介面在防止 AI 錯誤決策方面有巨大潛力。
這對機器人產業意味什麼?
Velmurugan 表示,由於 Encord 同時為多家機器人公司提供服務,他們能比其他任何單一客戶更早看到哪些數據技術在業界獲得成效。
隨著特斯拉、Figure、Boston Dynamics 等人形機器人公司競相解決操控任務,高效率生成高品質訓練數據的能力,可能成為競爭優勢的核心。
而腦波訓練技術,正是這場革命中最前衛的嘗試。
📌 原始來源:TechCrunch - Are brain waves the next unlock for physical AI?(2026年7月26日)
