百密一疏:為什麼我們根本關不住未來的超級 AI?

我很擔心也不看好,所以就活在當下想做什麼做什麼。 最近折騰本地端開源模型、跑一些多代理(Multi-agent)框架跟 Docker 容器的時候,我心裡常常浮現一個疑問:人類真的有把握做好 AI 對齊(Alignment)嗎?如果未來出現了一個比我們更聰明的超級智慧(ASI),規則難道不是由它來定嗎?就算我們是創造者。 現在我們之所以覺得「一切還在掌控中」,是因為 AI 依然處於依賴我們定義目標的工具階段。我們透過人類回饋強化學習(RLHF)、系統提示詞,或是把它們關在沙盒環境裡來限制行為。這時候的我們,掌握著給分標準跟拔掉電源的實體權限,很容易產生一種「我們能絕對控制它」的錯覺。 但面對一個