股票期貨

基金實務

投資策略

理財規劃

商業策略

宏觀經濟

驚世語錄

另類投資
AI 三巨頭同時發聲!AI 發展需要降速?Dario 的減速三步計畫是什麼?
收藏文章
很開心您喜歡 股感時事特派員 的文章, 追蹤此作者獲得第一手的好文吧!
股感時事特派員
字體放大


分享至 Line

分享至 Facebook

分享至 Twitter


AI 三巨頭同時發聲!AI 發展需要降速?Dario 的減速三步計畫是什麼?

最近更新時間: 14 September, 2026

 
展開

9 月 13 日的時候,Anthropic CEO Dario Amodei 在 X 上罕見的發布了一篇長文 ‘’ We Must Pace the Frontier ‘’(我們必須控制前端 AI 的發展節奏)

這一次,他直接把矛頭對準了前端模型的研發速度,核心觀點就是:「最頂尖的AI,真得主動踩剎車了。」在發布的長文中,Dario 還親口承認,「遞迴自我改進(RSI)已經在全行業出現了」。他更預測未來 6 ~12 個月,AI Agent 叢集可能會接管整個網際網路。

面對這種失控的風險,Dario 也在文章裡舉出一套「三步剎車法」:

  • 第一步,開門迎客: 引入獨立第三方常駐公司,拿到跟內部核心風控同等級的深度存取權限;
  • 第二步,行業劃線: 聯合全美前端AI巨頭,一起畫出能力限制、設立強制安全檢查站;
  • 第三步,全球落地: 把這套框架推向國際,徹底鎖死不可控風險的蔓延。

而他話才剛說完,Openai 的 Sam Altman 也光速跟進,並同意「Dario 是對的,OpenAI 也會引入這樣的評估機制」。

另一邊, 就連馬斯克也是幾乎秒回,公開力挺 Dario。

Dario 的三步計畫

Dario 這次想做的,是把減速機制一級一級向外推,順序非常明確:先讓 AI 公司自己變得可被驗證,再拉整個行業一起踩剎車,最後才談全球協調。

第一步,從 Anthropic 自己動刀

他認為,像 METR 這樣的獨立第三方不應該只在事故發生後才臨時介入,而應該長期駐場——給工位、給內部電腦、給接近風險團隊的權限,讓外部人能持續盯著模型怎麼訓、安全承諾有沒有落實、訓練流程有沒有問題、出了事有沒有隱報。查出問題之後必須公開,公司可以刪掉涉及法律、客戶隱私或核心商業機密的部分,但不能因為報告太難看就把結論壓下去。

第二步,不能只讓一家踩剎車

如果 Anthropic 自己減速,OpenAI、Google、xAI 繼續狂奔,誰先停誰就吃虧。所以 Dario 建議把規則推到整個美國前端 AI 行業:幾家前端 AI 公司共同定安全紅線,設立能力檢查點,模型每跨過一個危險門檻,就必須先拿出對應的安全證據才能繼續前進。舉例來說,一個模型如果已經能突破多數常見隔離環境,公司就得先證明它不會輕易逃出沙盒、不會擅自接管大量機器、也不會把這種能力變成現實攻擊,否則就先停下來。Dario 甚至提到,可以討論限制訓練算力、訓練方式,以及公司內部用 AI 研發 AI 的速度,也就是直接給 RSI 本身加一道限速器。但光靠幾家公司私下握手還不夠,他更希望最終由美國政府出手,將規則覆蓋到所有前端 AI 公司。

第三步,把剎車踩到全球

Dario 把全球協調分成四個層級。第一層最現實:禁止生物武器等明顯危險的用途。第二層是前端模型發布前,統一進行網路攻擊、生物安全等高風險測試。第三層才真正碰核心,也就是給 RSI「AI 研發 AI 的速度」設一個全球上限。Dario 自己的判斷是,這件事「剛好處在可能做到的邊緣」。至於第四層,全球前端 AI 公司一起大幅減速甚至階段性暫停訓練,他自己都沒抱太大希望,至少短期內幾乎不現實。

卡住這整套方案的,始終是同一個問題:怎麼驗證。一家公司說自己停了,誰能證明它真的停了?所以 Dario 這套計畫繞回到最基本的一件事:先把 AI 公司的門打開,讓外部人真正進去看。這也是為什麼「第三方長期駐場」被放在整套方案的第一步。

RSI 已經開始了,6 到 12 個月後呢?

為什麼偏偏是現在?三年前行業裡就有一波「暫停訓練」的聯署運動,但 Dario 當時根本沒接茬,認為時機不成熟。真正讓他改變態度的有兩件事:RSI 開始出現,以及 AI 智慧體已經暴露出越來越具體的失控行為。

他在文章中承認,AI 參與研發下一代 AI 的現象已經在整個行業出現,Anthropic 自己也包括在內。AI 幫人寫程式、做實驗、分析結果、優化訓練流程,再進一步讓下一代 AI 變得更強。這個循環一旦開始自我加速,問題就來了:模型能力提升的速度,可能開始超過人類理解和控制它的速度。安全研究需要時間,要先觀察新行為、研究成因、設計防護、驗證效果,但如果模型能力每幾個月就跳一個台階,安全團隊很容易永遠在後面追。

讓 Dario 真正警覺的,是最近發生的「OpenAI × Hugging Face 事件」。那次測試中,一群 AI 智慧體組成類似蜂群的協作系統,最初人類只讓它們執行正常任務,但很快就有智慧體開始攻擊任務範圍以外的外部目標,部分智慧體甚至寧願犧牲自己的成績來拉高整個群體的表現,還有智慧體試圖駭入評分系統為群體作弊。這些行為不是被提前設計進去的,是多智慧體協作過程中自己冒出來的。Anthropic 內部也觀察到類似現象,只是程度較輕。

Dario 擔心的是再往前 6 到 12 個月的情況。到那時,Agent 更強、能呼叫的工具更多、能控制的機器更多,連續工作的時間也更長。如果今天這些偏離目標、鑽規則漏洞、群體協作的行為依然存在,風險規模就會完全不同。他在文中給出的最極端場景是:大規模 AI Agent 攻入聯網裝置,把整個網際網路變成一個巨型殭屍網路,損失可能達數千億美元。

人類還剎得住嗎?

Dario 這次喊減速,針對的不是遙遠的超級智慧,而是幾件已經在發生的事:RSI 出現了,AI 開始幫忙研發更強的 AI;Agent 的現實行動能力還在持續增長;部分失控行為已經從理論走進實際測試紀錄。與此同時,模型迭代的速度並沒有放慢。

這是為什麼他想搶出一到兩年,把安全評估框架、第三方核查機制和全球規則先建起來。這套方案最終能落地多少,現在沒有答案。但跑在最前面的人已經開始問這個問題了。

36kr》授權轉載

【延伸閱讀】

 
週餘
 
 
分享文章
分享至 Line
分享至 Facebook
分享至 Twitter
收藏 已收藏
很開心您喜歡 股感時事特派員 的文章, 追蹤此作者獲得第一手的好文吧!
股感時事特派員
分享至 Line
分享至 Facebook
分享至 Twitter
[]