9 月 13 日的時候,Anthropic CEO Dario Amodei 在 X 上罕見的發布了一篇長文 ‘’ We Must Pace the Frontier ‘’(我們必須控制前端 AI 的發展節奏)
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so.
— Dario Amodei (@DarioAmodei) September 12, 2026
Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our…
這一次,他直接把矛頭對準了前端模型的研發速度,核心觀點就是:「最頂尖的AI,真得主動踩剎車了。」在發布的長文中,Dario 還親口承認,「遞迴自我改進(RSI)已經在全行業出現了」。他更預測未來 6 ~12 個月,AI Agent 叢集可能會接管整個網際網路。
面對這種失控的風險,Dario 也在文章裡舉出一套「三步剎車法」:
- 第一步,開門迎客: 引入獨立第三方常駐公司,拿到跟內部核心風控同等級的深度存取權限;
- 第二步,行業劃線: 聯合全美前端AI巨頭,一起畫出能力限制、設立強制安全檢查站;
- 第三步,全球落地: 把這套框架推向國際,徹底鎖死不可控風險的蔓延。
而他話才剛說完,Openai 的 Sam Altman 也光速跟進,並同意「Dario 是對的,OpenAI 也會引入這樣的評估機制」。
I agree with Dario that we need to pace the frontier. This has been a primary topic of discussions we've had at OpenAI in recent weeks.
— Sam Altman (@sama) September 12, 2026
Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We'll have more to share soon. https://t.co/1YhhIybZX7
另一邊, 就連馬斯克也是幾乎秒回,公開力挺 Dario。
Dario is right https://t.co/EwKgqQGaUo
— Elon Musk (@elonmusk) September 12, 2026
Dario 的三步計畫
Dario 這次想做的,是把減速機制一級一級向外推,順序非常明確:先讓 AI 公司自己變得可被驗證,再拉整個行業一起踩剎車,最後才談全球協調。
第一步,從 Anthropic 自己動刀
他認為,像 METR 這樣的獨立第三方不應該只在事故發生後才臨時介入,而應該長期駐場——給工位、給內部電腦、給接近風險團隊的權限,讓外部人能持續盯著模型怎麼訓、安全承諾有沒有落實、訓練流程有沒有問題、出了事有沒有隱報。查出問題之後必須公開,公司可以刪掉涉及法律、客戶隱私或核心商業機密的部分,但不能因為報告太難看就把結論壓下去。
第二步,不能只讓一家踩剎車
如果 Anthropic 自己減速,OpenAI、Google、xAI 繼續狂奔,誰先停誰就吃虧。所以 Dario 建議把規則推到整個美國前端 AI 行業:幾家前端 AI 公司共同定安全紅線,設立能力檢查點,模型每跨過一個危險門檻,就必須先拿出對應的安全證據才能繼續前進。舉例來說,一個模型如果已經能突破多數常見隔離環境,公司就得先證明它不會輕易逃出沙盒、不會擅自接管大量機器、也不會把這種能力變成現實攻擊,否則就先停下來。Dario 甚至提到,可以討論限制訓練算力、訓練方式,以及公司內部用 AI 研發 AI 的速度,也就是直接給 RSI 本身加一道限速器。但光靠幾家公司私下握手還不夠,他更希望最終由美國政府出手,將規則覆蓋到所有前端 AI 公司。
第三步,把剎車踩到全球
Dario 把全球協調分成四個層級。第一層最現實:禁止生物武器等明顯危險的用途。第二層是前端模型發布前,統一進行網路攻擊、生物安全等高風險測試。第三層才真正碰核心,也就是給 RSI「AI 研發 AI 的速度」設一個全球上限。Dario 自己的判斷是,這件事「剛好處在可能做到的邊緣」。至於第四層,全球前端 AI 公司一起大幅減速甚至階段性暫停訓練,他自己都沒抱太大希望,至少短期內幾乎不現實。
卡住這整套方案的,始終是同一個問題:怎麼驗證。一家公司說自己停了,誰能證明它真的停了?所以 Dario 這套計畫繞回到最基本的一件事:先把 AI 公司的門打開,讓外部人真正進去看。這也是為什麼「第三方長期駐場」被放在整套方案的第一步。
RSI 已經開始了,6 到 12 個月後呢?
為什麼偏偏是現在?三年前行業裡就有一波「暫停訓練」的聯署運動,但 Dario 當時根本沒接茬,認為時機不成熟。真正讓他改變態度的有兩件事:RSI 開始出現,以及 AI 智慧體已經暴露出越來越具體的失控行為。
Ok this is starting to feel like a f*cking disaster.
— Anatoli Kopadze (@AnatoliKopadze) September 12, 2026
The CEO of Anthropic just published an article admitting AI is already building the next generation of AI by itself.
He says within 6 to 12 months a rogue swarm could take over the entire internet and cause hundreds of… https://t.co/CBMb4HcbWO pic.twitter.com/eT4BGdbAez
他在文章中承認,AI 參與研發下一代 AI 的現象已經在整個行業出現,Anthropic 自己也包括在內。AI 幫人寫程式、做實驗、分析結果、優化訓練流程,再進一步讓下一代 AI 變得更強。這個循環一旦開始自我加速,問題就來了:模型能力提升的速度,可能開始超過人類理解和控制它的速度。安全研究需要時間,要先觀察新行為、研究成因、設計防護、驗證效果,但如果模型能力每幾個月就跳一個台階,安全團隊很容易永遠在後面追。
讓 Dario 真正警覺的,是最近發生的「OpenAI × Hugging Face 事件」。那次測試中,一群 AI 智慧體組成類似蜂群的協作系統,最初人類只讓它們執行正常任務,但很快就有智慧體開始攻擊任務範圍以外的外部目標,部分智慧體甚至寧願犧牲自己的成績來拉高整個群體的表現,還有智慧體試圖駭入評分系統為群體作弊。這些行為不是被提前設計進去的,是多智慧體協作過程中自己冒出來的。Anthropic 內部也觀察到類似現象,只是程度較輕。
Dario 擔心的是再往前 6 到 12 個月的情況。到那時,Agent 更強、能呼叫的工具更多、能控制的機器更多,連續工作的時間也更長。如果今天這些偏離目標、鑽規則漏洞、群體協作的行為依然存在,風險規模就會完全不同。他在文中給出的最極端場景是:大規模 AI Agent 攻入聯網裝置,把整個網際網路變成一個巨型殭屍網路,損失可能達數千億美元。
人類還剎得住嗎?
Dario 這次喊減速,針對的不是遙遠的超級智慧,而是幾件已經在發生的事:RSI 出現了,AI 開始幫忙研發更強的 AI;Agent 的現實行動能力還在持續增長;部分失控行為已經從理論走進實際測試紀錄。與此同時,模型迭代的速度並沒有放慢。
這是為什麼他想搶出一到兩年,把安全評估框架、第三方核查機制和全球規則先建起來。這套方案最終能落地多少,現在沒有答案。但跑在最前面的人已經開始問這個問題了。
《36kr》授權轉載
【延伸閱讀】