Anthropic 在9月17日提出了一套觀察AI開發速度的指標,試圖回答外界長期未能看到的三個問題:AI在多大程度上參與了下一代AI的研發;公司能否監控內部代理的行動;計算資源究竟有多少用於安全工作。公司同時提供了內部數據快照,包括2026年8月任意一時刻最常用的研發平臺上約有3萬個代理在運行,在線監控當月檢查超過十億次決策,以及在一週的樣本中約6%的AI研發算力被歸類為安全工作。
這些數字並非監管審計的結論,亦非業界的統一標準。研發自動化指數由 Anthropic 自行設計,並大量使用 Claude 來整理任務和評分;代理監控僅覆蓋所描述的主要內部平台;算力分配則來自7月13日至20日的一週快照。官方將其定位為原型測量,期望未來能由獨立第三方進行驗證,并在不同實驗室之間形成可比對的標準。
從「AI 助理研究員」到「AI 領導研發」,首先需要知道自動化是發生在什麼地方
Anthropic 构建了 R& D Automation Index。團隊從 Slack 和內部文件中抽樣整理了約 1.5 萬個細粒度的研發任務,再組織成一個包含 542 個節點、378 個子任務的層級樹。每類任務都根據 Epoch AI 提出的六級評分標準進行評估:從 AL0 沒有 AI 參與,到 AL5 完全自主,中間依次包括輕度使用、輔助、協作和主導。最後再根據人員在各项任務上投入的時間來估算權重。
這比統計員工發送了多少條 Claude 消息更接近實際工作,因為一條消息可能只是改寫句子,也有可能完成一次實驗設計。但方法仍有局限。任務樹在特定時期被凍結,若員工因 AI 的出現而轉向全新工作,舊的評估方式未必能捕捉到;重要性用人工來代理評估,也不能衡量某項少量工作對模型能力的巨大影響;評分模型又來自被評估公司的自有系統。
Anthropic 要求相關領域的員工在不知道模型證據和結論的情況下獨立評分。官方稱模型與人類給出的完全相同等級的比例為59%,人類之間完全一致的比例只有35%;模型與人類相差不超過一級的比例為97%。這些結果表明邊界判斷本來就主觀,也說明了「AI 協作」與「AI 主導」不能被包裝成精確的物理量。指數更適合觀察同一標準隨時間的變化,而不是用一個分數來宣告已經實現自主研發。
公司希望公開 AI 參與研發的程度,是因為模型加速自身的開發可能縮短人類理解和干預的時間。自動化提高也可能帶來更多安全實驗和測試,不能只被解釋為風險。關鍵在於能力研發和監督能力是否同步增長,以及當代理人開始選擇研究方向、委派子任務時,人類是否仍掌握明確的停止條件。
100%的監控覆蓋並不等於100%能發現問題,安全算力佔比也並非安全成果。
Anthropic 將代理監督分為在線與離線兩層。在線監控在動作執行前進行檢查,針對複製模型權重等快速且不可逆的風險;離線監控則在事後閱讀活動,尋找可能緩慢發展、能夠補救的失配跡象。官方稱主要內部平台的代理動作100%經過在線監控,也全部進入離線系統。8月十億多次決策中約0.002%被在線監控阻止,約等於每4.7萬次一次。
離線系統每週會標記約10萬筆記錄,再由多個分類器排除誤報並進行初審,其中最高優先級的約50筆會升級為人工審查。整體上,每千筆記錄中大約有一到兩筆會進入進一步查看。較低的阻止率可以說明大多數動作未觸發規則,也可能反映監控有漏檢的情況或任務風險較低,但這並不能單獨證明代理幾乎不會越權。評估監控品質還需要公開已知攻擊被捕捉的比例、誤報率、人工複核的時延以及事後發現的漏網事件。
在算力方面,Anthropic分析了每周的工作負載,並將主要目的是提高安全性、可解釋性或系統安全性的運行歸類為安全工作。結果顯示,在AI的研發算力中,約有6%用於安全;在由AI驅動的AI的研發算力中,約有12%用於安全。公司表示採取了保守的定義:同時促進能力和安全的任務被視為一般研發,而安全分類器的另一部分可用算力則沒有計入。
即便如此,算力占比仍不能衡量安全成果。一个高效的分類器使用更少的芯片完成更多的檢查,雖然會讓算力占比下降,但卻可能提升實際的安全性;而一次大規模的前沿訓練雖然會讓算力總量大幅增加,也不代表安全團隊的規模就會突然縮小。工作標籤的設定和自動分類過程也有可能出錯,如果不同公司自行定義「安全」的標準,就很容易得到無法比較的數據結果。
這套指標真正有價值的方向,是在建立連續時間序列之後,交給獨立機構進行核驗。研發自動化可以觀察 AI 是否從輔助走向主導;監控覆蓋範圍、延遲和升級率可以觀察監督是否能夠跟上市場規模的變化;算力分配則可以觀察公司在能力與安全之間的資源選擇。這三者必須結合起來看,任何單一項都不應該成為評估安全性的唯一依據。
Anthropic 所揭露的只是實驗室內部生產過程的一角。3萬個代理說明 AI 已經深入研發階段,但並不等於有3萬名獨立的研究人員;十億次監控決策說明監督規模巨大,但並不等於沒有漏檢;6%的安全算力說明資源可以被分類,但並不等於風險已經得到解決。下一步更重要的は、統一定義、定期更新、第三方驗證,以及在指標惡化時明確會觸發什麼限制。只有數字才能改變決策,透明度才不只是一次性的展示。












