外媒評論認為,企業在部署 AI 時,正把一個容易統計的數字當成效率指標:Token 用量。這種做法與早年即時戰略遊戲玩家迷信 APM(每分鐘操作數)相似,看起來更忙,卻未必帶來更好的結果。
Token 用量未必更有效
文章提到,隨著 AI 代理成為企業應用熱點,模型呼叫量明顯上升。 Anthropic 先前發現,代理任務消耗的 Token 通常約為普通聊天的 4 倍,多代理系統則可達到約 15 倍。
作者認為,這類數字很容易被當成能力證明,但高消耗本身並不能說明輸出更有價值。相反,生成內容越多,後續審核、校驗和修正的工作也會同步增加。
遊戲中的 APM 類比
文章以《星海爭霸》等遊戲舉例稱,APM 曾長期被視為高手指標,但後來的研究並未發現高水準玩家一定有更高的 APM。更關鍵的差異,往往在於判斷、注意力分配和更有效的操作。
作者也提到,Google DeepMind 訓練 AlphaStar 時發現,允許系統執行更多點擊並不會提升表現,反而可能讓算力浪費在細節上。該系統在與職業玩家的演示對局中,平均 APM 低於人類選手,但仍獲勝。
審核能力才是約束
文章認為,企業更該關注的不是產生了多少,而是能否穩定驗證這些結果。文中引述一篇由 MIT、華盛頓大學和 UCLA 研究人員撰寫的經濟學論文稱,AI 帶來的成長限制已不再只是智慧本身,而是人類的驗證頻寬。
作者據此提出,企業部署 AI 時應把重點放在可觀測性、審核流程和驗證體系,而不是單純追求更高的 Token 消耗。文章還引述 2025 年一項關於 AI 對軟體開發影響的分析稱,工程師花在審查和修改 AI 生成程式碼上的時間,佔比已超過等待程式碼生成本身。
在筆者看來,若企業只優化容易計數的代理指標,反而可能偏離真正目標。對 AI 系統而言,缺的不是繼續放大生成量,而是先建立足夠穩健的複核能力。












