【導讀】隨著 AI 從響應提示詞邁向完成任務,基礎設施的優化重點也從模型本身擴展到整個工作流,涵蓋規劃、工具調用、結果驗證與任務執行。上午 8:42,一名開發者打開筆記本電腦,映入眼簾的是環境構建失敗、測試報錯,還有一條等待發布的代碼分支。過去,她可能需要花費大量時間逐一排查日志、比對代碼提交記錄、追溯倉庫歷史;而如今,她只需向 AI 編碼智能體下達一句簡單指令:
'修復失敗的測試。找出 bug、提交補丁、重跑測試并匯總改動內容。”
敲幾下鍵盤,喝上一口茶的時間,智能體就返回了已通過測試的補丁,并附上簡潔的說明。對用戶而言,效果如同瞬時魔法:輸入需求,輸出結果。但在系統內部,實現這一結果的過程一點也不簡單。
僅一條提示詞就可以觸發請求解析、任務創建、策略檢查、代碼庫檢索、上下文拼接、Token(詞元)編碼、模型調用、工具驗證、沙箱路由、文件編輯、測試運行、遙測采集與最終結果核驗。模型調用固然關鍵,但它只是工作負載的一環,真正體現工程能力的是對任務圖的協調與編排。
智能體 AI 會進行規劃、檢索、執行、校驗、重試和反饋。隨著 AI 從孤立的提示-響應交互模式轉向持續工作流模式,性能的衡量維度也從 Token 轉向完整的任務交付。
模型調用已不再等同于全部工作負載
長期以來,AI 基礎設施主要以模型執行為衡量標準:預填充 (prefill)、解碼 (decode)、每秒生成 Token 數、首 Token 延遲、吞吐量、批處理效率、內存占用以及加速器利用率。這些指標依然重要,但隨著智能體 AI 的興起,系統的關鍵路徑已不再局限于模型執行本身。
傳統的推理請求有明確的邊界:從提示詞到結果輸出。而智能體工作流可能涉及任務規劃、上下文檢索、狀態管理、工具與 API 調用、沙箱運行、結果驗證、遙測采集以及重試。最終輸出可能是一個答案、一段代碼變更、一條數據庫查詢、一次工具調用,或是一個搜集更多信息的決策。
簡而言之,智能體 AI 讓推理演變為一個分布式系統問題。GPU 對于高強度模型執行仍然不可或缺,但圍繞 GPU 展開的工作正日益成為系統性能的決定性因素:哪些任務在運行、在哪里運行、伴隨哪些上下文、允許使用哪些工具,結果是否滿足用戶需求。
這個周邊的技術棧為模型增加了多個層級,其中大量協調工作都由 CPU 承擔,包括編排、內存與檢索、工具調用、運行時與沙箱、策略系統以及可觀測性等。模型則提供智能、推理和生成能力,而外圍系統能將這些能力轉化為可執行的行動。
為什么傳統推理基準已無法全面衡量系統性能
對于聊天機器人,Token 吞吐量可以體現出模型響應速度與生成效率,以及系統能服務多少用戶。但對于智能體 AI,這個評判視角并不夠全面。
開發者并不會以每秒多少原始 Token 來感知系統性能。她真正關注的是:bug 是否定位準確、補丁修復是否正確、測試是否全部通過、權限是否合規、結果是否可信且可驗證。對于企業、科研、安全、運營以及物理世界的各類智能體而言,同樣如此,用戶關心的是最終成果。
這意味著,智能體 AI 時代需要采用工作流級別的性能指標,包括:單項任務完成成本、工具調用延遲、檢索延遲、沙箱啟動時間以及單節點智能體數量。核心評判標準從“模型生成得有多快?”轉變為“系統完成任務的效率有多高?”
CPU 發揮決定性的作用
CPU 在智能體 AI 中的價值,體現在圍繞模型調用的各環節中。模型運行前,系統解析請求、初始化運行環境、加載策略、讀取工程文件、查詢檢索系統、排序上下文、統計 Token 數量并準備請求。模型調用期間,CPU 負責處理路由、Token 化、批處理、流式傳輸和 Schema 配置。調用完成后,CPU 驗證輸出、路由工具調用、管理沙箱與子進程、采集日志、歸類故障、更新狀態并整合遙測數據。
在編碼智能體的例子中,一些最耗費 CPU 資源的工作往往發生在模型生成修復方案之后:運行測試、調用編譯器、啟動子進程、歸類故障、自主選擇重試邏輯。這些操作會對 CPU 核心、緩存、內存、存儲和編排軟件形成壓力。
這正是智能體 AI 看似“瞬間完成任務”背后隱藏的關鍵計算工作。
頭節點正演變為整個系統的控制中樞
隨著智能體系統規模化,頭節點 (head node) 的角色變得具有戰略意義。AI 頭節點不只是加速器旁邊的一顆 CPU。它是核心控制中樞,負責讓異構 AI 系統以統一、可靠的方式協同運作:路由請求、管理狀態、準備上下文、協調加速器、調用管理 API 與工具、執行策略、采集遙測,并保持工作流的可觀測性。
編排的本質,在于決定執行什么任務、在哪里執行、攜帶哪些上下文、允許調用哪些工具,以及如何判斷任務已經完成。而頭節點則是支撐這一能力的基礎設施控制中樞,負責在 CPU、GPU、加速器、內存、存儲、網絡、運行時、數據庫、規則管理系統以及可觀測性工具之間協調資源,并將這些編排決策貫穿整個系統。
隨著 AI 基礎設施日益異構化,模型、工具、內存、加速器、API、沙箱、規則管理、追蹤和評估循環都必須保持同步協作。而頭節點正是這一協調能力得以統一執行和運轉的控制中樞。
Arm 的機遇:全鏈路智能體工作流優化
對 Arm 而言,智能體 AI 代表著一次平臺級機遇。其對基礎設施的要求,正對應了云基礎設施建設者最關心的關鍵能力:性能、能效、擴展性、軟件成熟度以及選擇自由度。行業評判標準不再局限于 Token 生成速度,而是平臺能否在延遲、功耗、成本、資源利用率、穩定性、開發迭代效率等現實約束下,高效完成更多工作流。
Arm 提供了一個為異構基礎設施打造的計算平臺。在智能體時代,AI 系統由 CPU、GPU、加速器、內存、存儲、網絡、運行時、API、工具、可觀測系統和規則控制協同組成。Arm 的核心價值,在于幫助整個系統實現更高效率、更強擴展能力,并使系統級優化更加容易。
這一價值始于 Arm 深厚的技術底座:基于靈活的 Arm Neoverse IP 與計算子系統 (CSS) 打造的計算平臺、軟件支持體系以及合作伙伴生態,為 AI 基礎設施建設者提供了針對特定工作負載設計和部署基礎設施的多元路徑。智能體 AI 讓這種選擇靈活性變得更加重要,因為沒有任何單一計算配置能夠高效承載工作流的每一個環節。
這也是為什么 Arm 的價值應當從工作流層面來衡量。更優秀的智能體基礎設施應當體現在這些成果上:更低的單項任務成本、更低的延遲、更高的資源利用率、更可預測的執行效果。這些關鍵指標能夠直接體現 CPU 和頭節點的價值,并將其與業務成果緊密關聯起來。
Arm 將這一理念繼續延伸,推出面向智能體 AI 基礎設施的自研芯片 Arm AGI CPU,提供另一種部署 Arm 架構算力的選擇。在這套方案中,CPU 協調圍繞模型展開的工作:控制、內存、檢索、工具、API、運行時、沙箱以及可觀測性。
其目標并不是削弱 GPU 或其他加速器的作用,而是讓整個異構系統更好地協同運作。智能體 AI 時代,真正占據優勢的將是那些能夠優化整個任務圖 (Task Graph),而非僅僅優化 Token 流的基礎設施。
下一代基準:以任務完成為核心
回到前文那位等待修復結果的開發者,她需要的不是 Token,而是問題修復 bug。這就是智能體 AI 帶來的基礎設施架構轉變。在提示詞驅動的傳統問答時代,模型性能是顯而易見的重心。在智能體時代,系統必須優化全鏈路閉環:模型智能、內存、工具、狀態、規則管理、執行、驗證與可觀測性。
下一代 AI 基礎設施的評判標準,將是它能否快速、準確、安全、可觀測且高效地完成任務。在此背景下,Arm AGI CPU 為 AI 基礎設施建設者提供了部署 Arm 架構算力的新選擇,用于承載編排與任務執行等關鍵工作負載,幫助將模型輸出轉化為真正有價值的行動。



