AI 模型更強、成本更低,企業帳單卻失控:代理式工作流成 Token 飆升主因

AI 產業正面臨一項日益明顯的矛盾:模型性能持續提升、單位 Token 成本逐步下降,但企業的 AI 帳單卻快速膨脹。近期觀察指出,成本壓力不只來自模型推理本身,更與日益普及的「代理式工作流」(agentic workflows)有關。

代理式工作流會將複雜任務拆解成多個步驟,讓 AI 反覆讀取上下文、呼叫外部工具、檢查結果並進行修正。這類流程雖然能擴大 AI 的自動化能力,卻也可能讓 Token 消耗量呈倍數,甚至數十倍增加,成為企業難以預測支出的主要來源。

多步驟任務讓 Token 用量快速放大

簡單的問答可能只需要數百至數千個 Token,但若任務涉及 Excel、CRM 系統與網路搜尋,並要求 AI 整理資料後製作報告,累積用量可能達到數十萬,甚至數百萬個 Token。

原因在於,模型每次互動時通常都必須重新處理既有對話、指令與相關檔案。當對話內容變長、工具呼叫次數增加,或工作流包含更多檢查與重試步驟,成本與回應時間便更容易失控。

例如,一項每 15 分鐘執行一次的榜單製作工作,月費可能從數十美元迅速增加至數千美元;更複雜的多階段報告任務,單次成本甚至可能達到數萬美元。實際金額仍會受到模型選擇、輸入輸出長度、工具使用方式與供應商計費規則影響。

固定訂閱模式難以承受代理式 AI 用量

隨著企業從單純聊天工具轉向大規模部署 AI 代理,原本以固定月費或固定額度為主的方案,開始難以反映實際使用量。Anthropic、OpenAI 與微軟在 4 月轉向更重視用量的計費方式,並收緊固定方案的 Token 上限,反映供應商也正面臨推理資源與成本控制壓力。

對大型企業而言,AI 支出已不再只是技術部門的問題,而是財務部門必須持續監控的成本項目。Uber、微軟、亞馬遜與沃爾瑪等企業都開始控制 AI 開支;相關觀察指出,在大量部署代理式 AI 後,部分企業的 AI 支出甚至可能高於人事成本。

企業 AI 預算面臨超支風險

這項現象並非單一企業的個案,而逐漸成為企業導入 AI 後的普遍管理難題。麥肯錫調查指出,93% 的企業 AI 團隊已超過預算;另有資料顯示,代理式 AI 支出中有 60% 來自反覆修正與重寫輸出。

即使 Token 價格在兩年內大幅下滑,企業 AI 帳單仍可能持續上升,主因是實際用量與工作流複雜度的增長速度更快。部分企業甚至在數個月內用盡全年 AI 預算,之後只能重新協商合約或追加資金。

這也使企業開始重新評估 AI 專案的投資報酬率(ROI)。過去以「能否導入」或「能否提升效率」為主要判斷標準的做法,逐步轉向追蹤每項任務的 Token 用量、實際成本、產出品質與業務效益。

Tokenomics 成為 AI 導入的新管理課題

業界目前開始以「Tokenomics」描述 AI 使用量與成本管理,並採用多種工程方法降低不必要的推理支出:

  • Prompt Caching:快取重複使用的指令與上下文,減少相同內容被反覆處理。
  • Model Routing:依任務難度將請求分配給不同模型,讓簡單工作使用成本較低的小型模型。
  • Batching:將可延後處理的請求集中批次執行,以提高資源使用效率。
  • Semantic Caching:針對語意相近的請求重用既有結果,降低重複推理需求。
  • 縮短上下文窗口:只保留完成任務所需的資訊,避免每次互動都重新傳送過長內容。
  • 分層使用模型:將大型模型保留給高難度或高風險工作,簡單任務則交由較小模型處理。

可視化與成本歸因決定能否規模化

成本優化不只是選用更便宜的模型,也包括建立完整的用量監控與成本歸因機制。企業需要知道每個部門、應用程式、代理或工作流消耗多少 Token,以及這些支出是否帶來相應的效率提升或營收效益。

若缺乏可視化工具,企業可能只在月底收到一筆難以拆解的帳單,無法判斷成本是來自模型、上下文、工具呼叫,還是代理反覆修正造成的額外用量。當 AI 應用進一步擴大,這種不可見性將使預算更加難以預測。

代理式 AI 的價值因此不只取決於它能否完成更多工作,也取決於系統是否知道何時停止、哪些步驟值得重試,以及何時應改用較低成本的模型。對企業而言,AI 規模化的下一階段,將是同時管理自動化效益、輸出品質與每筆 Token 成本。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles