什麼是 LLM agent?
LLM agent 是一種 AI 系統,以大型語言模型作為核心推理引擎,再結合規劃、記憶、工具與執行邏輯來完成任務。除了產生文字回應之外,LLM agent 還能理解目標、決定所需的步驟、使用外部工具、觀察結果,並持續運作直到得出有用的成果為止。
LLM agent 與聊天機器人:有什麼不同?
基本的聊天機器人是為對話而設計的。它接收使用者訊息,然後產生回覆。這種方式很適合可以用單一回應回答的問題。
LLM agent 則是為完成任務而設計的。它可以規劃一連串的行動。舉例來說,聊天機器人可以說明如何製作簡報,而 LLM agent 則能協助蒐集資訊、組織內容架構、生成投影片、修飾文字,並產出更完整的成果。
這正是 Kimi Agent 這類產品能發揮作用的地方。Kimi Agent 可以支援研究資訊、處理文件、生成 PPT 內容、分析試算表,以及處理需要不只一個答案的多步驟任務等工作流程。
LLM agent 架構
典型的 LLM agent 架構包含多個相互連結的部分。LLM 扮演推理核心的角色,但它並不是整個系統。要完成實際任務,agent 還需要規劃、記憶、工具、觀察機制與安全控制。
簡化後的 LLM agent 架構如下:
每個元件都扮演不同的角色。agent 核心決定要做什麼,規劃將工作拆解成步驟,記憶負責追蹤上下文,而工具則讓 agent 能夠與外部系統互動。
Agent 核心:作為大腦的 LLM
agent 核心通常是一個大型語言模型。它負責解讀使用者的請求、理解目標、判斷需要哪些資訊,並決定下一步該採取的行動。
你可以把 LLM 想成 agent 的大腦。它負責協調整個工作流程,但仍需要系統其他部分才能發揮實際作用。沒有工具,它就只能產生文字;沒有記憶,它可能會失去任務的脈絡;沒有規劃,它在面對冗長或複雜的工作流程時可能會遇到困難;沒有安全界限,它可能會採取原本應該經過驗證的行動。
在設計良好的 agent 中,LLM 不會單獨運作。它是在一個系統之內運作,這個系統定義了它的角色、可用的工具、任務界限,以及何時該停止或請求確認的規則。
規劃:agent 如何拆解複雜任務
規劃能讓 LLM Agent 把一個大請求拆解成更小、更容易處理的步驟。當答案無法透過單一回應得出時,這一點尤其重要。
有些 Agent 會在一開始就制定計畫,然後按部就班執行。有些則採用更靈活的循環方式:先採取一項行動,觀察結果,再修訂計畫。ReAct 和 Reflexion 這類技術經常在這樣的討論中被提及,因為它們結合了推理、行動、回饋與調整。
規劃正是幫助 Agent 從「回答一個提示詞」進化到「管理一整套工作流程」的關鍵。
記憶:Agent 如何保留脈絡
記憶能幫助 Agent 追蹤已經發生的事情,以及接下來還需要做什麼。
短期記憶用於當前任務,可能包含使用者的請求、最近的工具結果、中間筆記,以及當前的計畫。這有助於 Agent 在完成多步驟工作流程時保持連貫性。
長期記憶則儲存跨互動的資訊,可能包括使用者偏好、先前的決策、專案歷史,或先前任務中有用的事實。當 Agent 需要個人化未來的工作,或長時間持續推進一個專案時,長期記憶尤其有用。
擁有記憶並不代表 Agent 像人類一樣「理解」一切,而是代表這個系統有辦法在做決策時儲存、擷取並運用相關的脈絡資訊。
工具:LLM Agent 如何採取行動
工具讓 LLM Agent 能夠在模型本身之外採取行動,可以包括搜尋引擎、資料庫、程式碼直譯器、檔案系統、瀏覽器、API、計算機、企業軟體,或其他專門系統。
舉例來說,Agent 可能會使用:
使用搜尋工具蒐集最新資訊
使用資料庫連接器擷取商業資料
使用程式碼直譯器執行運算
使用檔案工具讀取和編輯文件
使用試算表工具清理和分析資料
使用 API 更新工作流程或觸發某項動作
工具是聊天機器人和 Agent 之間最大的差異之一。聊天機器人能告訴你該做什麼,而具備工具的 Agent 則能幫你把它做完。
LLM Agent 框架
LLM Agent 框架能協助開發者建構、串接並管理具備代理能力的系統。開發者不必手動把提示詞、工具、記憶、規劃邏輯、工作流程狀態、日誌和評估步驟一一串連起來,而是可以使用框架來建立可重複使用的 Agent 工作流程。
許多 Agent 框架都是圍繞著編排、檢索、多 Agent 協作和正式環境部署所打造的。LangGraph 專注於長時間運行、具狀態的 Agent 編排;LlamaIndex 常用於資料連接型 Agent,特別是應用程式需要檢索、文件解析、索引與查詢工作流程的情境;Haystack 支援可用於正式環境的 LLM 應用程式,包括檢索、搜尋、文件處理和 Agent 工作流程;CrewAI 則是為多 Agent 工作流程而設計,讓不同的 Agent 能擔任不同角色,並透過共用流程互相協調。
這些框架本身並不是 Agent,而是提供 Agent 運作所需的基礎架構:Agent 如何接收脈絡資訊、呼叫工具、記住資訊、協調各個步驟、從失敗中恢復,以及產出可供檢視或改進的結果。實際上,選擇哪一種框架取決於目標工作流程:研究或文件類 Agent 可能需要檢索與引用來源的支援;程式編寫類 Agent 可能需要檔案存取、終端機執行和測試回饋;商業自動化類 Agent 則可能需要工作流程狀態、審核關卡、可觀測性,以及與內部系統的整合。
LLM Agent 能做什麼?
LLM Agent 已成為許多產業與職務中的重要工具。以下段落以 Kimi 為例,說明 LLM Agent 可以如何應用在不同情境中。
研究與資訊整合
研究是 LLM Agent 最明確的應用場景之一,因為它通常需要搜尋、閱讀、比較、擷取、彙整並整理資訊。具備代理能力的工作流程能夠處理各種來源,並產出更有條理的結果。在 Kimi 中,使用者可以使用 Kimi Deep Research 進行更長的研究工作流程,適合用於深度簡報、主題分析、市場掃描,以及有來源佐證的報告。
範例提示詞:
寫作、摘要與內容規劃
LLM Agent 能協助寫作,把雜亂的輸入轉化為有條理的輸出:它們可以彙整長篇資料、建立大綱、起草段落、調整語氣,並根據回饋進行修改。Kimi LLM Agent 可用於寫作和長脈絡對話,在處理資料筆記、長篇文件或多步驟內容任務時特別有幫助。
資料分析與試算表作業
許多商業任務都是在試算表中進行的。LLM Agent 可以幫忙清理資料、找出規律、產生公式、解釋表格內容,以及建立圖表或樞紐分析式的摘要。透過 Kimi Sheets,你可以建立試算表、產生公式、建立樞紐分析表和圖表、轉換檔案格式,並清理雜亂的資料。
可能的試算表工作流程包括:
清理不一致的名稱、類別或日期格式
解釋既有公式並產生新的公式
彙整問卷結果或銷售資料
為報告製作圖表
把非結構化資料轉換為表格
人工審核仍然很重要。Agent 可能會誤讀雜亂的資料,或選錯分析方法,但對於重複性的試算表工作,它們能減少人力負擔,幫助使用者更快完成工作。
程式編寫、測試與工作流程自動化
LLM Agent 在軟體開發領域越來越實用,因為程式編寫天生就是一個多步驟的過程。開發者可能需要理解需求、檢視既有邏輯、產生程式碼、測試結果、閱讀錯誤訊息,並修改實作方式。在 Kimi 中,使用者可以要求產生程式碼、解釋程式碼、提供除錯思路、撰寫小型腳本,以及規劃工作流程自動化方案。
文件、簡報、網站與業務營運
當最終輸出不只是文字時,LLM Agent 就能派上用場。許多工作成果其實是結構化的交付物:文件、簡報、試算表、網站、報告與營運計畫。Kimi 能夠規劃並完成諸如網站生成、PPT 製作、深度研究,以及文件或表格處理等任務。
適用於大型任務的多 Agent 工作流程
有些任務範圍太廣,無法靠單一線性工作流程完成。競品研究、長篇寫作、大規模搜尋、批次分析與多來源彙整等工作,往往能透過多個 Agent 並行運作而受益。Kimi Agent Swarm 就是為大規模 Agent 任務打造的產品介面。它支援最多 4,000 個並行工具呼叫,並能調度 300 多個子 Agent,用於大規模搜尋、長篇寫作與批次任務等場景,優勢在於速度與覆蓋範圍。
LLM Agent 的優勢
LLM Agent 之所以實用,是因為它們能處理需要不止一次回應才能完成的任務。
首先,它們能管理多步驟工作流程。無論是研究報告、程式修復、試算表分析還是簡報製作,很少能一步到位。Agent 可以將這些任務拆解,並有系統地逐步完成。
其次,它們能連接工具與外部系統。這讓它們可以搜尋網路、閱讀文件、執行程式碼、分析資料,或與商業軟體互動。
第三,它們能保留上下文。有了記憶,Agent 才能追蹤已完成的工作以及尚待完成的部分。
第四,它們減少了在工具之間手動切換的需求。使用者不必再手動切換工具,因為 Agent 會替他們處理整個流程。
第五,它們能產出更貼合個人需求的結果。當 Agent 掌握相關上下文時,就能根據使用者的任務、文件、資料或偏好格式來調整輸出。
結論
LLM Agent 將語言模型與 Agent 能力結合,用以完成超越單一回應範疇的任務。它們能在研究、資料分析、程式撰寫與內容創作等領域管理多步驟工作流程,同時根據新資訊調整行動。隨著其能力不斷成長,明確的目標與人工審核仍是產出可靠結果不可或缺的一環。