LLM Agent là gì?
LLM agent là một hệ thống AI sử dụng mô hình ngôn ngữ lớn làm bộ máy suy luận cốt lõi, sau đó kết hợp nó với khả năng lập kế hoạch, bộ nhớ, công cụ và logic thực thi để hoàn thành tác vụ. Bên cạnh việc tạo ra phản hồi văn bản, LLM agent còn có thể hiểu một mục tiêu, quyết định các bước cần thiết, sử dụng công cụ bên ngoài, quan sát kết quả, và tiếp tục làm việc cho đến khi đạt được một kết quả hữu ích.
LLM agent so với chatbot: Sự khác biệt là gì?
Một chatbot cơ bản được thiết kế cho việc trò chuyện. Nó nhận một tin nhắn từ người dùng và tạo ra một câu trả lời. Điều này hoạt động tốt với những câu hỏi có thể được trả lời trong một phản hồi duy nhất.
LLM agent được thiết kế để hoàn thành tác vụ. Nó có thể lập kế hoạch cho một chuỗi hành động. Ví dụ, một chatbot có thể giải thích cách tạo một bài trình bày. Còn LLM agent có thể giúp thu thập thông tin, xây dựng cấu trúc nội dung, tạo các trang trình bày, tinh chỉnh câu chữ, và tạo ra một kết quả bàn giao hoàn chỉnh hơn.
Đây chính là chỗ những sản phẩm như Kimi Agent phát huy tác dụng một cách tự nhiên. Kimi Agent có thể hỗ trợ các quy trình như nghiên cứu thông tin, xử lý tài liệu, tạo nội dung PPT, phân tích bảng tính và xử lý các tác vụ nhiều bước đòi hỏi nhiều hơn một câu trả lời đơn lẻ.
Kiến trúc agent LLM
Một kiến trúc agent LLM điển hình gồm nhiều phần được kết nối với nhau. LLM đóng vai trò là bộ phận suy luận cốt lõi, nhưng nó không phải là toàn bộ hệ thống. Để hoàn thành các tác vụ thực tế, agent còn cần có khả năng lập kế hoạch, bộ nhớ, công cụ, khả năng quan sát và các cơ chế kiểm soát an toàn.
Một kiến trúc agent LLM đơn giản hóa trông như sau:
Mỗi thành phần đóng một vai trò khác nhau. Phần lõi của agent quyết định phải làm gì, việc lập kế hoạch chia công việc thành các bước, bộ nhớ theo dõi ngữ cảnh, còn công cụ giúp agent tương tác với các hệ thống bên ngoài.
Lõi của agent: LLM đóng vai trò bộ não
Lõi của agent thường là một mô hình ngôn ngữ lớn. Nó diễn giải yêu cầu của người dùng, hiểu mục tiêu, xác định thông tin nào cần thiết và chọn hành động tiếp theo.
Bạn có thể hình dung LLM như bộ não của agent. Nó điều phối quy trình làm việc, nhưng vẫn cần phần còn lại của hệ thống để tạo ra kết quả hữu ích. Không có công cụ, nó chỉ có thể tạo văn bản. Không có bộ nhớ, nó có thể mất dấu tác vụ đang thực hiện. Không có kế hoạch, nó có thể gặp khó khăn với các quy trình dài hoặc phức tạp. Không có ranh giới an toàn, nó có thể thực hiện những hành động đáng lẽ cần được xác minh trước.
Trong một agent được thiết kế tốt, LLM không hoạt động một mình. Nó vận hành bên trong một hệ thống xác định vai trò của nó, các công cụ khả dụng, ranh giới tác vụ, và các quy tắc về thời điểm cần dừng lại hoặc yêu cầu xác nhận.
Lập kế hoạch: Cách agent chia nhỏ các tác vụ phức tạp
Việc lập kế hoạch cho phép agent LLM biến một yêu cầu lớn thành các bước nhỏ hơn, dễ quản lý hơn. Điều này đặc biệt quan trọng khi câu trả lời không thể tìm ra chỉ bằng một phản hồi duy nhất.
Một số agent lập kế hoạch ngay từ đầu rồi thực hiện theo từng bước. Số khác sử dụng một vòng lặp linh hoạt hơn: thực hiện một hành động, quan sát kết quả, rồi điều chỉnh lại kế hoạch. Các kỹ thuật như ReAct và Reflexion thường được nhắc đến trong bối cảnh này vì chúng kết hợp suy luận, hành động, phản hồi và điều chỉnh.
Chính việc lập kế hoạch giúp agent chuyển từ việc "trả lời một prompt" sang "quản lý cả một quy trình làm việc".
Bộ nhớ: Cách agent duy trì ngữ cảnh
Bộ nhớ giúp agent theo dõi những gì đã xảy ra và những gì còn cần thực hiện.
Bộ nhớ ngắn hạn được sử dụng trong suốt tác vụ hiện tại. Nó có thể bao gồm yêu cầu của người dùng, kết quả gần nhất từ các công cụ, ghi chú trung gian, và kế hoạch hiện tại. Điều này giúp agent duy trì tính nhất quán khi thực hiện một quy trình nhiều bước.
Bộ nhớ dài hạn lưu trữ thông tin xuyên suốt nhiều lượt tương tác. Nó có thể bao gồm sở thích của người dùng, các quyết định trước đây, lịch sử dự án, hoặc các dữ kiện hữu ích từ những tác vụ trước. Bộ nhớ dài hạn đặc biệt hữu ích khi agent cần cá nhân hóa công việc trong tương lai hoặc tiếp tục một dự án theo thời gian.
Bộ nhớ không có nghĩa là agent "hiểu" mọi thứ như con người. Nó có nghĩa là hệ thống có một cách để lưu trữ, truy xuất và sử dụng ngữ cảnh liên quan khi đưa ra quyết định.
Công cụ: Cách agent LLM hành động
Công cụ là thứ cho phép agent LLM hành động vượt ra ngoài bản thân mô hình. Chúng có thể bao gồm công cụ tìm kiếm, cơ sở dữ liệu, trình thông dịch mã, hệ thống tệp, trình duyệt, API, máy tính, phần mềm doanh nghiệp, hoặc các hệ thống chuyên biệt khác.
Ví dụ, một agent có thể sử dụng:
Một công cụ tìm kiếm để thu thập thông tin mới nhất
Một trình kết nối cơ sở dữ liệu để truy xuất dữ liệu kinh doanh
Một trình thông dịch mã để thực hiện các phép tính
Một công cụ tệp để đọc và chỉnh sửa tài liệu
Một công cụ bảng tính để làm sạch và phân tích dữ liệu
Một API để cập nhật quy trình làm việc hoặc kích hoạt một hành động
Công cụ là một trong những khác biệt lớn nhất giữa chatbot và agent. Chatbot có thể cho bạn biết phải làm gì. Agent có công cụ có thể giúp bạn thực hiện điều đó.
Các framework agent LLM
Các framework agent LLM giúp nhà phát triển xây dựng, kết nối và quản lý các hệ thống agentic. Thay vì phải tự tay kết nối prompt, công cụ, bộ nhớ, logic lập kế hoạch, trạng thái quy trình, nhật ký và các bước đánh giá, nhà phát triển có thể sử dụng framework để tạo ra các quy trình agent có thể tái sử dụng.
Nhiều framework agent được xây dựng xoay quanh việc điều phối (orchestration), truy xuất thông tin (retrieval), phối hợp đa agent, và triển khai vào môi trường sản xuất. LangGraph tập trung vào việc điều phối agent có trạng thái, chạy trong thời gian dài. LlamaIndex thường được dùng cho các agent kết nối dữ liệu, đặc biệt khi ứng dụng cần truy xuất, phân tích tài liệu, lập chỉ mục và xử lý luồng truy vấn. Haystack hỗ trợ các ứng dụng LLM sẵn sàng cho môi trường sản xuất, bao gồm truy xuất, tìm kiếm, xử lý tài liệu và luồng làm việc của agent. CrewAI được thiết kế cho các luồng làm việc đa agent, trong đó các agent khác nhau có thể đảm nhận các vai trò khác nhau và phối hợp thông qua các quy trình chung.
Các framework này không phải là agent. Chúng cung cấp hạ tầng xung quanh agent: cách agent nhận ngữ cảnh, gọi công cụ, ghi nhớ thông tin, phối hợp các bước, khôi phục sau lỗi, và tạo ra kết quả có thể kiểm tra hoặc cải thiện. Trong thực tế, framework phù hợp phụ thuộc vào luồng công việc mục tiêu. Một agent nghiên cứu hoặc xử lý tài liệu có thể cần hỗ trợ truy xuất và trích dẫn nguồn. Một agent lập trình có thể cần quyền truy cập file, thực thi terminal, và phản hồi từ kiểm thử. Một agent tự động hóa nghiệp vụ có thể cần trạng thái luồng công việc, các bước kiểm duyệt, khả năng quan sát, và tích hợp với hệ thống nội bộ.
LLM agent có thể làm được gì?
LLM agent đã trở thành công cụ quan trọng trong nhiều ngành và vai trò công việc khác nhau. Phần dưới đây dùng Kimi làm ví dụ để minh họa cách LLM agent có thể được áp dụng trong các tình huống khác nhau.
Nghiên cứu và tổng hợp thông tin
Nghiên cứu là một trong những trường hợp sử dụng rõ ràng nhất của LLM agent, vì công việc này thường đòi hỏi tìm kiếm, đọc, so sánh, trích xuất, tóm tắt và sắp xếp thông tin. Một luồng làm việc dạng agentic có thể xử lý qua nhiều nguồn và tạo ra kết quả có cấu trúc hơn. Trong Kimi, người dùng có thể sử dụng Kimi Deep Research cho các luồng nghiên cứu dài hơi, phù hợp với các báo cáo chuyên sâu, phân tích chủ đề, khảo sát thị trường, và báo cáo có dẫn nguồn.
Ví dụ về prompt:
Viết, tóm tắt, và lập kế hoạch nội dung
LLM agent có thể hỗ trợ việc viết bằng cách biến đầu vào lộn xộn thành đầu ra có cấu trúc: chúng có thể tóm tắt tài liệu dài, tạo dàn ý, soạn các phần nội dung, điều chỉnh giọng văn, và chỉnh sửa theo phản hồi. Kimi LLM agent có thể được dùng cho việc viết và trò chuyện ngữ cảnh dài, hữu ích khi làm việc với ghi chú nguồn, tài liệu dài, hoặc các nhiệm vụ nội dung nhiều bước.
Phân tích dữ liệu và làm việc với bảng tính
Nhiều công việc kinh doanh diễn ra trên bảng tính. LLM agent có thể giúp làm sạch dữ liệu, phát hiện xu hướng, tạo công thức, giải thích bảng dữ liệu, và tạo biểu đồ hoặc bản tổng hợp dạng pivot. Với Kimi Sheets, bạn có thể tạo bảng tính, tạo công thức, xây dựng pivot table và biểu đồ, chuyển đổi định dạng file, và làm sạch dữ liệu lộn xộn.
Các luồng làm việc bảng tính có thể bao gồm:
Làm sạch tên, danh mục, hoặc định dạng ngày không nhất quán
Giải thích công thức và tạo công thức mới
Tóm tắt kết quả khảo sát hoặc dữ liệu bán hàng
Tạo biểu đồ cho báo cáo
Chuyển đổi dữ liệu chưa có cấu trúc thành bảng
Việc con người rà soát vẫn quan trọng. Agent có thể hiểu sai dữ liệu lộn xộn hoặc chọn sai phương pháp phân tích, nhưng với các công việc bảng tính có tính lặp lại, chúng có thể giảm công sức thủ công và giúp người dùng làm việc nhanh hơn.
Lập trình, kiểm thử, và tự động hóa luồng công việc
LLM agent ngày càng hữu ích trong phát triển phần mềm vì lập trình bản chất là công việc nhiều bước. Một nhà phát triển có thể cần hiểu yêu cầu, xem xét logic hiện có, tạo mã, kiểm thử kết quả, đọc lỗi, và chỉnh sửa cách triển khai. Trong Kimi, người dùng có thể yêu cầu tạo mã, giải thích mã, ý tưởng gỡ lỗi, các script nhỏ, và kế hoạch tự động hóa luồng công việc.
Tài liệu, slide, website, và vận hành kinh doanh
LLM agent hữu ích khi kết quả cuối cùng không chỉ là văn bản. Nhiều sản phẩm công việc là các kết quả có cấu trúc: tài liệu, bài trình bày, bảng tính, website, báo cáo, và kế hoạch vận hành. Kimi có thể lập kế hoạch và hoàn thành các nhiệm vụ như tạo website, tạo PPT, nghiên cứu chuyên sâu, và xử lý tài liệu hoặc bảng tính.
Luồng làm việc đa agent cho các nhiệm vụ lớn hơn
Một số nhiệm vụ quá rộng để xử lý bằng một luồng công việc tuyến tính duy nhất. Nghiên cứu đối thủ, viết nội dung dài, tìm kiếm quy mô lớn, phân tích theo lô, và tổng hợp từ nhiều nguồn có thể được hưởng lợi từ nhiều agent làm việc song song. Kimi Agent Swarm là một bề mặt sản phẩm dành cho công việc agentic quy mô lớn hơn. Nó hỗ trợ tới 4.000 lệnh gọi công cụ song song và có thể điều phối hơn 300 sub-agent cho các trường hợp sử dụng như tìm kiếm quy mô lớn, viết nội dung dài, và các nhiệm vụ theo lô. Lợi thế ở đây là tốc độ và độ bao phủ.
Lợi ích của LLM agent
LLM agent hữu ích vì chúng có thể xử lý các nhiệm vụ cần nhiều hơn một lần phản hồi.
Thứ nhất, chúng có thể quản lý các luồng công việc nhiều bước. Một báo cáo nghiên cứu, việc sửa mã, phân tích bảng tính, hoặc bài trình bày hiếm khi hoàn thành trong một bước. Agent có thể chia nhỏ các nhiệm vụ này và xử lý chúng một cách có hệ thống.
Thứ hai, chúng kết nối với các công cụ và hệ thống bên ngoài. Điều này cho phép chúng tìm kiếm trên web, đọc tài liệu, chạy mã, phân tích dữ liệu, hoặc tương tác với phần mềm nghiệp vụ.
Thứ ba, chúng có thể duy trì ngữ cảnh. Bộ nhớ giúp agent theo dõi những gì đã làm và những gì còn cần hoàn thành.
Thứ tư, chúng giảm việc chuyển đổi thủ công giữa các công cụ. Người dùng không còn phải tự chuyển đổi giữa các công cụ, vì agent đã xử lý quy trình đó thay họ.
Thứ năm, chúng có thể tạo ra kết quả cá nhân hóa hơn. Khi một agent có ngữ cảnh liên quan, nó có thể điều chỉnh đầu ra theo tác vụ, tài liệu, dữ liệu hoặc định dạng ưa thích của người dùng.
Kết luận
Agent LLM kết hợp mô hình ngôn ngữ với khả năng của agent để hoàn thành các tác vụ vượt ra ngoài một câu trả lời đơn lẻ. Chúng có thể quản lý các quy trình làm việc nhiều bước trong lĩnh vực nghiên cứu, phân tích dữ liệu, viết mã và sáng tạo nội dung, đồng thời điều chỉnh hành động dựa trên thông tin mới. Khi khả năng của chúng ngày càng phát triển, mục tiêu rõ ràng và sự giám sát của con người vẫn là yếu tố thiết yếu để tạo ra kết quả đáng tin cậy.