LLM Agent Nedir?
LLM agent, temel akıl yürütme motoru olarak büyük bir dil modeli kullanan, ardından bunu görevleri tamamlamak üzere planlama, bellek, araçlar ve yürütme mantığıyla birleştiren bir yapay zeka sistemidir. LLM agent, bir metin yanıtı üretmenin ötesinde bir hedefi anlayabilir, hangi adımların gerektiğine karar verebilir, harici araçları kullanabilir, sonuçları gözlemleyebilir ve yararlı bir sonuca ulaşana kadar çalışmaya devam edebilir.
LLM ajanları ve chatbot’lar: Aralarındaki fark nedir?
Temel bir chatbot, sohbet için tasarlanmıştır. Bir kullanıcı mesajı alır ve bir yanıt üretir. Bu, tek bir yanıtla cevaplanabilecek sorular için iyi çalışır.
LLM agent ise görev tamamlama için tasarlanmıştır. Bir dizi eylemi planlayabilir. Örneğin bir chatbot, bir sunumun nasıl oluşturulacağını açıklayabilir. Bir LLM agent ise bilgi toplamaya, kurguyu yapılandırmaya, slaytlar oluşturmaya, metni geliştirmeye ve daha eksiksiz bir çıktı üretmeye yardımcı olabilir.
Kimi Agent gibi ürünler tam da burada devreye girer. Kimi Agent; bilgi araştırma, doküman işleme, PPT içeriği oluşturma, elektronik tablo analizi yapma ve tek bir yanıttan fazlasını gerektiren çok adımlı görevleri ele alma gibi iş akışlarını destekleyebilir.
LLM agent mimarisi
Tipik bir LLM agent mimarisi, birbirine bağlı birkaç parçadan oluşur. LLM akıl yürütme çekirdeği görevi görür, ancak sistemin tamamı bu değildir. Gerçek görevleri tamamlamak için ajanın planlama, bellek, araçlar, gözlemler ve güvenlik kontrollerine de ihtiyacı vardır.
Basitleştirilmiş bir LLM agent mimarisi şöyle görünür:
Her bileşen farklı bir rol üstlenir. Agent çekirdeği ne yapılacağına karar verir, planlama işi adımlara böler, bellek bağlamı takip eder ve araçlar ajanın harici sistemlerle etkileşime girmesini sağlar.
Agent çekirdeği: Beyin olarak LLM
Agent çekirdeği genellikle büyük bir dil modelidir. Kullanıcının isteğini yorumlar, hedefi anlar, hangi bilginin gerektiğine karar verir ve bir sonraki eylemi seçer.
LLM’yi ajanın beyni olarak düşünebilirsiniz. İş akışını koordine eder, ancak yararlı bir iş yapabilmek için yine de sistemin geri kalanına ihtiyaç duyar. Araçlar olmadan yalnızca metin üretebilir. Bellek olmadan görevi takip edemeyebilir. Planlama olmadan uzun veya karmaşık iş akışlarında zorlanabilir. Güvenlik sınırları olmadan doğrulama gerektiren eylemler gerçekleştirebilir.
İyi tasarlanmış bir ajanda LLM tek başına hareket etmez. Rolünü, kullanabileceği araçları, görev sınırlarını ve ne zaman durması veya onay istemesi gerektiğini tanımlayan bir sistem içinde çalışır.
Planlama: Ajanlar karmaşık görevleri nasıl adımlara böler
Planlama, bir LLM agent'ın büyük bir isteği daha küçük, yönetilebilir adımlara bölmesini sağlar. Bu, özellikle yanıtın tek bir cevapla bulunamadığı durumlarda önem taşır.
Bazı agent'lar en başta bir plan oluşturur ve bu planı adım adım uygular. Diğerleri ise daha esnek bir döngü kullanır: bir eylemde bulunur, sonucu gözlemler ve ardından planı yeniden düzenler. ReAct ve Reflexion gibi teknikler, akıl yürütme, eylem, geri bildirim ve düzeltmeyi bir arada barındırdıkları için bu bağlamda sıkça ele alınır.
Planlama, agent'ların “bir prompt'a yanıt vermek”ten “bir iş akışını yönetmek”e geçmesini sağlayan unsurdur.
Bellek: Agent'lar bağlamı nasıl korur?
Bellek, bir agent'ın ne olduğunu ve daha ne yapılması gerektiğini takip etmesine yardımcı olur.
Kısa süreli bellek, geçerli görev sırasında kullanılır. Kullanıcının isteği, son araç sonuçları, ara notlar ve mevcut plan bu belleğin içeriğinde olabilir. Bu, agent'ın çok adımlı bir iş akışını tamamlarken tutarlı kalmasına yardımcı olur.
Uzun süreli bellek, etkileşimler arasında bilgi saklar. Kullanıcı tercihlerini, önceki kararları, proje geçmişini veya daha önceki görevlerden edinilen faydalı bilgileri içerebilir. Uzun süreli bellek, özellikle bir agent'ın gelecekteki çalışmaları kişiselleştirmesi veya bir projeyi zaman içinde sürdürmesi gerektiğinde işe yarar.
Bellek, agent'ın bir insan gibi her şeyi “anladığı” anlamına gelmez. Bunun anlamı, sistemin karar verirken ilgili bağlamı saklama, geri getirme ve kullanma yolunun olmasıdır.
Araçlar: LLM agent'lar nasıl eylemde bulunur?
Araçlar, LLM agent'ların modelin kendisinin dışında eylemde bulunmasını sağlayan unsurlardır. Bunlar arama motorları, veritabanları, kod yorumlayıcıları, dosya sistemleri, tarayıcılar, API'ler, hesap makineleri, kurumsal yazılımlar veya diğer özel sistemleri içerebilir.
Örneğin, bir agent şunları kullanabilir:
Güncel bilgi toplamak için bir arama aracı
İş verilerini almak için bir veritabanı bağlayıcısı
Hesaplamaları çalıştırmak için bir kod yorumlayıcı
Belgeleri okumak ve düzenlemek için bir dosya aracı
Verileri temizlemek ve analiz etmek için bir e-tablo aracı
Bir iş akışını güncellemek veya bir eylemi tetiklemek için bir API
Araçlar, bir chatbot ile bir agent arasındaki en büyük farklardan biridir. Bir chatbot size ne yapmanız gerektiğini söyleyebilir. Araçlara sahip bir agent ise bunu yapmanıza yardımcı olabilir.
LLM agent framework'leri
LLM agent framework'leri, geliştiricilerin agent tabanlı sistemler oluşturmasına, bağlamasına ve yönetmesine yardımcı olur. Geliştiriciler prompt'ları, araçları, belleği, planlama mantığını, iş akışı durumunu, günlükleri ve değerlendirme adımlarını manuel olarak birbirine bağlamak yerine, tekrar kullanılabilir agent iş akışları oluşturmak için framework'lerden yararlanabilir.
Birçok agent framework'ü orkestrasyon, bilgi getirme (retrieval), çoklu agent iş birliği ve üretim ortamına dağıtım etrafında kurulmuştur. LangGraph, uzun süre çalışan, durum tutan agent orkestrasyonuna odaklanır. LlamaIndex, özellikle uygulamaların bilgi getirme, belge ayrıştırma, indeksleme ve sorgu iş akışlarına ihtiyaç duyduğu durumlarda, verilere bağlı agent'lar için sıklıkla kullanılır. Haystack, bilgi getirme, arama, belge işleme ve agent iş akışları dahil olmak üzere üretime hazır LLM uygulamalarını destekler. CrewAI, farklı agent'ların farklı roller üstlenip ortak süreçler üzerinden koordinasyon sağlayabildiği çoklu agent iş akışları için tasarlanmıştır.
Bu framework'ler kendi başlarına agent değildir. Agent'ların etrafındaki altyapıyı sağlarlar: agent'ların bağlamı nasıl aldığı, araçları nasıl çağırdığı, bilgiyi nasıl hatırladığı, adımları nasıl koordine ettiği, hatalardan nasıl kurtulduğu ve incelenebilir veya geliştirilebilir çıktılar nasıl ürettiği gibi konuları kapsar. Pratikte, doğru framework seçimi hedeflenen iş akışına bağlıdır. Bir araştırma veya belge agent'ı bilgi getirme ve kaynak gösterme desteğine ihtiyaç duyabilir. Bir kodlama agent'ı dosya erişimi, terminal çalıştırma ve test geri bildirimi gerektirebilir. Bir iş otomasyonu agent'ı ise iş akışı durumu, onay kontrol noktaları, gözlemlenebilirlik ve iç sistemlerle entegrasyon gerektirebilir.
LLM agent'lar ne yapabilir?
LLM agent'lar, birçok sektör ve iş rolü için önemli araçlar haline gelmiştir. Aşağıdaki bölümde, LLM agent'ların farklı senaryolarda nasıl uygulanabileceğini göstermek için örnek olarak Kimi kullanılmaktadır.
Araştırma ve bilgi sentezi
Araştırma, genellikle arama yapma, okuma, karşılaştırma, çıkarma, özetleme ve bilgiyi düzenleme gerektirdiği için LLM agent'lar için en açık kullanım alanlarından biridir. Agent tabanlı bir iş akışı, kaynakları tarayarak daha yapılandırılmış bir sonuç üretebilir. Kimi'de kullanıcılar, daha uzun araştırma iş akışları için Kimi Derin Araştırma'yı kullanabilir; bu özellik daha kapsamlı brief'ler, konu analizleri, pazar taramaları ve kaynak destekli raporlar için uygundur.
Örnek prompt'lar:
Yazma, özetleme ve içerik planlama
LLM agent'lar, dağınık girdileri yapılandırılmış çıktılara dönüştürerek yazma sürecini destekleyebilir: uzun materyalleri özetleyebilir, taslak ana hatlar oluşturabilir, bölümler yazabilir, tonu uyarlayabilir ve geri bildirime göre revizyon yapabilir. Kimi LLM agent, yazma ve uzun bağlamlı sohbetler için kullanılabilir; bu, kaynak notlarıyla, uzun belgelerle veya çok adımlı içerik görevleriyle çalışırken faydalıdır.
Veri analizi ve e-tablo çalışmaları
Birçok iş görevi e-tablolarda gerçekleşir. LLM agent'lar veri temizleme, örüntü tespiti, formül oluşturma, tabloları açıklama ve grafik veya pivot tablo türü özetler oluşturma konularında yardımcı olabilir. Kimi Sheets ile e-tablolar oluşturabilir, formüller üretebilir, pivot tablolar ve grafikler hazırlayabilir, dosya formatlarını dönüştürebilir ve dağınık verileri temizleyebilirsiniz.
Olası e-tablo iş akışları şunları içerir:
Tutarsız isimleri, kategorileri veya tarih formatlarını temizleme
Formülleri açıklama ve yeni formüller oluşturma
Anket sonuçlarını veya satış verilerini özetleme
Bir rapor için grafikler oluşturma
Yapılandırılmamış verileri bir tabloya dönüştürme
İnsan denetimi hâlâ önemlidir. Agent'lar dağınık verileri yanlış okuyabilir veya yanlış analiz yöntemini seçebilir; ancak tekrarlayan e-tablo işleri için manuel emeği azaltabilir ve kullanıcıların daha hızlı ilerlemesine yardımcı olabilirler.
Kodlama, test etme ve iş akışı otomasyonu
Kodlama doğası itibarıyla çok adımlı bir süreç olduğu için LLM agent'lar yazılım geliştirmede giderek daha kullanışlı hale gelmektedir. Bir geliştiricinin gereksinimleri anlaması, mevcut mantığı incelemesi, kod üretmesi, sonucu test etmesi, hataları okuması ve uygulamayı revize etmesi gerekebilir. Kimi'de kullanıcılar kod üretimi, kod açıklaması, hata ayıklama önerileri, küçük script'ler ve iş akışı otomasyon planları isteyebilir.
Belgeler, sunumlar, web siteleri ve iş operasyonları
LLM agent'lar, nihai çıktının sadece metin olmadığı durumlarda kullanışlıdır. Birçok iş çıktısı yapılandırılmış teslim edilebilirlerdir: belgeler, sunumlar, elektronik tablolar, web siteleri, raporlar ve operasyon planları. Kimi, web sitesi oluşturma, PPT hazırlama, derin araştırma ve belge veya tablo işleme gibi görevleri planlayıp tamamlayabilir.
Daha büyük görevler için çoklu agent iş akışları
Bazı görevler tek bir doğrusal iş akışı için kapsam olarak fazla geniştir. Rekabet araştırması, uzun form yazım, büyük ölçekli arama, toplu analiz ve çok kaynaklı sentez gibi işler birden fazla agent'ın paralel çalışmasından fayda görebilir. Kimi Agent Swarm, daha büyük ölçekli agent tabanlı çalışmalar için bir ürün yüzeyidir. 4.000'e kadar paralel araç çağrısını destekler ve büyük ölçekli arama, uzun form yazım ve toplu görevler gibi kullanım durumları için 300'den fazla alt agent'ı koordine edebilir. Bunun avantajı hız ve kapsam genişliğidir.
LLM agent'ların avantajları
LLM agent'lar, birden fazla yanıt gerektiren görevleri ele alabildikleri için kullanışlıdır.
Birincisi, çok adımlı iş akışlarını yönetebilirler. Bir araştırma raporu, kod düzeltmesi, elektronik tablo analizi veya sunum, tek bir adımda tamamlanan işler değildir. Agent'lar bu görevleri parçalara ayırıp sistematik bir şekilde yürütebilir.
İkincisi, araçlara ve harici sistemlere bağlanırlar. Bu, web'de arama yapmalarını, belgeleri okumalarını, kod çalıştırmalarını, veri analiz etmelerini veya iş yazılımlarıyla etkileşime geçmelerini sağlar.
Üçüncüsü, bağlamı koruyabilirler. Hafıza, agent'ların şimdiye kadar ne yaptıklarını ve hâlâ tamamlanması gerekenleri takip etmelerine olanak tanır.
Dördüncüsü, araçlar arasında manuel geçiş yapma ihtiyacını azaltırlar. Süreci agent yönettiği için kullanıcıların araçlar arasında manuel olarak geçiş yapmasına gerek kalmaz.
Beşincisi, daha kişiselleştirilmiş sonuçlar üretebilirler. Bir agent ilgili bağlama sahip olduğunda, çıktısını kullanıcının görevine, belgesine, verisine veya tercih ettiği biçime göre uyarlayabilir.
Sonuç
LLM agent'lar, tek bir yanıtın ötesine geçen görevleri tamamlamak için dil modellerini agent yeteneklerle birleştirir. Yeni bilgilere göre eylemlerini uyarlarken; araştırma, veri analizi, kodlama ve içerik oluşturma gibi alanlarda çok adımlı iş akışlarını yönetebilirler. Yetenekleri gelişse de, güvenilir sonuçlar üretmek için açık hedefler ve insan denetimi hâlâ vazgeçilmezdir.