"Ajan" kelimesi artık arkasında bir dil modeli olan neredeyse her şeye, yalnızca metin üreten sistemlere bile takılıyor. Bu, tedarikçi karşılaştırmasını zorlaştırıyor, bütçe konuşmalarını daha da zorlaştırıyor; çünkü karşılaştırılan iki şey maliyet, risk ve üretime çıkış süresi açısından on kat farklı.
Önemli olan ayrım sohbet kalitesi, hafıza veya sunumda kaç aracın göründüğü değildir. Başka bir sistemde durum değiştirip değiştirmediğidir. Sohbet botu bir cevap üretir, ne yapılacağına insan karar verir. Ajan ise eylemi kendisi gerçekleştirir - kaydı yazar, mesajı gönderir, iadeyi yapar. Ajanlarla ilgili pahalı olan her şey bu tek özellikten doğar.
Bu yazı şunları ele alıyor: çizgi tam olarak nerede, çoğu ekibin durması gereken ara seviyeler hangileri, çizgiyi geçtiğinizde mimaride ve maliyette ne değişiyor ve probleminizin hangisine ihtiyacı olduğuna nasıl karar verirsiniz.
Çizgi, Eyleme Geçip Geçemediğidir
Kullanışlı bir test: sistem gece 03:00'te, kimse bakmazken hata yaparsa zarar nedir?
Sohbet botu için en kötü durum, bir kişinin okuduğu yanlış bir cevaptır. Zarar insan dikkatiyle sınırlıdır - buna göre hareket edip etmemeye yine biri karar verir. Ajan için en kötü durum, zaten yapılmış yanlış bir eylemdir. Döngüde hiç insan olmayabilir ve zarar yalnızca sistemin yapmasına izin verilen şeyle sınırlıdır.
Bu fark tüm projeyi yeniden çerçeveler. Sohbet botu bir bilgi kalitesi problemidir: cevap doğru mu, dayanaklı mı, güncel mi? Ajan bunun üstüne bir yetki problemidir: neye dokunmasına izin var, kim onayladı, geri alınabilir mi ve ne olduğunu nasıl yeniden kurarsınız.
Sohbet yeteneği ayırıcı çizgi değildir. Bir sistem akıcı çok turlu konuşma yapabilir, bağlamı hatırlayabilir ve kaynak gösterebilir ama yine de sohbet botu kalır; çünkü her sonucu hâlâ bir insan uygular.
İki Değil, Dört Seviye
Gerçek kurulumların çoğu uçlar arasında bir yerde durur ve seviyeyi adlandırmak, görevin ihtiyacından fazlasını satın almayı önler.
Seviye 1 - Külliyattan cevaplama. Retrieval destekli soru-cevap. Sistem belgelerde arama yapar ve kaynak göstererek cevaplar. Dışarıda hiçbir durum değişmez. Kurumsal bilgi vakalarının çoğu buraya aittir ve bu alanda ölçülebilir değerin büyük kısmı gerçekte burada üretilmiştir.
Seviye 2 - Canlı sistemlerden okuma. Model salt-okunur API'leri çağırır: sipariş durumu, hesap bakiyesi, talep geçmişi. Artık belgelerin cevaplayamadığı soruları cevaplayabilir ama hâlâ hiçbir şeyi değiştiremez. Eklenen risk veri bozulması değil veri ifşasıdır; bu yüzden ana kontrol izin filtrelemesidir.
Seviye 3 - Tek sınırlı eylem. Sistem iyi tanımlanmış tek bir yazma işlemi yapar: talep açar, randevu oluşturur, limit altında iade uygular. Her eylem ayrı ayrı tasarlanır, doğrulanır ve kaydedilir. Bu, otomasyon değerinin büyük bir kısmını, uçu açık bir ajanın riskinin çok altında yakalar.
Seviye 4 - Çok adımlı özerklik. Sistem bir dizi planlar, birden fazla araç çağırır, ara sonuçlara tepki verir ve döngüye girebilir. İnsanların genellikle "ajan" derken kastettiği budur ve maliyet, hata biçimleri ve operasyonel yük burada yoğunlaşır.
Yaygın hata, Seviye 4 demoda iyi göründüğü için Seviye 1'den doğrudan Seviye 4'e atlamaktır. Seviye 3, adının düşündürdüğünden çok daha fazla gerçek problemi çözer ve sindirebileceğiniz şekilde başarısız olur.
Mimaride Ne Değişir
Eyleme geçmek, sohbet botunun hiç ihtiyaç duymadığı bileşenler getirir.
Sözleşmesi zorunlu tutulan araç katmanı. Model veritabanı bağlantısı almaz; argümanları doğrulayan, kapsamı kontrol eden ve limitleri kodda uygulayan belirli fonksiyonlar alır. Modelin doğru sorup sormaması, sistemin tutarlı kalmasını belirlemeyi bırakır.
Kalıcı durum. Çok adımlı bir görev tek bir istekten uzun yaşar. Saklanan duruma, hatadan sonra devam edebilmeye ve "bu çalıştırma şu an ne yapıyor" sorusunu yanıtlayacak bir yapıya ihtiyaç duyar - bir konuşma tamponuna değil, bir iş deposuna.
İdempotentlik. Yeniden denemeler kaçınılmazdır. Yinelenme anahtarları olmadan, başarılı bir iadedeki ağ zaman aşımı iki iadeye dönüşür. Bu tek eksiklik, ajan olaylarına model kalitesinden daha fazla sebep olur.
Onay kapıları. Eşiğin üzerindeki eylemler insan kararı gerektirir; üstelik araç adı değil, çözümlenmiş argümanları ve etkilenecek kayıtları gösteren bir arayüzle.
Geri alınabilirlik ve denetim. Her eylem bir korelasyon kimliği, kayıt altına alınmış model ve prompt sürümü ve ideal olarak bir geri alma yolu gerektirir. Sohbet botunun bunların hiçbirine ihtiyacı yoktur, çünkü hiçbir şeyi değiştirmemiştir.
Dayanıklılık tarafını güvenilir ajan backend'leri, yetki tarafını yapay zeka ajanı güvenliği yazılarında ele alıyoruz. Buradaki asıl nokta şu: çizgiyi geçtiğiniz anda ikisi de zorunlu hale gelir - sonradan eklenecek isteğe bağlı sıkılaştırmalar değildir.
Maliyette Ne Değişir
Model faturası en küçük farktır.
Sohbet botu bir veya iki model çağrısıyla cevaplar. Çok adımlı bir ajan görev başına on ila otuz çağrı yapabilir ve her biri birikmiş bağlamı taşır; dolayısıyla tamamlanan görev başına token maliyeti on kat yüksek olabilir. Gecikme de nitelik değiştirir: sohbet botu saniyeler içinde cevaplar, ajan görevi dakikalarca sürebilir ve bu yüzden asenkron işleme ile bir ilerleme göstergesine ihtiyaç duyar.
Daha büyük fark mühendislik süresidir. Retrieval sohbet botu ağırlıklı olarak ingestion, retrieval kalitesi ve değerlendirmedir. Ajan bunun üstüne araç katmanı, durum makinesi, idempotentlik, onay akışı, denetim deposu, geri alma prosedürleri ve saldırgan test seti ekler. Pratikte aynı alan için ajan kurulumu, sohbet botu kurulumunun birkaç katıdır ve süregelen operasyonel yük daha ağırdır; çünkü her yeni yetenek yeni bir izin yüzeyidir.
Seviyenin önemi buradan gelir. Seviye 3 - tek sınırlı eylem - hedeflenen faydanın çoğunu genellikle Seviye 4'ün maliyetinin küçük bir kısmıyla sağlar.
Riskte Ne Değişir
Sohbet botu hataları bilgiseldir: halüsinasyon, eski içerik, eksik kanıt, yanlış üslup. Ciddidirler ama hata ile sonuç arasında bir insan oturur.
Ajan hataları operasyoneldir. Eylem iki kez çalışır. Yanlış okunan bir talimattan kurulan filtre yüzünden eylem yanlış kayıt üzerinde çalışır. Ajan içinde talimat bulunan bir belgeyi okur ve onu uygular. Görev yarıda kalır ve hiçbir sürecin temizlemediği yarım bir durum bırakır. Ajan, bütçe bitene kadar başarısız bir araçta döngüye girer.
Bunların hiçbiri model kalitesi problemi değildir ve daha iyi bir model bunları ortadan kaldırmaz. Tasarım kararlarıyla sınırlanırlar - kapsam, limitler, doğrulama, onay ve sistemin nasıl durduğu.
Seçim: Görevden Başlayın
Genellikle üç soru meseleyi çözer.
Şu anda bir insan eylem mi yapıyor, yoksa yalnızca karar mı veriyor? İnsan bir raporu okuyup karar veriyorsa ürün bilgidir ve sohbet botu yeterlidir. İnsanın işi tıklamaksa - değerleri forma kopyalamak, talebi açmak, kaydı güncellemek - ürün eylemdir.
Eylem geri alınabilir mi? Geri alınabilir eylemler cömert bir eşikle onay kapısının altında durabilir. Geri alınamaz olanlar - para çıkışı, dış iletişim, silme - model ne kadar iyi olursa olsun insan kararının arkasına aittir.
Görev ne kadar varyasyon içeriyor? Sabit biçimli tekrarlayan bir görev Seviye 3'e uyar: eylemi tanımla, doğrula, kaydet. Gereken adımların her seferinde gerçekten farklılaştığı görev, Seviye 4'ün gerekçesidir - ve aynı zamanda değerlendirmesi en zor olandır; çünkü karşılaştırılacak sabit bir beklenen çıktı yoktur.
Sohbet Botunun Doğru Cevap Olduğu Durumlar
Bunu açıkça söylemekte fayda var, çünkü daha sık karşılaşılan doğru cevap budur.
Darboğaz insanların bilgiyi bulamaması veya yorumlayamaması ise; alan zaten her kararı bir insanın sahiplenmesini gerektirecek kadar düzenlemeye tabiyse; alttaki sistemlerin güvenli bir yazma API'si yoksa ve onu inşa etmek asıl proje ise; ya da doğru eylemin ne olduğunu henüz kimse söyleyemiyorsa sohbet botunu seçin.
Son madde vurgulanmayı hak ediyor. Deneyimli iki kişi, belirli bir durumda sistemin ne yapması gerektiği konusunda anlaşamıyorsa, eylemi otomatikleştirmek çözülmemiş bir anlaşmazlığı kodlar ve onu ölçekte uygular. Belirsizlik altında soru cevaplamak güvenlidir. Eylemde bulunmak değildir.
Makul Bir Geçiş Yolu
Üretime güvenilir şekilde ulaşan ekipler genellikle seviyeleri teker teker çıkar.
Seviye 1'de başlayın ve retrieval ile cevap kalitesini gerçek sorularla ölçün. Belgeler kullanıcıların sorduğunu cevaplayamadığında salt-okunur araçlar ekleyin ve izinlerin kaynakta uygulanması için kullanıcı kimliğini bu çağrılar boyunca taşıyın.
Okuma yolu güvenilir hale geldiğinde tek bir yazma eylemi getirin. Onu eksiksiz tasarlayın - kapsam, limit, doğrulama, idempotentlik anahtarı, denetim kaydı, onay eşiği - ve bu işi sonraki her eylem için şablon kabul edin.
Çok adımlı özerkliği yalnızca birden fazla sınırlı eylem varsa, aralarındaki sıra gerçekten değişkense ve başarısız bir çalıştırmayı sonradan açıklayacak durum, izleme ve geri alma altyapınız varsa ekleyin.
Etiket seviyeden daha az önemlidir. Kesin bir tarif - "politika belgeleri üzerinde kaynak göstererek salt-okunur cevaplama" veya "500 EUR altında tek iade eylemi, üstünde onay" - neyi kuracağınızı, ne maliyeti olacağını ve neyin ters gidebileceğini söyler. "Bir yapay zeka ajanı" bunların hiçbirini söylemez.

