Bir Retrieval-Augmented Generation sistemi, birkaç bağımsız yoldan başarısız olsa da akıcı bir yanıt üretebilir. Yanlış kanıtı elde edebilir, gerekli bir belgeyi atlayabilir, doğru bağlamı yanlış okuyabilir, farklı bir soruyu yanıtlayabilir veya hiçbir kaynakta hiç görünmeyen bir değer icat edebilir. Tek bir "doğruluk" puanı bu hataları açıklayamaz veya değişmesi gereken bileşeni belirleyemez.
Güvenilir değerlendirme, RAG'i pipeline olarak ele alır. Retrieval ve generation ayrı ölçümler alır. Kesin değerler deterministik kodla kontrol edilir. Serbest biçimli yanıtlar açık ölçütlere göre değerlendirilir. Her model, prompt, chunking ve sıralama değişikliği, yayınlanmadan önce aynı veri kümesi üzerinde değerlendirilir.
Amaç etkileyici bir gösterge tablosu numarası üretmek değildir. Üç operasyonel soruyu yanıtlayan tekrarlanabilir bir karar sistemi oluşturmaktır:
- Sistem soruyu yanıtlamak için gereken kanıtları elde etti mi?
- Oluşturulan cevapta bu kanıt doğru şekilde kullanıldı mı?
- Önerilen değişiklik, maliyetini ve gecikmesini haklı çıkaracak kadar kaliteyi artırdı mı?
Retrieval ve Generation Katmanlarını Ayırın
RAG'in en az iki ana arıza yüzeyi vardır.
retrieval katmanı bağlamı seçer. İlgisiz chunks'i döndürebilir, gerekli bir pasajı atlayabilir veya güncel olmayan bir sürümü alabilir. generation katmanı bu bağlamı yorumlar. Kanıtları göz ardı edebilir, gerçekleri yanlış bir şekilde birleştirebilir veya desteklenmeyen iddialar ekleyebilir.
Bu hatalar farklı düzeltmeler gerektirir. Doğru fatura satırı hiçbir zaman bağlama girmezse, prompt cevabını değiştirmek retrieval'i onarmayacaktır. Doğru satır mevcutsa ancak model yanlış birim fiyatı bildiriyorsa, top-k vektörünün arttırılması generation'i onarmayacaktır.
Bu nedenle değerlendirme bu aşamalar arasındaki sınırı korumalıdır.
Retrieval Metrikleri
Context Precision
Bağlam precision, alınan bağlamın ne kadarının soruyla alakalı olduğunu ölçer. Düşük precision, prompt'in gürültü içerdiği anlamına gelir. İlgisiz chunks, jeton tüketir ve doğru kanıt mevcut olsa bile jeneratörün dikkatini dağıtabilir.
Precision aynı zamanda sıralama sırasını da tartmalıdır - ilgili bir chunk 8. konuma gömülüyken ilgisiz chunks 1-7. konumları işgal eder, ham alaka oranının önerdiğinden daha zayıf bir retriever'i gösterir.
PRD-482 ürününün iade koşullarıyla ilgili bir soru için, garanti süresiyle ilgili bir madde konuyla ilgili olabilir ancak soruyu yanıtlamayabilir. Retrieval değerlendirmesi, genel benzerliği cevap taşıyan kanıtlardan ayırmalıdır.
Context Recall
Bağlam recall, yanıt için gereken tüm kanıtların alınıp alınmadığını ölçer. Bu, özellikle birden fazla kaynak veya tablo satırı gerektiren sorular için önemlidir.
Bir talebin üç satır öğesinin toplam maliyetini istediğini varsayalım. İki doğru satırın alınması, yüksek görünümlü precision üretir ancak eksik recall üretir. Oluşturulan toplam doğru olamaz çünkü gerekli bir girdi modele hiç ulaşmadı.
Sıralama Metrikleri
Veri seti beklenen kanıtı tanımladığında sıralama, k'te recall, Ortalama Karşılıklı Sıra veya normalleştirilmiş indirimli kümülatif kazanç gibi ölçümlerle de değerlendirilebilir. Bu ölçümler, aday kümesinde doğru chunk'in mevcut olup olmadığını ve ne kadar yüksek göründüğünü ortaya çıkarır.
k'in değeri gerçek pipeline'i yansıtmalıdır. 40. sıradaki doğru sonuç, yalnızca aday oluşturucunun bir sonraki aşamaya en az 40 öğeyi geçmesi durumunda faydalıdır. Uygulama modele yalnızca en üstteki 5 chunks'i gönderirse, 5'teki recall, 100'deki recall'ten operasyonel olarak daha anlamlıdır.
Generation Metrikleri
Faithfulness
Faithfulness, yanıttaki iddiaların sağlanan bağlam tarafından desteklenip desteklenmediğini sorar. Alınan kanıtın desteklemediği bir fiyat, tarih, koşul veya sonuç ortaya koyuyorsa, bir yanıt akıcı, konuyla ilgili ve yine de sadakatsiz olabilir.
Faithfulness mümkün olduğunda iddia bazında değerlendirilmelidir. Çok cümleli bir cevap, üç desteklenen ifade ve bir desteklenmeyen sonuç içerebilir. Tek bir ikili etiket bu ayrımı gizler.
Answer Relevancy
Answer relevancy, yanıtın kullanıcının gerçek isteğini karşılayıp karşılamadığını sorar. Bir cevap, istenen karşılaştırma veya hesaplamadan kaçınarak bağlamdaki doğru bilgiyi tekrarlayabilir.
Örneğin, ürün açıklamalarını listeleyen bir yanıt, hangi ürünün daha düşük birim fiyata sahip olduğu sorusunu yanıtlamaz. İçerik temellendirilmiş olabilir ancak talep edilen kararla ilgisiz olabilir.
Kesin ve Yapılandırılmış Kontroller
Her cevabın bir dil modeli yargıcına ihtiyacı yoktur. Fatura numaraları, ürün kodları, adetler, birim fiyatlar, tarihler, para birimleri ve toplamlar deterministik kod aracılığıyla normalleştirilip karşılaştırılmalı.
Yapılandırılmış kontroller şunları doğrulayabilir:
- Tam tanımlayıcı eşleşmesi
- Açık bir tolerans dahilinde sayısal eşitlik
- Doğru para birimi ve birim
- Döndürülen satır öğelerinin doğru sayısı
- Ürün kodu ile fiyat arasındaki doğru ilişki
- Aritmetik tutarlılık
- Gerekli kaynak referansları
Kod temelli değerlendirme, bir modelin halihazırda resmi bir temsili olan gerçekleri yargılamasını istemekten daha ucuz, daha hızlı ve daha tekrarlanabilirdir.
Açık kaynak değerlendirme çerçeveleri bu kontrollerin operasyonel hale getirilmesini kolaylaştırır. Ragas ve DeepEval, faithfulness, answer relevancy, bağlam precision ve bağlam recall'in hazır uygulamalarını sağlar; TruLens ve Arize Phoenix, topraklama veya faithfulness, yanıt alaka düzeyi ve retrieval uygunluk açısından yakından ilişkili önceden oluşturulmuş RAG değerlendiricilerini açığa çıkarır. Varsayılanlar yararlı başlangıç noktalarıdır ancak değerlendirme modelinin, değerlendirme listesinin ve eşiklerin yine de hedef alana göre kalibrasyona ihtiyacı vardır.
Metrik Bağımsızlık Önemlidir

Retrieval ve generation ölçümleri birbirinin yerine kullanılamaz. Bağlam recall mükemmel olabilirken faithfulness zayıf olabilir. Model, doğru fatura satırını alıp yine de kendi ön bilgisinden bir değer raporlayabilir veya iki bitişik sütunu karıştırabilir.
Bunun tersi de meydana gelebilir. Bir model, eksik bağlama tamamen sadık kalabilir. Cevabı, alınan chunks'i doğru bir şekilde yansıtıyor ancak retrieval kaçırdığı için gerekli bir ürünü atlıyor.
Yararlı bir teşhis matrisi aşağıda gösterilmektedir. Bu, resmi veya standartlaştırılmış bir çerçeve değil, teşhis için basitleştirilmiş bir buluşsal yöntemdir.
| Bağlam kalitesi | Cevap kalitesi | Olası sorun |
|---|---|---|
| Düşük | Düşük | Chunking, retrieval, filtreleme veya indeksleme |
| Yüksek | Düşük | Prompt, bağlam sunumu, model veya doğrulama |
| Düşük | Görünüşe göre yüksek | Olası kıyaslama farkı veya desteklenmeyen şanslı cevap |
| Yüksek | Yüksek | Beklenen davranış |
Bu ayrım, değerlendirmeyi puanlamadan tanıya dönüştürür.
Golden Dataset Tasarlama
golden dataset, bilinen beklentileri olan, seçilmiş bir dizi test senaryosudur. Her örnek bir soru ve referans cevabından fazlasını içermelidir.
Pratik bir kayıt şunları içerebilir:
{
"id": "price-lookup-014",
"question": "What was the March unit price of PRD-482?",
"expected_answer": {
"product_code": "PRD-482",
"unit_price": 125.50,
"currency": "EUR"
},
"required_sources": [
"invoice-2026-0148-line-04"
],
"category": "exact_lookup",
"answerable": true
}
Veri kümesi, zor durumları kasıtlı olarak dahil ederken sorguların gerçek dağılımını temsil etmelidir:
- Tam tanımlayıcı aramaları
- Anlamsal sorular
- Çoklu belge karşılaştırmaları
- Çok atlamalı ilişki soruları
- Toplamalar
- Belirsiz istekler
- Çok turlu referanslar
- Eski ve güncel belge sürümleri
- Eksik bilgi
- Erişim kontrollü içerik
Kategoriler regresyonların yerelleştirilmesine olanak tanır. Yeni bir embedding modeli, tam ürün kodu retrieval'e zarar verirken anlamsal soruları iyileştirebilir. Tek bir toplam puan bu ödünleşimi gizleyebilir.
Reddetme Yeteneğinin Test Edilmesi
Bazı altın soruların mevcut külliyattan kasıtlı olarak yanıtlanamaz olması gerekir. Beklenen davranış, makul bir tamamlama değil, bilginin mevcut olmadığının açık bir ifadesidir.
Cevaplanamayan vakalar testi:
- retrieval güven eşiklerinin çalışıp çalışmadığı
- prompt'in çekimser kalmaya izin verip vermediği
- Modelin eksik fiyatları veya politikaları icat edip etmediği
- Alıntıların yanıtı gerçekten destekleyip desteklemediği
- Bir takım arızasının gizlenmek yerine açığa çıkıp çıkmadığı
Olumsuz örnekler önemlidir, çünkü yalnızca yanıtlanabilir sorular üzerinden değerlendirilen bir sistem doğru görünse de kanıt eksik olduğunda güvensiz kalabilir.
Çekimserlik bir sınıflandırma görevi olarak ölçülebilir. precision çekimserliğini correct abstentions / all abstentions olarak tanımlayın; bu, bir reddetmenin ne sıklıkta haklı olduğunu ölçer. recall çekimserliğini correct abstentions / all unanswerable cases olarak tanımlayın; bu, reddedilmesi gereken soruların kaçının gerçekte reddedildiğini ölçer. Bunlar, answered cases / all cases olarak tanımlanan yanıt kapsamı ve yanıtlanan vakalardaki doğrulukla rapor edilmelidir; böylece bir sistem yalnızca her isteği reddederek reddetme puanını iyileştiremez.
Veri Kümesini Canlı Tutmak

golden dataset tek seferlik bir kıyaslama değildir. Corpus ve üretim trafiğiyle birlikte gelişmelidir.
Yeni belgeler yeni sorular getirmelidir. Aksi halde kıyaslama yalnızca eski sorguların hala çalışıp çalışmadığını ölçer ve yeni eklenen bilgilerdeki hataları tespit edemez. Üretim olayları ve kullanıcı tarafından bildirilen hatalar, doğru yanıt ve kaynak doğrulandıktan sonra regresyon vakaları haline gelmelidir.
Her test senaryosunun sahipliğe ve menşee ihtiyacı vardır. Referans cevapları, beklentinin neden değiştiğine dair bir kayıtla birlikte yalnızca inceleme yoluyla güncellenmelidir. Temel iş verileri değişirse, geçmiş ve güncel sorular sessizce birbirinin üzerine yazmak yerine ayrı kalmalıdır.
Veri kümesinin kirlenmeyi de önlemesi gerekir. İstemleri ayarlamak veya modelleri eğitmek için tam test soruları tekrar tekrar kullanılırsa, bildirilen puanlar genel performansı temsil etmeyebilir. Bir geliştirme seti yinelemeyi yönlendirebilirken, ayrı bir uzatma seti daha dürüst bir sürüm kontrolü sağlar.
Bir Değerlendirme Döngüsü Olarak İnsan Geri Bildirimi
Olumsuz derecelendirme gibi açık geri bildirimler, yalıtılmış bir analiz olayı olarak kalmak yerine bir inceleme öğesi oluşturmalıdır. Bir incelemeci nedeni sınıflandırabilir:
- Retrieval hatası
- Generation hatası
- Araç veya hesaplama hatası
- Eksik veya eski kaynak verileri
- Belirsiz kullanıcı isteği
- Yanlış altın beklentisi
Sorun düzeltildikten sonra soru, doğrulanmış yanıt ve kaynak bir regresyon testi haline gelir. Bu, üretim hatasından kalıcı kapsamaya kadar olan döngüyü kapatır.
Gerçek kişi tarafından yapılan inceleme ayrıca kısmi kaliteye açıklama da ekleyebilir. Yanıt, doğru kaynağı kullanabilir ancak istenen alanı atlayabilir. Yapılandırılmış hata nedenlerini yakalamak, yalnızca olumlu veya olumsuz bir etiket depolamaktan daha kullanışlıdır.
LLM-as-Judge'i Dikkatli Kullanmak
Dil modeli yargıçları, faithfulness, tamlık, netlik ve uygunluk gibi kesin kurallar olarak kodlanması zor olan nitelikler için kullanışlıdır. Otomatik olarak güvenilir değillerdir.
Bir hakim şunları gerektirir:
- Kesin bir değerlendirme tablosu
- Soru
- Alınan bağlam
- Oluşturulan cevap
- Net puan tanımları
- Kabul edilebilir ve kabul edilemez yargı örnekleri
- Puanın ardındaki kanıtları açıklama zorunluluğu
Otomatik değerlendirmeye güvenilmeden önce, temsili bir numunenin insanlar ve hakim tarafından bağımsız olarak puanlanması gerekir. Anlaşma yalnızca genel bir yüzde olarak değil, kategoriye göre ölçülmelidir. Bir yargıç faithfulness açısından güvenilir olabilir ancak yazma kalitesi veya kısmi bütünlük konusunda tutarsız olabilir.
Yayınlanan sonuçlar, metriğe özel kalibrasyonun neden önemli olduğunu göstermektedir. Orijinal RAGAS makalesinde, otomatik ölçümler, WikiEval ikili faithfulness karşılaştırmalarının %95'inde ve cevap-ilgililik karşılaştırmalarının %78'inde çözümlenmiş insan tercihleriyle uyumluydu. Bu rakamlar, 50 soruluk bir değerlendirme kurulumunun doğruluğudur; başka bir alan, değerlendirme listesi veya değerlendirme modeli için evrensel garantiler değildir.
Düşük uyum, değerlendirme listesi, prompt veya puan tanımlarının iyileştirilmesi gerektiğini gösterir. Hakemin yeniden kalibre edilmesi ve tekrar test edilmesi gerekiyor. İnsan incelemesi daha sonra belirsiz vakalara, anlaşmazlıklara, yüksek risk kategorilerine ve hakimin sapmasını izlemek için kullanılan örneklere odaklanabilir.
Deterministik değerlerin bu sürecin dışında kalması gerekir. Kod karşılaştırması, 125.50 EUR'in beklenen fiyatla eşleştiğini doğrulamalıdır. Hakim, çevredeki açıklamanın gerçeğe uygun ve yerinde olup olmadığını değerlendirebilir.
Kalite, Gecikme ve Maliyet ile Denemeler Yapmak

Retrieval konfigürasyonu çok amaçlı bir optimizasyon problemidir. Alınan chunks sayısını artırmak recall'i iyileştirebilir ancak gecikmeyi, belirteç kullanımını ve gürültüyü artırabilir. reranker eklemek sıralamayı iyileştirebilir ancak çıkarım maliyetini artırır. Daha güçlü bir jeneratör, yanıt süresini artırırken faithfulness'i iyileştirebilir.
Her aday konfigürasyon aynı golden dataset üzerinde çalışmalı ve bir karşılaştırma tablosu oluşturmalıdır:
Aşağıdaki ilk satır, bir kıyaslama sonucundan ziyade açıklayıcı, gerçekçi bir örnektir. Üretim raporları, onu ve her measured yer tutucusunu hedef ortamdan gözlemlerle değiştirmelidir.
| Yapılandırma | Bağlam recall | Bağlam precision | Faithfulness | P95 gecikmesi | Maliyet/sorgu |
|---|---|---|---|---|---|
| Yoğun, ilk 5 (açıklayıcı) | 0.81 | 0,74 | 0,88 | 340 ms | 0,004$ |
| Yoğun + BM25, ilk 10 | ölçülen | ölçülen | ölçülen | ölçülen | ölçülen |
| Hibrit + reranker | ölçülen | ölçülen | ölçülen | ölçülen | ölçülen |
Tablo, hedef ortamdan gözlemlenen değerleri kullanmalıdır. Kararlar daha sonra açık kurallara tabidir. Kalite kabul edilen aralıkta kalırken maliyet düşerse değişiklik devam edebilir. Kalite bir kategori eşiğinin altına düşerse, daha düşük maliyet tek başına yeterli değildir.
Yönlendirme bu dengeyi iyileştirebilir. Basit aramalarda daha az retrieval aşaması ve daha küçük bir model kullanılabilir. Karmaşık karşılaştırmalar, daha geniş retrieval, reranking ve daha güçlü bir jeneratörü haklı gösterebilir. Her rotanın kendi hizmet seviyesi ve kalite hedefleri olmalıdır.
Doğru İçerik Mevcut Olduğunda Hata Ayıklama
retrieval değerlendirmesi, gerekli kanıtın oluşturucuya ulaştığını ancak yanıtın yanlış kaldığını doğruladığında, hata ayıklamanın generation katmanına taşınması gerekir.
Grounding Talimatları
prompt sistemi, modelin yalnızca sağlanan kanıtları kullanmasını ve kanıt yetersiz olduğunda bunu belirtmesini açıkça gerektirmelidir. "Aşağıdaki bilgilerin kullanılması" yönündeki muğlak bir talep, desteklenmeyen eklemeleri açıkça yasaklamaz.
Bağlam Konumu ve Yapısı
Uzun yönlendirmeler ortadaki ilgili pasajların daha az dikkat çekmesine neden olabilir. En güçlü kanıtlar belirgin bir şekilde yerleştirilmeli, chunks'in sınırları net olmalı ve kaynak meta verileri, belgeler ile tablo satırlarını birbirinden ayırmalıdır.
Model ve Örnekleme
Testin daha düşük sıcaklıkla veya daha güçlü bir modelle tekrarlanması, örnekleme değişkenliğinin yapısal prompt sorunlarından ayrılmasına yardımcı olur. Modellerde ve deterministik kod çözmede aynı hata devam ederse, bağlam temsili veya talimatların sorumlu olma olasılığı daha yüksektir.
Alıntı Yaptırımı
Her gerçek iddia için kaynak referanslarının zorunlu kılınması, desteklenmeyen içeriğin tespit edilmesini kolaylaştırır. Alıntılar programlı olarak doğrulanmalıdır: başvurulan kaynak mevcut olmalı ve alıntı yapılan pasaj değeri veya iddiayı içermelidir.
Çıktı Doğrulaması
Son bir faithfulness kontrolü, oluşturulan talepleri bağlamla karşılaştırabilir. Yapılandırılmış yanıtlar aynı zamanda şema ve aritmetik doğrulamayı da geçmelidir. Bu katman, bir prompt'i veya bağlam düzenini düzeltmekten daha pahalıdır, bu nedenle önceki kontrollerin yerini almak yerine tamamlamalıdır.
Release Gate'leri
Değerlendirme, sürümler kontrol edildiğinde işlevsel hale gelir. chunking, embeddings, istemler, modeller, yönlendirme veya dizin parametrelerinde yapılan değişiklikler ilgili test paketlerini tetiklemelidir.
Bir sürüm kapısı şunları zorunlu kılabilir:
- Kategoriye göre minimum retrieval recall
- Minimum faithfulness ve answer relevancy
- Yapılandırılmış yanıtlar için tam eşleşme eşikleri
- Cevaplanamayan sorularda maksimum halüsinasyon oranı
- P95 gecikme süresi ve maliyet bütçeleri
- Kritik test senaryolarında gerileme yok
Başarısız geçitler, regresyon anlaşılıncaya kadar konuşlandırmayı engellemelidir. Amaç her puan dalgalanmasını engellemek değil; incelenmemiş kalite kayıplarının kullanıcılara ulaşmasını önlemektir.
Risk Tabanlı Eşikler ve Puan Toplama
Her sorgu kategorisi aynı sonucu doğurmaz. Ürün özetindeki küçük bir ifade farklılığı, hatalı birim fiyat veya eksik sözleşme kısıtlaması anlamına gelmez. Değerlendirme eşikleri çıktı riskini yansıtmalıdır.
Kritik tam değer rotaları deterministik eşitlik, tam kaynak kapsamı ve başarılı aritmetik doğrulama gerektirebilir. Anlamsal özetler, kademeli alaka düzeyini ve faithfulness puanlarını kullanabilir. Cevaplanamayan sorular, yüksek bir çekimserlik oranı ve sıfır desteklenmeyen sayısal iddia gerektirebilir.
Örneğin, risk bazlı bir kapı, tanımlayıcılar, birimler ve aritmetik de dahil olmak üzere kritik kesin değer yollarında %100 deterministik bir eşleşme gerektirebilir. Daha düşük riskli bir anlamsal özet rotası, faithfulness >= 0.85 ve answer relevancy >= 0.80 gerektirebilir. Bunlar örnek başlangıç noktalarıdır, evrensel varsayılanlar değil; gerçek uygulamadaki insan incelemesi, gözlemlenen hata maliyetleri ve puan dağılımları ile kalibre edilmelidirler.
Bu nedenle bir yayın raporunun hem toplu hem de kategori düzeyinde sonuçları sunması gerekir. Makro ortalamalar her kategoriye eşit etki sağlarken, trafik ağırlıklı ortalamalar mevcut kullanımı yansıtır. Her ikisi de tek başına kullanıldığında yanıltıcı olabilir. Nadir ancak kritik bir hesaplama kategorisi, güçlü bir genel puanın içinde kaybolabilir.
Sert kapılar şu durumları korur:
- Belirlenen kritik sorgularda gerileme yok
- Normalleştirmeden sonra tam ürün ve fatura tanımlayıcıları eşleşmelidir
- Sayısal yanıtlar deterministik araç çıktısıyla uyumlu olmalıdır
- Çok kaynaklı sorular gerekli her kaynağı almalıdır
- Desteklenmeyen sayısal hak taleplerine izin verilmez
- Erişim kontrolü testleri her zaman geçmelidir
Güven aralıkları veya tekrarlanan çalıştırmalar, generation belirleyici olmadığında faydalıdır. Küçük bir veri setine dayalı tek noktalık bir değişiklik, bir gelişmeden ziyade gürültü olabilir. Test seti boyutu, kategori kapsamı ve çalışma değişkenliği raporlanan puanlara eşlik etmelidir.
Değerlendirme aynı zamanda hataları yalnızca kategoriler arasında hareket ettiren iyileştirmeleri de tespit etmelidir. top-k'in arttırılması, recall'i iyileştirebilir ve precision ve faithfulness bağlamını azaltabilir. Daha güçlü bir model yanıt kalitesini artırabilir ancak gecikme hedeflerini ihlal edebilir. Yeni bir yönlendirici, küçük bir grup toplu soruyu yanlış araca gönderirken maliyeti düşürebilir.
Sonuçlar incelenmeden önce karar kuralı tanımlanmalıdır. Örneğin, bir adayın hiçbir kritik regresyona, hedef kategorisinde minimum kalite iyileştirmesine ve maliyet ve gecikme bütçeleriyle uyumluluğa ihtiyacı olmayabilir. Önceden tanımlanmış kurallar, deneyden sonra tercih edilen bir konfigürasyonu haklı çıkarma isteğini azaltır.
Kalite eşikleri operasyonel sözleşmelerdir. Soyut değerlendirme puanlarını, bir sistemin piyasaya sürülmesinin güvenli kabul edildiği açık koşullara dönüştürürler.
Bir Mühendislik Disiplini Olarak Değerlendirme
RAG değerlendirmesi, ölçümleri eylemlere bağladığında en kullanışlıdır. Düşük bağlamlı recall, ingestion, chunking, embeddings, filtreler veya sıralamaya işaret eder. Güçlü bağlam işaretlerine sahip düşük faithfulness; yönlendirme, bağlam sunumu, model davranışı veya doğrulamaya yöneliktir. Değişmeyen kaliteyle yüksek gecikme, gereksiz aşamalara veya büyük boyutlu modellere işaret eder.
Altın veri kümeleri, deterministik kontroller, kalibre edilmiş dil modeli yargıçları ve insan geri bildirimi tamamlayıcı kanıtlar sağlar. Hep birlikte öznel tartışmaların yerine tekrarlanabilir deneyler koyuyorlar ve üretim hatalarını kalıcı testlere dönüştürüyorlar.
Bir RAG sistemi, arızaları ayrılıncaya, etiketleninceye ve meydana geldikleri katmanda ölçülinceye kadar güvenilir bir şekilde iyileştirilemez.
Daha Fazla Okuma
- RAGAS: Retrieval Artırılmış Generation'in Otomatik Değerlendirmesi - orijinal makale ve WikiEval insan anlaşması deneyi
- Ragas açık kaynak değerlendirme çatısı - hazır RAG değerlendirme ölçümleri
- DeepEval RAG değerlendirme kılavuzu - retriever ve uygulama örnekleriyle birlikte jeneratör ölçümleri
- TruLens RAG Triad - temellilik, yanıt uygunluğu ve bağlam uygunluğu
- Arize Phoenix önceden oluşturulmuş metrikleri - faithfulness ve retrieval alaka düzeyi için açık kaynaklı değerlendiriciler
