İşe yarayan bir senaryo tabanlı değerlendirme seti, parlak örnek sorular koleksiyonu değil, sınırları belli bir iş akışının yeniden kurulabilir temsilidir. Bir satın alma talebi asistanına eksiksiz görünen bir dosya geldiğini düşünün: talep formuyla teklif belgesindeki tedarikçi kimlikleri çelişiyor, güncel politika kaynağına erişilemiyor ve yüklenen teklif asistanı kuralları aşmaya yönlendiren bir talimat içeriyor. Yalnızca sıradan istemlerden oluşan bir set bu birleşik riski göstermez. Ekip önce hangi sistem sürümünü, aktörleri, girdileri, araçları ve kararı değerlendirdiğini sınırlar; sonra olağan işi, önemli sınırları, doğrulanmış hataları ve yasak davranışları ayrı ama bağlantılı kanıtlar olarak kurar.
Uygulanabilir özet
Vaka toplamadan önce tek bir iş akışını, değerlendirme kararını, raporlama dilimlerini ve sürüm kapılarını tanımlayın.
Olağan işi gözlenen koşullarla orantılı temsil ederken seyrek fakat önemli sınırları, doğrulanmış hataları ve yasak davranışları özellikle ekleyin.
Her vaka başlangıç durumunu, yetkili kanıt ve araçları, kabul edilebilir seçenekleri, yasak sonuçları, kaynağı, sürümleri ve puanlama yöntemini kaydetsin.
Göreve uygun en dar puanlayıcıyı kullanın; kısmi puan veya yüksek ortalama açıkça yasaklanmış bir eylemi telafi etmesin.
Geliştirme vakalarını yinelemeli çalışma için görünür tutun; korunan sürüm testini ancak içeriği ve sonuçları değişiklikleri yönlendirmediği sürece bağımsız kanıt sayın.
Set, önce olağan işin gözlenen çeşitliliğini, ardından sıklıkla kaybolabilecek önemli sınırları, bilinen hataları ve yasak davranışları kapsamalıdır. Başlangıç noktası genel amaçlı bir asistan fikri değil; tek sistem sürümü, sınırlı bir iş akışı, izinli kullanıcılar, girdiler, bilgi kaynakları, araçlar ve değerlendirme sonucunun destekleyeceği karardır. Doğruluk ölçümünün gerçekçi kullanım koşullarını temsil eden açık testlere dayanması ve yöntemin belgelenmesi, sonuçların hangi koşullarda anlamlı olduğunu görünür kılar. Dört aileden oluşan aşağıdaki harita ise kaynakların ortak ilkelerini işletme akışına uyarlayan editoryal bir sentezdir.
Olağan iş dağılımını yetkilendirilmiş işlem kayıtları, destek vakaları, kullanıcı araştırması, geçmiş iş ürünleri ve alan uzmanı yürüyüşlerinden çıkarın; fakat bu kaynakların kendiliğinden eksiksiz, doğru etiketli veya yeniden kullanıma uygun olduğunu varsaymayın. Kayıt bulunmayan yeni bir sistemde oran uydurmak yerine kapsamı başlangıç varsayımı olarak işaretleyin. Dil, belge türü, rol, belirsizlik, eksik bilgi, izin sınırı, araç sonucu ve sonuç ağırlığı gibi boyutlardan yalnızca gerçek iş akışını etkileyenleri seçin. Raporlanacak dilimler ve yasak davranış kapıları, aday çıktılar görülmeden önce belirlenmelidir.
Satın alma asistanında temsilî vaka, alanları tutarlı, gerekli belgeleri bulunan ve güncel politikaya erişilebilen sıradan bir talep olabilir.
Önemli sınır vakaları; eksik belgeyi, çelişen tutar veya tedarikçi kimliğini, yetersiz kanıtı ve erişilemeyen ya da tutarsız politika sonucunu kapsayabilir.
Bilinen hata vakası, hassas üretim içeriğini kopyalamak yerine doğrulanmış sorunun küçültülmüş, yetkili ve mümkünse kimliksizleştirilmiş yeniden üretimidir.
Yasak davranış vakaları, insan onayını aşma isteğini, dosyaya gömülü yönlendirmeyi, gizli bilgi talebini ve taslağı yetkili karar gibi sunma girişimini sınar.
Bu örnekteki izinler ve yasaklar yalnızca açıklayıcıdır; gerçek kuralları kuruluşun yetkili ürün, güvenlik, gizlilik ve risk sahipleri belirlemelidir.
Dört kapsama ailesi ve sete alınma gerekçeleri
Kapsama ailesi
Yanıtladığı soru
Olası yetkili kanıt
Sete alma mantığı
Temsilî iş
Sistem beklenen günlük işi ne ölçüde yapabiliyor?
İş kayıtları, kullanıcı araştırması, destek vakaları, alan uzmanı incelemesi
Güvenilir biçimde gözlenen iş karışımını yansıtın; bilinmeyen dağılımları kesin oran gibi sunmayın.
Önemli sınırlar
Geçerli fakat zor koşullarda davranış sınırı korunuyor mu?
İş akışı analizi, alan incelemesi, biçim ve bağlam çeşitliliği
Belirsizlik, eksik veya çelişkili bilgi, izin sınırı ve bozuk araç sonucu gibi etkili koşulları özellikle ekleyin.
Bilinen hatalar
Doğrulanmış bir sorun sonraki sürümde geri geliyor mu?
Olay kayıtları, doğrulanmış şikâyetler, hata incelemeleri
Hassas veriyi en aza indirerek doğrulanmış hata sınıfını geliştirme veya regresyon kanıtında koruyun.
Yasak davranışlar
Sistem açıkça izin verilmeyen çıktıyı veya eylemi engelliyor mu?
Politika sınırları, izin modeli, risk incelemesi, karşıt senaryolar
Seyrek olsa bile makul doğrudan ve dolaylı girişimleri ekleyin; sonucu kalite ortalamasına gömmeyin.
Aileler için eşit vaka sayısı gerekmez. Temsilî işin ağırlığı gözlenen akışla ilişkili olabilirken, seyrek fakat ciddi sonuç doğuran koşullar kasıtlı olarak fazla temsil edilebilir. Önemli olan, her eklemenin hangi değerlendirme sorusuna yanıt verdiğini ve hangi kanıttan üretildiğini kaydetmektir. Bir davranışın hem gerçekleşmesi gereken hem de gerçekleşmemesi gereken tarafını sınamak da tek yönlü optimizasyonu azaltır. Sonuçları görev ailesi, kapsama ailesi, ilgili dilim, sonuç ağırlığı ve kapı bazında göstermek; güçlü bir toplam puanın yerel bir başarısızlığı gizlemesini önler.
Her değerlendirme senaryosu nasıl kaydedilmeli?
Her senaryo, başka bir değerlendiricinin aynı başlangıç koşullarını kurabileceği, kabul edilebilir sonuçları tanıyabileceği ve yasak sonucu yakalayabileceği tek bir vaka kaydı olarak tutulmalıdır. Kaydın kimlik bölümünde sabit vaka kimliği, sahip, durum, set sürümü, değişiklik geçmişi, görev ve kapsama ailesi, dilim etiketleri, sonuç ağırlığı, kaynak türü, kullanım yetkisi ve geliştirme ya da korunan sürüm testi üyeliği bulunur. Kaynak kayda bağlantı ancak erişim kontrolleri izin veriyorsa eklenmeli; kişisel, gizli, lisanslı veya güvenlik açısından hassas üretim içeriği yetki ve minimizasyon olmadan çoğaltılmamalıdır.
Kurulum: aktörün rolü ve amacı, başlangıç iş akışı durumu, istek, dosyalar, ilgili konuşma geçmişi ve çevresel koşullar.
Kullanılabilir bağlam: yalnızca yetkili bilgi kaynakları, izinler, araçlar, önceden belirlenmiş araç sonuçları ve sisteme verilen talimatlar.
Beklenti: gerekli gerçekler veya durum değişiklikleri, kabul edilebilir alternatif yollar ve kanıt yetersizse açıklama isteme, çekinme, reddetme ya da yetkili kişiye yönlendirme koşulları.
Yasaklar: izin verilmeyen açıklamalar, eylemler, araç çağrıları, veri ifşaları ve durum değişiklikleri; bunlar genel kalite beklentilerinden ayrı yazılır.
İşletim: puanlayıcı türü, rubrik ve kapı sürümü, varsa referans çözüm, deneme sayısının gerekçesi, önceden belirlenmiş birleştirme kuralı ve karar yolu.
Teknik iz: model, istem, getirim külliyatı, araç, politika, izin ve değerlendirme düzeneği sürümleri ile bilinen sınırlamalar.
Satın alma örneğinde vaka, çelişkili tedarikçi kimliklerini ve erişilemeyen politika sonucunu olduğu gibi sağlamalıdır. Kabul edilebilir sonuç; çelişkiyi belirtmek, eksik kanıtı ayırmak ve yetkili insan adımına yönlendirmek gibi birden çok ifade veya yol içerebilir. Çalıştığı bilinen bir referans çözüm, görevin çözülebilirliğini ve puanlayıcının işleyişini sınar; ancak tek geçerli metin sayılmaz. Çok adımlı veya değişken çıktılı sistemlerde deneme sayısı ve sonuçların nasıl birleştirileceği çıktılar incelenmeden belirlenmelidir. Bu alanların bütünü, bağlamsal ölçüm ve görev tanımı ilkelerini bir araya getiren uyarlanabilir bir kayıt tasarımıdır.
İyi bir değerlendirme vakası yalnızca zor bir soru sormaz; sınırlı bir işi yeniden kurar ve başarıyı, geçerli farklılığı, yasak davranışı görünür kılar.
Yanlış davranışı ödüllendirmeden senaryo nasıl puanlanır?
Her senaryo, başarıyla başarısızlığı geçerli biçimde ayırabilen en dar yöntemle puanlanmalıdır. Kesin cevap, şema, hesap, araç argümanı, kayıt durumu veya yasak eylem için deterministik kontrol uygundur; yine de kontrolün eksiksizliği ve vakanın gerçekten çözülebilirliği doğrulanmalıdır. Gerekli gerçekler veya son durum sınırlı, ifade yolları çeşitli olduğunda referans gerçekler kullanılabilir. Kullanışlılık, bütünlük, temellendirme veya açıklama kalitesi gibi açık uçlu boyutlar ayrı ve gözlenebilir çıpalara sahip rubrikler gerektirir. Alan yorumu otomasyonla geçerli biçimde çözülemiyorsa yetkili uzman yargısı devreye girer.
Deterministik kontrolü yalnızca nesnel olarak doğrulanabilen unsur için kullanın; kesin çalışan bir kontrolün yanlış beklentiyi kodlayabileceğini unutmayın.
Referans çözümü çözülebilirlik kanıtı ve gerekli unsurların kaynağı olarak kullanın; eş anlamlı ifadeleri veya geçerli alternatif yolları cezalandırmayın.
Model tabanlı puanlayıcıya her boyut için somut çıpalar verin ve sonuçlarını ilgili bağlamdaki nitelikli insan yargılarıyla kalibre edin.
Anlamlı görev bileşenleri için kısmi puan verilebilir; ancak hangi bileşenin başarısız olduğu ayrı raporlanmalıdır.
Yasak bilgi ifşası veya yetkisiz işlem, önceden tanımlanmış telafi edilemez bir kapıdır; cilalı anlatım veya yüksek ortalama bu kapıyı geçersiz kılamaz.
Deterministik, model tabanlı ve insan puanlayıcıların güçlü yanları farklıdır; otomatik değerlendirme sırf geliştirme örnekleriyle uyumlu diye nesnel veya yeterli sayılmaz. OpenAI, GDPval çalışmasındaki otomatik puanlayıcının deneyimli meslek değerlendiricilerinin yerini alacak kadar güvenilir olmadığını bildirmiştir; bu bulgu başka düzeneklere otomatik olarak genellenemez. Rubrik sürümü, kapı mantığı, dilim tanımı, deneme birleştirme kuralı ve sürüm kararı adaylar karşılaştırılmadan sabitlenmelidir. Sonradan yapılan değişiklik, önceki sonuçları sessizce yeniden yorumlamak yerine yeni değerlendirme sürümü olarak belgelenmelidir.
Değerlendiriciler ölçütleri nasıl tutarlı uygulayabilir?
Tutarlılık, çıktıyı göstermeden önce ortak bağlam ve gözlenebilir puan çıpaları verilmesiyle başlar. Değerlendirici rehberi iş akışının amacını, aktörü, kullanılabilir kanıtı, izinli davranışı, ürün sınırını ve rubrik sürümünü açıklar. Her puan düzeyi için gözlenebilir bir ölçüt ile olumlu, olumsuz ve sınır örneği sunar. Hatalı vaka, eksik dosya veya erişilemeyen kanıt karşısında değerlendiricinin tahmin yürütmesini önlemek için yetersiz kanıt ya da puanlanamaz seçeneği bulunur. Görev bağlamı ve somut örnekler güvenilirliği artırabilir; fakat insan incelemesi de kendiliğinden hatasız veya tarafsız değildir.
Canlı inceleme öncesinde ortak kalibrasyon vakalarını puanlayın; görev karışımı, politika, rubrik veya değerlendirici havuzu değiştiğinde kalibrasyonu yenileyin.
Karşılaştırmalı yargıda uygulanabildiği ölçüde sistem kimliğini ve çıktı sırasını gizleyin.
Tartışmadan önce bağımsız puanı ve kısa gerekçeyi kaydedin; erken uzlaşmanın farklı yorumları görünmez kılmasına izin vermeyin.
Anlaşmazlığın kusurlu vakadan, belirsiz eşikten, eksik bağlamdan, meşru sonuç çeşitliliğinden veya çözülmemiş ürün kararından kaynaklanıp kaynaklanmadığını inceleyin.
Bir karar sahibi belirleyin; özgün etiketleri, gerekçeleri, rubrik sürümünü ve nihai kararı sonraki inceleme ile puanlayıcı kalibrasyonu için saklayın.
Yapılandırılmış rubrikler, insan kalibrasyonu ve puanlarla yürütme izlerinin birlikte incelenmesi, gerçek sistem hatasını kusurlu görev, puanlayıcı veya ortam sorunundan ayırmaya yardımcı olur. GDPval gibi belgelenmiş bir profesyonel ölçütün çok aşamalı uzman incelemesi, kör karşılaştırmalı puanlama ve ayrıntılı rubrikler kullanması bu uygulamaların mümkün olduğunu gösterir; evrensel bir protokol oluşturmaz. Değerlendiriciler farklı fakat meşru sonuçları seçtiğinde ya da ürün sahibi henüz sınır kararı vermediğinde anlaşmazlık zorla uzlaşmaya çevrilmemelidir. Bu durum karar kaydında açık bırakılmalı veya vaka puanlanamaz olarak ayrılmalıdır.
Değerlendirme seti geliştirme ve sürüm boyunca nasıl yararlı kalır?
Set, görünür geliştirme vakaları ile erişimi sıkı biçimde sınırlandırılmış sürüm testini ayırarak yararlı kalır. Geliştirme seti istem, getirim, araç, politika ve iş akışı değişikliklerinde tekrar tekrar kullanılabilir; ekip vakaları gördüğü ve onlara göre iyileştirme yaptığı için sonuçları geliştirme kanıtıdır. Korunan test ise üyeliği rutin çalıştırmadan ve çıktı incelemesinden önce belirlenmiş, seyrek nihai karşılaştırmalar veya sürüm kararları için ayrılmış vakalardan oluşur. Aynı testin değişiklikleri yönlendirmek için tekrar kullanılması örtük aşırı uyum riski yaratır ve testin bağımsız kanıt değerini aşındırır.
Setler arasında birebir ve yakın kopyaları, aynı kaynak kayda dayanan vakaları, yeniden ifade edilmiş örnekleri ve aynı senaryo şablonunun kardeşlerini arayın.
Vaka içeriğine, referans yanıta, rubriğe ve sonuca kimlerin veya hangi sistemlerin eriştiğini kaydedin.
Tanı ya da iyileştirmeyi yönlendiren doğrulanmış hata vakasını geliştirme veya regresyon setine alın; korunan sette aynı hata sınıfını bağımsız ve yinelenmeyen yeni vakayla sınayın.
Korunan bir vaka değişikliği maddi biçimde etkilediğinde onu geliştirme setine taşıyın ve korunan teste sürümlü bir yedek ekleyin.
Evrensel bölme yüzdesi kullanmayın; setin boyutu ve bileşimi kararın niteliğine, iş akışı çeşitliliğine, önemli dilimlere, sonuçlara ve yetkili kanıta bağlıdır.
Merkezî kayıt; vaka sahibini, kaynağı, kullanım yetkisini, set üyeliğini, maruz kalmayı, sürümleri, gözden geçirme geçmişini, değişiklik ve emeklilik gerekçelerini birlikte tutmalıdır. Vaka içeriği, etiket, rubrik, kaynak politikası ve değerlendirme düzeneği sessizce değiştirilmemeli; sonuçların hangi sürüme ait olduğu korunmalıdır. Göreve özgü setler doğrulanmış üretim, geçmiş, alan, sentetik ve insan eliyle hazırlanmış vakalarla büyüyebilir. Her ekleme için beklenen davranış doğrulanmalı, hassas veri en aza indirilmeli ve yeniden kullanım yetkisi kaydedilmelidir; sentetik olması bir vakayı kendiliğinden geçerli veya geçersiz yapmaz.
İş akışı, kullanıcı grubu, politika, bilgi külliyatı, model, istem, araçlar, izinler veya işletim ortamı maddi biçimde değiştiğinde kapsam, ölçütler ve kapılar yeniden incelenmelidir. Sonuçlar görev, kapsama ailesi, dilim, sonuç ağırlığı ve kapı bazında raporlanmalı; yalnızca tek bir ortalamaya dayanılmamalıdır. Çevrimdışı başarı, tek başına iş değeri, güvenlik, adalet, mevzuata uygunluk veya üretime hazır olma kanıtı değildir. İzleme, kullanıcı araştırması, olay incelemesi ve sisteme uygun diğer kanıtlarla birlikte ele alınmalı; düzenlemeye tabi veya yüksek sonuçlu yargılar nitelikli ve yetkili kişilerin sorumluluğunda kalmalıdır.
Sık sorulan sorular
Bir iş akışı için yapay zekâ değerlendirme veri seti nasıl hazırlanır?
Önce tek iş akışını, sistem sürümünü, izinli aktörleri, kullanılabilir bağlamı ve değerlendirmenin destekleyeceği kararı sınırlandırın. Görev ailelerini ve etkili varyasyonları çıkarıp temsilî iş, önemli sınırlar, bilinen hatalar ve yasak davranışlar için vakalar oluşturun. Dilimleri ve kapıları sonuçları görmeden tanımlayın; her vakayı yeniden üretilebilir kayda dönüştürüp geçerli puanlayıcı, geliştirme-sürüm ayrımı ve sürümlü kayıtla yönetin.
Senaryo tabanlı yapay zekâ değerlendirmesi nedir?
Senaryo tabanlı değerlendirme, sınırlı bir yapay zekâ destekli iş akışını yeniden üretilebilir vakalar üzerinden sınama yöntemidir. Her vaka aktörü, başlangıç durumunu, girdileri, yetkili bilgi ve araçları, gerekli sonuçları, kabul edilebilir alternatifleri, yasak sonuçları ve puanlama yöntemini açıklar. Amaç yalnızca iyi görünen bir yanıtı değil, işin ve sınırların doğru yönetilip yönetilmediğini incelemektir.
Bir yapay zekâ değerlendirme setinde kaç vaka olmalı?
Her sistem için geçerli evrensel bir vaka sayısı yoktur. Gerekli büyüklük ve bileşim; alınacak sürüm kararına, iş akışının çeşitliliğine, önemli dilimlere, hataların sonuçlarına, puanlama güvenilirliğine ve kullanılabilecek yetkili kanıta bağlıdır. Sayıyı tek başına hedeflemek yerine hangi önemli davranışların ve sınırların kanıtsız kaldığını izleyin.
Yapay zekâ değerlendirmesinde referans yanıt mı, rubrik mi kullanılmalı?
Yöntemi görevin niteliğine göre seçin. Nesnel cevap, şema veya durum için deterministik kontrol; gerekli gerçekleri sınırlı fakat ifadeleri çeşitli görev için referans gerçekler ya da çözüm; açık uçlu kalite için gözlenebilir çıpalı rubrik kullanın. Alan yorumu otomasyonla geçerli biçimde çözülemiyorsa nitelikli ve yetkili uzman değerlendirmesi gerekir.
Geliştirme değerlendirme seti ile korunan test seti arasındaki fark nedir?
Geliştirme seti ekip tarafından görülür ve istem, getirim, araç, politika ile iş akışı iyileştirmelerinde tekrar kullanılır. Korunan testin üyeliği rutin çalıştırmadan önce belirlenir, erişimi sınırlandırılır ve sürüm kanıtı için seyrek kullanılır. Vakaları, yanıtları, rubrikleri veya sonuçları bir değişikliği maddi biçimde yönlendirdiğinde ilgili vaka artık bağımsız sayılmamalı ve geliştirme setine taşınmalıdır.
Referanslar ve Kaynaklar
Bu yazı hazırlanırken aşağıdaki kaynaklardan yararlanılmıştır:
Yapay zekânın bir şirkette gerçekte nasıl karşılık bulduğunu anlatıyoruz. Çalışmalarımız adı belirtilen kaynaklardan yola çıkar, bulduklarımızı yorumlarımızdan ayırır ve belgelenmiş editoryal denetimler çerçevesinde araştırma ile taslak aşamasında yapay zekâ desteği kullanır. Bireysel uzman incelemesinin yerini tutmayız.