Kısa versiyon: Bu rehber, yapay zeka koçluk sistemlerini değerlendirmeyi, NIST AI Risk Management Framework'ten ve temel makine öğrenimi metriklerinden yararlanmayı ele almaktadır.
Öne çıkan noktalar
- NIST Yapay Zeka Risk Yönetimi Çerçevesi, Yapay Zeka güvenilirliğini değerlendirmek için gönüllü, yapılandırılmış bir yaklaşım sunar.
- Standart doğruluk, dengesiz veri kümelerinde Yapay Zeka performansını değerlendirmek için genellikle yanıltıcı bir ölçüttür.
- Geri çağırma ve kesinlik, tespit oranları ve tahmin kalitesinin matematiksel olarak kesin ölçümlerini sağlar.
- Eksiksiz bir değerlendirme, yanlış pozitifleri, yanlış negatifleri ve şeffaf model kartlarını analiz etmeyi gerektirir.
Yapay Zeka Koçluk Sistemlerinde Güvenilirliği Nasıl Sağlarız?
AI RMF - AIRC'ye göre, Yapay Zeka Risk Yönetimi Çerçevesi (AI RMF), gönüllü kullanım için tasarlanmıştır ve yapay zeka ürünleri, hizmetleri ve sistemlerinin tasarımı, geliştirilmesi, kullanımı ve değerlendirilmesine güvenilirlik hususlarını dahil etme yeteneğini geliştirmeyi amaçlamaktadır. AI RMF - AIRC'ye göre, bu çerçeve 18 aylık bir süre boyunca açık, şeffaf, çok disiplinli ve çok paydaşlı bir şekilde ve 240'tan fazla katkıda bulunan kuruluşla işbirliği içinde geliştirilmiştir. AI RMF - AIRC
Yapay zeka risklerini ve potansiyel etkilerini belirlemek ve yönetmek, yapay zeka yaşam döngüsü boyunca geniş bir perspektif ve aktör yelpazesi gerektirir. Yapay zeka sistemlerinin güvenilir olması için, ilgili taraflar için değerli olan birçok kritere duyarlı olmaları gerekir. Yapay zeka güvenilirliğini artıran yaklaşımlar, olumsuz yapay zeka risklerini azaltabilir. Yapay zeka koçluk sistemleri
Yapay Zeka Risk Yönetiminin Temel Fonksiyonları ve Profilleri Nelerdir?
AI RMF - AIRC'ye göre, AI RMF Çekirdeği, yapay zeka risklerini yönetmek ve güvenilir yapay zeka sistemlerini sorumlu bir şekilde geliştirmek için diyalog, anlayış ve faaliyetleri mümkün kılan sonuçlar ve eylemler sunar. Bu, dört işlev aracılığıyla hayata geçirilir: Yönetme, Haritalama, Ölçme ve Yönetme. teknoloji alıcıları için pratik yol haritası
AI RMF - AIRC'ye göre, kullanım senaryosu Profilleri, Çerçeve kullanıcısının gereksinimlerine, risk toleransına ve kaynaklarına dayalı olarak belirli bir ayar veya uygulama için AI RMF işlevlerinin, kategorilerinin ve alt kategorilerinin uygulamalarıdır. NIST'e göre, NIST, 26 Temmuz 2024 tarihinde NIST-AI-600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile'ı yayınladı. NIST'e göre, Generative AI Profile, kuruluşların üretken yapay zekanın oluşturduğu benzersiz riskleri belirlemelerine ve üretken yapay zeka risk yönetimi için eylemler önermelerine yardımcı olur. AI Risk Management Framework | NIST
AI Risk Management Framework | NIST'e göre, 30 Mart 2023 tarihinde NIST, Güvenilir ve Sorumlu Yapay Zeka Kaynak Merkezi'ni başlattı. Bu kaynak merkezi, AI RMF'nin uygulanmasını ve uluslararası uyumunu kolaylaştıracaktır. Ayrıca, 7 Nisan 2026 tarihinde NIST, Kritik Altyapıda Güvenilir Yapay Zeka üzerine bir AI RMF Profili için bir konsept notu yayınladı.
Makine Öğrenimi Metrikleri Günlük Dilden Nasıl Farklılaşır?
Makine öğreniminde, geri çağırma (recall), kesinlik (precision) ve doğruluk (accuracy) gibi kelimelerin, kelimelerin daha yaygın kullanılan anlamlarından farklı veya daha spesifik olabilen matematiksel tanımları vardır. Doğru ve yanlış pozitifler ile negatifler, modelleri değerlendirmek için çeşitli faydalı metrikleri hesaplamak için kullanılır. Sınıflandırma: Doğruluk, Geri Çağırma, Kesinlik ve İlgili Metrikler | Makine Öğrenimi | Google for Developers
Hangi değerlendirme metriklerinin en anlamlı olduğu, belirli modele ve belirli göreve, farklı yanlış sınıflandırmaların maliyetine ve veri kümesinin dengeli mi yoksa dengesiz mi olduğuna bağlıdır. Bir modeli değerlendirirken ve bir eşik seçerken öncelik vermeyi seçtiğiniz metrikler, belirli sorunun maliyetlerine, faydalarına ve risklerine bağlıdır. Model kartları — Google DeepMind'e göre, model kartları, gelişmiş bir yapay zeka modelinin nasıl tasarlandığı ve değerlendirildiğine dair basit, yapılandırılmış genel bakışlardır. Model kartları â Google DeepMind
Dengesiz Veri Kümelerinde Standart Doğruluk Neden Yanıltıcıdır?
Doğruluk, dengeli veri kümeleri için model eğitim ilerlemesinin veya yakınsamanın kaba bir göstergesi olarak kullanılmalı, ancak dengesiz veri kümeleri için kaçınılmalıdır. Bir veri kümesi dengesiz olduğunda veya bir tür hatanın diğerinden daha maliyetli olduğu durumlarda, doğruluk dışındaki metrikler için optimize etmek daha iyidir.
Bir sınıfın çok nadir, örneğin zamanın %1'inde ortaya çıktığı aşırı dengesiz veri kümeleri için, %100 negatif tahmin eden bir model, işe yaramaz olmasına rağmen doğrulukta %99 puan alacaktır. kritik, nadir hareketleri tespit edin
Duyarlılık Nedir ve Tespit İçin Neden Önemlidir?
Geri çağırma (recall) veya gerçek pozitif oranı (TPR), doğru bir şekilde pozitif olarak sınıflandırılan tüm gerçek pozitiflerin oranıdır. Matematiksel olarak, geri çağırma, doğru sınıflandırılmış gerçek pozitiflerin tüm gerçek pozitiflere bölünmesiyle, yani TP / (TP + FN) olarak tanımlanır.
Yanlış negatifler, negatif olarak yanlış sınıflandırılmış gerçek pozitiflerdir ve bu nedenle geri çağırma (recall) formülünün paydasında yer alırlar. Varsayımsal mükemmel bir modelin sıfır yanlış negatifi olur ve bu nedenle %100 tespit oranını temsil eden 1.0'lık bir geri çağırma değerine sahip olurdu. Uygulamada, yanlış negatifler yanlış pozitiflerden daha maliyetli olduğunda geri çağırmaya öncelik verilmelidir.
Kesinlik ve Yanlış Pozitif Oranları Kullanılabilirliği Nasıl Etkiler?
Hassasiyet (precision), modelin tüm pozitif sınıflandırmalarının gerçekte pozitif olanlarının oranıdır. Matematiksel olarak, hassasiyet, doğru sınıflandırılmış gerçek pozitiflerin pozitif olarak sınıflandırılan her şeye bölünmesiyle, yani TP / (TP + FP) olarak tanımlanır. Varsayımsal olarak mükemmel bir modelin sıfır yanlış pozitifleri ve dolayısıyla 1.0 hassasiyeti olurdu.
Tersine, hiçbir zaman pozitif tahmin etmeyen bir modelin 0 TP ve 0 FP'si olur, bu da NaN hassasiyet hesaplamasıyla sonuçlanır. Pozitif tahminlerin doğru olması çok önemli olduğunda hassasiyete öncelik verilmelidir.
Yanlış pozitif oranı (FPR), yanlış alarm olasılığı olarak da bilinen, pozitif olarak yanlış sınıflandırılan tüm gerçek negatiflerin oranıdır. FPR matematiksel olarak yanlış sınıflandırılmış gerçek negatiflerin tüm gerçek negatiflere bölünmesiyle, yani FP / (FP + TN) olarak tanımlanır. Yanlış pozitifler, yanlış sınıflandırılmış gerçek negatiflerdir ve bu nedenle yanlış pozitif oranı (FPR) formülünün paydasında yer alırlar.
Mükemmel bir modelin sıfır yanlış pozitifleri ve dolayısıyla %0.0'lık bir FPR'si olurdu, bu da %0 yanlış alarm oranını temsil eder. Dengesiz bir veri kümesi için, FPR genellikle doğruluktan daha bilgilendirici bir metriktir. Yanlış pozitifler, yanlış negatiflerden daha maliyetli olduğunda bu orana öncelik verilmelidir.
Ancak, gerçek negatiflerin sayısı çok düşükse, FPR oynaklığı nedeniyle ideal bir seçim olmayabilir. Örneğin, bir veri kümesinde yalnızca dört gerçek negatif varsa, tek bir yanlış sınıflandırma %25'lik bir FPR ile sonuçlanırken, ikinci bir yanlış sınıflandırma FPR'nin %50'ye sıçramasına neden olur.
Sınıflandırma Metriklerini Pratik Örneklere Nasıl Uygularız?
Bu metriklerin gerçek dünya senaryosunda nasıl işlediğini anlamak için standart bir spam sınıflandırma örneğine bakabiliriz. Bu bağlamda, geri çağırma (recall), spam olarak doğru şekilde sınıflandırılan spam e-postaların oranını ölçer. Bu nedenle geri çağırmanın (recall) diğer bir adı tespit olasılığıdır, çünkü model tarafından spam e-postaların ne kadarının tespit edildiği sorusunu yanıtlar.
Aynı spam sınıflandırma örneğinde, yanlış pozitif oranı (FPR), spam olarak yanlış sınıflandırılan meşru e-postaların oranını ölçer ve modelin yanlış alarm oranını temsil eder. Kesinlik (precision), spam olarak sınıflandırılan e-postaların aslında spam olan kısmını ölçer. Böyle bir sistemi değerlendirirken, genellikle belirli bir minimum doğruluk seviyesinin üzerinde geri çağırma (recall), kesinlik (precision) veya ikisinin bir dengesine öncelik vermek mantıklıdır.
Sıkça sorulan sorular
Yapay Zeka değerlendirmesinde geri çağırma ve kesinlik arasındaki fark nedir?
Geri çağırma (recall) veya gerçek pozitif oranı, doğru bir şekilde pozitif olarak sınıflandırılan tüm gerçek pozitiflerin oranıdır. Hassasiyet (precision) ise, modelin tüm pozitif sınıflandırmalarının gerçekte pozitif olanlarının oranıdır.
Dengesiz veri kümeleri için doğruluk neden kötü bir metriktir?
Dengesiz veri kümeleri için doğruluktan kaçınılmalıdır çünkü bir model, işe yaramaz olmasına rağmen yüksek puan alabilir. Örneğin, nadir bir sınıf zamanın yalnızca %1'inde ortaya çıkarsa, %100 negatif tahmin eden bir model %99 doğruluk puanı alır.
NIST Yapay Zeka Risk Yönetimi Çerçevesi'nin dört temel işlevi nelerdir?
AI RMF - AIRC'ye göre, AI RMF Core dört fonksiyon aracılığıyla işlevselleştirilir: Govern, Map, Measure ve Manage. AI RMF Core, yapay zeka risklerini yönetmek ve güvenilir yapay zeka sistemleri geliştirmek için diyalog, anlayış ve faaliyetleri sağlayan sonuçlar ve eylemler sunar.
Sıkça sorulan sorular
Yapay Zeka değerlendirmesinde geri çağırma ve kesinlik arasındaki fark nedir?
Geri çağırma (recall) veya gerçek pozitif oranı, doğru bir şekilde pozitif olarak sınıflandırılan tüm gerçek pozitiflerin oranıdır. Hassasiyet (precision) ise, modelin tüm pozitif sınıflandırmalarının gerçekte pozitif olanlarının oranıdır.
Dengesiz veri kümeleri için doğruluk neden kötü bir metriktir?
Dengesiz veri kümeleri için doğruluktan kaçınılmalıdır çünkü bir model, işe yaramaz olmasına rağmen yüksek puan alabilir. Örneğin, nadir bir sınıf zamanın yalnızca %1'inde ortaya çıkarsa, %100 negatif tahmin eden bir model %99 doğruluk puanı alır.
NIST Yapay Zeka Risk Yönetimi Çerçevesi'nin dört temel işlevi nelerdir?
AI RMF - AIRC'ye göre, AI RMF Core dört fonksiyon aracılığıyla işlevselleştirilir: Govern, Map, Measure ve Manage. AI RMF Core, yapay zeka risklerini yönetmek ve güvenilir yapay zeka sistemleri geliştirmek için diyalog, anlayış ve faaliyetleri sağlayan sonuçlar ve eylemler sunar.



