W skrócie: Ten przewodnik omawia ocenę systemów trenerskich AI, wykorzystując ramy zarządzania ryzykiem AI NIST oraz kluczowe metryki uczenia maszynowego.
Najważniejsze wnioski
- NIST AI Risk Management Framework oferuje dobrowolne, ustrukturyzowane podejście do oceny wiarygodności AI.
- Standardowa dokładność jest często mylącą metryką do oceny wydajności AI na niezbalansowanych zbiorach danych.
- Czułość i precyzja dostarczają matematycznie precyzyjnych miar wskaźników wykrywalności i jakości predykcji.
- Pełna ocena wymaga analizy fałszywych pozytywów, fałszywych negatywów i przejrzystych kart modeli.
Jak Ustanowić Wiarygodność w Systemach Trenerskich AI?
Według AI RMF - AIRC, AI Risk Management Framework (AI RMF) jest przeznaczony do dobrowolnego stosowania i ma na celu poprawę zdolności do uwzględniania kwestii wiarygodności w projektowaniu, rozwoju, użytkowaniu i ocenie produktów, usług i systemów AI. Według AI RMF - AIRC, ramy te zostały opracowane w sposób otwarty, przejrzysty, multidyscyplinarny i z udziałem wielu interesariuszy w ciągu 18 miesięcy oraz we współpracy z ponad 240 organizacjami współtworzącymi. AI RMF - AIRC
Identyfikacja i zarządzanie ryzykiem AI oraz potencjalnymi wpływami wymaga szerokiego zakresu perspektyw i podmiotów w całym cyklu życia AI. Aby systemy AI były godne zaufania, często muszą odpowiadać na wiele kryteriów, które są wartościowe dla zainteresowanych stron. Podejścia, które zwiększają wiarygodność AI, mogą zmniejszyć negatywne ryzyka związane z AI. Systemy coachingowe AI
Jakie Są Kluczowe Funkcje i Profile Zarządzania Ryzykiem AI?
Według AI RMF - AIRC, Rdzeń AI RMF dostarcza wyników i działań, które umożliwiają dialog, zrozumienie i działania w celu zarządzania ryzykiem AI oraz odpowiedzialnego rozwijania godnych zaufania systemów AI. Jest to operacjonalizowane poprzez cztery funkcje: Zarządzanie, Mapowanie, Mierzenie i Kontrolowanie. praktyczny plan działania dla nabywców technologii
Według AI RMF - AIRC, profile przypadków użycia (use-case Profiles) są implementacjami funkcji, kategorii i podkategorii AI RMF dla konkretnego środowiska lub zastosowania, oparte na wymaganiach, tolerancji ryzyka i zasobach użytkownika Frameworka. Według NIST, NIST opublikował NIST-AI-600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, 26 lipca 2024 roku. Według NIST, profil generatywnej sztucznej inteligencji (Generative AI Profile) pomaga organizacjom identyfikować unikalne ryzyka związane z generatywną sztuczną inteligencją i proponuje działania w zakresie zarządzania ryzykiem generatywnej sztucznej inteligencji. AI Risk Management Framework | NIST
Według AI Risk Management Framework | NIST, 30 marca 2023 roku NIST uruchomił Centrum Zasobów Godnej Zaufania i Odpowiedzialnej Sztucznej Inteligencji. To centrum zasobów ułatwi wdrożenie i międzynarodowe dostosowanie do AI RMF. Ponadto, 7 kwietnia 2026 roku NIST opublikował notę koncepcyjną dotyczącą profilu AI RMF w zakresie godnej zaufania sztucznej inteligencji w infrastrukturze krytycznej.
Jak Metryki Uczenia Maszynowego Różnią się od Języka Potocznego?
W uczeniu maszynowym słowa takie jak czułość (recall), precyzja i dokładność mają definicje matematyczne, które mogą różnić się od, lub być bardziej specyficzne niż, powszechnie używane znaczenia tych słów. Prawdziwe i fałszywe pozytywy oraz negatywy są używane do obliczania kilku przydatnych metryk do oceny modeli. Klasyfikacja: Dokładność, czułość, precyzja i powiązane metryki | Uczenie maszynowe | Google for Developers
Które metryki oceny są najbardziej znaczące, zależy od konkretnego modelu i konkretnego zadania, kosztu różnych błędnych klasyfikacji oraz tego, czy zbiór danych jest zrównoważony, czy niezrównoważony. Metryki, które wybierzesz do priorytetyzacji podczas oceny modelu i wyboru progu, zależą od kosztów, korzyści i ryzyka konkretnego problemu. Według Model cards — Google DeepMind, karty modeli to proste, ustrukturyzowane przeglądy sposobu projektowania i oceny zaawansowanego modelu AI. Model cards â Google DeepMind
Dlaczego Standardowa Trafność Jest Myląca w Niezbalansowanych Zbiorach Danych?
Dokładność powinna być używana jako ogólny wskaźnik postępu lub zbieżności treningu modelu dla zbalansowanych zbiorów danych, ale należy jej unikać w przypadku niezbalansowanych zbiorów danych. Gdy zbiór danych jest niezbalansowany lub gdy jeden rodzaj błędu jest kosztowniejszy niż inny, lepiej jest optymalizować pod kątem innych metryk niż dokładność.
W przypadku mocno niezbalansowanych zbiorów danych, gdzie jedna klasa pojawia się bardzo rzadko, powiedzmy w 1% przypadków, model, który przewiduje wynik negatywny w 100% przypadków, uzyskałby 99% dokładności, mimo że byłby bezużyteczny. wykrywanie krytycznych, rzadkich ruchów
Czym jest Recall i dlaczego jest ważny dla detekcji?
Czułość (recall), czyli wskaźnik prawdziwie pozytywnych (TPR), to proporcja wszystkich rzeczywistych pozytywnych przypadków, które zostały poprawnie sklasyfikowane jako pozytywne. Matematycznie, czułość jest definiowana jako poprawnie sklasyfikowane rzeczywiste pozytywne przypadki podzielone przez wszystkie rzeczywiste pozytywne przypadki, czyli TP / (TP + FN).
Fałszywe negatywy to rzeczywiste pozytywy, które zostały błędnie sklasyfikowane jako negatywy, dlatego pojawiają się w mianowniku wzoru na czułość (recall). Hipotetyczny idealny model miałby zero fałszywych negatywów, a zatem czułość 1.0, co odpowiada 100% wskaźnikowi wykrywalności. W praktyce czułość powinna być priorytetem, gdy fałszywe negatywy są droższe niż fałszywe pozytywy.
Jak Precyzja i Współczynniki Fałszywie Pozytywnych Wpływają na Użyteczność?
Precyzja to proporcja wszystkich pozytywnych klasyfikacji modelu, które są faktycznie pozytywne. Matematycznie, precyzja jest definiowana jako poprawnie sklasyfikowane rzeczywiste pozytywne przypadki podzielone przez wszystko, co zostało sklasyfikowane jako pozytywne, czyli TP / (TP + FP). Hipotetyczny idealny model miałby zero fałszywych pozytywów, a zatem precyzję wynoszącą 1.0.
Z kolei model, który nigdy nie przewiduje pozytywnych wyników, miałby 0 TP i 0 FP, co skutkowałoby obliczeniem precyzji jako NaN. Precyzja powinna być priorytetem, gdy bardzo ważne jest, aby pozytywne przewidywania były dokładne.
Wskaźnik fałszywych pozytywów (FPR) to proporcja wszystkich rzeczywistych negatywów, które zostały błędnie sklasyfikowane jako pozytywy, znana również jako prawdopodobieństwo fałszywego alarmu. FPR jest matematycznie zdefiniowany jako błędnie sklasyfikowane rzeczywiste negatywy podzielone przez wszystkie rzeczywiste negatywy, czyli FP / (FP + TN). Fałszywe pozytywy to rzeczywiste negatywy, które zostały błędnie sklasyfikowane, dlatego pojawiają się w mianowniku wzoru na wskaźnik fałszywych pozytywów (FPR).
Idealny model miałby zero fałszywych pozytywów, a zatem FPR wynoszące 0.0, co oznacza 0% wskaźnika fałszywych alarmów. Dla niezbalansowanego zbioru danych, FPR jest zazwyczaj bardziej informatywną metryką niż dokładność. Ten wskaźnik powinien być priorytetem, gdy fałszywe pozytywy są droższe niż fałszywe negatywy.
Jednakże, jeśli liczba rzeczywistych negatywów jest bardzo niska, FPR może nie być idealnym wyborem ze względu na jego zmienność. Na przykład, jeśli w zbiorze danych są tylko cztery rzeczywiste negatywy, pojedyncza błędna klasyfikacja skutkuje FPR wynoszącym 25%, podczas gdy druga błędna klasyfikacja powoduje skok FPR do 50%.
Jak Zastosować Metryki Klasyfikacji do Praktycznych Przykładów?
Aby zrozumieć, jak te metryki funkcjonują w rzeczywistym scenariuszu, możemy przyjrzeć się standardowemu przykładowi klasyfikacji spamu. W tym kontekście czułość (recall) mierzy ułamek wiadomości spamowych, które zostały poprawnie sklasyfikowane jako spam. Dlatego inną nazwą dla czułości jest prawdopodobieństwo wykrycia, ponieważ odpowiada na pytanie, jaki ułamek wiadomości spamowych jest wykrywany przez model.
W tym samym przykładzie klasyfikacji spamu wskaźnik fałszywych pozytywów (FPR) mierzy ułamek legalnych wiadomości e-mail, które zostały błędnie sklasyfikowane jako spam, reprezentując wskaźnik fałszywych alarmów modelu. Precyzja mierzy ułamek wiadomości e-mail sklasyfikowanych jako spam, które faktycznie były spamem. Oceniając taki system, często ma sens priorytetyzowanie czułości (recall), precyzji lub pewnej równowagi między nimi, powyżej pewnego minimalnego poziomu dokładności.
Najczęściej zadawane pytania
Jaka jest różnica między czułością a precyzją w ocenie AI?
Czułość (recall), czyli wskaźnik prawdziwie pozytywnych, to proporcja wszystkich rzeczywistych pozytywnych przypadków, które zostały poprawnie sklasyfikowane jako pozytywne. Precyzja natomiast to proporcja wszystkich pozytywnych klasyfikacji modelu, które są faktycznie pozytywne.
Dlaczego trafność jest słabą metryką dla niezbalansowanych zbiorów danych?
Należy unikać dokładności dla niezbalansowanych zbiorów danych, ponieważ model może osiągać wysokie wyniki, będąc jednocześnie bezużytecznym. Na przykład, jeśli rzadka klasa pojawia się tylko w 1% przypadków, model przewidujący wynik negatywny w 100% przypadków osiąga 99% dokładności.
Jakie są cztery podstawowe funkcje NIST AI Risk Management Framework?
Zgodnie z AI RMF - AIRC, rdzeń AI RMF jest operacjonalizowany poprzez cztery funkcje: Zarządzanie (Govern), Mapowanie (Map), Mierzenie (Measure) i Kierowanie (Manage). Rdzeń AI RMF dostarcza wyników i działań, które umożliwiają dialog, zrozumienie i działania w celu zarządzania ryzykiem AI oraz odpowiedzialnego rozwijania godnych zaufania systemów AI.
Najczęściej zadawane pytania
Jaka jest różnica między czułością a precyzją w ocenie AI?
Czułość (recall), czyli wskaźnik prawdziwie pozytywnych, to proporcja wszystkich rzeczywistych pozytywnych przypadków, które zostały poprawnie sklasyfikowane jako pozytywne. Precyzja natomiast to proporcja wszystkich pozytywnych klasyfikacji modelu, które są faktycznie pozytywne.
Dlaczego trafność jest słabą metryką dla niezbalansowanych zbiorów danych?
Należy unikać dokładności dla niezbalansowanych zbiorów danych, ponieważ model może osiągać wysokie wyniki, będąc jednocześnie bezużytecznym. Na przykład, jeśli rzadka klasa pojawia się tylko w 1% przypadków, model przewidujący wynik negatywny w 100% przypadków osiąga 99% dokładności.
Jakie są cztery podstawowe funkcje NIST AI Risk Management Framework?
Zgodnie z AI RMF - AIRC, rdzeń AI RMF jest operacjonalizowany poprzez cztery funkcje: Zarządzanie (Govern), Mapowanie (Map), Mierzenie (Measure) i Kierowanie (Manage). Rdzeń AI RMF dostarcza wyników i działań, które umożliwiają dialog, zrozumienie i działania w celu zarządzania ryzykiem AI oraz odpowiedzialnego rozwijania godnych zaufania systemów AI.



