Košarkaška tehnologija & AI

Kako procijeniti AI košarkaškog trenera: Pouzdani okvir

Dijagram evaluacije umjetne inteligencije s TP FP FN TN matricom i formulama za preciznost, odziv i točnost

Kratka verzija: Ovaj vodič raspravlja o procjeni AI sustava za treniranje, koristeći NIST AI Okvir za upravljanje rizikom i ključne metrike strojnog učenja.

Ključni zaključci

  • NIST AI Risk Management Framework nudi dobrovoljan, strukturiran pristup za procjenu pouzdanosti umjetne inteligencije.
  • Standardna točnost često je zavaravajuća metrika za procjenu performansi umjetne inteligencije na neuravnoteženim skupovima podataka.
  • Odziv i preciznost pružaju matematički precizne mjere stopa detekcije i kvalitete predviđanja.
  • Potpuna evaluacija zahtijeva analizu lažno pozitivnih, lažno negativnih i transparentnih kartica modela.

Kako uspostaviti povjerenje u AI sustave za treniranje?

Prema AI RMF - AIRC, Okvir za upravljanje rizikom umjetne inteligencije (AI RMF) namijenjen je za dobrovoljnu upotrebu i za poboljšanje sposobnosti uključivanja razmatranja pouzdanosti u dizajn, razvoj, upotrebu i evaluaciju AI proizvoda, usluga i sustava. Prema AI RMF - AIRC, ovaj okvir je razvijen na otvoren, transparentan, multidisciplinaran način i uz sudjelovanje više dionika tijekom 18-mjesečnog razdoblja te u suradnji s više od 240 organizacija koje su dale doprinos. AI RMF - AIRC

Identifikacija i upravljanje rizicima umjetne inteligencije i potencijalnim utjecajima zahtijeva širok spektar perspektiva i aktera kroz cijeli životni ciklus umjetne inteligencije. Da bi AI sustavi bili pouzdani, često moraju biti osjetljivi na mnoštvo kriterija koji su vrijedni zainteresiranim stranama. Pristupi koji poboljšavaju pouzdanost umjetne inteligencije mogu smanjiti negativne rizike umjetne inteligencije. AI sustavi za treniranje

Koje su osnovne funkcije i profili upravljanja rizikom AI-ja?

Prema AI RMF - AIRC, AI RMF Core pruža ishode i radnje koje omogućuju dijalog, razumijevanje i aktivnosti za upravljanje rizicima umjetne inteligencije te odgovorno razvijanje pouzdanih AI sustava. To se operacionalizira kroz četiri funkcije: Upravljanje, Mapiranje, Mjerenje i Vođenje. praktična mapa puta za kupce tehnologije

Prema AI RMF - AIRC, profili slučajeva upotrebe su implementacije funkcija, kategorija i podkategorija AI RMF-a za specifično okruženje ili primjenu temeljene na zahtjevima, toleranciji rizika i resursima korisnika Okvira. Prema NIST-u, NIST je objavio NIST-AI-600-1, Okvir za upravljanje rizikom umjetne inteligencije: Profil generativne umjetne inteligencije, 26. srpnja 2024. Prema NIST-u, Profil generativne umjetne inteligencije pomaže organizacijama identificirati jedinstvene rizike koje predstavlja generativna umjetna inteligencija i predlaže radnje za upravljanje rizikom generativne umjetne inteligencije. AI Risk Management Framework | NIST

Prema Okviru za upravljanje rizikom umjetne inteligencije | NIST, 30. ožujka 2023., NIST je pokrenuo Centar za resurse pouzdane i odgovorne umjetne inteligencije. Ovaj resursni centar olakšat će implementaciju i međunarodno usklađivanje s AI RMF-om. Nadalje, 7. travnja 2026., NIST je objavio konceptualnu bilješku za AI RMF profil o pouzdanoj umjetnoj inteligenciji u kritičnoj infrastrukturi.

Kako se metrike strojnog učenja razlikuju od uobičajenog jezika?

U strojnom učenju, riječi poput odziva, preciznosti i točnosti imaju matematičke definicije koje se mogu razlikovati od, ili biti specifičnije od, uobičajenijih značenja tih riječi. Istinski i lažno pozitivni te negativni slučajevi koriste se za izračun nekoliko korisnih metrika za evaluaciju modela. Klasifikacija: Točnost, odziv, preciznost i povezane metrike | Strojno učenje | Google for Developers

Koje su metrike evaluacije najsmislenije ovisi o specifičnom modelu i specifičnom zadatku, cijeni različitih pogrešnih klasifikacija te o tome je li skup podataka uravnotežen ili neuravnotežen. Metrike koje odaberete za prioritizaciju prilikom evaluacije modela i odabira praga ovise o troškovima, koristima i rizicima specifičnog problema. Prema Model cards — Google DeepMind, kartice modela su jednostavni, strukturirani pregledi načina na koji je napredni AI model dizajniran i evaluiran. Model cards — Google DeepMind

Zašto je standardna točnost zavaravajuća na neuravnoteženim skupovima podataka?

Točnost treba koristiti kao grubi pokazatelj napretka treniranja modela ili konvergencije za uravnotežene skupove podataka, ali je treba izbjegavati za neuravnotežene skupove podataka. Kada je skup podataka neuravnotežen, ili kada je jedna vrsta pogreške skuplja od druge, bolje je optimizirati za druge metrike osim točnosti.

Za jako neuravnotežene skupove podataka gdje se jedna klasa pojavljuje vrlo rijetko, recimo 1% vremena, model koji predviđa negativno 100% vremena postigao bi 99% točnosti unatoč tome što je beskoristan. otkrivanje kritičnih, rijetkih pokreta

Što je odziv i zašto je važan za detekciju?

Odziv, ili stopa istinskih pozitiva (TPR), je udio svih stvarnih pozitiva koji su ispravno klasificirani kao pozitivni. Matematički, odziv se definira kao ispravno klasificirani stvarni pozitivni podijeljeni sa svim stvarnim pozitivnima, ili TP / (TP + FN).

Lažno negativni su stvarni pozitivni slučajevi koji su pogrešno klasificirani kao negativni, zbog čega se pojavljuju u nazivniku formule za odziv. Hipotetski savršen model imao bi nula lažno negativnih i stoga odziv od 1.0, što predstavlja stopu detekcije od 100%. U praksi, odziv bi trebao biti prioritet kada su lažno negativni skuplji od lažno pozitivnih.

Kako preciznost i stope lažno pozitivnih rezultata utječu na upotrebljivost?

Preciznost je udio svih pozitivnih klasifikacija modela koje su zapravo pozitivne. Matematički, preciznost se definira kao ispravno klasificirani stvarni pozitivni podijeljeni sa svime što je klasificirano kao pozitivno, ili TP / (TP + FP). Hipotetski savršen model imao bi nula lažnih pozitiva i stoga preciznost od 1.0.

Nasuprot tome, model koji nikada ne predviđa pozitivno imao bi 0 TP-a i 0 FP-a, što bi rezultiralo izračunom preciznosti od NaN. Preciznost treba dati prioritet kada je vrlo važno da pozitivna predviđanja budu točna.

Stopa lažno pozitivnih (FPR) je udio svih stvarnih negativnih slučajeva koji su pogrešno klasificirani kao pozitivni, također poznata kao vjerojatnost lažnog alarma. FPR je matematički definiran kao pogrešno klasificirani stvarni negativni slučajevi podijeljeni sa svim stvarnim negativnim slučajevima, ili FP / (FP + TN). Lažno pozitivni su stvarni negativni slučajevi koji su pogrešno klasificirani, zbog čega se pojavljuju u nazivniku formule za stopu lažno pozitivnih (FPR).

Savršen model imao bi nula lažnih pozitiva i stoga FPR od 0.0, što predstavlja 0% stope lažnih alarma. Za neuravnoteženi skup podataka, FPR je općenito informativnija metrika od točnosti. Ovu stopu treba dati prioritet kada su lažni pozitivni skuplji od lažnih negativa.

Međutim, ako je broj stvarnih negativa vrlo nizak, FPR možda neće biti idealan izbor zbog svoje volatilnosti. Na primjer, ako u skupu podataka postoje samo četiri stvarna negativa, jedna pogrešna klasifikacija rezultira FPR-om od 25%, dok druga pogrešna klasifikacija uzrokuje skok FPR-a na 50%.

Kako primijeniti klasifikacijske metrike na praktične primjere?

Kako bismo razumjeli kako ove metrike funkcioniraju u stvarnom scenariju, možemo pogledati standardni primjer klasifikacije neželjene pošte. U ovom kontekstu, odziv mjeri udio neželjene pošte koja je ispravno klasificirana kao neželjena pošta. Zbog toga je drugi naziv za odziv vjerojatnost detekcije, jer odgovara na pitanje koji udio neželjene pošte model detektira.

U istom primjeru klasifikacije neželjene pošte, stopa lažno pozitivnih (FPR) mjeri udio legitimnih e-poruka koje su pogrešno klasificirane kao neželjena pošta, predstavljajući stopu lažnih alarma modela. Preciznost mjeri udio e-poruka klasificiranih kao neželjena pošta koje su zapravo bile neželjena pošta. Prilikom evaluacije takvog sustava, često ima smisla dati prioritet odzivu, preciznosti ili nekoj ravnoteži između njih dvoje, iznad minimalne razine točnosti.

Često postavljana pitanja

Koja je razlika između odziva i preciznosti u evaluaciji umjetne inteligencije?

Odziv, ili stopa istinskih pozitiva, je udio svih stvarnih pozitiva koji su ispravno klasificirani kao pozitivni. Preciznost, s druge strane, je udio svih pozitivnih klasifikacija modela koje su zapravo pozitivne.

Zašto je točnost loša metrika za neuravnotežene skupove podataka?

Točnost treba izbjegavati za neuravnotežene skupove podataka jer model može postići visoke rezultate, a pritom biti beskoristan. Na primjer, ako se rijetka klasa pojavljuje samo 1% vremena, model koji predviđa negativno 100% vremena postiže 99% točnosti.

Koje su četiri temeljne funkcije NIST AI Risk Management Frameworka?

Prema AI RMF - AIRC, AI RMF Core se operacionalizira kroz četiri funkcije: Upravljanje, Mapiranje, Mjerenje i Vođenje. AI RMF Core pruža ishode i akcije koje omogućuju dijalog, razumijevanje i aktivnosti za upravljanje AI rizicima i odgovorno razvijanje pouzdanih AI sustava.

Često postavljana pitanja

Koja je razlika između odziva i preciznosti u evaluaciji umjetne inteligencije?

Odziv, ili stopa istinskih pozitiva, je udio svih stvarnih pozitiva koji su ispravno klasificirani kao pozitivni. Preciznost, s druge strane, je udio svih pozitivnih klasifikacija modela koje su zapravo pozitivne.

Zašto je točnost loša metrika za neuravnotežene skupove podataka?

Točnost treba izbjegavati za neuravnotežene skupove podataka jer model može postići visoke rezultate, a pritom biti beskoristan. Na primjer, ako se rijetka klasa pojavljuje samo 1% vremena, model koji predviđa negativno 100% vremena postiže 99% točnosti.

Koje su četiri temeljne funkcije NIST AI Risk Management Frameworka?

Prema AI RMF - AIRC, AI RMF Core se operacionalizira kroz četiri funkcije: Upravljanje, Mapiranje, Mjerenje i Vođenje. AI RMF Core pruža ishode i akcije koje omogućuju dijalog, razumijevanje i aktivnosti za upravljanje AI rizicima i odgovorno razvijanje pouzdanih AI sustava.