Ang maikling bersyon: Tatalakayin ng gabay na ito ang pagsusuri ng mga sistema ng AI coaching, gamit ang NIST AI Risk Management Framework at mga pangunahing sukatan ng machine learning.
Mga pangunahing aral
- Ang NIST AI Risk Management Framework ay nag-aalok ng boluntaryo, structured na pamamaraan para suriin ang pagiging mapagkakatiwalaan ng AI.
- Ang karaniwang accuracy ay madalas na isang nakakapanlinlang na sukatan para sa pagtatasa ng performance ng AI sa mga imbalanced na dataset.
- Ang recall at precision ay nagbibigay ng mathematically precise na mga sukat ng detection rates at kalidad ng prediksyon.
- Ang isang kumpletong ebalwasyon ay nangangailangan ng pagsusuri sa false positives, false negatives, at transparent na model cards.
Paano Natin Maitatatag ang Pagiging Mapagkakatiwalaan sa mga AI Coaching System?
Ayon sa AI RMF - AIRC, ang AI Risk Management Framework (AI RMF) ay inilaan para sa boluntaryong paggamit at upang mapabuti ang kakayahang isama ang mga pagsasaalang-alang sa pagiging mapagkakatiwalaan sa disenyo, pagbuo, paggamit, at pagsusuri ng mga produkto, serbisyo, at sistema ng AI. Ayon sa AI RMF - AIRC, ang balangkas na ito ay binuo sa isang bukas, transparent, multidisciplinary, at multistakeholder na paraan sa loob ng 18-buwan at sa pakikipagtulungan ng higit sa 240 nag-ambag na organisasyon. AI RMF - AIRC
Ang pagtukoy at pamamahala sa mga panganib ng AI at potensyal na epekto ay nangangailangan ng malawak na hanay ng mga pananaw at aktor sa buong AI lifecycle. Upang maging mapagkakatiwalaan ang mga AI system, madalas silang kailangang tumugon sa maraming pamantayan na mahalaga sa mga interesadong partido. Ang mga pamamaraan na nagpapahusay sa pagiging mapagkakatiwalaan ng AI ay maaaring magpababa ng mga negatibong panganib ng AI. mga AI coaching system
Ano ang mga Pangunahing Function at Profiles ng AI Risk Management?
Ayon sa AI RMF - AIRC, ang AI RMF Core ay nagbibigay ng mga resulta at aksyon na nagbibigay-daan sa diyalogo, pag-unawa, at mga aktibidad upang pamahalaan ang mga panganib ng AI at responsableng bumuo ng mapagkakatiwalaang AI systems. Ito ay isinasagawa sa pamamagitan ng apat na function: Govern, Map, Measure, at Manage. praktikal na roadmap para sa mga mamimili ng teknolohiya
Ayon sa AI RMF - AIRC, ang mga use-case Profile ay mga implementasyon ng mga function, kategorya, at subkategorya ng AI RMF para sa isang partikular na setting o aplikasyon batay sa mga kinakailangan, pagpapaubaya sa panganib, at mapagkukunan ng gumagamit ng Framework. Ayon sa NIST, inilabas ng NIST ang NIST-AI-600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, noong Hulyo 26, 2024. Ayon sa NIST, tinutulungan ng Generative AI Profile ang mga organisasyon na tukuyin ang mga natatanging panganib na dulot ng generative AI at nagmumungkahi ng mga aksyon para sa pamamahala ng panganib ng generative AI. AI Risk Management Framework | NIST
Ayon sa AI Risk Management Framework | NIST, noong Marso 30, 2023, inilunsad ng NIST ang Trustworthy and Responsible AI Resource Center. Ang resource center na ito ay magpapadali sa pagpapatupad ng, at internasyonal na pagkakahanay sa, AI RMF. Bukod pa rito, noong Abril 7, 2026, naglabas ang NIST ng concept note para sa isang AI RMF Profile sa Trustworthy AI sa Critical Infrastructure.
Paano Nagkakaiba ang Machine Learning Metrics mula sa Karaniwang Wika?
Sa machine learning, ang mga salitang tulad ng recall, precision, at accuracy ay may mathematical na kahulugan na maaaring naiiba mula sa, o mas tiyak kaysa sa, mas karaniwang ginagamit na kahulugan ng mga salita. Ang true at false positives at negatives ay ginagamit upang kalkulahin ang ilang kapaki-pakinabang na sukatan para sa pagsusuri ng mga modelo. Classification: Accuracy, recall, precision, at mga kaugnay na sukatan | Machine Learning | Google for Developers
Ang pinakamakabuluhang evaluation metrics ay nakasalalay sa partikular na modelo at partikular na gawain, ang halaga ng iba't ibang maling klasipikasyon, at kung ang dataset ay balanse o hindi balanse. Ang mga sukatan na pipiliin mong bigyan ng prayoridad kapag sinusuri ang isang modelo at pumipili ng threshold ay nakasalalay sa mga gastos, benepisyo, at panganib ng partikular na problema. Ayon sa Model cards — Google DeepMind, ang mga model card ay simple, structured na pangkalahatang-ideya kung paano idinisenyo at sinuri ang isang advanced na modelo ng AI. Model cards â Google DeepMind
Bakit Nakakapanlinlang ang Standard Accuracy sa mga Imbalanced Dataset?
Ang accuracy ay dapat gamitin bilang isang magaspang na indikasyon ng pag-unlad ng pagsasanay ng modelo o convergence para sa mga balanced dataset, ngunit iwasan para sa mga imbalanced dataset. Kapag ang isang dataset ay imbalanced, o kung saan ang isang uri ng pagkakamali ay mas magastos kaysa sa isa, mas mahusay na i-optimize para sa ibang mga sukatan maliban sa accuracy.
Para sa mga lubhang imbalanced dataset kung saan ang isang klase ay napakabihira lumabas, sabihin nating 1% ng oras, ang isang modelo na humuhula ng negatibo ng 100% ng oras ay makakakuha ng 99% sa accuracy sa kabila ng pagiging walang silbi. makakita ng mga kritikal at bihirang galaw
Ano ang Recall at Bakit Mahalaga Ito para sa Detection?
Ang recall, o ang true positive rate (TPR), ay ang proporsyon ng lahat ng aktwal na positibo na tama ang pagkakaklasipika bilang positibo. Sa matematika, ang recall ay tinukoy bilang tama ang pagkakaklasipika na aktwal na positibo na hinati sa lahat ng aktwal na positibo, o TP / (TP + FN).
Ang mga false negative ay aktwal na positibo na maling nauri bilang negatibo, kaya naman lumalabas ang mga ito sa denominator ng recall formula. Ang isang hypothetical na perpektong modelo ay magkakaroon ng zero false negative at samakatuwid ay isang recall na 1.0, na kumakatawan sa 100% detection rate. Sa praktika, dapat bigyan ng prayoridad ang recall kapag mas mahal ang mga false negative kaysa sa mga false positive.
Paano ang Precision at False Positive Rates Nakakaapekto sa Usability?
Ang precision ay ang proporsyon ng lahat ng positibong klasipikasyon ng modelo na aktwal na positibo. Sa matematika, ang precision ay tinukoy bilang tama ang pagkakaklasipika na aktwal na positibo na hinati sa lahat ng kinlasipika bilang positibo, o TP / (TP + FP). Ang isang hypothetical na perpektong modelo ay magkakaroon ng zero false positives at samakatuwid ay isang precision na 1.0.
Sa kabaligtaran, ang isang modelo na hindi kailanman humuhula ng positibo ay magkakaroon ng 0 TPs at 0 FPs, na magreresulta sa isang kalkulasyon ng precision na NaN. Dapat bigyan ng prayoridad ang precision kapag napakahalaga na maging tumpak ang mga positibong hula.
Ang false positive rate (FPR) ay ang proporsyon ng lahat ng aktwal na negatibo na maling nauri bilang positibo, na kilala rin bilang posibilidad ng maling alarma. Ang FPR ay mathematically na tinukoy bilang maling nauri na aktwal na negatibo na hinati sa lahat ng aktwal na negatibo, o FP / (FP + TN). Ang mga false positive ay aktwal na negatibo na maling nauri, kaya naman lumalabas ang mga ito sa denominator ng false positive rate (FPR) formula.
Ang isang perpektong modelo ay magkakaroon ng zero false positives at samakatuwid ay isang FPR na 0.0, na kumakatawan sa isang 0% false alarm rate. Para sa isang imbalanced dataset, ang FPR ay karaniwang mas nagbibigay-impormasyon na sukatan kaysa sa accuracy. Ang rate na ito ay dapat bigyan ng prayoridad kapag ang false positives ay mas mahal kaysa sa false negatives.
Gayunpaman, kung napakababa ng bilang ng aktwal na negatibo, maaaring hindi ideal na pagpipilian ang FPR dahil sa pagbabago-bago nito. Halimbawa, kung mayroon lamang apat na aktwal na negatibo sa isang dataset, ang isang maling klasipikasyon ay nagreresulta sa isang FPR na 25%, habang ang pangalawang maling klasipikasyon ay nagiging sanhi upang tumalon ang FPR sa 50%.
Paano Natin Ilalapat ang Classification Metrics sa mga Praktikal na Halimbawa?
Upang maunawaan kung paano gumagana ang mga sukatan na ito sa isang real-world na sitwasyon, maaari nating tingnan ang isang karaniwang halimbawa ng pag-uuri ng spam. Sa kontekstong ito, sinusukat ng recall ang bahagi ng mga spam email na tama ang pagkakaklasipika bilang spam. Ito ang dahilan kung bakit ang isa pang pangalan para sa recall ay ang posibilidad ng deteksyon, dahil sinasagot nito ang tanong kung anong bahagi ng mga spam email ang natukoy ng modelo.
Sa parehong halimbawa ng pag-uuri ng spam, sinusukat ng false positive rate (FPR) ang bahagi ng mga lehitimong email na maling nauri bilang spam, na kumakatawan sa rate ng mga maling alarma ng modelo. Sinusukat ng precision ang bahagi ng mga email na nauri bilang spam na aktwal na spam. Kapag sinusuri ang isang ganoong sistema, madalas na makatuwirang bigyan ng prayoridad ang recall, precision, o ilang balanse ng dalawa, higit sa ilang minimum na antas ng katumpakan.
Mga madalas itanong
Ano ang pagkakaiba ng recall at precision sa ebalwasyon ng AI?
Ang recall, o ang true positive rate, ay ang proporsyon ng lahat ng aktwal na positibo na tama ang pagkakaklasipika bilang positibo. Ang precision, sa kabilang banda, ay ang proporsyon ng lahat ng positibong klasipikasyon ng modelo na aktwal na positibo.
Bakit ang accuracy ay isang mahinang sukatan para sa mga imbalanced dataset?
Dapat iwasan ang accuracy para sa mga imbalanced dataset dahil ang isang modelo ay maaaring makakuha ng mataas na marka habang walang silbi. Halimbawa, kung ang isang bihirang klase ay lumalabas lamang ng 1% ng oras, ang isang modelo na humuhula ng negatibo ng 100% ng oras ay nakakakuha ng 99% accuracy.
Ano ang apat na pangunahing tungkulin ng NIST AI Risk Management Framework?
Ayon sa AI RMF - AIRC, ang AI RMF Core ay isinasagawa sa pamamagitan ng apat na function: Govern, Map, Measure, at Manage. Ang AI RMF Core ay nagbibigay ng mga resulta at aksyon na nagbibigay-daan sa diyalogo, pag-unawa, at mga aktibidad upang pamahalaan ang mga panganib ng AI at responsableng bumuo ng mapagkakatiwalaang mga sistema ng AI.
Mga madalas itanong
Ano ang pagkakaiba ng recall at precision sa ebalwasyon ng AI?
Ang recall, o ang true positive rate, ay ang proporsyon ng lahat ng aktwal na positibo na tama ang pagkakaklasipika bilang positibo. Ang precision, sa kabilang banda, ay ang proporsyon ng lahat ng positibong klasipikasyon ng modelo na aktwal na positibo.
Bakit ang accuracy ay isang mahinang sukatan para sa mga imbalanced dataset?
Dapat iwasan ang accuracy para sa mga imbalanced dataset dahil ang isang modelo ay maaaring makakuha ng mataas na marka habang walang silbi. Halimbawa, kung ang isang bihirang klase ay lumalabas lamang ng 1% ng oras, ang isang modelo na humuhula ng negatibo ng 100% ng oras ay nakakakuha ng 99% accuracy.
Ano ang apat na pangunahing tungkulin ng NIST AI Risk Management Framework?
Ayon sa AI RMF - AIRC, ang AI RMF Core ay isinasagawa sa pamamagitan ng apat na function: Govern, Map, Measure, at Manage. Ang AI RMF Core ay nagbibigay ng mga resulta at aksyon na nagbibigay-daan sa diyalogo, pag-unawa, at mga aktibidad upang pamahalaan ang mga panganib ng AI at responsableng bumuo ng mapagkakatiwalaang mga sistema ng AI.



