In breve: Questa guida discute la valutazione dei sistemi di coaching basati sull'IA, sfruttando il Framework di Gestione del Rischio AI del NIST e le metriche chiave del machine learning.
Punti chiave
- Il NIST AI Risk Management Framework offre un approccio volontario e strutturato per valutare l'affidabilità dell'IA.
- L'accuratezza standard è spesso una metrica fuorviante per valutare le prestazioni dell'IA su dataset sbilanciati.
- Richiamo e precisione forniscono misure matematicamente precise dei tassi di rilevamento e della qualità della previsione.
- Una valutazione completa richiede l'analisi di falsi positivi, falsi negativi e schede modello trasparenti.
Come Stabiliamo l'Affidabilità nei Sistemi di Coaching AI?
Secondo l'AI RMF - AIRC, l'AI Risk Management Framework (AI RMF) è destinato all'uso volontario e a migliorare la capacità di incorporare considerazioni di affidabilità nella progettazione, sviluppo, uso e valutazione di prodotti, servizi e sistemi di IA. Secondo l'AI RMF - AIRC, questo framework è stato sviluppato in modo aperto, trasparente, multidisciplinare e multistakeholder in un periodo di 18 mesi e in collaborazione con oltre 240 organizzazioni contributrici. AI RMF - AIRC
Identificare e gestire i rischi dell'IA e i potenziali impatti richiede un'ampia gamma di prospettive e attori lungo l'intero ciclo di vita dell'IA. Affinché i sistemi di IA siano affidabili, spesso devono essere reattivi a una molteplicità di criteri che sono di valore per le parti interessate. Gli approcci che migliorano l'affidabilità dell'IA possono ridurre i rischi negativi dell'IA. sistemi di coaching AI
Quali Sono le Funzioni Principali e i Profili della Gestione del Rischio AI?
Secondo l'AI RMF - AIRC, il Core dell'AI RMF fornisce risultati e azioni che consentono il dialogo, la comprensione e le attività per gestire i rischi dell'IA e sviluppare responsabilmente sistemi di IA affidabili. Questo viene reso operativo attraverso quattro funzioni: Governare, Mappare, Misurare e Gestire. roadmap pratica per gli acquirenti di tecnologia
Secondo l'AI RMF - AIRC, i Profili di caso d'uso sono implementazioni delle funzioni, categorie e sottocategorie dell'AI RMF per un'impostazione o applicazione specifica basata sui requisiti, la tolleranza al rischio e le risorse dell'utente del Framework. Secondo il NIST, il NIST ha pubblicato NIST-AI-600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, il 26 luglio 2024. Secondo il NIST, il Profilo AI Generativa aiuta le organizzazioni a identificare i rischi unici posti dall'AI generativa e propone azioni per la gestione del rischio dell'AI generativa. Framework per la Gestione del Rischio dell'AI | NIST
Secondo l'AI Risk Management Framework | NIST, il 30 marzo 2023, il NIST ha lanciato il Trustworthy and Responsible AI Resource Center. Questo centro risorse faciliterà l'implementazione e l'allineamento internazionale con l'AI RMF. Inoltre, il 7 aprile 2026, il NIST ha pubblicato una nota concettuale per un profilo AI RMF sull'IA affidabile nelle infrastrutture critiche.
In Che Modo le Metriche di Machine Learning Differiscono dal Linguaggio Comune?
Nel machine learning, parole come recall, precisione e accuratezza hanno definizioni matematiche che possono differire da, o essere più specifiche rispetto ai significati più comunemente usati delle parole. I veri e falsi positivi e negativi sono usati per calcolare diverse metriche utili per la valutazione dei modelli. Classificazione: Accuratezza, recall, precisione e metriche correlate | Machine Learning | Google for Developers
Quali metriche di valutazione siano più significative dipende dal modello specifico e dal compito specifico, dal costo delle diverse misclassificazioni e se il dataset è bilanciato o sbilanciato. Le metriche che si sceglie di privilegiare nella valutazione di un modello e nella scelta di una soglia dipendono dai costi, dai benefici e dai rischi del problema specifico. Secondo Model cards — Google DeepMind, le schede modello sono panoramiche semplici e strutturate di come un modello AI avanzato è stato progettato e valutato. Model cards â Google DeepMind
Perché l'Accuratezza Standard è Ingannevole sui Dataset Sbilanciati?
L'accuratezza dovrebbe essere usata come un indicatore approssimativo del progresso o della convergenza dell'addestramento del modello per dataset bilanciati, ma evitata per dataset sbilanciati. Quando un dataset è sbilanciato, o dove un tipo di errore è più costoso dell'altro, è meglio ottimizzare per metriche diverse dall'accuratezza.
Per dataset fortemente sbilanciati in cui una classe appare molto raramente, diciamo l'1% delle volte, un modello che prevede un risultato negativo il 100% delle volte otterrebbe un'accuratezza del 99% pur essendo inutile. rilevare movimenti critici e rari
Cos'è il Richiamo e perché è importante per il rilevamento?
Il richiamo (recall), o tasso di veri positivi (TPR), è la proporzione di tutti i positivi effettivi che sono stati classificati correttamente come positivi. Matematicamente, il richiamo è definito come i veri positivi correttamente classificati divisi per tutti i positivi effettivi, ovvero TP / (TP + FN).
I falsi negativi sono positivi reali che sono stati classificati erroneamente come negativi, ed è per questo che compaiono al denominatore della formula del recall. Un modello perfetto ipotetico avrebbe zero falsi negativi e quindi un recall di 1.0, rappresentando un tasso di rilevamento del 100%. In pratica, il recall dovrebbe essere prioritario quando i falsi negativi sono più costosi dei falsi positivi.
Come Precisione e Tassi di Falsi Positivi Influenzano l'Usabilità?
La precisione è la proporzione di tutte le classificazioni positive del modello che sono effettivamente positive. Matematicamente, la precisione è definita come i veri positivi correttamente classificati divisi per tutto ciò che è classificato come positivo, ovvero TP / (TP + FP). Un modello ipotetico perfetto avrebbe zero falsi positivi e quindi una precisione di 1.0.
Al contrario, un modello che non prevede mai un risultato positivo avrebbe 0 TP e 0 FP, risultando in un calcolo della precisione di NaN. La precisione dovrebbe essere prioritaria quando è molto importante che le previsioni positive siano accurate.
Il tasso di falsi positivi (FPR) è la proporzione di tutti i negativi reali che sono stati classificati erroneamente come positivi, noto anche come probabilità di falso allarme. L'FPR è matematicamente definito come negativi reali classificati erroneamente diviso per tutti i negativi reali, o FP / (FP + TN). I falsi positivi sono negativi reali che sono stati classificati erroneamente, ed è per questo che compaiono al denominatore della formula del tasso di falsi positivi (FPR).
Un modello perfetto avrebbe zero falsi positivi e quindi un FPR di 0.0, rappresentando un tasso di falsi allarmi dello 0%. Per un dataset sbilanciato, l'FPR è generalmente una metrica più informativa dell'accuratezza. Questo tasso dovrebbe essere prioritario quando i falsi positivi sono più costosi dei falsi negativi.
Tuttavia, se il numero di negativi effettivi è molto basso, l'FPR potrebbe non essere una scelta ideale a causa della sua volatilità. Ad esempio, se ci sono solo quattro negativi effettivi in un dataset, una singola errata classificazione si traduce in un FPR del 25%, mentre una seconda errata classificazione fa salire l'FPR al 50%.
Come Applichiamo le Metriche di Classificazione a Esempi Pratici?
Per capire come queste metriche funzionano in uno scenario reale, possiamo esaminare un esempio standard di classificazione dello spam. In questo contesto, il recall misura la frazione di email di spam che sono state correttamente classificate come spam. Questo è il motivo per cui un altro nome per il recall è la probabilità di rilevamento, poiché risponde alla domanda su quale frazione di email di spam viene rilevata dal modello.
Nello stesso esempio di classificazione dello spam, il tasso di falsi positivi (FPR) misura la frazione di email legittime che sono state classificate erroneamente come spam, rappresentando il tasso di falsi allarmi del modello. La precisione misura la frazione di email classificate come spam che erano effettivamente spam. Quando si valuta un tale sistema, spesso ha senso dare priorità al recall, alla precisione o a un certo equilibrio tra i due, al di sopra di un livello minimo di accuratezza.
Domande frequenti
Qual è la differenza tra richiamo e precisione nella valutazione dell'IA?
Il richiamo (recall), o tasso di veri positivi, è la proporzione di tutti i positivi effettivi che sono stati classificati correttamente come positivi. La precisione (precision), d'altra parte, è la proporzione di tutte le classificazioni positive del modello che sono effettivamente positive.
Perché l'accuratezza è una metrica inadeguata per i dataset sbilanciati?
L'accuratezza dovrebbe essere evitata per i dataset sbilanciati perché un modello può ottenere un punteggio elevato pur essendo inutile. Ad esempio, se una classe rara appare solo l'1% delle volte, un modello che prevede un risultato negativo il 100% delle volte ottiene un'accuratezza del 99%.
Quali sono le quattro funzioni principali del NIST AI Risk Management Framework?
Secondo l'AI RMF - AIRC, l'AI RMF Core è reso operativo attraverso quattro funzioni: Governare, Mappare, Misurare e Gestire. L'AI RMF Core fornisce risultati e azioni che consentono il dialogo, la comprensione e le attività per gestire i rischi dell'IA e sviluppare responsabilmente sistemi di IA affidabili.
Domande frequenti
Qual è la differenza tra richiamo e precisione nella valutazione dell'IA?
Il richiamo (recall), o tasso di veri positivi, è la proporzione di tutti i positivi effettivi che sono stati classificati correttamente come positivi. La precisione (precision), d'altra parte, è la proporzione di tutte le classificazioni positive del modello che sono effettivamente positive.
Perché l'accuratezza è una metrica inadeguata per i dataset sbilanciati?
L'accuratezza dovrebbe essere evitata per i dataset sbilanciati perché un modello può ottenere un punteggio elevato pur essendo inutile. Ad esempio, se una classe rara appare solo l'1% delle volte, un modello che prevede un risultato negativo il 100% delle volte ottiene un'accuratezza del 99%.
Quali sono le quattro funzioni principali del NIST AI Risk Management Framework?
Secondo l'AI RMF - AIRC, l'AI RMF Core è reso operativo attraverso quattro funzioni: Governare, Mappare, Misurare e Gestire. L'AI RMF Core fornisce risultati e azioni che consentono il dialogo, la comprensione e le attività per gestire i rischi dell'IA e sviluppare responsabilmente sistemi di IA affidabili.



