Kurz gesagt: Dieser Leitfaden behandelt die Bewertung von KI-Coaching-Systemen, unter Nutzung des NIST AI Risk Management Frameworks und wichtiger Metriken des maschinellen Lernens.
Wichtigste Erkenntnisse
- Das NIST AI Risk Management Framework bietet einen freiwilligen, strukturierten Ansatz, um die Vertrauenswürdigkeit von KI zu bewerten.
- Standardgenauigkeit ist oft eine irreführende Metrik zur Bewertung der KI-Leistung bei unausgewogenen Datensätzen.
- Recall und Precision bieten mathematisch präzise Maße für Erkennungsraten und Vorhersagequalität.
- Eine vollständige Bewertung erfordert die Analyse von False Positives, False Negatives und transparenten Modellkarten.
Wie stellen wir Vertrauenswürdigkeit in KI-Coaching-Systemen her?
Laut dem AI RMF - AIRC ist das AI Risk Management Framework (AI RMF) für die freiwillige Nutzung vorgesehen und soll die Fähigkeit verbessern, Vertrauenswürdigkeitsaspekte in das Design, die Entwicklung, die Nutzung und die Bewertung von KI-Produkten, -Diensten und -Systemen zu integrieren. Laut dem AI RMF - AIRC wurde dieses Framework in einem offenen, transparenten, multidisziplinären und multistakeholder-Ansatz über einen Zeitraum von 18 Monaten und in Zusammenarbeit mit mehr als 240 beitragenden Organisationen entwickelt. AI RMF - AIRC
Die Identifizierung und das Management von KI-Risiken und potenziellen Auswirkungen erfordert eine breite Palette von Perspektiven und Akteuren über den gesamten KI-Lebenszyklus hinweg. Damit KI-Systeme vertrauenswürdig sind, müssen sie oft auf eine Vielzahl von Kriterien reagieren, die für interessierte Parteien von Wert sind. Ansätze, die die Vertrauenswürdigkeit von KI verbessern, können negative KI-Risiken reduzieren. KI-Coaching-Systeme
Was sind die Kernfunktionen und Profile des KI-Risikomanagements?
Gemäß dem AI RMF - AIRC bietet der AI RMF Core Ergebnisse und Maßnahmen, die den Dialog, das Verständnis und Aktivitäten zur Bewältigung von KI-Risiken und zur verantwortungsvollen Entwicklung vertrauenswürdiger KI-Systeme ermöglichen. Dies wird durch vier Funktionen operationalisiert: Govern, Map, Measure und Manage. praktischer Fahrplan für Technologiekäufer
Laut dem AI RMF - AIRC sind die Anwendungsfallprofile Implementierungen der AI RMF-Funktionen, -Kategorien und -Unterkategorien für eine spezifische Einstellung oder Anwendung, basierend auf den Anforderungen, der Risikotoleranz und den Ressourcen des Framework-Benutzers. Laut NIST veröffentlichte NIST am 26. Juli 2024 NIST-AI-600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. Laut NIST hilft das Generative AI Profile Organisationen dabei, einzigartige Risiken zu identifizieren, die durch generative KI entstehen, und schlägt Maßnahmen für das Risikomanagement generativer KI vor. AI Risk Management Framework | NIST
Laut dem AI Risk Management Framework | NIST hat NIST am 30. März 2023 das Trustworthy and Responsible AI Resource Center ins Leben gerufen. Dieses Ressourcenzentrum wird die Implementierung und internationale Abstimmung mit dem AI RMF erleichtern. Darüber hinaus veröffentlichte NIST am 7. April 2026 ein Konzeptpapier für ein AI RMF Profile zu vertrauenswürdiger KI in kritischen Infrastrukturen.
Wie unterscheiden sich Metriken des maschinellen Lernens von der Umgangssprache?
Im maschinellen Lernen haben Wörter wie Recall, Precision und Accuracy mathematische Definitionen, die sich von den gebräuchlicheren Bedeutungen der Wörter unterscheiden oder spezifischer sein können. Wahre und falsche Positive und Negative werden verwendet, um verschiedene nützliche Metriken zur Bewertung von Modellen zu berechnen. Klassifizierung: Genauigkeit, Recall, Präzision und verwandte Metriken | Maschinelles Lernen | Google for Developers
Welche Bewertungsmetriken am aussagekräftigsten sind, hängt vom spezifischen Modell und der spezifischen Aufgabe, den Kosten unterschiedlicher Fehlklassifikationen und davon ab, ob der Datensatz ausgewogen oder unausgewogen ist. Die Metriken, die Sie bei der Bewertung eines Modells und der Wahl eines Schwellenwerts priorisieren, hängen von den Kosten, Vorteilen und Risiken des spezifischen Problems ab. Laut Model cards — Google DeepMind sind Modellkarten einfache, strukturierte Übersichten darüber, wie ein fortschrittliches KI-Modell entworfen und bewertet wurde. Model cards â Google DeepMind
Warum ist die Standardgenauigkeit bei unausgewogenen Datensätzen irreführend?
Die Genauigkeit sollte als grober Indikator für den Modelltrainingsfortschritt oder die Konvergenz bei ausgewogenen Datensätzen verwendet werden, aber bei unausgewogenen Datensätzen vermieden werden. Wenn ein Datensatz unausgewogen ist oder eine Art von Fehler kostspieliger ist als die andere, ist es besser, andere Metriken als die Genauigkeit zu optimieren.
Bei stark unausgewogenen Datensätzen, bei denen eine Klasse sehr selten auftritt, sagen wir 1% der Zeit, würde ein Modell, das zu 100% negativ vorhersagt, eine Genauigkeit von 99% erzielen, obwohl es nutzlos ist. kritische, seltene Bewegungen erkennen
Was ist Recall und warum ist er für die Erkennung wichtig?
Der Recall, oder die Rate der echten Positiven (TPR), ist der Anteil aller tatsächlichen Positiven, die korrekt als positiv klassifiziert wurden. Mathematisch ist der Recall definiert als korrekt klassifizierte tatsächliche Positive geteilt durch alle tatsächlichen Positive, oder TP / (TP + FN).
Falsch negative sind tatsächliche Positive, die fälschlicherweise als Negative klassifiziert wurden, weshalb sie im Nenner der Recall-Formel erscheinen. Ein hypothetisches perfektes Modell hätte null falsch negative und somit einen Recall von 1.0, was einer Erkennungsrate von 100% entspricht. In der Praxis sollte Recall priorisiert werden, wenn falsch negative teurer sind als falsch positive.
Wie beeinflussen Präzision und Fehlalarmraten die Benutzerfreundlichkeit?
Präzision ist der Anteil aller positiven Klassifikationen des Modells, die tatsächlich positiv sind. Mathematisch ist Präzision definiert als korrekt klassifizierte tatsächliche Positive geteilt durch alles, was als positiv klassifiziert wurde, oder TP / (TP + FP). Ein hypothetisches perfektes Modell hätte null falsch Positive und somit eine Präzision von 1,0.
Umgekehrt hätte ein Modell, das niemals positiv vorhersagt, 0 TPs und 0 FPs, was zu einer Präzisionsberechnung von NaN führen würde. Die Präzision sollte priorisiert werden, wenn es sehr wichtig ist, dass positive Vorhersagen korrekt sind.
Die Falsch-Positiv-Rate (FPR) ist der Anteil aller tatsächlichen Negativen, die fälschlicherweise als Positive klassifiziert wurden, auch bekannt als die Wahrscheinlichkeit eines Fehlalarms. FPR ist mathematisch definiert als falsch klassifizierte tatsächliche Negative geteilt durch alle tatsächlichen Negative, oder FP / (FP + TN). Falsch positive sind tatsächliche Negative, die falsch klassifiziert wurden, weshalb sie im Nenner der Falsch-Positiv-Rate (FPR) Formel erscheinen.
Ein perfektes Modell hätte null falsch Positive und somit eine FPR von 0,0, was einer Fehlalarmrate von 0% entspricht. Für einen unausgewogenen Datensatz ist die FPR im Allgemeinen eine informativere Metrik als die Genauigkeit. Diese Rate sollte priorisiert werden, wenn falsch Positive kostspieliger sind als falsch Negative.
Wenn jedoch die Anzahl der tatsächlichen Negativen sehr gering ist, ist die FPR aufgrund ihrer Volatilität möglicherweise keine ideale Wahl. Zum Beispiel, wenn in einem Datensatz nur vier tatsächliche Negative vorhanden sind, führt eine einzige Fehlklassifizierung zu einer FPR von 25%, während eine zweite Fehlklassifizierung die FPR auf 50% ansteigen lässt.
Wie wenden wir Klassifizierungsmetriken auf praktische Beispiele an?
Um zu verstehen, wie diese Metriken in einem realen Szenario funktionieren, können wir uns ein Standardbeispiel für die Spam-Klassifizierung ansehen. In diesem Kontext misst der Recall den Anteil der Spam-E-Mails, die korrekt als Spam klassifiziert wurden. Deshalb wird Recall auch als Wahrscheinlichkeit der Erkennung bezeichnet, da er die Frage beantwortet, welcher Anteil der Spam-E-Mails vom Modell erkannt wird.
Im selben Beispiel der Spam-Klassifizierung misst die Falsch-Positiv-Rate (FPR) den Anteil legitimer E-Mails, die fälschlicherweise als Spam klassifiziert wurden, und stellt die Rate der Fehlalarme des Modells dar. Die Präzision misst den Anteil der als Spam klassifizierten E-Mails, die tatsächlich Spam waren. Bei der Bewertung eines solchen Systems ist es oft sinnvoll, den Recall, die Präzision oder eine Balance aus beiden über einem bestimmten Mindestgenauigkeitsniveau zu priorisieren.
Häufig gestellte Fragen
Was ist der Unterschied zwischen Recall und Precision in der KI-Bewertung?
Der Recall, oder die Rate der echten Positiven, ist der Anteil aller tatsächlichen Positiven, die korrekt als positiv klassifiziert wurden. Die Präzision hingegen ist der Anteil aller positiven Klassifikationen des Modells, die tatsächlich positiv sind.
Warum ist Genauigkeit eine schlechte Metrik für unausgewogene Datensätze?
Die Genauigkeit sollte bei unausgewogenen Datensätzen vermieden werden, da ein Modell hohe Werte erzielen kann, obwohl es nutzlos ist. Zum Beispiel, wenn eine seltene Klasse nur 1% der Zeit auftritt, erzielt ein Modell, das zu 100% negativ vorhersagt, eine Genauigkeit von 99%.
Was sind die vier Kernfunktionen des NIST AI Risk Management Framework?
Gemäß dem AI RMF - AIRC wird der AI RMF Core durch vier Funktionen operationalisiert: Govern, Map, Measure und Manage. Der AI RMF Core liefert Ergebnisse und Maßnahmen, die Dialog, Verständnis und Aktivitäten zur Steuerung von KI-Risiken und zur verantwortungsvollen Entwicklung vertrauenswürdiger KI-Systeme ermöglichen.
Häufig gestellte Fragen
Was ist der Unterschied zwischen Recall und Precision in der KI-Bewertung?
Der Recall, oder die Rate der echten Positiven, ist der Anteil aller tatsächlichen Positiven, die korrekt als positiv klassifiziert wurden. Die Präzision hingegen ist der Anteil aller positiven Klassifikationen des Modells, die tatsächlich positiv sind.
Warum ist Genauigkeit eine schlechte Metrik für unausgewogene Datensätze?
Die Genauigkeit sollte bei unausgewogenen Datensätzen vermieden werden, da ein Modell hohe Werte erzielen kann, obwohl es nutzlos ist. Zum Beispiel, wenn eine seltene Klasse nur 1% der Zeit auftritt, erzielt ein Modell, das zu 100% negativ vorhersagt, eine Genauigkeit von 99%.
Was sind die vier Kernfunktionen des NIST AI Risk Management Framework?
Gemäß dem AI RMF - AIRC wird der AI RMF Core durch vier Funktionen operationalisiert: Govern, Map, Measure und Manage. Der AI RMF Core liefert Ergebnisse und Maßnahmen, die Dialog, Verständnis und Aktivitäten zur Steuerung von KI-Risiken und zur verantwortungsvollen Entwicklung vertrauenswürdiger KI-Systeme ermöglichen.



