Technologie du basketball & IA

Comment évaluer un entraîneur de basketball IA : Un cadre fiable

Diagramme d'évaluation de l'IA avec une matrice TP FP FN TN et des formules pour la précision, le rappel et l'exactitude

En bref : Ce guide aborde l'évaluation des systèmes de coaching basés sur l'IA, en s'appuyant sur le cadre de gestion des risques liés à l'IA du NIST et les métriques clés de l'apprentissage automatique.

Points clés

  • Le cadre de gestion des risques de l'IA du NIST offre une approche volontaire et structurée pour évaluer la fiabilité de l'IA.
  • L'exactitude standard est souvent une métrique trompeuse pour évaluer les performances de l'IA sur des ensembles de données déséquilibrés.
  • Le rappel et la précision fournissent des mesures mathématiquement précises des taux de détection et de la qualité de la prédiction.
  • Une évaluation complète nécessite l'analyse des faux positifs, des faux négatifs et des fiches de modèle transparentes.

Comment établir la confiance dans les systèmes de coaching par IA ?

Selon l'AI RMF - AIRC, le Cadre de gestion des risques liés à l'IA (AI RMF) est destiné à une utilisation volontaire et vise à améliorer la capacité d'intégrer des considérations de fiabilité dans la conception, le développement, l'utilisation et l'évaluation des produits, services et systèmes d'IA. Selon l'AI RMF - AIRC, ce cadre a été élaboré de manière ouverte, transparente, multidisciplinaire et multipartite sur une période de 18 mois et en collaboration avec plus de 240 organisations contributrices. AI RMF - AIRC

L'identification et la gestion des risques liés à l'IA et de leurs impacts potentiels nécessitent un large éventail de perspectives et d'acteurs tout au long du cycle de vie de l'IA. Pour que les systèmes d'IA soient fiables, ils doivent souvent répondre à une multiplicité de critères qui ont de la valeur pour les parties intéressées. Les approches qui améliorent la fiabilité de l'IA peuvent réduire les risques négatifs liés à l'IA. systèmes de coaching IA

Quelles sont les fonctions principales et les profils de la gestion des risques de l'IA ?

Selon l'AI RMF - AIRC, le cœur de l'AI RMF fournit des résultats et des actions qui permettent le dialogue, la compréhension et des activités pour gérer les risques liés à l'IA et développer de manière responsable des systèmes d'IA fiables. Ceci est opérationnalisé à travers quatre fonctions : Gouverner, Cartographier, Mesurer et Gérer. feuille de route pratique pour les acheteurs de technologies

Selon l'AI RMF - AIRC, les profils de cas d'utilisation sont des implémentations des fonctions, catégories et sous-catégories de l'AI RMF pour un contexte ou une application spécifique, basées sur les exigences, la tolérance au risque et les ressources de l'utilisateur du Cadre. Selon le NIST, le NIST a publié le NIST-AI-600-1, Cadre de gestion des risques liés à l'intelligence artificielle : Profil d'intelligence artificielle générative, le 26 juillet 2024. Selon le NIST, le Profil d'IA générative aide les organisations à identifier les risques uniques posés par l'IA générative et propose des actions pour la gestion des risques liés à l'IA générative. Cadre de gestion des risques liés à l'IA | NIST

Selon le Cadre de gestion des risques liés à l'IA | NIST, le 30 mars 2023, le NIST a lancé le Centre de ressources pour une IA fiable et responsable. Ce centre de ressources facilitera la mise en œuvre et l'harmonisation internationale avec l'AI RMF. De plus, le 7 avril 2026, le NIST a publié une note conceptuelle pour un profil AI RMF sur l'IA fiable dans les infrastructures critiques.

En quoi les métriques d'apprentissage automatique diffèrent-elles du langage courant ?

En apprentissage automatique, des mots comme rappel, précision et exactitude ont des définitions mathématiques qui peuvent différer ou être plus spécifiques que les significations plus couramment utilisées de ces mots. Les vrais et faux positifs et négatifs sont utilisés pour calculer plusieurs métriques utiles pour évaluer les modèles. Classification : Exactitude, rappel, précision et métriques associées | Apprentissage automatique | Google for Developers

Les métriques d'évaluation les plus pertinentes dépendent du modèle spécifique et de la tâche spécifique, du coût des différentes erreurs de classification, et de l'équilibre ou du déséquilibre de l'ensemble de données. Les métriques que vous choisissez de prioriser lors de l'évaluation d'un modèle et du choix d'un seuil dépendent des coûts, des avantages et des risques du problème spécifique. Selon les fiches de modèle — Google DeepMind, les fiches de modèle sont des aperçus simples et structurés de la manière dont un modèle d'IA avancé a été conçu et évalué. Fiches de modèle — Google DeepMind

Pourquoi la Précision Standard est-elle trompeuse sur les jeux de données déséquilibrés ?

L'exactitude doit être utilisée comme un indicateur approximatif de la progression ou de la convergence de l'entraînement du modèle pour les jeux de données équilibrés, mais évitée pour les jeux de données déséquilibrés. Lorsqu'un jeu de données est déséquilibré, ou lorsqu'un type d'erreur est plus coûteux qu'un autre, il est préférable d'optimiser d'autres métriques que l'exactitude.

Pour les jeux de données fortement déséquilibrés où une classe apparaît très rarement, disons 1 % du temps, un modèle qui prédit négatif 100 % du temps obtiendrait 99 % d'exactitude malgré son inutilité. détecter les mouvements critiques et rares

Qu'est-ce que le Recall et pourquoi est-ce important pour la détection ?

Le rappel, ou le taux de vrais positifs (TPR), est la proportion de tous les positifs réels qui ont été correctement classés comme positifs. Mathématiquement, le rappel est défini comme les positifs réels correctement classés divisés par tous les positifs réels, soit VP / (VP + FN).

Les faux négatifs sont des positifs réels qui ont été mal classés comme négatifs, c'est pourquoi ils apparaissent au dénominateur de la formule du rappel. Un modèle parfait hypothétique aurait zéro faux négatifs et donc un rappel de 1,0, représentant un taux de détection de 100 %. En pratique, le rappel doit être priorisé lorsque les faux négatifs sont plus coûteux que les faux positifs.

Comment la Précision et les Taux de Faux Positifs impactent-ils l'utilisabilité ?

La précision est la proportion de toutes les classifications positives du modèle qui sont réellement positives. Mathématiquement, la précision est définie comme les positifs réels correctement classés divisés par tout ce qui est classé comme positif, soit VP / (VP + FP). Un modèle parfait hypothétique aurait zéro faux positifs et donc une précision de 1,0.

Inversement, un modèle qui ne prédit jamais de positif aurait 0 Vrais Positifs et 0 Faux Positifs, ce qui entraînerait un calcul de précision de NaN. La précision doit être priorisée lorsqu'il est très important que les prédictions positives soient exactes.

Le taux de faux positifs (FPR) est la proportion de tous les négatifs réels qui ont été classés incorrectement comme positifs, également connu sous le nom de probabilité de fausse alarme. Le FPR est défini mathématiquement comme les négatifs réels mal classés divisés par tous les négatifs réels, ou FP / (FP + TN). Les faux positifs sont des négatifs réels qui ont été mal classés, c'est pourquoi ils apparaissent au dénominateur de la formule du taux de faux positifs (FPR).

Un modèle parfait aurait zéro faux positifs et donc un FPR de 0,0, représentant un taux de fausses alarmes de 0 %. Pour un jeu de données déséquilibré, le FPR est généralement une métrique plus informative que l'exactitude. Ce taux doit être priorisé lorsque les faux positifs sont plus coûteux que les faux négatifs.

Cependant, si le nombre de négatifs réels est très faible, le FPR peut ne pas être un choix idéal en raison de sa volatilité. Par exemple, s'il n'y a que quatre négatifs réels dans un jeu de données, une seule erreur de classification entraîne un FPR de 25 %, tandis qu'une deuxième erreur de classification fait passer le FPR à 50 %.

Comment appliquer les métriques de classification à des exemples pratiques ?

Pour comprendre comment ces métriques fonctionnent dans un scénario réel, nous pouvons examiner un exemple standard de classification de spams. Dans ce contexte, le rappel mesure la fraction des e-mails de spam qui ont été correctement classés comme spam. C'est pourquoi un autre nom pour le rappel est la probabilité de détection, car il répond à la question de savoir quelle fraction des e-mails de spam est détectée par le modèle.

Dans le même exemple de classification de spams, le taux de faux positifs (FPR) mesure la fraction des e-mails légitimes qui ont été incorrectement classés comme spam, représentant le taux de fausses alertes du modèle. La précision mesure la fraction des e-mails classés comme spam qui étaient réellement des spams. Lors de l'évaluation d'un tel système, il est souvent judicieux de prioriser le rappel, la précision, ou un certain équilibre des deux, au-delà d'un niveau de précision minimum.

Questions fréquentes

Quelle est la différence entre le rappel et la précision dans l'évaluation de l'IA ?

Le rappel, ou le taux de vrais positifs, est la proportion de tous les positifs réels qui ont été correctement classés comme positifs. La précision, d'autre part, est la proportion de toutes les classifications positives du modèle qui sont réellement positives.

Pourquoi la précision est-elle une mauvaise métrique pour les jeux de données déséquilibrés ?

L'exactitude doit être évitée pour les jeux de données déséquilibrés, car un modèle peut obtenir un score élevé tout en étant inutile. Par exemple, si une classe rare apparaît seulement 1 % du temps, un modèle prédisant négatif 100 % du temps obtient une exactitude de 99 %.

Quelles sont les quatre fonctions principales du cadre de gestion des risques de l'IA du NIST ?

Selon l'AI RMF - AIRC, le cœur de l'AI RMF est opérationnalisé à travers quatre fonctions : Gouverner, Cartographier, Mesurer et Gérer. Le cœur de l'AI RMF fournit des résultats et des actions qui permettent le dialogue, la compréhension et des activités pour gérer les risques liés à l'IA et développer de manière responsable des systèmes d'IA fiables.

Questions fréquentes

Quelle est la différence entre le rappel et la précision dans l'évaluation de l'IA ?

Le rappel, ou le taux de vrais positifs, est la proportion de tous les positifs réels qui ont été correctement classés comme positifs. La précision, d'autre part, est la proportion de toutes les classifications positives du modèle qui sont réellement positives.

Pourquoi la précision est-elle une mauvaise métrique pour les jeux de données déséquilibrés ?

L'exactitude doit être évitée pour les jeux de données déséquilibrés, car un modèle peut obtenir un score élevé tout en étant inutile. Par exemple, si une classe rare apparaît seulement 1 % du temps, un modèle prédisant négatif 100 % du temps obtient une exactitude de 99 %.

Quelles sont les quatre fonctions principales du cadre de gestion des risques de l'IA du NIST ?

Selon l'AI RMF - AIRC, le cœur de l'AI RMF est opérationnalisé à travers quatre fonctions : Gouverner, Cartographier, Mesurer et Gérer. Le cœur de l'AI RMF fournit des résultats et des actions qui permettent le dialogue, la compréhension et des activités pour gérer les risques liés à l'IA et développer de manière responsable des systèmes d'IA fiables.