La versión corta: Esta guía aborda la evaluación de sistemas de entrenamiento de IA, aprovechando el Marco de Gestión de Riesgos de IA del NIST y métricas clave de aprendizaje automático.
Conclusiones clave
- El Marco de Gestión de Riesgos de IA del NIST ofrece un enfoque voluntario y estructurado para evaluar la fiabilidad de la IA.
- La accuracy estándar es a menudo una métrica engañosa para evaluar el rendimiento de la IA en conjuntos de datos desequilibrados.
- Recall y precision proporcionan medidas matemáticamente precisas de las tasas de detección y la calidad de la predicción.
- Una evaluación completa requiere analizar los falsos positivos, los falsos negativos y las tarjetas de modelo transparentes.
¿Cómo establecemos la confiabilidad en los sistemas de entrenamiento con IA?
Según el AI RMF - AIRC, el Marco de Gestión de Riesgos de IA (AI RMF) está destinado a un uso voluntario y a mejorar la capacidad de incorporar consideraciones de confiabilidad en el diseño, desarrollo, uso y evaluación de productos, servicios y sistemas de IA. Según el AI RMF - AIRC, este marco fue desarrollado de manera abierta, transparente, multidisciplinaria y con la participación de múltiples partes interesadas durante un período de 18 meses y en colaboración con más de 240 organizaciones contribuyentes. AI RMF - AIRC
Identificar y gestionar los riesgos de la IA y sus posibles impactos requiere un amplio conjunto de perspectivas y actores a lo largo del ciclo de vida de la IA. Para que los sistemas de IA sean confiables, a menudo necesitan responder a una multiplicidad de criterios que son valiosos para las partes interesadas. Los enfoques que mejoran la confiabilidad de la IA pueden reducir los riesgos negativos de la IA. sistemas de entrenamiento de IA
¿Cuáles son las funciones principales y los perfiles de la gestión de riesgos de IA?
Según el AI RMF - AIRC, el Núcleo del AI RMF proporciona resultados y acciones que permiten el diálogo, la comprensión y las actividades para gestionar los riesgos de la IA y desarrollar de forma responsable sistemas de IA confiables. Esto se operacionaliza a través de cuatro funciones: Gobernar, Mapear, Medir y Gestionar. hoja de ruta práctica para compradores de tecnología
Según el AI RMF - AIRC, los perfiles de casos de uso son implementaciones de las funciones, categorías y subcategorías del AI RMF para un entorno o aplicación específicos, basados en los requisitos, la tolerancia al riesgo y los recursos del usuario del Marco. Según NIST, NIST publicó NIST-AI-600-1, Marco de Gestión de Riesgos de Inteligencia Artificial: Perfil de Inteligencia Artificial Generativa, el 26 de julio de 2024. Según NIST, el Perfil de IA Generativa ayuda a las organizaciones a identificar riesgos únicos planteados por la IA generativa y propone acciones para la gestión de riesgos de la IA generativa. AI Risk Management Framework | NIST
Según el Marco de Gestión de Riesgos de IA | NIST, el 30 de marzo de 2023, NIST lanzó el Centro de Recursos de IA Confiable y Responsable. Este centro de recursos facilitará la implementación y la alineación internacional con el AI RMF. Además, el 7 de abril de 2026, NIST publicó una nota conceptual para un Perfil del AI RMF sobre IA Confiable en Infraestructura Crítica.
¿Cómo difieren las métricas de aprendizaje automático del lenguaje común?
En el aprendizaje automático, palabras como recall, precisión y exactitud tienen definiciones matemáticas que pueden diferir o ser más específicas que los significados más comúnmente usados de las palabras. Los verdaderos y falsos positivos y negativos se utilizan para calcular varias métricas útiles para evaluar modelos. Clasificación: Exactitud, recall, precisión y métricas relacionadas | Aprendizaje Automático | Google for Developers
Qué métricas de evaluación son más significativas depende del modelo específico y la tarea específica, el costo de las diferentes clasificaciones erróneas y si el conjunto de datos está equilibrado o desequilibrado. Las métricas que elija priorizar al evaluar un modelo y elegir un umbral dependen de los costos, beneficios y riesgos del problema específico. Según Model cards — Google DeepMind, las Model cards son resúmenes simples y estructurados de cómo se diseñó y evaluó un modelo avanzado de IA. Model cards â Google DeepMind
¿Por qué la exactitud estándar es engañosa en conjuntos de datos desequilibrados?
La exactitud debe usarse como un indicador aproximado del progreso o convergencia del entrenamiento del modelo para conjuntos de datos equilibrados, pero debe evitarse para conjuntos de datos desequilibrados. Cuando un conjunto de datos está desequilibrado, o donde un tipo de error es más costoso que el otro, es mejor optimizar para métricas distintas a la exactitud.
Para conjuntos de datos muy desequilibrados donde una clase aparece muy raramente, digamos el 1% de las veces, un modelo que predice negativo el 100% de las veces obtendría un 99% de exactitud a pesar de ser inútil. detectar movimientos críticos y raros
¿Qué es la exhaustividad y por qué es importante para la detección?
La exhaustividad, o la tasa de verdaderos positivos (TPR), es la proporción de todos los positivos reales que fueron clasificados correctamente como positivos. Matemáticamente, la exhaustividad se define como los verdaderos positivos clasificados correctamente divididos por todos los positivos reales, o TP / (TP + FN).
Los falsos negativos son positivos reales que fueron clasificados erróneamente como negativos, razón por la cual aparecen en el denominador de la fórmula de recall. Un modelo hipotético perfecto tendría cero falsos negativos y, por lo tanto, un recall de 1.0, lo que representa una tasa de detección del 100%. En la práctica, el recall debe priorizarse cuando los falsos negativos son más costosos que los falsos positivos.
¿Cómo impactan la precisión y las tasas de falsos positivos en la usabilidad?
La precisión es la proporción de todas las clasificaciones positivas del modelo que son realmente positivas. Matematicamente, la precisión se define como los verdaderos positivos clasificados correctamente divididos por todo lo clasificado como positivo, o TP / (TP + FP). Un modelo hipotético perfecto tendría cero falsos positivos y, por lo tanto, una precisión de 1.0.
Por el contrario, un modelo que nunca predice positivo tendría 0 TPs y 0 FPs, lo que resultaría en un cálculo de precisión de NaN. La precisión debe priorizarse cuando es muy importante que las predicciones positivas sean exactas.
La tasa de falsos positivos (FPR) es la proporción de todos los negativos reales que fueron clasificados incorrectamente como positivos, también conocida como la probabilidad de falsa alarma. La FPR se define matemáticamente como los negativos reales clasificados incorrectamente divididos por todos los negativos reales, o FP / (FP + TN). Los falsos positivos son negativos reales que fueron clasificados erróneamente, razón por la cual aparecen en el denominador de la fórmula de la tasa de falsos positivos (FPR).
Un modelo perfecto tendría cero falsos positivos y, por lo tanto, un FPR de 0.0, lo que representa una tasa de falsas alarmas del 0%. Para un conjunto de datos desequilibrado, el FPR es generalmente una métrica más informativa que la exactitud. Esta tasa debe priorizarse cuando los falsos positivos son más costosos que los falsos negativos.
Sin embargo, si el número de negativos reales es muy bajo, el FPR puede no ser una opción ideal debido a su volatilidad. Por ejemplo, si solo hay cuatro negativos reales en un conjunto de datos, una única clasificación errónea resulta en un FPR del 25%, mientras que una segunda clasificación errónea hace que el FPR salte al 50%.
¿Cómo aplicamos las métricas de clasificación a ejemplos prácticos?
Para entender cómo funcionan estas métricas en un escenario del mundo real, podemos observar un ejemplo estándar de clasificación de spam. En este contexto, el recall mide la fracción de correos electrónicos de spam que fueron clasificados correctamente como spam. Por eso, otro nombre para el recall es la probabilidad de detección, ya que responde a la pregunta de qué fracción de correos electrónicos de spam son detectados por el modelo.
En el mismo ejemplo de clasificación de spam, la tasa de falsos positivos (FPR) mide la fracción de correos electrónicos legítimos que fueron clasificados incorrectamente como spam, representando la tasa de falsas alarmas del modelo. La precisión mide la fracción de correos electrónicos clasificados como spam que eran realmente spam. Al evaluar un sistema así, a menudo tiene sentido priorizar el recall, la precisión o un equilibrio entre ambos, por encima de un nivel mínimo de exactitud.
Preguntas frecuentes
¿Cuál es la diferencia entre recall y precision en la evaluación de IA?
La exhaustividad, o la tasa de verdaderos positivos, es la proporción de todos los positivos reales que fueron clasificados correctamente como positivos. La precisión, por otro lado, es la proporción de todas las clasificaciones positivas del modelo que son realmente positivas.
¿Por qué la exactitud es una métrica deficiente para conjuntos de datos desequilibrados?
La exactitud debe evitarse para conjuntos de datos desequilibrados porque un modelo puede obtener una puntuación alta siendo inútil. Por ejemplo, si una clase rara aparece solo el 1% de las veces, un modelo que predice negativo el 100% de las veces obtiene una exactitud del 99%.
¿Cuáles son las cuatro funciones principales del Marco de Gestión de Riesgos de IA del NIST?
Según el AI RMF - AIRC, el Núcleo del AI RMF se operacionaliza a través de cuatro funciones: Gobernar, Mapear, Medir y Gestionar. El Núcleo del AI RMF proporciona resultados y acciones que permiten el diálogo, la comprensión y las actividades para gestionar los riesgos de la IA y desarrollar de forma responsable sistemas de IA confiables.
Preguntas frecuentes
¿Cuál es la diferencia entre recall y precision en la evaluación de IA?
La exhaustividad, o la tasa de verdaderos positivos, es la proporción de todos los positivos reales que fueron clasificados correctamente como positivos. La precisión, por otro lado, es la proporción de todas las clasificaciones positivas del modelo que son realmente positivas.
¿Por qué la exactitud es una métrica deficiente para conjuntos de datos desequilibrados?
La exactitud debe evitarse para conjuntos de datos desequilibrados porque un modelo puede obtener una puntuación alta siendo inútil. Por ejemplo, si una clase rara aparece solo el 1% de las veces, un modelo que predice negativo el 100% de las veces obtiene una exactitud del 99%.
¿Cuáles son las cuatro funciones principales del Marco de Gestión de Riesgos de IA del NIST?
Según el AI RMF - AIRC, el Núcleo del AI RMF se operacionaliza a través de cuatro funciones: Gobernar, Mapear, Medir y Gestionar. El Núcleo del AI RMF proporciona resultados y acciones que permiten el diálogo, la comprensión y las actividades para gestionar los riesgos de la IA y desarrollar de forma responsable sistemas de IA confiables.



